当前位置:

首页 > 业界资讯 > 百度文心一言在国产模型中倒数?我看懵了

百度文心一言在国产模型中倒数?我看懵了

夕小瑶科技说原创作者|卖萌酱最近几天,我们公众号的社群在纷纷转发一张名为SuperClue评测的截图。科大讯飞甚至在官号进行了宣传:由于讯飞星火大模型刚发布,笔者玩的少,它是不是真的是国产最强这个笔者不敢下结论。但在该评测截图中,当下国产模型中热度最高的百度文心一言竟然连一个小型的学术开源模型ChatGLM-6B都打不过。这不仅与笔者自己的使用体验严重不符,而且在我们的专业NLP技术社群中,大家也纷纷表示一脸懵逼:好奇之下,笔者去这个superclue榜单的github,想看看这个测评结论是怎么得出来的:

 夕小瑶科技说 原创
 作者 | 卖萌酱最近几天,我们公众号的社群在纷纷转发一张名为SuperClue 评测的截图。科大讯飞甚至在官号进行了宣传:

百度文心一言在国产模型中倒数?我看懵了

由于讯飞星火大模型刚发布,笔者玩的少,它是不是真的是国产最强这个笔者不敢下结论。

但在该评测截图中,当下国产模型中热度最高的百度文心一言竟然连一个小型的学术开源模型ChatGLM-6B都打不过。这不仅与笔者自己的使用体验严重不符,而且在我们的专业NLP技术社群中,大家也纷纷表示一脸懵逼:

百度文心一言在国产模型中倒数?我看懵了

百度文心一言在国产模型中倒数?我看懵了

好奇之下,笔者去这个superclue榜单的github,想看看这个测评结论是怎么得出来的:https://github.com/CLUEbenchmark/SuperCLUE

首先笔者注意到这个repo下面已经有一些issue了:

百度文心一言在国产模型中倒数?我看懵了

百度文心一言在国产模型中倒数?我看懵了

看起来这个离谱的感觉不仅仅是笔者有,果然群众的眼睛还是雪亮的。。。

笔者进一步看了一下这个榜单的评测方式:

百度文心一言在国产模型中倒数?我看懵了

好家伙,原来所谓的生成式大模型的测试,竟然全都是让模型做选择题。。。

很明显这种做选择题的评测方式是针对BERT时代的判别式AI模型的,那时候的AI模型普遍不具备生成能力,仅仅有判别能力(比如能判别一段文本属于什么类别,选项中哪个是问题的正确答案,判断两段文本的语义是否一致等)。

而生成式模型的评测与判别式模型的评测有相当于大的差异。

例如,对于机器翻译这种特殊的生成任务而言,一般采用BLEU等评价指标来检测模型生成的回复与参考回复之间的“词汇、短语覆盖度”。但机器翻译这种有参考回复的生成类任务是极少数,绝大多数的生成类评测都要采用人工评测的方式。

例如闲聊式对话生成、文本风格迁移、篇章生成、标题生成、文本摘要等生成任务,都需要各个待评测模型去自由生成回复,然后人工去对比这些不同模型生成的回复的质量,或人工判断是否满足了任务需求。

当前这一轮的AI竞争,是模型生成能力的竞争,而不是模型判别能力的竞争。最有评价权的是真实的用户口碑,不再是一个个冰冷的学术榜单。更何况是一个压根没测模型生成能力的榜单。

回想起来前些年——

2019年,OpenAI发布了GPT-2的时候,我们在堆tricks刷榜;

2020年,OpenAI发布了GPT-3的时候,我们在堆tricks刷榜;

2021-2022年,FLAN、T0、InstructGPT等instruction tuning和RLHF工作爆发的时候,我们还有不少团队在坚持堆tricks刷榜…

希望这一波生成式模型的军备竞赛,我们不要再重蹈覆辙。

那么生成式AI模型到底应该怎么测?

很抱歉,我前面说过,如果想做到无偏测试,非常非常的难,甚至比你自研一个生成式模型出来难得多。难度有哪些?具体抛几个问题:

  • 评测维度该如何划分?按理解、记忆、推理、表达?按专业领域?还是将传统的NLP生成式评测任务杂揉起来?
  • 评测人员如何培训?对于写代码、debug、数学推导、金融法律医疗问答这种专业门槛极高的测试题,该如何招募人员测试?
  • 主观性极高的测试题(如生成小红书风格的文案),该如何定义评测标准?
  • 问几个泛泛的写作类问题就能代表一个模型的文本生成/写作能力了吗?
  • 考察模型的文本生成子能力,篇章生成、问答生成、翻译、摘要、风格迁移都覆盖到了吗?各个任务的占比均匀吗?评判标准都清晰吗?统计显著吗?
  • 在上面的问答生成子任务里,科学、医疗、汽车、母婴、金融、工程、政治、军事、娱乐等各个垂类都覆盖到了吗?占比均匀吗?
  • 如何测评对话能力?对话的一致性、多样性、话题深度、人格化分别怎么设计的考察任务?
  • 对于同一项能力测试,简单问题、中等难度问题和复杂长冷问题都覆盖到了吗?如何界定?分别占比多少?

这只是随手抛的几个要解决的基础问题,在实际基准设计的过程中,要面临大量比以上问题棘手得多的问题。

因此,作为AI从业者,笔者呼吁大家理性看待各类AI模型排名。连一个无偏的测试基准都没有出现,要这排名有何用?

还是那句话,一个生成式模型好不好,真实用户说了算。

一个模型在一个榜单的排名再高,它解决不好你在意的问题,它对你来说就是个一般般的模型。换言之,一个排名倒数的模型,如果在你关注的场景下发现非常强,那它对你来说就是个宝藏模型。

在此,笔者公开了我们团队内部富集和撰写的一个hard case(困难样例)测试集。这份测试集重点关注模型对困难问题/指令的解决能力。

这个困难测试集重点考察了模型的语言理解、复杂指令理解与遵循、文本生成、复杂内容生成、多轮对话、矛盾检测、常识推理、数学推理、反事实推理、危害信息识别、法律伦理意识、中国文学知识、跨语言能力和代码能力等。

再次强调一遍,这是笔者团队为测试生成式模型对困难样例解决能力而做的一个case集,评测结果只能代表“对笔者团队而言,哪个模型感觉更好”,远远不能代表一个无偏的测试结论,如果想要无偏的测试结论,请先解答以上提到的测评问题,再去定义权威测试基准。

想要自己评测验证的小伙伴,可以在本公众号“夕小瑶科技说”后台回复【AI评测】口令来下载测试文件

以下是在superclue榜单中受争议最大的讯飞星火、文心一言与ChatGPT这三个模型的测评结果:

百度文心一言在国产模型中倒数?我看懵了

百度文心一言在国产模型中倒数?我看懵了

百度文心一言在国产模型中倒数?我看懵了

困难Case解决率:

  • ChatGPT(GPT-3.5-turbo):11/24=45.83%
  • 文心一言(2023.5.10版本):13/24=54.16%
  • 讯飞星火(2023.5.10版本):7/24=29.16%

这是要论证讯飞星火不如文心一言吗?如果你仔细看前文了,就明白笔者想说什么。

确实,尽管在这份我们内部的困难case集上,星火模型不如文心一言,但这不能说明综合起来谁一定比谁强,仅仅说明,在我们团队内部的困难case测试集上,文心一言表现最强,甚至比ChatGPT多解决了2个困难case。

对于简单问题而言,其实国产模型跟ChatGPT已经没有太大差距。而对于困难问题而言,各个模型各有所长。就笔者团队的综合使用体验来看,文心一言完全足以吊打ChatGLM-6B等学术测试性质的开源模型,部分能力上不如ChatGPT,部分能力上又超越了ChatGPT。

阿里通义千问、讯飞星火等其他大厂出品的国产模型也是相同的道理。

还是那句话,如今连一个无偏的测试基准都没出现,你要那模型排名有啥用?

比起争论各类有偏的榜单排名,不如像笔者团队一样去做一个自己关心的测试集。

能解决你问题的模型,就是好模型。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型 百度
相关文章 更多
115、百度网盘 618 加促 2 天:VIP & 超级会员低至 75 元起 / 年均探底
115、百度网盘 618 加促 2 天:VIP & 超级会员低至 75 元起 / 年均探底

百度网盘超级会员年卡限时特惠,原价298元,现仅189元加送2个月共14个月,月均仅13.5元,年付低至162元,活动至6月20日,比原价节省109元。115网盘VIP两年仅150元,另有多种联合会员套餐可选,如百度网盘联合套餐等,超值优惠,机会难得。

百度旗下文心助手月活跃用户数突破 2 亿
百度旗下文心助手月活跃用户数突破 2 亿

百度旗下文心助手月活跃用户数突破两亿大关,依托文心大模型与DeepSeek技术,实现搜索、服务与创作一体化,并内测了多人协同多Agent群聊功能,推动AI从单点对话向群体协作演进,这标志着AI应用进入新阶段。

如何查看百度杀毒日志
如何查看百度杀毒日志

在使用百度杀毒进行电脑防护的过程中,查看杀毒日志能够帮助我们了解软件的运行情况、检测到的威胁以及处理结果等重要信息。那么,该如何查看百度杀毒日志呢?首先,打开百度杀毒软件。确保软件已经成功安装并正常运行在你的电脑上。找到百度杀毒软件的主界面图标,双击打开它。进入百度杀毒主界面后,在界面的上方菜单栏中

多重冲击之下,百度不知道如何做搜索了
多重冲击之下,百度不知道如何做搜索了

8月20日,新任百度App研发中心负责人何径舟首次公开亮相,他带来了两项搜索的产品升级。其中一项是搜索结果形态"GUI通识卡片"。在体验交流时,一位百度负责产品的人员向透露,这是其首创的"整页可交互"的搜索结果形态,能够把知识卡片、步骤图解、可交互动画整合成一个完整页面,目前覆盖数理化的全部高频考点

百度相册官网照片管理入口 百度相册官方网页版平台
百度相册官网照片管理入口 百度相册官方网页版平台

百度相册的正式入口是https://xiangce.baidu.com/index.html ,它有四大核心功能:多端同步、智能整理、隐私控制和离线协作。多端同步可实现网页端、app端和tv版之间的实时同步,如网页端新增照片会实时同步至百度App内的“一刻相册”模块,手机端编辑的文字描述或标签也能反

百度相册官方在线入口 百度相册官网最新登录地址
百度相册官方在线入口 百度相册官网最新登录地址

百度相册的最新在线入口为xiangce.baidu.com。它拥有诸多强大的核心功能,比如能实现原图无损上传,让你珍贵的照片保持最原始的清晰度;多端同步功能更是方便至极,无论你在电脑、手机还是平板上操作,数据都能实时同步;智能分类可根据图像内容自动识别出人物、地理位置、宠物、文字等二十类属性,让你的

百度相册网页版在线平台 百度相册官网官方登录入口
百度相册网页版在线平台 百度相册官网官方登录入口

想登录百度相册网页版?入口就在xiangce.baidu.com,主流浏览器都能直接访问哦!而且支持百度账号一键登录,还有扫码/密码双通道验证,超方便。它的功能也很强大,有智能排序、多级分类、批量操作,能满足你各种管理照片的需求。不仅如此,还提供历史快照,让你随时回溯照片的变化,并且实现跨端实时同步

百度相册官方入口在线登录 百度相册官网网页版登录
百度相册官方入口在线登录 百度相册官网网页版登录

百度相册最新的在线登录入口是https://photo.baidu.com/photo/web/login ,该入口支持扫码登录和账号密码直登两种方式,能兼容主流浏览器。其界面设计简洁大方,拥有智能分类、批量管理、隐私保护以及AI识图等功能,为用户提供了便捷且安全的相册管理体验。百度相册最新入口在线

百度相册网页版登录平台 百度相册官网官方入口
百度相册网页版登录平台 百度相册官网官方入口

百度相册网页版的正式入口是https://xiangce.baidu.com。在此,用户能通过百度账号一键登录或扫码登录。该网页版功能丰富,涵盖多端同步、智能分类、批量上传、在线修图、AES - 256加密存储以及跨终端协同等。百度相册网页版登录平台的正式入口究竟在哪儿呢?这可是许多网友都极为关注的

百度相册官网最新入口平台 百度相册官方网站登录地址
百度相册官网最新入口平台 百度相册官方网站登录地址

百度相册官网入口是xiangce.baidu.com,提供原图无损上传、多端同步、智能分类、大容量免费存储等核心功能。近期,不少用户频繁搜索百度相册官网入口平台在哪里。别着急,接下来PHP小编将为大家带来百度相册官网在线地址,感兴趣的用户不妨一起来看看吧! xiangce.baidu.com 平台基

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。