首页>动态>正文
天天微动态丨上海研发的“书生·浦语”大语言模型发布
2023-06-07 21:06:43    来源:澎湃新闻

上海研发的“书生·浦语”大语言模型发布

6月7日,上海人工智能实验室(上海AI实验室)、商汤科技联合香港中文大学、复旦大学及上海交通大学发布千亿级参数大语言模型“书生·浦语”(InternLM)。

随着AI大语言模型越来越多地表现出接近人类的智能,面向人类设计的高难度、综合性考试被越来越多地引入对语言模型的智能水平进行评测。OpenAI在其关于GPT-4的技术报告中就主要通过各领域的考试对模型能力进行检验。2023年高考开考,中文大语言模型是否能够在高考中赶超ChatGPT呢?

据上海人工智能实验室介绍,“书生·浦语”具有1040亿参数,是在包含1.6万亿token的多语种高质量数据集上训练而成。全面评测结果显示,“书生·浦语”不仅在知识掌握、阅读理解、数学推理、多语翻译等多个测试任务上表现优秀,而且具备很强的综合能力,因而在综合性考试中表现突出,在多项中文考试中取得超越ChatGPT的成绩,其中就包括中国高考各科目的数据集(GaoKao)。


(资料图片)

综合“大考”:“书生·浦语”多项成绩领先于ChatGPT

“书生·浦语”联合团队选取了20余项评测对其进行检验,其中包含全球最具影响力的四个综合性考试评测集:由伯克利加州大学等高校构建的多任务考试评测集MMLU;微软研究院推出的学科考试评测集AGIEval(含中国高考、司法考试及美国SAT、LSAT、GRE 和 GMAT等);由上海交通大学、清华大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集C-Eval;以及由复旦大学研究团队构建的高考题目评测集Gaokao。

实验室联合团队对“书生·浦语”、GLM-130B、LLaMA-65B、ChatGPT 和 GPT-4 进行了全面测试,针对上述四个评测集的成绩对比。

研究发现,“书生·浦语”不仅显著超越了GLM-130B和LLaMA-65B 等学术开源模型,还在AGIEval、C-Eval、以及Gaokao等多个综合性考试中领先于ChatGPT;在以美国考试为主的MMLU上实现和 ChatGPT 持平。这些综合性考试的成绩反映出“书生·浦语”扎实的知识掌握程度和优秀的综合能力。

虽然 “书生·浦语”在考试评测上取得优秀成绩,但在测评中也可以看到,大语言模型仍然存在不少能力局限性。“书生·浦语” 受限于2K的语境窗口长度(GPT-4的语境窗口长度为32K),在长文理解、复杂推理、撰写代码以及数理逻辑演绎等方面还存在明显局限。另外,在实际对话中,大语言模型还普遍存在幻觉、概念混淆等问题;这些局限使得大语言模型在开放场景中的使用还有很长的路要走。

分项评测:阅读理解、推理能力表现出色

为了避免“偏科”,研究人员还通过多个学术评测集,对“书生·浦语”等语言模型的分项能力进行了评测对比。结果显示,“书生·浦语”不仅在中英文的阅读理解方面表现突出,并且在数学推理、编程能力等评测中也取得了较好的成绩。

例如,在知识问答方面,“书生·浦语”在TriviaQA 和 NaturalQuestions 两项评测上得分为69.8和27.6,均超越 LLaMA-65B(得分为68.2和23.8,满分100分)。

在阅读理解(英语)方面,“书生·浦语”明显领先于 LLaMA-65B 和 ChatGPT。浦语在初中和高中英语阅读理解中得分为92.7和88.9,⽽ChatGPT得分为85.6和81.2,LLaMA-65B则更低。

在中文理解方面,“书生·浦语”的成绩全面超越主要的两个中文语言模型ERNIE-260B和GLM-130B。在多语翻译方面,“书生·浦语”在多语种互译中的平均得分为33.9,显著超越LLaMA(平均得分15.1)。

在编程能力方面,“书生·浦语”在HumanEval 和MBPP这两项最具代表性的考评中,分别取得28.1和 41.4的得分(其中经过在代码领域的微调后,在HumanEval上的得分可以提升至45.7),明显领先于 PaLM-540B(得分为 26.2 和 36.8)与LLaMA-65B(得分为 23.7 和 37.7)。

此外,研究人员还对“书生·浦语”的安全性进行评测,在TruthfulQA(主要评价回答的事实准确性) 以及 CrowS-Pairs(主要评价回答是否含有偏见)上,“书生·浦语”均达到领先水平。

关键词:

天天微动态丨上海研发的“书生·浦语”大语言模型发布

上海研发的“书生·浦语”大语言模型发布6月7日,上海人工智能实验室(2023-06-07

海关总署:前5个月我国进出口增长4.7%-即时

海关总署:前5个月我国进出口增长4 7%---人民网北京6月7日电(记者王震2023-06-07

世界热点评!宇宙最多的两个元素是氢和什么_宇宙最多的两个元素是什么

想必现在有很多小伙伴对于宇宙最多的两个元素是什么方面的知识都比较想2023-06-07

探访贵州遵义“中国辣椒城”

6月6日,工人在贵州省遵义市中国辣椒城进行辣椒脱把。近日,位于贵州省2023-06-07

第十九届文博会开幕 推动中国文化产业发展

新华社深圳6月7日电(记者王思北、李晓玲)为期5天的第十九届中国(深2023-06-07

世界观热点:实惠喵怎么分享给好友 操作方法介绍

实惠喵怎么分享给好友操作方法介绍,2023-06-07

全球热推荐:一般纳税人房屋出租简易征收税率(房屋租赁税率11 简易征收5)

1、简易征税应注意增值税征收率统一调整为3%。2、至此,大家不再为五花2023-06-07

倒计时20天!天津夏季达沃斯论坛6月27日开幕|快看

天津夏季达沃斯论坛2023年6月27日-2023年6月29日企业家精神:世界经济2023-06-07

武汉化工区税务局以“模拟法庭”强化企业依法纳税意识

武汉化工区税务局以“模拟法庭”强化企业依法纳税意识---随着法槌的清2023-06-07

天天新动态:lte网络是什么意思

LTE网络是网络制式的一类,是4G网络的制式;LTE便是通用移动通信技术的2023-06-07

康辰药业:公司目前经营正常 在研KC1036、金草片等项目正常推进 环球新要闻

康辰药业6月7日在投资者互动平台表示,公司目前经营正常,销售方面,主2023-06-07

天天看热讯:每体记者:尽管梅西想回巴萨但我认为这不可能,他在绝望里等待着

直播吧6月7日讯关于巴萨重签梅西的话题,《每日体育报》记者卡梅-巴切2023-06-07

环球短讯!帝国时代罗马复兴秘籍建筑无敌(帝国时代罗马复兴秘籍)

1、在游戏中,按回车键,填写以下秘籍。输入完成后,按回车键确认。2、2023-06-07

澳优子公司拟向伊利方面出售新西兰奶粉工厂60%股权

澳优子公司拟向伊利方面出售新西兰奶粉工厂60%股权,股权,奶粉,乳业,新2023-06-07

全球微动态丨Q1全球半导体设备出货金额达1908亿元 同比增长9%

6月6日,国际半导体产业协会SEMI发布的报告指出,2023年第一季度全球半2023-06-07

环球头条:在探索与好奇中破“卷” | 2023高考加油

前年考“沉淀与认识”,去年考“发问与结论”,今年考“探索与好奇”。2023-06-07

播报:厦门:壮大城市引才联盟 深入推动职称改革

强化国际化引才工作,对构筑有独特吸引力的人才高地、以人口高质量发展2023-06-07

不和阿根廷队一同抵达!梅西官宣决定,名记曝内幕,中国球迷失落_微资讯

这次梅西将会带着世界杯主力成员还有世界杯冠军奖杯,来到现场和球迷互2023-06-07

2023上半年内蒙古英语四六级准考证打印入口官网

2023上半年内蒙古大学英语四六级准考证打印打印时间:2023年6月8日9:002023-06-07

熵基科技:6月6日融资买入2049.05万元,融资融券余额1.22亿元|焦点播报

6月6日,熵基科技(301330)融资买入2049 05万元,融资偿还2464 1万元2023-06-07

怎么安装打印机的扫描功能_怎么安装打印机|环球今亮点

1、安装打印机,对一个会电脑的人是一个很简单的操作,但如果对一个不2023-06-07

香蕉皮泡水喝的功效_香蕉皮泡水喝的功效减肥|全球即时看

1、香蕉属于芭蕉科、芭蕉属、真蕉亚属。2、香蕉其实是食用蕉(甘蕉)的2023-06-07

多家媒体发声力挺A股:增强对市场的信心、决心和耐心_环球视点

【官媒接连发声力挺A股】6月5日周一,包括经济日报、经济参考报、上证2023-06-07

小学therebe句型练习题_小学there be句型练习题_环球热议

1、在四年级教材中,首次出现Therebe句型:Thereisabeeontheboard2023-06-07