阿里云发布通义千问2.0,性能加速追赶GPT-4
在2023杭州云栖大会上,阿里云首席技术官周靖人发布千亿级参数大模型通义千问2.0。在10个权威测评中,通义千问2.0综合性能超过GPT-3.5,正在加速追赶GPT-4。
据悉,过去6个月,通义千问2.0在性能上取得巨大飞跃,相比4月发布的1.0版本,通义千问2.0在复杂指令理解、文学创作、通用数学、知识记忆、幻觉抵御等能力上均有显著提升。目前,通义千问的综合性能已经超过GPT-3.5,加速追赶GPT-4。
在MMLU、C-Eval、GSM8K、HumanEval、MATH等10个主流Benchmark测评集上,通义千问2.0的得分整体超越Meta的Llama-2-70B,相比OpenAI的Chat-3.5是九胜一负,相比GPT-4则是四胜六负,与GPT-4的差距进一步缩小。
中英文理解能力是大语言模型的基本功。英语任务方面,通义千问2.0在MMLU基准的得分是82.5,仅次于GPT-4,通过大幅增加参数量,通义千问2.0能更好地理解和处理复杂的语言结构和概念;中文任务方面,通义千问2.0以明显优势在C-Eval基准获得最高得分,这是由于模型在训练中学习了更多中文语料,进一步强化了中文理解和表达能力。
在数学推理、代码理解等领域,通义千问2.0进步明显。在推理基准测试GSM8K中,通义千问排名第二,展示了强大的计算和逻辑推理能力;在HumanEval测试中,通义千问得分紧跟GPT-4和GPT-3.5,该测试主要衡量大模型理解和执行代码片段的能力,这一能力是大模型应用于编程辅助、自动代码修复等场景的基础。
相关阅读
- 后摩尔时代破局者:物元半导体领航中国3D集成制造产业
- 1725kW/2236kWh!明美新能源助力南非储能项目并网成功
- 受AI热潮、内存短缺推动,应用材料DRAM芯片设备营收大涨34%
- 新款STM32U5:让便携产品拥有惊艳图效
- 比特早报:人工智能首尔峰会线上开幕,我国首次实现完全可编程拓扑光子芯片
- 东软睿驰与瑞萨电子达成合作伙伴关系,强化汽车软硬件协同创新
- 垂直力量!华晟异质结组件荣膺TUV莱茵 “质胜中国优胜奖”!
- 贸泽电子田吉平荣膺产业特别贡献人物奖
- 英特尔全方位助力解决方案服务商伙伴业务升级,加速推进区域数字化发展
- 比特网早报:宇树人形机器人新外观设计专利获授权,OpenAI 2025年年化收入破200亿美元