阿里云发布通义千问2.0,性能加速追赶GPT-4
在2023杭州云栖大会上,阿里云首席技术官周靖人发布千亿级参数大模型通义千问2.0。在10个权威测评中,通义千问2.0综合性能超过GPT-3.5,正在加速追赶GPT-4。
据悉,过去6个月,通义千问2.0在性能上取得巨大飞跃,相比4月发布的1.0版本,通义千问2.0在复杂指令理解、文学创作、通用数学、知识记忆、幻觉抵御等能力上均有显著提升。目前,通义千问的综合性能已经超过GPT-3.5,加速追赶GPT-4。
在MMLU、C-Eval、GSM8K、HumanEval、MATH等10个主流Benchmark测评集上,通义千问2.0的得分整体超越Meta的Llama-2-70B,相比OpenAI的Chat-3.5是九胜一负,相比GPT-4则是四胜六负,与GPT-4的差距进一步缩小。
中英文理解能力是大语言模型的基本功。英语任务方面,通义千问2.0在MMLU基准的得分是82.5,仅次于GPT-4,通过大幅增加参数量,通义千问2.0能更好地理解和处理复杂的语言结构和概念;中文任务方面,通义千问2.0以明显优势在C-Eval基准获得最高得分,这是由于模型在训练中学习了更多中文语料,进一步强化了中文理解和表达能力。
在数学推理、代码理解等领域,通义千问2.0进步明显。在推理基准测试GSM8K中,通义千问排名第二,展示了强大的计算和逻辑推理能力;在HumanEval测试中,通义千问得分紧跟GPT-4和GPT-3.5,该测试主要衡量大模型理解和执行代码片段的能力,这一能力是大模型应用于编程辅助、自动代码修复等场景的基础。
相关阅读
- 贸泽电子倾力打造新能源资源中心 为设计工程师提供丰富内容和值得信赖的产品
- 美光发布 2024 年可持续发展报告,聚焦进展与长期愿景
- 比特早报:各地区陆续成立数据局,马逊云计算业务全年营收逾900亿美元
- 岁末喜迎20周年,2024年Automechanika Shanghai拥抱创新变革,驱动汽车产业可持续发展
- 电力市场化浪潮下,“运维+交易”铸就分布式资产盈利新引擎
- 中昱绿能100GW光伏配套石英坩埚一期项目点火
- 瑞浦兰钧与韩国晓星重工业签署储能领域合作备忘录 共拓全球市场
- 终端快充行业协会将制定伸缩式快速充电线团体标准,拟明确伸缩寿命等指标
- TUV莱茵加入AEC汽车电子委员会,致力提升汽车电子产品可靠性
- SK 海力士宣称英特尔未来 AI 芯片 “Jaguar Shores” 支持 HBM4 内存