通义千问2.5系列发布:72B开源模型登场,性能直逼闭源巨头

通义千问2.5系列正式发布,含通用、编码与数学专用模型,最大72B参数开源。

开放权重大模型生态再添重磅玩家

2026年8月,通义千问系列迎来三代同堂式更新:在Qwen2发布仅三个月后,通义实验室推出Qwen2.5系列大模型。此次更新不仅包含通用语言模型Qwen2.5,还新增面向编程与数学的垂直专用模型——Qwen2.5-Coder与Qwen2.5-Math。所有关联模型均为密集型(dense)解码器架构,提供0.5B至72B共七种参数规模。核心事实如下

  • 发布时间:2026年8月下旬
  • 新增版本:Qwen2.5系列(0.5B/1.5B/3B/7B/14B/32B/72B)、Qwen2.5-Coder(1.5B/7B/32B)、Qwen2.5-Math(1.5B/7B/72B)
  • 价格与可用性:所有开源模型开放权重(open-weight),绑定Apache 2.0许可证(3B与72B除外)
  • 许可证状态:除3B与72B版本外,其余均开放权重
  • API服务:Qwen-Plus与Qwen-Turbo可通过Model Studio调用

此次发布被官方描述为"史上最大规模开源发布",覆盖从轻量级边缘部署到高性能推理的全场景需求。

性能突破与关键升级

Qwen2.5系列在多个能力维度实现显著跃升:基础模型预训练数据量达18万亿Token相比Qwen2大幅扩充知识储备(MMLU均分突破85),同时在编程(HumanEval 85+)与数学(MATH 80+)专项测试中表现突出。值得注意的是,最小参数规模的Qwen2.5-3B模型架构仅30亿参数,却在MMLU基准测试中取得65+高分,印证了当前行业向高知识密度小模型收敛的趋势——这意味着性能不再完全依赖参数量堆叠。

在长期任务支持方面,Qwen2.5维持128K上下文窗口与8K输出长度,支持29种语言(含中英法德意俄日韩越南泰阿拉伯等)。后训练流程升级带来四点改进:长文本生成能力强化、结构化数据(如表格)理解提升、JSON等结构化输出可靠性增强系统提示多样性鲁棒性提高利于角色扮演与条件设定。

Qwen2.5-Coder累计训练5.5万亿代码Token数据,其7B版本在编码任务中甚至超越部分更大参数规模的通用模型;Qwen2.5-Math融合中文支持及三种推理范式(思维链CoT、程序链PoT、工具集成推理TIR),其1.5B微型版本已展现挑战大型模型的竞争力。

模型规格对比

模型类型参数规模许可证特点
Qwen2.50.5B/1.5B/3B/7B/14B/32B/72BApache 2.0 (3B/72B除外)通用语言模型,MMLU >85
Qwen2.5-Coder1.5B/7B/32BApache 2.0编码专用,5.5万亿Token训练数据
Qwen2.5-Math1.5B/7B/72BApache 2.0数学专用,支持CoT/PoT/TIR推理
Qwen2-VL-72B72B未明确提及视觉语言模型,性能较上月提升
Qwen-Plus (API)商业授权面向生产环境的API服务
Qwen-Turbo (API)商业授权高性价比低延迟API服务

开源模型Hugging Face仓库附带许可证文件,用户可按需验证具体版本条款。

落地使用建议

对开发者而言,以下策略值得考虑:

  • 适合立即采用:中小团队或资源受限场景可选用Qwen2.5-7B/14B/32B系列在通用任务、编码辅助与数学推演上获得接近大模型的性能但部署成本更低;教育与研究机构推荐从Qwen2.5-Math-1.5B起步验证数学教学或自动化解题可行性
  • 建议再等等:若应用场景对中文兼容性或极端错误敏感(如法律文书生成),可等待Qwen2.5-Math增强版或Qwen2.5-Coder完整版发布;生产系统若需与GPT-4o/ Claude 3.5 Sonnet对标建议当前优先采用Qwen-Plus API并关注其迭代

通义实验室同步开放了Qwen2.5-Coder与Qwen2.5-Math的早期版本(如1.5B/7B/32B/72B),项目生命周期管理需注意其72B版本可能独属Apache 2.0例外清单。

写在最后

当72B开源模型性能逼近闭源标杆时,开源生态的价值正从"能用"转向"好用"。值得注意的是,Qwen2.5-72B基础模型(未经指令微调)在对比中已逼近405B级Llama-3,说明架构创新与数据效率成为新一代模型的关键竞争维度。

原文配图1
原文配图1|新闻截图

原文配图2
原文配图2|新闻截图

原文配图3
原文配图3|新闻截图

原文配图4
原文配图4|新闻截图