Qwen3-2507系列发布:235B级MoE模型开放,支持百万Token长上下文

通义千问最新版Qwen3-2507系列开放下载,含235B/30B/4B三款MoE与稠密模型。

核心事件:Qwen3-2507系列正式发布

阿里巴巴通义实验室于2025年8月推出Qwen3-2507系列大语言模型,包含两个主要变体三种规模

  • 两个变体:Qwen3-Instruct-2507(非思考模式,适用于通用对话)与Qwen3-Thinking-2507(思考模式,专精复杂推理)
  • 三种规模:Qwen3-235B-A22B(MoE架构)、Qwen3-30B-A3B(MoE架构)、Qwen3-4B(稠密架构)

所有模型权重已向公众开放,可通过Hugging Face或ModelScope获取。235B与30B系列在2025年7月底至8月初分批发布,4B版本于2025年8月6日最终开放。

模型支持256K Token长上下文,可扩展至100万Token(自2025年8月8日起启用),适用于文档摘要、长文本生成等需要上下文理解的任务。

性能提升与能力升级

Qwen3-Instruct-2507作为前代非思考模式的进化版,在多项基础能力上实现显著增强:通用指令遵循、逻辑推理、文本理解、数学能力、科学知识、编程能力以及工具调用能力均有明显提升;多语言长尾知识覆盖范围扩大;在主观与开放性任务中更好对齐用户偏好;256K Token长上下文支持提升至极限100万Token

Qwen3-Thinking-2507延续Qwen3思考模式定位,在推理任务上表现更为突出,涵盖逻辑推理、数学、科学、编程及学术基准测试——在开源权重思考模型中达到当前最优水平(state-of-the-art)。同时,其通用能力(指令遵循、工具使用、文本生成、人类偏好对齐)与长上下文处理能力同步增强。

值得注意的是,Qwen3系列通过稠密与MoE混合架构提供灵活选择:235B-A22B与30B-A3B采用Mixture-of-Expert(MoE,混合专家)设计,仅激活部分参数提升效率;而4B为传统稠密模型,更适合资源受限环境部署。

模型版本架构类型非思考模式思考模式最大上下文发布日期
Qwen3-235B-A22B-Instruct-2507MoE (235B总参数, 22B激活)支持不生成 blocks100万Token2025.07.21
Qwen3-235B-A22B-Thinking-2507MoE (235B总参数, 22B激活)不生成enums blocks支持100万Token2025.07.25
Qwen3-30B-A3B-Instruct-2507MoE (30B总参数, 3B激活)支持不生成Markdown100万Token2025.07.30
Qwen3-30B-A3B-Thinking-2507MoE (30B总参数, 3B激活)不生成Markdown支持100万Token2025.07.31
Qwen3-4B-Instruct-2507稠密支持不生成Markdown100万Token2025.08.06
Qwen3-4B-Thinking-2507稠密不生成Markdown支持100万Token2025.08.06

使用方式与技术规格

模型可通过Hugging Face Transformers库加载,要求transformers版本≥4.51.0。加载示例代码已在官方提供:

1
2
3
4
5
6
7
8
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-30B-A3B-Instruct-2507"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"
)

注意事项:Instruct-2507系列默认不生成代码块,无需显式指定enable_thinking=False;Thinking-2507则会输出思考过程标记块。

MoE模型支持lama.cpp、Ollama、LM Studio等本地运行框架,也兼容SGLang、vLLM、TGI等推理加速服务。

落地建议

适合立即使用的场景

  • 需要推理能力的开发者:选择Thinking-2507系列,尤其适合数学、编程、学术任务
  • 需要长上下文理解的业务:256K起始支持,百万Token上限适用于多文档整合分析
  • 资源受限环境:4B稠密模型轻量易部署,适合边缘设备或低预算场景

建议再观望的场景

  • 推理质量要求极端苛刻的生产环境:尽管Thinking-2507在开源模型中领先,仍建议对比商业闭源模型效果
  • 需要多模态能力的用户:本次更新仅涉及文本模型, multimodal版本未提及

写在最后

Qwen3-2507系列将推理与通用对话的分离设计推向更成熟阶段,开源大模型首次在思考能力上达到商业领先水准,为社区与企业提供了真正可落地的高性能替代方案。MoE混合架构与百万Token上下文的组合,标志着大模型从"参数竞赛"转向"实用效率"的新阶段。