阿里通义千问发布Qwen3Guard安全卫士、Qwen-Image图像生成模型及GSPO强化学习算法

通义千问系列推出首个安全防护模型及20B图像生成模型,并发布新型强化学习算法。

新发布

核心事件:通义千问系列三大技术突破集中发布

阿里通义实验室于近期统一公布Qwen4及全模态模型路线图,同步释放多项关键进展:

  • Qwen3Guard:Qwen家族首个安全防护模型,基于Qwen3基础模型微调,专用于安全分类任务
  • Qwen-Image:200亿参数MMDiT图像生成模型,支持复杂文本渲染与图像编辑
  • Qwen-Image-Edit:基于Qwen-Image扩展的图像编辑版本,支持语义级与外观级双重编辑能力
  • Qwen-MT (qwen-mt-turbo):多语言翻译模型升级版,支持92种语言,集成强化学习技术
  • GSPO算法:新提出的_group sequence policy optimization_算法,旨在解决强化学习训练不稳定问题

上述模型已在GitHub、Hugging Face、ModelScope同步开源,并提供在线Demo与API服务。

技术细节与关键参数

安全防护层首次构筑:Qwen3Guard在国内首次实现对prompt与response的双向安全检测,输出风险等级与分类标签。其在主流安全基准测试中达到当前最优水平,覆盖中英文及多语言场景。值得注意的是,该模型虽属安全子类,却依托于Qwen3主干模型——这意味着其推理能力未因安全任务产生显著折损,打破了‘安全与性能必须 trade-off’的行业默认前提。

图像生成能力跃升:Qwen-Image采用20B参数量级MMDiT架构,主打复杂文本渲染能力,支持多行排版、段落级语义理解与细粒度细节控制。相比同类模型仅处理单句文本的局限,Qwen-Image可实现段落级文字嵌入图像,并保持文字可读性——这是当前多数生成式图像模型仍较薄弱的环节。

其衍生版本Qwen-Image-Edit进一步引入双路径控制:一路输入Qwen2.5-VL进行视觉语义控制,另一路输入VAE编码器进行视觉外观保持,从而实现‘改字不改图’的精准编辑效果。

多语言翻译升级:Qwen-MT (qwen-mt-turbo)基于Qwen3底层能力,利用万亿级多语言与翻译语料训练,覆盖92种主流官方语言及重要方言,覆盖超95%全球人口。其翻译准确率与语言流畅性通过强化学习技术获得显著提升。

模型版本参数规模特性安全能力开放渠道
Qwen3Guard基于Qwen3安全分类prompt/response双向检测GitHub / HF / ModelScope
Qwen-Image20B图像生成无 explicit 说明Qwen Chat / GitHub / HF / ModelScope
Qwen-Image-Edit基于Qwen-Image图像编辑无 explicit 说明GitHub / HF / ModelScope / Demo
Qwen-MT (turbo)基于Qwen3多语言翻译无 explicit 说明API / GitHub / HF / ModelScope

强化学习训练稳定性新解

针对当前强化学习(RL)在长训练中易出现模型坍塌(model collapse)导致性能倒退的顽疾,通义实验室提出GSPO(Group Sequence Policy Optimization)。该算法强调维持训练动态的稳定性与鲁棒性,为后续千卡级大模型RL扩展铺平道路。

需要说明的是,目前GSPO尚未配套开源具体代码实现,其技术有效性依赖于论文验证结果;是否适配消费级算力环境尚不明确。

读者落地建议

  • 适合立即尝试者:需要高质量多语言翻译(尤其小语种)的开发者,可接入Qwen-MT API;设计师或内容创作者可测试Qwen-Image生成带复杂排版文字的插图,规避当前多数模型‘文字模糊’的缺陷。

  • 建议再等等者:期待免费本地部署Qwen3Guard的安全团队应关注其是否提供轻量化版本——当前Tech Report未披露具体推理资源需求;需要图像编辑功能的用户可等待Qwen-Image-Edit Demo上线后实测编辑流畅度。

写在最后

通义千问此次同步推进基础模型(Qwen3)、专用模型(Image/MT)与底层算法(GSPO)三线突破,展现出‘全栈自研’的清晰路径。尤其将安全能力作为独立模块封装,代表大模型实用化进程中对合规性与可控性的重视已 reaching ainflection point.*