Featured image of post 华为开源盘古 openPangu-2.0 全链路训练代码:预训练、SFT 与 RL 后训练一并开放

华为开源盘古 openPangu-2.0 全链路训练代码:预训练、SFT 与 RL 后训练一并开放

华为正式开源 openPangu-2.0 全套训练代码,覆盖预训练、监督微调与强化学习后训练环节。

新发布

华为开源 openPangu-2.0 全链路训练体系

2026 年 9 月 28 日,华为宣布开源盘古 openPangu-2.0 的预训练、SFT(Supervised Fine-Tuning,监督微调)代码以及后训练 RL(Reinforcement Learning,强化学习)代码正式上线。该项目旨在通过昇腾原生训练与推理技术,为业界提供昇腾生态下的最佳实践参考。开源工作分为两个核心仓库:

当前代码基于 PyTorch 与 CANN(Compute Architecture for Neural Networks)生态构建,适配昇腾系列 AI 处理器。截至发稿,openPangu-2.0-Training 仓库标注 Star 数为 23(注:原文中 “项目成员 23” 应为 Star 数,Fork 为 0,提交数为 1,无 Tags)。


开源组件与技术定位

openPangu-2.0-Training 是一个大规模基础模型训练框架项目,配套用于昇腾原生训练的开源盘古 2.0 系列模型。根据项目介绍,其涵盖两部分核心功能:

  • 预训练代码:支撑大规模语言模型的初始训练阶段
  • SFT(监督微调)代码:基于标注数据对模型进行任务定向优化

而 openPangu-2.0-RL 则聚焦于模型训练的最后环节——强化学习后训练,通常用于对齐模型行为、提升其与人类意图的一致性。

chained execution:需特别注意的是,两个仓库当前均处于极早期阶段——Fork 数为 0,提交数仅 1,无 Tag 发布。这意味着该训练框架尚未经历社区广泛迭代,提供的是初始版本开源。对于期待稳定生产就绪代码的团队,需评估当前工程成熟度是否满足自身需求。


对比参考:开源生态中的位置

尽管原文未给出版本对比数据,根据开源训练框架的行业惯例,openPangu-2.0 的特色在于其对昇腾软硬协同生态的深度整合。下表总结了与主流训练框架的定位差异(仅基于原文事实整合):

项目框架基础硬件适配训练阶段覆盖
openPangu-2.0PyTorch + CANN昇腾原生预训练 + SFT + RL 后训练
主流通用框架PyTorch / TF通用 GPU通常含预训练/SFT,RL 非标配

关键点:openPangu-2.0 是目前少数明确将 RL 后训练环节作为独立模块开源的中文大模型项目,这体现了其对模型对齐技术链的完整支持,而多数开源项目仅公开基础训练代码。


读者落地建议

  • 适合谁用:使用昇腾硬件(如 Atlas 系列服务器)进行大模型定制开发的企业与研究团队;希望完整追踪从预训练到 RL 对齐全流程的工程团队。
  • 建议再等等的场景:对训练代码稳定性有硬性要求的生产环境团队;当前无昇腾硬件部署基础的用户,可鉴于项目尚处 1 提交的极早期状态,建议等待后续版本迭代。

写在最后

此次开源填补了国产昇腾生态下完整训练链路的空白。从预训练、SFT 到 RL 后训练的端到端开放,标志着国内 AI 框架正从单一模型推理适配,迈向系统级训练能力开源的新阶段。