核心事件:NeoHorse 模型发布
基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、阿里巴巴等机构,正式发布首个 Agent-Native 架构模型 NeoHorse-1。该模型不依赖传统指令微调,而是直接从 Agent 执行过程中产生的轨迹数据中学习、迭代。
核心硬信息如下:
- 发布时间:2026 年 9 月(技术报告已公开)
- 版本型号:NeoHorse-1,含 4B 和 9B 两个参数规模版本
- 训练底座:基于阿里巴巴开源 Qwen3.5-4B 和 Qwen3.5-9B 进行后训练
- 开源情况:Routing Harness 系统 OpenSquilla 已开源;模型底座与算法方法公开,未明确说明是否开源 NeoHorse 权重
- 训练范式:采用 \“执行轨迹监督 + 在策略蒸馏(On-Policy Distillation)\",教师模型根据学生实际生成内容提供指导
注:Agent-Native 指模型训练目标与 Agent 实际执行流程完全对齐——即模型预测/生成即构成 Agent 决策链的一部分,而非先预测再由外部系统调度。
训练方法:执行轨迹为核心数据源
NeoHorse 的训练语料以 Routing Harness 系统(OpenSquilla)产出的执行轨迹为核心。Routing Harness 是基元律动此前开源的工具,用于在 Agent 执行任务时动态选择与组合不同模型,应对任务需求。该系统产出的轨迹数据包含完整信息:
- 能力需求预测
- 路由选择决策
- 模型响应内容
- 工具调用行为
- 环境反馈结果
这些轨迹经过完整性检查及三类质量评估后用于后训练:
- 目标是否完成:最终任务是否达成
- 证据一致性:中间推理是否与最终结果逻辑一致
- 错误恢复能力:发现失败后能否调整并重试
训练过程中,团队进一步引入路由信号驱动的动态训练调度:基于任务对能力的需求估计,调整模型训练顺序;并结合在策略蒸馏技术,由教师模型针对学生模型实际生成内容进行修正指导。
评测表现:4B 版本反超 9B 底座模型
NeoHorse 在 11 项 benchmark 上完成评测,覆盖 Agent 执行、工具交互、代码生成、指令遵循等任务场景。
关键结果如下:
- 未加权平均分:NeoHorse 4B 为各 4B 级模型中最高
- 5 项基准超越 Qwen3.5-9B 底座模型
- 改善最显著的场景:流程清晰、反馈可观察、结果可验证的任务
- 相比之下,9B 版本在复杂状态维护、长程调试、失败恢复中仍具优势——说明更大模型对 "容错与状态保持" 能力仍具不可替代性
意外与反差:小模型在结构化任务上的突破
一个值得关注的反差是:
一个 4B 基础模型曾在排期测试中漏读关键邮件,导致按过时约束将文件写入错误位置——而经 NeoHorse 训练后,其在同类流程清晰的任务上表现大幅提升,甚至反超原版 9B 底座。
这意味着:通过执行轨迹训练,小模型可在特定任务维度实现能力跃迁,击败更大但未适配的模型。这为资源受限场景下的高效 Agent 部署提供了新可能。
产业协同:开源生态链的协同验证
本次项目是国产开源模型全栈协作的典型案例:
| 角色 | 贡献 |
|---|---|
| 基元律动 | 提出 Agent-Native 架构设计、开发 OpenSquilla Routing Harness、主导模型训练方法 |
| 无问芯穹 | 提供基础设施支持,利用模型-芯片协同优化提升训练效率、降低成本 |
| 清华大学 & 北京大学 | 参与算法与训练方法创新,探索更陡峭的训练 Scaling 曲线 |
| 阿里巴巴 | 提供 Qwen3.5 系列开源底座 |
这种 \“底座-算法-Infa-反馈\” 四层协同,为国产模型快速迭代路径提供了实证。
读者落地建议
适合立即尝试的:
- 需在流程明确、反馈可观察场景中部署 Agent 的企业(如自动化排期、文档校验、标准化代码生成),可评估 NeoHorse 4B 的轻量替代方案;
- 研究机构复现 Routing Harness 轨迹收集 pipeline,验证轨迹监督对自身任务的适配性。
建议再等等的:
- 需处理长链路、多状态切换、模糊目标场景(如复杂开发排期、跨系统集成调试)的用户,当前 9B 仍更可靠;
- 对模型权重/OpenWeights 开放有强依赖的团队,需等待基元律动明确权重开放计划。
写在最后
NeoHorse 的单轮 RSI(递归自我改进)验证,首次将 "Agent 执行—评测发现短板—训练调整—模型更新\” 的闭环落地到可见模型版本。这并非终极方案,而是开源生态下迭代范式的可行性证明——当训练起点本身即为真实世界任务执行数据时,模型与环境的协同进化将具备更强的现实锚点。

