核心事件:SWE-2 发布
Cognition 发布了 SWE-2 编码 Agent 模型。该模型以 Kimi K3 为基座,参数量为 2.8T,并通过强化学习(RL)后训练得到优化。
源材料明确披露的信息如下:
- 模型名称:SWE-2
- 基座模型:Kimi K3(2.8T 参数)
- 优化方式:强化学习(RL)后训练
- 评测集:FrontierCode 1.1 Main
- 权重、API 与具体可用时间:原文未说明
性能表现:接近 Fable 5.1
SWE-2 在 Cognition 维护的 FrontierCode 1.1 Main 上取得 50.0%。作为对比,Fable 5.1 的成绩为 50.9%,两者相差 0.9 个百分点。
与 GPT-5.6 Sol 的 47.5% 相比,SWE-2 高出 2.5 个百分点。在该项评测和原文列出的模型中,SWE-2 展现出较有竞争力的成绩。
基准测试背景
FrontierCode 是 Cognition 维护的、相对 SWE-bench 的升级版评测。此类基准通常用于衡量模型处理真实软件工程问题的能力,例如理解问题描述、修改代码并通过测试。基准分数可作为模型能力的参考,但实际部署效果仍会受到代码库、工具链、任务类型和人工审核流程的影响。
成本对比:价格低于 Fable 5.1
源材料称,SWE-2 的价格比 Fable 5.1 低 64%。在分数接近的前提下,这一价格差异使其成为重视推理成本的编码 Agent 用户可关注的选项。
| 模型 | FrontierCode 1.1 Main | 相对 Fable 5.1 价格 | 备注 |
|---|---|---|---|
| SWE-2 | 50.0% | 低 64% | Kimi K3 经 RL 后训练 |
| Fable 5.1 | 50.9% | 基准 | — |
| GPT-5.6 Sol | 47.5% | — | — |
注: 表中分数和价格信息均来自原始材料;未披露的信息以“—”标注。
适用场景与落地建议
- 可重点评估 SWE-2 的团队: 有较多代码修复、代码审查辅助或工程任务自动化需求,同时对模型使用成本敏感的开发团队。
- 需要进一步确认的事项: 在纳入生产流程前,团队应核实其访问方式、价格计费口径、数据处理政策,以及在自身代码库和任务分布上的实际表现。
- 评测时的重点: 除基准分数外,还应关注任务完成率、工具调用稳定性、生成补丁的可维护性,以及人工复核所需时间。
写在最后
SWE-2 的成绩说明,基座模型之外,后训练策略也是编码 Agent 竞争力的重要变量。对于采购或评估此类模型的团队而言,性能、价格与实际工程工作流的匹配度,往往需要一并考量。
