Featured image of post AI 编程进入深水区:算力、责任与工程师价值正在重排

AI 编程进入深水区:算力、责任与工程师价值正在重排

资深工程师更能放大AI编程价值。

随着 Claude Code、Codex、Kimi Code 等编程智能体加速演进,软件开发正从“人写代码、AI 辅助”转向“人设定目标、Agent 连续执行”。

从 Token 消耗到任务价值

从 Token 消耗到任务价值

在 2026 世界人工智能大会期间的 InfoQ 直播间,Sirius contributor 滕昱与月之暗面开发者关系负责人唐飞虎讨论了 AI Coding 的真实变化。两人都已重度使用编程模型,但用法不同:滕昱倾向直接购买最强模型和最高档套餐,减少选型时间;唐飞虎则会尝试 Kimi Code、Claude Code、Codex 及垂直工具,并按任务组合模型与 Harness。

**Token 不再是唯一指标。**过去的 Vibe Coding 多是一问一答,成本较容易估算;现在开发者常把目标交给 Agent,让它调用工具、调试、修改代码并持续运行,可能一小时后才需要人介入。中间会有无效尝试,也可能最终完成任务。因此,企业若只把 Token 当作云资源式指标,容易误判效率。更合理的衡量方式,是看任务是否完成、人工介入多少、失败代价多大,以及最终产生了什么业务价值。

“人人开发”有边界

两位嘉宾都承认,AI 让非专业开发者更容易做出应用,但边界并未消失。滕昱认为,围绕界面、流程和常见业务逻辑的应用,用户只要描述清楚需求,Agent 往往可以完成;但涉及新逻辑、新架构或缺少成熟参考的系统设计时,模型容易在错误路径上循环。他估计普通应用中约 70%-80% 的需求可通过 Vibe Coding 实现,关键部分仍需人判断。

唐飞虎更乐观。他提到,自己曾在 SIGGRAPH 活动中用模型制作 3D 停船游戏,早期连续折腾 48 小时 仍不理想;使用最新 Kimi K3 后,一句话就生成了可玩的版本。这说明模型迭代会让许多“几个月前还必须由专业开发者完成”的工作变成自然语言指令。但“能生成代码”不等于“成为工程师”:人仍要决定产品为何存在、目标是否合理、交付是否满足需求。

模型像发动机,Harness 决定落地

AI Coding 产品通常由模型和 Harness 共同构成。Harness 可理解为“把模型接入工具、上下文、执行环境和流程的外部系统”。同一模型放入不同 Harness,效果可能差异很大。

滕昱提醒,提示词和工作流更新很快,过早追求完美 Harness 可能被下一代模型内化。他更重视方向判断、团队沟通和开源协作。唐飞虎则认为模型像航空发动机,Harness 像机身和机翼,二者缺一不可。大模型公司组建 Harness 团队,正是因为它能接触真实用户,把需求反馈给训练团队;垂直行业还可接入 MCP、Skills 和业务工具,提高特定任务成功率。

关键变量包括:

  • 模型能力与推理强度;
  • Harness 的工具、上下文和流程设计;
  • 企业内部 Benchmark 与安全规则;
  • 用户体验、Token 成本和任务成功率。

责任、ROI 与组织重构

争议最大的不是 AI 会不会写代码,而是谁为结果负责。滕昱认为,模型可持续尝试,却难以像人一样判断“这条路应当停止”,更不能承担生产事故后果。唐飞虎则认为模型已有某种判断机制,例如能评价文章质量,也可能拒绝不安全操作。但两者并不矛盾:模型可以生成判断,企业仍必须由人承担责任。

这对生产环境尤其关键。即便 AI 能写代码、调试和测试,真正上线后的事故处理、风险取舍和责任承担仍不能完全交给模型。企业需要持续评估模型是否在合适时机调用正确工具,是否遵守内部规则,以及任务成功率是否真实提升。

因此,AI Coding 的 ROI 不是“谁用掉更多 Token”。复杂任务如果反复交给不合适的模型尝试,可能比直接使用更强模型更贵。滕昱进一步判断,最好的模型不应平均分给所有人,而应优先给最有经验的工程师,因为他们更懂任务拆解、质量判断和何时叫停。

行业走向已较清晰:大型软件组织会更扁平,小型精英团队和开源团队更容易受益;新人过去靠重复编码“刷题式成长”的路径会被压缩。未来工程师的核心竞争力,将从写出每一行代码,转向定义问题、验证结果、承担责任,并把 AI 的执行力转化为真实交付。