先看一个实验
2026 年初,开发者 Can Bölük 做了个实验:同一个模型,同一批任务,什么都不换,只改模型外面那圈工程——具体说,是 harness 里处理代码补丁的格式。任务成功率从 6.7% 跳到 68.3%。
十倍。模型一行没动。
这个数字最近在 AI 圈传得很广,因为它把一件大家隐约感觉到的事,变成了没法装看不见的结论:到了今天,拉开差距的已经不是模型本身,而是包在模型外面的那层东西。
那层东西叫 harness——直译是"挽具",让马往正确方向使劲的那套装备。回看这几年,AI 圈集体追逐的重心,其实已经换了三次。

2022 到 2024:全民学"说话"
ChatGPT 刚出来那两年,全行业的显学是提示词工程(Prompt Engineering)。
当时模型笨。笨就意味着话术能挤出差距:开头加一句"你是资深专家",答案就像样一点;让它"一步一步想",正确率真的会上去。于是提示词宝典满天飞,“提示词工程师"成了新岗位,教人写咒语的课一度比编程课还贵。
现在回头看,那套东西的本质是:把模型当神谕,研究怎么许愿。 优化的是单次输入输出,赌的是一句话里藏着魔法。
2025:发现模型不笨,是你喂得不对
2025 年风向变了。Claude Code 这类 coding agent 出来,模型开始长时间、多步骤地干活,一个新问题暴露出来:模型常常不是不会,是它根本没看到该看的信息——相关的代码没喂进去,项目的规矩没告诉它,上周干过的事它不记得。
于是重心从"写好一句话"变成"搭好一个信息环境”:RAG、记忆系统、MCP 协议、CLAUDE.md 这类项目说明书文件,全是这一年的热点。Shopify 的 CEO 和 Karpathy 前后脚带火了一个新词:上下文工程(Context Engineering)——在有限的上下文窗口里,放什么、不放什么、按什么顺序放,是门手艺。
我自己那套家当就是这时候长出来的:记忆库、工作纪律、上下文卫生,全是这一卦的。
2026:单次对话优化到顶,轮到外面那圈
但上下文工程优化的只是"一次对话"。真实的工作不是一次对话,是一串:任务要拆、代码要写、测试要跑、失败要重试、写完要有人审。把这些串成一条线的工程结构——工具、权限、钩子、调度、评审、流水线——就是 harness。今年大家发现,单次对话的优化有天花板,而 harness 没有。
几个标志性的事:
Stripe 内部的编码 agent 叫 Minions,在 Slack 上点一个表情就能触发,现在每周产出 1300 多个 PR,PR 里没有一行人类写的代码,工程师只做 review。它跑在一个深度定制过的开源 harness(基于 Goose 改的)上,内部流程打包成一套叫 blueprints 的东西。Stripe 的人自己拆账:这套系统六成靠模型,四成靠 harness 工程——而那四成,才是别家抄不走的部分。
有人把 Claude Code 的源码拆开看,发现真正属于"调用模型"的代码只占一小块,压倒性的大头是工具定义、权限控制、上下文压缩、任务调度——全是 harness。你每天用的 AI 工具,本身就是半个 harness。
Cole Medin 干脆把这件事产品化了:他开源的 Archon 自称 “harness builder”,把你的整套 agentic 流程打包成 YAML 工作流,可编排、可复用、可重复。口号很直白:让 AI 编程从抛硬币,变成一条产线。
连 benchmark 都在跟进:今年的编码 agent 评测,已经开始测"模型+harness"的整栈,不再单测模型裸跑了。
我为什么对这事有感
因为我这两个月干的事,回头看全是 harness,虽然我当时不知道这个词。
看门狗 llmdog 管着十几个服务的死活;cron 管线一天三班倒;TG 推送要令牌桶限流;并行会话施工会抢 git,就得立规矩;上个项目没收尾不许开新坑——这些没有一行是"模型能力",但没有它们,模型能力一分钱不值。
上个月我写过一篇《AI 的开发曲线》,说上下文装不下的部分,就是隐性 bug 的滋生地。当时只说了病,没给药。现在看,行业给的答案就是 harness:模型的视野是局部的,那就用工程结构把局部兜住——评审兜住质量,测试兜住回归,流水线兜住流程,看门狗兜住运行。
最后
这四年说白了是一层一层地承认现实:先承认模型不会读心,所以学提示词;再承认模型看不见你的项目,所以管上下文;最后承认模型单独干不成事,所以造 harness。
对普通人的启发也在这儿。模型变强是实验室的事,你插不上手;harness 是你自己的事,每一行都是。这四年,杠杆的位置一直在挪:从"会不会提问",到"会不会给信息",再到"会不会搭系统"。
提示词速成班都黄了,不是偶然。
