ARTICLE · 人工智能
模型越来越强, harness 该留下什么?
一语总结本文基于团队 harness 框架 61% 内容的实战瘦身经验,结合 Anthropic 与 OpenAI 的最新指引,系统阐述模型变强后 harness 该删什么、留什么,以及团队自建 harness 的真正价值所在。
文章围绕「模型越来越强,harness 该留下什么」这一核心问题展开。作者以腾讯云 TDSQL 团队对内部 harness 框架 tdsql-harness 的彻底重构(根指令删 61%、skills 砍 40%、agent 从 10 个减到 6 个)为切入点,结合 Anthropic 为 Claude 5 系列删掉 Claude Code 系统提示词 80% 的事实,指出行业级转向已发生:冗余指令从「中性浪费」变成「主动造成质量损失」。
文章分三部分:第一部分梳理行业转向的事实与机制,归纳出「规则→判据」「前置全量上下文→渐进式披露」「示例→接口设计」「简单 markdown 规格→可执行引用物」四个具体变化方向,并以 prefill 从 API 层面消失作为「脚手架消失」的标志性案例。第二部分给出 harness 与 skill 撰写的五道关卡:该不该写、从规则到判据、路径放开验收收紧、先建评测再写内容、能沉降到工具层的就别留在指令层,每关都配有可机械执行的判据。第三部分回答「什么值得留下」,提出四层归属框架(L0 公开知识/L1 平台能力/L2 组织特有流程/L3 责任与价值判断),论证 L2 与 L3 才是团队自建 harness 的真正立足点,并以 Anthropic 自身作为最强论据——他们留下的 20% 全部是 L2 和 L3 内容。
- 冗余指令在弱模型时代是中性浪费,在强模型时代会主动造成质量损失。
OpenAI 与 Anthropic 的最新指引都明确指出,旧 prompt 中的过度规定会缩小模型搜索空间、被字面执行、导致过度触发,覆盖掉模型本来更好的判断。
- harness 撰写的核心是从「规定路径」转向「定义成功判据」。
目标结果、成功判据、约束必须写死,路径留给模型自己选;判据必须能被机械判定(测试变绿、产物存在、diff 为空、命令 exit 0),否则等于没写。
- 每条 harness 规则都是一个关于「模型做不到什么」的赌注,会随模型变强而过期。
凡是在补模型能力缺口的规则都会过期;唯一不会过期的是组织特有信息(L2)和人必须持有的责任与价值判断(L3),前者因为信息不在公开语料里,后者因为责任无法转移给技术系统。
- 团队自建 harness 的真正价值在 L2 与 L3,不在 L1。
开源框架与平台原生能力会持续吸收 L1(执行循环、状态管理、subagent 编排),团队把力气花在 L1 是贬值最快的投入;L2 是组织特有流程与工具接入,L3 是验收标准与授权边界,这两层才是不可替代的杠杆。
- 验证能力而非任务重要性,才是自主度的真正上界。
能交给 agent 的自主度上限等于能廉价且可靠地验证的量;启动 agent 便宜但收口不便宜,生成速度超过验证速度就会积累「认知债」——代码看着干净但没人真正理解。
模型越来越强, harness 该留下什么?
文章围绕「模型越来越强,harness 该留下什么」这一核心问题展开。作者以腾讯云 TDSQL 团队对内部 harness 框架 tdsql-harness 的彻底重构(根指令删 61%、skills 砍 40%、agent 从 10 个减到 6 个)为切入点,结合 Anthropic 为 Claude 5 系列删掉 Claude Code 系统提示词 80% 的事实,指出行业级转向已发生:冗余指令从「中性浪费」变成「主动造成质量损失」。
文章分三部分:第一部分梳理行业转向的事实与机制,归纳出「规则→判据」「前置全量上下文→渐进式披露」「示例→接口设计」「简单 markdown 规格→可执行引用物」四个具体变化方向,并以 prefill 从 API 层面消失作为「脚手架消失」的标志性案例。第二部分给出 harness 与 skill 撰写的五道关卡:该不该写、从规则到判据、路径放开验收收紧、先建评测再写内容、能沉降到工具层的就别留在指令层,每关都配有可机械执行的判据。第三部分回答「什么值得留下」,提出四层归属框架(L0 公开知识/L1 平台能力/L2 组织特有流程/L3 责任与价值判断),论证 L2 与 L3 才是团队自建 harness 的真正立足点,并以 Anthropic 自身作为最强论据——他们留下的 20% 全部是 L2 和 L3 内容。
文章金句
"harness 里的每一个组件,都编码了一个关于「模型自己做不到什么」的假设——而这些假设会随着模型变强而过期。
"你能交给一个循环的自主度,上限就是你能廉价且可靠地验证的那么多——一寸都不能多。
"只有人能继承后果。你可以让 agent 在 policy 内安全地做选择、路由、合并、升级,但它无法继承后果。
"反直觉的是,harness 不是在缩小,而是在迁移。更好的模型消灭了某些脚手架,同时解锁了需要另一类脚手架的新能力。假设的地形是移动,不是收缩。
"过期的文档比没有文档更危险。