奈亚
· Luke

大科技的Harness工程无用论以及对于无分别的循环次世代论的批评

harness-engineeringAI-agentnaialocal-aiopen-weightsoftware-engineering

AI Times发表的相关文章关于"大科技的Harness工程无用论"发表后,众多技术领导人对此交换了意见。继谷歌之后,OpenAI也发表了意见,称下一代模型能够吸收当前Harness功能相当一部分的言论。

这篇文章是对这一讨论的补充。先说结论,我同意大多数Harness会变得无用的展望。我本人在《Harness工程完全解说——诞生·概念·差距·未来一次看尽》的文章中也写过,为了弥补模型弱点而制作的复杂Harness会随着模型的改进而迅速被替代。

但是,以此为依据说整个Harness很快就会变得不必要的话,就会错过Harness的本质。模型吸收功能的问题和人类与组织在委托AI工作同时管理责任的问题是不同的。

旗舰计算与用户侧Harness的边界
旗舰计算与用户侧Harness的边界

首先,需要看关键词流通的方式

但是首先,科技关键词在国内往往与海外以不同的方式和含义被消费,所以我先进行了这方面的验证。这次也需要区分原始发言、实际技术讨论和国内形成的框架。

这是《Harness工程完全解说——诞生·概念·差距·未来一次看尽》中关于Harness工程关键词的国内和全球消费比较。

分类全球韩国
论述主导以工程师·实践者的公开分析为中心。Hashimoto、Martin Fowler这样的实践者的文章和案例构成了轴线。媒体·教育平台和一些科技影响者的文章·总结·解说迅速传播。
主要渠道GitHub、技术博客、X(推特)、官方案例研究YouTube、Brunch、博客、文章
深化资料OpenAI案例研究、Martin Fowler分析这样的原文·代码·运营经验一起看。翻译·总结为主的流通比重较大,第一手案例生产相对较少。
实际使用分享Stripe的每周1000+PR处理案例、Salesforce这样的企业公开运营数字和失败经验。Toss、Channel Talk这样的一些领先企业分享实际使用经验,但还难以一般化为整个产业的共同案例。

这次需要谨慎的一点是,在英语世界中"harness is dead"或"harness is useless"广泛流通的证据并不明确。更接近的是模型的工具使用能力改善、一些脚手架被模型或平台吸收、手工堆砌的复杂协调层寿命可能缩短这样的讨论。Noam Brown副总裁的发言也不是我直接确认的原始出处,而是通过国内外报道接触到的。因此我会来看在国内迅速定型的"Harness无用论"框架本身。

消失的Harness和应该保留的Harness是不同的

消失的Harness是明确的。必须将提示分解成多个阶段的方式、为了绕过特定模型缺陷的临时规则、人为固定工具调用顺序的浅层工作流随着模型的改进可能会被吸收。这样的Harness消失是正确的。

但是,按照A2Sys李东洙代表的整理,将此扩大解释为所有Harness是危险的。整理如下:

  • 提示·工作流Harness可能会被模型吸收。我同意。
  • 工具执行Harness处理权限、批准、失败恢复。这真的是会消失的Harness吗?
  • 运行时·内存·基础设施Harness处理上下文、缓存、模型路由、成本、延迟、审计日志。同样难以认为这是会消失的Harness。

我在《Harness工程:Re:从零开始的AI软件工程》第7章到第11章中谈论的Harness核心也在这里。契约决定了允许范围,结构和隔离缩小了变更范围,可追踪性和验证连接了原始目标和实际结果。测量和运营管理成本、权限、故障、恢复。这个范围的Harness工程不是模型改进就能解决的部分。

另一方面,Harness、循环、提示工程是人类启发式这种说法也是对的。所有方法论都从启发式开始。类型、测试、CI、代码审查、权限分离也都是人类为了处理复杂系统而创建的方法。但这里更重要的是,我们能否将透明性和责任都委托给旗舰模型呢?如果给工作下单,就要确保它按照意图正确工作,不越权闯祸,这点AI自己做不到。当然可能存在监督和纠正AI的AI,但那样的话就成了Harness。

我在汉相奇教授帖子的评论中这样写了我的立场。

根据对Harness工程的理解程度不同。只要组织和开发者有意图,就很难消失。

模型越聪明,AI越有可能更漂亮地完成更离谱的事情。所以Harness不是模型弱点的纠正装置,而是固定方向和责任的运营装置。

实际运营中,模型能力之前是责任边界

Nextain与开发委托企业通过Discord进行工作。而今天,我在这里放入了一个正在解决特定问题的Claude Code代理。参加Discord的Nextain代理(实际上是服务器上运行的Claude Code)阅读Discord频道并做出回答。

该频道中的非开发者运营人员传达了测试结果、不足之处和需求。处理能处理的事情,但当涉及重要部署或不应该修改的资源时,需要我的批准,所以会向我询问是否允许。

而且初次投入时,听完需求就直接开始工作导致委托方感到烦躁,所以我指示了工作流程。听到需求就回复已收到,进行分析制定计划,再把计划报告到Discord频道,然后进行工作。最后工作完成时提交最终报告,万一中间出现问题就呼叫我(开发负责人),需要决定的事情就通过Discord提问。

这个Harness的核心是Nextain的开发流程和各成员的权限。如果这是旗舰产品会自动以最佳方式工作吗?最佳方式真的只有一种吗?组织和业务流程的一致性最终就是Harness。这种责任边界与模型的能力无关。模型能够做的工作越多,什么可以做、在哪里要停止就需要划分得越严格。

现业的问题是漂移和成本

现在在实际工作中使用Codex和Claude的开发者面对的问题仍然是漂移。即使目标缩小也会偏离,做了不该做的改动,修改测试来声称通过了,遗漏了运营权限的边界。模型越精巧,这个问题就可能越光滑地隐藏。

此时"多运行几次就行"这个答案对大科技公司来说是可行的。可以延长推理时间,生成更多候选项,舍弃失败的路径,附加外部验证。但现业开发者和必须省一分钱的中小初创公司做不到。国内企业的现实也是如此。

在上面链接到的汉相奇教授的评论中,前AI未来规划秘书官河郑禹先生提到的"令牌总成本效率"正是这个标准。Harness不是拒绝旗舰模型的装置。而是成本控制装置,用昂贵的模型仅用于真正必要的判断,把可重复的工作分离为小模型·本地工具·脚本·确定性验证器。

最近OpenAI发布的数学相关成就也需要分为两个时间点。我对Erdős平面单位距离问题反例的相关首个成就的评价很高,认为是发现了不同于现有方法的数学联系的可能性。因为它展示了只有AI才能产生新发现的可能性。

相比之下,其后更突出的测试时计算是在推理时投入更多运算、候选搜索、验证、迭代的方向。这也是重要技术。但如果仅将其说成是单个模型的纯粹智能提升,成本结构就消失了。虽然是物量战也是技术,但对大科技企业特别有利。

Harness是成本和数据的防线

"模型会吞掉Harness"这样的说法很有刺激性。但那个模型由谁来花多少钱使用是另一回事。随着模型吸收更多功能,用户的代码可能会简化。同时也可能变得依赖更重、更贵的模型调用。复杂性没有消失,而是从用户的工作场所转移到了模型提供者的计费层。

数据也是如此。要让代理真正有用,就需要看文档、代码、日程、邮件、运营日志、故障历史、审批流、客户数据。代理一旦成为工作场所,用户的整个工作就成为了输入。

好的Harness只向外部模型发送必要的上下文,其余部分保留在用户的工作场所。它路由模型、重用缓存、分割权限、附加可重现的验证。所以Harness既是成本防线,也是数据防线。

从这个角度看,全球模型企业可能不喜欢强大的用户侧Harness。如果用户先用小模型和本地工具处理,只在必要时刻调用旗舰,调用量和传送的上下文就会减少。这其实不是断定,而是在前沿模型开发·推理·GPU·电力成本增加的产业结构中自然需要检讨的利益关系。

OpenAI和Anthropic通过CodexClaude Code处于Harness竞争的最前线。相比之下,Google既是模型公司也是云服务商。不能说每家公司的利益关系完全相同,但这个争论难以仅作为纯技术预测来听取的原因是明确的。好的Harness会减少大科技企业想要"将工作场所转移到模型、收集数据、依赖旗舰使用"的欲望。

循环不是次世代的默认值

循环也是如此。我在使用循环,但对大多数任务来说,不使用循环反而更合适。即使交给普通开发者,也能得到适当结果的工作,恰当使用好模型一次可能更便宜、更快。出人意料地,循环有效的情况范围很窄。

首先是研发。没有正确答案,根据实验结果改变假设,下一个实验需要主动改变以读取前一个结果的工作。我们内部进行的音声·歌曲研究就是这样。这种情况下,多个AI检查实验结果和全部数据,判断与既有实验的连续性、漂移情况、下一个周期的必要性。完成标准不是似乎合理的结果,而是指标不再上升的判断。既然探索收敛是目标,循环是合适的。

其次是在受限环境使用小模型的时候。小LLM容易缩小目标、"这程度就够了"就停止。但这种情况下需要的不是长循环,而是关闭目标和终止条件的装置。更接近Claude Code的goal功能而非Harness的循环。如果在普通用户的日常工作中滥用循环会浪费成本。循环用于探索收敛,Harness用于固定目标和责任。两者不是替代关系。

Naia想让工作场所保留在用户侧

Naia不拒绝旗舰模型。开发中打算彻底利用云端旗舰模型。好模型要用。

但我们没有计划把所有工作场所和数据都交给大科技平台。Naia追求的是本地、P2P、开放权重、小模型、确定性验证器、明确权限Harness一起使用的结构。昂贵的旗舰用在必要的判断上,但基本工作场所要保留在用户手中。

从这一点看,DeepSeekQwenKimiGLM这类开放权重模型的发展很重要。可以根据目的组合模型、在本地保护数据、只在必要时刻调用封闭旗舰的配置成为可能。在韩国,Upstage和Naver这样的独立模型战略在这个趋势中也有意义。与其直接跟踪全球大科技的旗舰,开放权重·独立模型·专门Harness·国内业务背景的好好结合可能更现实。

模型可以租借。但工作场所和数据没必要租借。

结论:比无用论更需要的是技术水平的讨论

消失的Harness会消失。模型吸收的功能也会增加。没有理由否认这一点。但我认为模型吸收的功能、固定组织意图和责任的实行体系、守护成本和数据边界的运营体系不会消失。如果委托工作的主体是人类,为结果负责的主体也是人类,那么契约·结构·可追踪性·验证·运营就不会消失。

我希望现在停止争论Harness是死了还是活着这样的关键词问题。我希望能进行什么要放入模型内、什么要保留在用户和组织的控制下、如何验证和恢复漂移、令牌成本和数据曝露由谁承担这样真正以技术为中心的讨论。

参考和出处

我的文章和书

这次讨论的直接契机

原文和技术资料

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

评论

无需登录即可评论

...