出版《Harness Engineering for AI Agents: Re:Zero》后,我收到了 Leanpub 联合创始人 Len Epp 的采访邀请。虽然我对自己的英语没有信心,也为此犹豫过,但想到这是一个介绍这本书和 Naia 的机会,最终还是接受了邀请。这本书介绍了应用于 Naia 的 Harness Engineering 实践案例,旨在帮助读者轻松入门 Naia 开源项目。我希望发挥电子书的优势,根据实际开发过程中获得的经验不断补充内容。最近,我也延续了这一承诺,将其更新至第 2 版(2026.08.03)。韩文版也已同步更新至 WikiDocs。
在准备英语采访的过程中,我与 AI 一起梳理可能的问题、完善回答,也借此将自己对 Naia 以及想要创造怎样的 AI 的思考串联成了完整的脉络。实际采访围绕两个核心问题简短展开,但准备文档中还留下了许多未能在节目里讲出的内容。因此,我决定公开完整的采访准备稿,并运用 Naia 所采用的技术,将其制作成英语 AI 模拟采访视频。视频已提前发给 Len 确认,并获得了发布许可。
虽然部分口型看起来略显生硬,但与其继续打磨,我更愿意把迄今为止的过程和成果一并分享出来。希望它能为大家提供一种借助 AI 准备英语采访的方法,带来一点帮助。
1. Leanpub Launch 真实采访
这是我与 Leanpub 联合创始人 Len Epp 进行的真实采访。视频将从两个核心问题开始的部分播放。
2. 根据完整采访准备稿制作的英语模拟采访
这并非真实通话的录像或文字记录,而是将采访前撰写的完整准备文档改编成英语对话形式后,由 AI 重现的模拟采访。
后记:书中未能说尽的 Naia 故事
仅靠一个模型,很难成为“我的 AI”
关于 AI 的许多讨论都聚焦于模型性能。但我想创造的 AI,无法只用一个模型来解释。它应该能记住用户、理解当前工作的上下文、使用必要的工具、在获准的范围内工作,并能验证结果。
我所说的“我的 AI”,并不只是一个很会和我聊天的 AI。它更接近一种让用户能够掌控其记忆、记录、设置、性格和工作上下文的 AI。我希望创造的不是在某家公司的服务中短暂交谈后便结束关系的 AI,而是能够根据用户的选择,持续陪伴用户工作的 AI。
小模型需要更明确的任务
我并不想掩饰小模型或本地模型的局限。模型之间确实存在能力差异,把模型周围的结构设计得再好,也不会让所有小模型都变得和大模型一样。
不过,只要为小模型提供更明确的上下文和恰当的工具,将职责范围划分得更窄、更清楚,并更严格地验证结果,就能让它更稳定地承担特定任务。在写这本书和开发 Naia 的过程中,我不断确认了一点:模型越小,围绕模型建立的开发与验证体系就越重要。
本地优先并不意味着拒绝云端
Naia 是一个本地优先的项目,但这并不意味着不使用云端 AI 或大型科技公司的 AI。只要有需要,就应该能够使用优秀的模型和服务。
我更重视的是用户的选择权。记忆、记录、设置和工作上下文等对个人而言十分重要的信息,应尽可能由用户自己掌控。即使没有互联网连接,或处于无法将资料发送给外部服务的环境中,也应该能够使用。与其说“本地”是一句产品口号,不如说它是维护用户控制权的一种方向。
Naia 不会止步于带有虚拟形象的聊天机器人
Naia 是一个本地优先的可视化 AI 智能体和工作空间。屏幕中的角色可以成为人们轻松接触 Naia 的入口,但它的长期目标并不是打造一个带有虚拟形象的聊天机器人。
我想创造一种能够记住用户、使用工具并与用户协作,同时又让用户掌控重要数据和决策的 AI。我还希望将这一过程以开源形式公开,让人们不只是使用成品,还能亲自理解、修改,并尝试创造属于自己的 AI。
这本书想表达的观点
《Harness Engineering for AI Agents: Re:Zero》的重点,不在于 AI 能生成多少代码,或生成得有多快。它的出发点是:只有当人能够理解、审查和测试 AI 完成的工作,并在出现问题时追溯究竟错在哪里,才可以真正把软件开发工作交给 AI。
我们需要同时设计模型周围的上下文、工具、工作范围、权限,以及测试和审查流程。正是出于这一含义,我将其称为 Harness Engineering。不过,我并不认为自己提出了适用于所有项目的标准答案。这本书更像是一份现场报告,记录了我和 AI 一起重新开发 Naia 时,哪些做法奏效、哪些做法失败,以及需要怎样的规则和验证方法。
既然 Naia 是开源项目,我也希望这本书不是出版一次便定稿的说明书,而是一本随源代码共同变化的活教材。每当在源代码中遇到新问题,我就修改书中的说明;书中总结的原则,也会重新回到实际工作中接受验证。
如果说这本书主要讲解的是这种开发方法,那么采访准备稿补充说明的,则是我为什么要开发 Naia,以及我想创造怎样的 AI。这也是我决定在后记中收录完整准备稿的最大原因。本书是公开图书,即使不购买,也可以在线阅读。
我如何借助 AI 准备英语采访
在这次准备过程中,AI 不只是一个替我撰写英语回答的工具。我用它调查采访、把自己的想法压缩成短句、追问不理解的表达,并一路用到语音练习环节。
1. 先与 AI 一起调查采访的形式和范围
我最初交给 AI 的资料,是 Len 发来的采访邀请邮件。我调查了 Leanpub 的官方说明和近期采访案例,并据此整理了预计时长、进行方式和问题范围。先明确需要准备什么,便能避免无休止地罗列大量预期问题。
2. 借助 AI 总结:将必须表达的内容压缩成三句话
与其准备大量问题和答案,我更需要一组无论遇到什么问题都能回归的核心观点。我准备了以下三句话。
- A model alone is not an agent. An agent needs a harness around the model. 仅靠一个模型无法构成智能体。模型周围需要一套开发与验证体系。
- Harness engineering becomes even more important when we use smaller or local models. 使用小模型和本地模型时,围绕模型的开发与验证体系会变得更加重要。
- Naia is open source, and the book will evolve as a living textbook for its source code. Naia 是开源项目,这本书也会作为源代码的活教材不断发展。
即使实际问题与预想不同,我也打算回到这三句话中的一句来回答。
3. 同时记录英语句子和韩语含义,辅助理解和学习
我没有直接背诵 AI 生成的英语回答。遇到难以理解的表达时,我会逐句询问它的含义和使用理由;如果某些部分与我的想法不一致,就重新修改。每个回答下面,我还会同时写下韩语含义和需要记住的关键词。
比起一字不差地记住英语句子,理解自己想表达什么意思,对实际采访更有帮助。因为即使一时想不起原句,也能用更简单的英语重新说出自己真正理解的内容。
4. 使用 Naia 中采用的 AI 合成提问者和回答者的语音,并反复聆听
完成文稿后,我将其打印成 PDF,检查了整体流程。接着,我让 AI 分别生成提问者和回答者的英语语音文件。因为已经具备 Naia 的开发环境,所以不需要另外订阅付费服务,就能立即生成并收听。由于没有太多时间专门学习,我便在路上反复聆听,并跟读回答。
这与只阅读文字不同,它让我逐渐熟悉问题结束后组织回答的顺序和说话的节奏。也就是说,同一份准备稿既被做成了供阅读的 PDF,又被转化成了供口语练习的音频。
5. 提前准备没听清问题时可以使用的句子
比起完美地回答所有问题,更重要的是在没听懂问题时不要慌张。我提前准备了下面这些句子。
Could you please repeat the question a little more slowly? 可以请您把问题再说慢一点吗?
My English is not perfect, so let me say it more simply. 我的英语不太好,所以我会用更简单的方式来表达。
I want to be careful because I do not want to overclaim. 因为我不想夸大其词,所以希望谨慎作答。
采访当天,我在打开 Zoom 的同时,也打开了准备稿和之前使用的 AI 会话,以便需要时搜索关键词。虽然非常紧张,但 Len 提出了事先告知的两个核心问题,我也得以根据准备好的思路进行回答。
如果你也要准备英语采访,可以直接采用下面的框架,再根据自己的主题加以调整。
- 必须传达的三个核心句子
- 预期问题和英语回答
- 回答的韩语含义
- 不记整句、只需记住的关键词
- 预期的后续追问
- 没听清问题时可以使用的句子
为什么把准备稿制作成 AI 视频
实际采访结束后,我手里仍留着一份很长的准备稿。我想把文稿中关于 Naia 的故事公开出来。虽然也可以直接阅读全文,但我认为以对话形式聆听,会更容易传达内容,因此又将它重新制作成了远程采访形式的视频。
这一次,我利用 Naia 的技术,以英语练习音频为基础制作了韩语语音,并结合 AI 生成的图像、动态效果和开源唇形同步技术,分别制作了英文版和韩文版。起初,我直接使用发音开始时的画面,结果出现了面部变形的问题。后来,我另行挑选眼睛和嘴部较为稳定的中性画面,再按句子分别生成视频,从而解决了这个问题。这项工作由 Codex 使用 Naia 项目的技术完成。
这个过程与通过一条提示词直接生成视频略有不同。
采访调查 → 梳理核心信息 → 韩英预期问答 → PDF 检查 → 语音练习 → 虚拟采访视频
每个阶段的成果,都会重新成为下一阶段的素材。为准备英语采访而编写的文稿,先变成了练习音频,又进一步成为可以公开的文章和视频。我认为,这可以作为一个实际应用 AI 的案例:不丢弃已经制作的资料,而是让它们继续流入后续工作。
比视频制作更重要的,是我自己理解并修改内容的过程。AI 可以很快生成初稿,但不会自动发现并纠正与我真实想法不一致的部分。我需要不断提问、理解和修改,并借助 AI 与 Len 沟通,确认哪些内容可以公开。
结语
我想通过这篇文章留下的,并不是“我用 AI 制作了采访视频”这一事实本身。我更想结合自己的实际经历,分享一种在英语采访令人感到压力时的准备方法:与 AI 一起整理预期问题、精简必须表达的内容,再通过反复聆听语音进行练习。
公开采访准备稿全文也是出于同样的原因。虽然在实际采访中只能做简短回答,但在准备过程中,我得以用更完整的脉络,梳理自己想创造的 Naia,以及对“我的 AI”的思考。视频只是为了让这些内容能够以更轻松的形式传达出去。
希望这个过程能为正在准备英语采访的人提供一点参考,也希望它能帮助对 Naia 感兴趣的人理解我为什么要开发这个项目。今后,我仍会根据实际开发过程中验证的内容,不断改进这本书和 Naia。