What Is a Harness?深入理解 AI Agent 的“安全带”
事件概述
Earendil 团队在 2026 年 8 月发布了一篇题为《What Is a Harness?》的技术文章,并在 Hacker News 上引发讨论(27 分,15 条评论)。文章用攀岩安全带的类比,首次系统性地向非技术用户解释了 AI Agent Harness(代理安全带/代理框架)的核心概念。作者指出,在当前 AI 信息流中,“Agent Harness”已经成为高频词汇,但多数人并不真正理解它是什么。这篇文章正是为那些“好奇但不好意思问”的人准备的。
原文链接:https://earendil.com/posts/what-is-a-harness/
关键技术点
Agent Harness 的定义
文章给出了一个简洁公式:Agent = Model + Harness。Agent Harness 是一类软件,它为 AI 模型提供运行环境。与大多数 AI 模型不同,Agent Harness 可以被终端用户所拥有和自行运行。它的第一个应用场景是编码,如今已发展为各种 AI Agent 的核心。
Harness 的四个核心组件
文章强调,无论使用何种交互界面(终端、iMessage、邮箱等),Agent Harness 通常都做四件事:
System Prompt(系统提示词):一组注入到每次对话中的指令,用于约束模型在特定场景下的行为方式。它类似于新员工入职第一天拿到的员工手册——模型尚未内化这些规则,但会遵循它们来完成当前任务。文中提到 Claude Opus 4.5 的“soul document”作为类比参照。
Tools(工具集):一系列以代码形式实现的能力,模型可以主动“调用”它们,例如联网搜索、执行代码、写邮件等。关键区别是:Harness 通常不会强制规定模型何时必须使用工具,而是把工具描述清楚并开放给模型,由模型自行决定何时用、怎么用。
Agentic Loops(代理循环):这是 Harness 中最核心的机制。模型在收到用户请求后,会经历“理解请求 → 调用工具 → 评估结果 → 再次调用或结束”的循环。文中举了“比较本地小学排名和测试成绩并给出推荐”的例子:模型先搜索数据,判断结果不足时反复重新搜索,随后用写代码工具生成电子表格,最后调用邮件工具将总结和附件发给用户。整个过程模型不断自评和迭代,直到任务完成。
Translation Layer(翻译层):这一层让 Harness 能够对接不同 AI 模型(Anthropic、OpenAI、开源权重模型等)。其意义不仅是技术兼容,更在于把选择权和数据主权交还给用户。用户可以在同一 Harness 内切换模型、对比输出与成本,并保存自己的会话记录,而不是被锁定在某一家 AI 实验室的应用程序里。
对数据科学或 AI Agent 落地的意义
Agent 工程从“模糊”走向“可拆解”:这篇科普文章把 Harness 拆解为四个明确的模块,为数据科学家和工程师提供了一个清晰的参考架构。当我们要设计一个 Agent 时,可以分别去思考 system prompt、工具注册表、agentic loop 控制逻辑以及模型适配层,而不是把“Agent”当作一个黑盒。
“循环”是智能体质量的关键:文章强调 Agentic Loop 是模型自我修正的过程。对数据科学落地而言,这意味着评测一个 Agent 不能只看单次输出,而要观察它在多次循环中的决策质量、工具调用效率以及最终的收敛速度。这也呼应了 RAG(检索增强生成)中 iterative retrieval 的思路。
翻译层促进模型中立与成本优化:在实际业务中,数据团队往往希望根据任务选择性价比最高的模型。Translation Layer 的提法启发我们在架构设计上应当抽象模型接口,使 Agent 不被特定厂商绑定,从而在成本、隐私、延迟之间取得平衡。
对普通用户的启发:文章花了不少篇幅强调“用户拥有自己的 Harness”意味着什么——保留会话数据、自由切换模型、不被厂商生态绑架。这实际上是在提醒我们,Agent 的使用方式正在从“打开一个 App”转向“运行自己的工具链”,类似当年从拨号上网到自建服务器的理念迁移。
我的技术点评
这篇由产品团队写的文章给我的第一印象是:用词浅显,但架构理解很扎实。以攀岩安全带作类比非常形象——安全带连接人、绳索和工具,允许你在不同岩壁上复用并加装零碎装备,这恰好对应 Agent Harness 的四个组件。文章没有陷入炫技式的术语堆砌,而是直接给出可操作的拆解,这在 AI 社区普遍“卷参数、卷榜单”的氛围里显得难得。
不过,文章也存在一些值得商榷和原文未说明的地方:
- “Harness”与“框架(Framework)”以及“运行时(Runtime)”之间的边界并未讨论。市面上的 LangChain、AutoGPT、CrewAI 都能算作 Harness 吗?文章没有明确回答。
- 对 Agentic Loop 的说明偏“理想状态”,没有提到 token 成本失控、工具调用死循环、模型幻觉导致的错误循环等工程痛点。
- 文中提到 “Pi”“OpenClaw”“Lefos” 等 Harness,但除了名称并未给出足够对比维度,尤其没有说明它们在架构上的差异。
- 文章未说明 Earendil 产品本身的技术细节,也未给出任何评测基准或使用成本数据,因此“效果好”的结论只能作为产品理念来读。
总体而言,这篇文章是一个优秀的入门读物,尤其适合想建立 Agent 心智模型的数据科学家和软件工程师。它让我更确信一点:AI Agent 的下一步竞争,不在于单个模型有多强,而在于 Harness 能否让模型稳定、可控、可复用、可迁移地完成真实任务。如果你正在设计自己的 Agent,不妨从这四个组件出发,先画好架构图,再写代码。
