驾驭谁
驾驭的是 AI 智能体。它不只是回答问题,而是会参与任务执行,所以需要被引导、约束和验收。
AI 正在从“回答问题的工具”变成“参与执行的智能体”。它可以参与开发、整理资料、拆解任务、调用工具、检查结果,甚至完成一整套工作。能力越强,越需要一套方法来管住方向、过程和结果。
Harness Engineering,也可以理解为驾驭工程:为 AI 智能体提前设计目标边界、资料供给、执行流程、行为约束和验收标准,让它在可控环境中稳定完成任务。
驾驭谁
驾驭的是 AI 智能体。它不只是回答问题,而是会参与任务执行,所以需要被引导、约束和验收。
怎么驾驭
通过目标、资料、流程、规则、环境和检查标准,把 AI 的执行过程纳入一套系统化方法。
解决什么
解决 AI 急于求成、提前收尾、缺少验证、模仿坏模式等复杂任务中的失控问题。
不是什么
它不是替代 Prompt 或 Context,而是把提示词、上下文、工具和检查机制组织成可执行的工作系统。
管方向
人类负责目标、边界、优先级和关键决策,避免 AI 只顾执行却偏离真实需求。
管过程
用流程拆解、上下文供给和行为约束,让 AI 按稳定路径推进复杂任务。
管结果
通过测试、构建、Review 和验收清单确认结果可用,而不是只听 AI 自评。
单次对话里的 AI 很容易显得“能说会道”,但复杂任务真正考验的是过程稳定性。
边界不清
任务还没定义完整,AI 就开始执行,最后容易做出方向正确但不完整的半成品。
半途收尾
完成局部内容后就判断任务结束,忽略测试、交付说明或关键边界条件。
缺少验证
代码、文档或方案看似完整,但没有经过运行、构建、预览或人工检查。
错误继承
盲目模仿已有项目中的坏模式,把旧问题继续放大。
驾驭工程的价值在于:把这些依赖“自觉”的环节,改造成可重复执行的流程和规则。
也就是说,不要只期待 AI 自己记得先确认需求、做完后主动测试、交付前检查遗漏;而是提前把这些动作写进工作流程里。这样每次任务都会按同一套标准执行,结果更稳定,也更容易排查问题。
驾驭工程不是提示词工程、上下文工程的替代品,而是更上一层的管控体系。
关注指令表达:让 AI 知道要回答什么、按什么格式回答、需要避开什么。
关键词:角色、任务、约束、示例、输出格式。
关注信息供给:让 AI 拿到正确背景、项目资料、代码上下文和业务规则。
关键词:资料整理、检索、压缩、动态上下文、记忆。
关注执行系统:让 AI 按流程做事,并能被检查、纠偏和复用。
关键词:流程、规则、环境、互审、验收、沉淀。
目标边界
明确做什么、不做什么、完成标准是什么。典型产物是任务说明和验收清单。
资料供给
提供稳定可信的信息来源,例如文档、接口说明、业务规则和示例。
行为约束
限制 AI 的执行方式和禁止动作,例如编码规范、目录规范和安全规则。
流程编排
把复杂任务拆成可执行步骤,设置阶段性检查点。
自动检查
用测试、构建、Lint、类型检查等系统手段验证结果,而不是只靠 AI 自评。
经验沉淀
把高频有效做法固化为模板、脚本、Skill 或 AGENTS.md。
把业务规则、接口说明、代码约定、运行方式整理清楚,减少 AI 在信息不足时自行猜测。
适合沉淀的资料包括:项目背景、核心术语、目录结构、接口协议、常见问题、禁止行为和安全边界。
固定项目结构、命名规范、代码风格和交付格式,让 AI 在同一套轨道上工作。
约束最好能落到可执行机制里,例如格式化工具、Lint 规则、测试命令和 CI 检查。
让结果经过外部验证,而不是只听 AI 说“已经完成”。
常见检查方式包括单元测试、集成测试、类型检查、Lint、构建验证、预览检查和人工 Review。
驾驭规则本身也需要维护。过期文档、冗余上下文、失效脚本和重复规则都会降低 AI 的执行质量。
好的 Harness 应该越用越清晰,而不是越积越厚。
划界:明确工作内容和边界,先回答“这次任务到底交付什么,不包含什么?”
筑底:准备运行和验证环境,确保 AI 能安装、运行、测试和预览。
投料:提供可靠上下文,标出哪些资料必须看,哪些资料不能直接信。
拆流:把复杂任务拆成可顺序执行的小任务,设置阶段性验收点。
互审:用检查清单、测试、构建或多个智能体交叉验证结果。
提纯:沉淀高频流程,把有效经验固化成模板、脚本或 Skill。
交付:完成上线、部署、说明和最终验收,让用户能确认结果可用。
一个项目不需要一开始就设计得很重。先搭出最小版本,就能明显提升 AI 的稳定性。
项目说明
写清目标、技术栈、目录结构和运行命令。
任务规则
写清做事顺序、禁止行为和验收标准。
检查命令
准备测试、构建、格式化或预览命令。
沉淀入口
把反复出现的流程写进文档、脚本或 Skill。
任务设计者
把模糊需求拆成可执行、可验证的任务。
系统搭建者
为 AI 准备资料、工具、流程和检查机制。
质量监督者
判断结果是否可靠,并把经验沉淀回系统。