AI Harness: 让 AI 稳定工作的工程控制面

返回 相关私有笔记 · 相关私有笔记

AI Harness 不是更长的 prompt,而是模型外部的一整套工作环境:上下文、工具、权限、护栏、评估、观测、记忆、人工审批和发布策略。它回答的核心问题是:AI 能在什么边界内行动,怎么拿证据,怎么调用工具,怎么判断做对,失败后怎么回流。

阅读顺序

  1. 01 Harness 模型 — 定义 harness 的边界、组件和最小可用结构。
  2. 02 OpenAI 与 Anthropic 实践 — 优先整理 OpenAI、Anthropic 的官方分享和工程实践。
  3. 03 来源索引 — 按 OpenAI / Anthropic / Google / Microsoft / LangSmith 维护来源。
  4. 相关私有笔记 — 把测试作为 AI harness 的验证层,区分单测、E2E 与 Playwright / Codex / Cursor / Chrome DevTools 的分工。

接入现有 AI 知识体系

已有基础心智模型

Agent 工程与工具层

  • Agent 工程知识地图 — LLM API、tool calling、RAG、memory、workflow、eval、observability。
  • Eval & Observability Playbook — trace、dataset、experiment、CI gate、dashboard。
  • 相关私有笔记 — 一个可扩展 coding agent harness 的具体实现样本。
  • 相关私有笔记 — agent loop、最小内核和扩展层。
  • 相关私有笔记 — AGENTS.md、行为纪律、复杂任务流程。

平台与编排

  • 相关私有笔记 — n8n / ComfyUI / Dify 在 workflow 和 agent 应用层的分工。
  • Knowledge capture — 把失败样例、偏好和工程经验写回 harness。

Harness 分层视图

关注点对应已有笔记
Contextsystem prompt、任务上下文、检索、示例、历史消息[[10 - 项目 Projects/AI Workflow Sharing/Context building
Tools工具定义、参数 schema、权限、错误返回、沙箱[[10 - 项目 Projects/LangSmith Agent Engineer Guide/02-agent-engineering-knowledge-map
Guardrails输入过滤、输出检查、工具审批、PII、prompt injection[[10 - 项目 Projects/AI Workflow Sharing/Minimum viable change
Evalstrace grading、dataset、trajectory、CI gate、人工复核[[10 - 项目 Projects/LangSmith Agent Engineer Guide/06-evaluation-observability-playbook
Testing单测、组件 / 集成测试、E2E、浏览器调试证据相关私有笔记
Observabilitytrace、span、latency、token、cost、failure taxonomy[[10 - 项目 Projects/LangSmith Agent Engineer Guide/06-evaluation-observability-playbook
State / Memorysession state、task state、长期记忆、handoff相关私有笔记
Human approvals高风险工具、写操作、外部发送、生产变更[[10 - 项目 Projects/AI Workflow Sharing/AI workflow escalation
Rolloutsandbox、canary、rollback、监控、incident review[[10 - 项目 Projects/AI Workflow Sharing/Hypothesis loop

当前判断

  • OpenAI 和 Anthropic 的共识是:可靠 agent 不是单靠模型升级,而是模型、上下文、工具、护栏、评估和观测一起设计。
  • OpenAI 更强调 Agents SDK / Responses API / trace graders / datasets / tool approvals 这一套开发平台能力。
  • Anthropic 更明确把 harness 说成模型运行其上的 instructions + guardrails,并强调 tool design、context engineering、trajectory eval、sandbox、handoff。
  • Google、Microsoft、LangSmith 的公开实践进一步证明:生产级 agent 的关键不是 demo,而是 trajectory 评估、全链路 trace、CI/CD eval、生产监控和治理。

维护方式

  • 新来源先放进 来源索引,再决定是否沉淀到模型页。
  • 只把长期复用的方法论写进本包;一次性分享稿仍留在 AI Workflow Sharing 包里。
  • 如果某个子主题超过 6 篇反链,再考虑拆成独立知识区 concept 或 AI 领域 MOC,不要提前套娃。