02 OpenAI 与 Anthropic 实践

返回 AI Harness

本页只沉淀能被公开来源支撑的实践。OpenAI 和 Anthropic 放在主线;Google、Microsoft、LangSmith 放在旁证和工具落地层。

OpenAI: 从 Agents SDK 到 trace/evals

可靠 agent 的基础

OpenAI 的 agents guide 把可靠 agent 的起点放在三个基础上:capable model、well-defined tools、clear structured instructions。它同时强调 orchestration pattern 要匹配复杂度,从 single agent 开始,需要时再演进到 multi-agent。

对应到 harness:先把工具、指令、退出条件和风险边界定义清楚,不要一开始就把系统做成多 agent。

来源: A practical guide to building agents

Agents SDK / Responses API 的 primitives

OpenAI 在 “New tools for building agents” 中把 Agents SDK 的能力拆成:

  • Agents: 可配置模型、指令和内置工具。
  • Handoffs: 在 agent 之间转交控制。
  • Guardrails: 输入/输出验证和安全检查。
  • Tracing & Observability: 可视化执行 trace,用于调试和优化。
  • Responses API: 把模型和 built-in tools 组合到应用里。

对应到 harness:OpenAI 的平台抽象已经把 tools、handoffs、guardrails、tracing 视为 agent 应用的一等组件。

来源: New tools for building agents

Safety: guardrails + structured data + approvals

OpenAI Agent Builder safety guide 的关键建议:

  • 用输入 guardrails 做 PII redaction 和 jailbreak detection。
  • 用 trace graders 和 evals 观察决策、工具调用和 reasoning steps。
  • 不让 untrusted data 直接驱动 agent 行为;从外部输入里只提取结构化字段。
  • MCP 工具调用保持 tool approvals,高风险动作走 human approval node。
  • structured outputs 和 isolation 能降低风险,但不能完全消除风险。

对应到 harness:高风险 agent 的输入、工具调用、输出都要有边界;权限和结构化数据比“相信模型会听话”更重要。

来源: Safety in building agents

Evals: 从 trace 到 dataset

OpenAI agent evals guide 建议:

  • 调试行为时先从 traces 入手。
  • trace 记录 model calls、tool calls、guardrails、handoffs。
  • graders 给 trace 的具体部分打分,帮助定位 workflow 级别问题。
  • 当知道“好”长什么样后,再迁移到 datasets 和 eval runs,用于 benchmark prompt、model 或 workflow 改动。

对应到 harness:eval 不应该只问“最终答案好不好”,而要把一次 agent run 的中间步骤纳入评分。

来源: Evaluate agent workflows

Anthropic: 明确的 harness 视角

Trustworthy agents: model / harness / tools / environment

Anthropic 在 “Trustworthy agents in practice” 中把 agent 行为拆成四层:model、harness、tools、environment。其中 harness 指模型运行其上的 instructions 和 guardrails。一个模型即使能力很强,如果 harness 配置差、工具过度授权或环境暴露,仍然会被利用。

对应到 harness:安全和可靠性不是模型层一个点能解决,要同时管 instruction、guardrails、tool permission 和 environment。

来源: Trustworthy agents in practice

Context engineering: 管的是整套上下文状态

Anthropic 的 context engineering 文章把 context 扩展为 system prompts、tools、examples、message history、external data 等整体状态。它强调:

  • 工具是 agent 和环境之间的 contract。
  • 工具要 self-contained、robust、用途清晰、参数无歧义。
  • 工具集不要膨胀到人类都分不清该用哪个。
  • 用 just-in-time retrieval 动态加载需要的信息,而不是预先把所有材料塞进上下文。
  • 任务状态可以用 todo list、NOTES.md 等低成本外部记忆保存。

对应到 harness:context engineering 是 harness 的核心层,不是 prompt wording 的小技巧。

来源: Effective context engineering for AI agents

Tool design: 面向非确定性系统设计工具

Anthropic 的 tool design 文章强调 agent 工具应当:

  • intentionally and clearly defined。
  • use agent context judiciously。
  • return high-signal information。
  • 通过 evaluation-driven process 不断改进。
  • 读 raw transcripts,不只看 agent 自己解释的 reasoning。

对应到 harness:工具返回“多而全”不一定好;真正好的工具会让模型更少猜、更少误路由。

来源: Writing effective tools for agents

Building effective agents: 简单、透明、工具接口

Anthropic 的 effective agents 文章建议:

  • 保持 agent design 简单。
  • 明确展示 planning steps,提高透明度。
  • 认真设计 agent-computer interface,也就是 agent 使用工具和环境的接口。
  • 对 autonomous agents 做 sandboxed testing 和 guardrails。
  • agent 执行时要不断从环境拿 ground truth,必要时在人类 checkpoint 暂停。

对应到 harness:不要把 autonomy 当目标;让 agent 每一步都能被环境证据校正,才是可靠性的来源。

来源: Building Effective AI Agents

Evals: 评的是 model + harness 的整体

Anthropic 的 evals 文章直接定义:agent harness 是让模型能作为 agent 行动的系统,它处理输入、编排工具调用并返回结果。因此评估“一个 agent”时,实际是在评估 model 和 harness 一起工作的结果。

关键实践:

  • 早写 eval,不要等完美 suite。
  • 从真实 failure 里提取任务。
  • success criteria 要明确。
  • 结合多种 grader。
  • eval 要足够难,否则没有信号。
  • 读 transcripts。
  • 结果要看 final outcome,不能只看 agent 说自己完成了。

对应到 harness:eval suite 是 harness 的一部分,不是上线前的附属 checklist。

来源: Demystifying evals for AI agents

Long-running apps: context reset 和结构化 handoff

Anthropic 的 long-running app harness 文章指出两个长任务问题:

  • context window 变满后,agent 容易失去 coherence。
  • agent 自评自己产出的主观质量时,容易过度乐观。

它提出的方向包括 context reset、fresh agent、structured handoff,以及独立 evaluator/外部反馈循环。

对应到 harness:长任务不能只靠一个会话无限滚动;需要压缩、交接、独立评估和阶段性重启。

来源: Harness design for long-running application development

旁证: 其他大厂与平台

Google

Google Cloud 的 production-ready agent 资料强调 trajectory evaluation:不仅评最终答案,还要评工具选择、reasoning quality、error recovery、是否该追问。部署上建议从 sandbox 到 canary 再到 production。

来源: A dev’s guide to production-ready AI agents

Microsoft

Microsoft Azure AI Foundry 的 observability 实践强调:

  • development 和 production 中持续评估 agent。
  • 把 eval 接入 CI/CD,每次变更都检查 quality 和 safety。
  • 用 red teaming、dashboard、governance 支撑生产可靠性。

来源: Agent Factory: Top 5 agent observability best practices for reliable AI

LangSmith

LangSmith 的落地路径和本库已有 Eval & Observability Playbook 高度一致:

  • 先 instrument traces。
  • 从 production traces 抽 failure pattern。
  • 写入 dataset。
  • 用 offline / online eval 跟踪质量。
  • 用 human feedback 校准 LLM-as-judge。

来源: AI Agent Observability: Tracing, Testing, and Improving Agents

综合结论

  • Harness 的核心不是让模型更自由,而是让模型在更清楚的边界里行动。
  • OpenAI 的路线偏平台 primitives:Responses API、Agents SDK、guardrails、tracing、evals、tool approvals。
  • Anthropic 的路线偏系统设计原则:context engineering、tool interface、agent-computer interface、trajectory eval、long-running handoff。
  • Google / Microsoft / LangSmith 的共同点是把 eval、observability、CI/CD 和生产监控前置为工程能力,而不是上线后的补丁。