04. 实践路径:从会用到能开发 Agent 系统

这份路径按「可验证产出」组织。每个阶段都应该有可演示结果,而不是只读完文档。

阶段 1:做一个可观察的 Chat Agent

目标:从前端页面切入 Agent 应用。

功能:

  • 用户输入问题
  • 后端调用模型
  • 前端展示 streaming response
  • 支持 loading、error、retry
  • 返回结构化结果
  • LangSmith 记录 trace

建议技术:

  • TypeScript
  • React / Next.js
  • LangChain JS
  • LangSmith tracing

验收标准:

  • 页面能展示模型流式输出。
  • 出错时有明确错误态。
  • 每次请求都能在 LangSmith 中找到 trace。
  • trace 中能看到 prompt、model response、latency。

阶段 2:把真实 API 封装成工具

目标:理解 tool calling。

选择 2-3 个工具,例如:

  • 搜索文档
  • 查询 GitHub issue
  • 创建 Linear task
  • 查询数据库只读接口
  • 读取 Notion 页面

每个工具需要:

  • 清晰命名
  • 清晰描述
  • 参数 schema
  • 权限边界
  • 错误返回
  • 稳定输出结构

验收标准:

  • Agent 能在合适场景选择工具。
  • 工具参数能被 schema 校验。
  • 工具失败时 Agent 能解释失败,而不是胡编结果。
  • LangSmith trace 中能看到 tool input / output。

阶段 3:做一个 RAG Agent

目标:构建有证据的回答系统。

功能:

  • ingest 一组文档
  • chunk 文档
  • embedding
  • vector search
  • 生成带引用的回答
  • 支持 no-answer

建议文档来源:

  • 团队 README
  • API 文档
  • 产品 FAQ
  • 技术方案文档

验收标准:

  • 回答必须带 citation。
  • 检索不到充分证据时能拒答。
  • LangSmith trace 中能看到 retrieval chunks。
  • 至少整理 10 个 hallucination 或 retrieval failure 样例。

阶段 4:建立 Dataset 和 Evaluation

目标:从「手动试」升级到「可重复评估」。

Dataset 结构建议:

  • input:用户问题
  • reference:期望答案或行为
  • context:必要背景
  • category:问题类型
  • risk:风险等级

Eval 维度建议:

  • correctness
  • groundedness
  • citation correctness
  • tool-use accuracy
  • refusal correctness
  • latency
  • cost

验收标准:

  • 至少 30 条 dataset 样例。
  • 能比较 prompt v1 和 v2。
  • 能输出失败分类报告。
  • 修改 prompt 后能用 experiment 证明是否变好。

阶段 5:用 LangGraph 做 Workflow

目标:从简单 Agent loop 进入可控 workflow。

可选项目:

Router Workflow

按问题类型路由:

  • 文档问答
  • API 查询
  • 任务创建
  • 无法处理

Orchestrator-Worker Workflow

主 Agent 拆任务,worker 执行:

  • 搜索
  • 总结
  • 校验
  • 输出

Evaluator-Optimizer Workflow

先生成答案,再由 evaluator 检查:

  • 是否有证据
  • 是否满足格式
  • 是否需要重试

验收标准:

  • graph 有清晰 state。
  • 每个 node 职责单一。
  • 支持 checkpoint 或恢复。
  • LangSmith trace 能看清节点流转。

阶段 6:加入 Human-in-the-loop

目标:让高风险动作可控。

适用场景:

  • 发送消息
  • 创建或修改任务
  • 写入数据库
  • 调用付费 API
  • 删除或覆盖内容

实现要求:

  • Agent 先生成计划
  • 用户确认后执行
  • trace 记录确认前后的状态
  • destructive action 必须有显式确认

验收标准:

  • 高风险工具不能静默执行。
  • UI 能展示即将执行的动作。
  • 用户可以 approve / reject / edit。

阶段 7:产品化和上线

目标:不只做 demo,而是能持续运营。

需要加入:

  • feedback UI
  • LangSmith dashboard
  • alert
  • CI eval gate
  • prompt version promotion
  • regression dataset
  • cost tracking
  • latency tracking

验收标准:

  • 差评 trace 能被追踪到。
  • 线上失败能进入 dataset。
  • CI 中能跑关键 eval。
  • 重要指标能在 dashboard 中查看。

推荐作品集项目

项目 1:文档问答 Agent

必须包含:

  • RAG
  • citation
  • no-answer
  • LangSmith trace
  • dataset eval
  • prompt comparison
  • feedback loop

展示重点:

  • 失败样例如何收集
  • 如何分类失败
  • 如何修复
  • 如何验证修复有效

项目 2:工作流 Agent

必须包含:

  • LangGraph workflow
  • 多工具调用
  • human approval
  • checkpoint
  • trace
  • dashboard
  • CI eval gate

展示重点:

  • 为什么不用简单 Agent loop
  • state 如何设计
  • 工具权限如何控制
  • 上线后如何监控

评估自己是否进入 Agent Engineer 状态

你能回答这些问题,就说明已经从「会调模型」进入「会做 Agent 工程」:

  • 这个 Agent 的核心失败模式是什么?
  • 失败样例是否进入 dataset?
  • 哪个 eval 能防止这类失败复发?
  • trace 能否解释一次线上错误?
  • 工具调用是否有权限边界?
  • prompt 修改是否有版本和回滚机制?
  • 线上反馈如何进入下一轮改进?
  • latency 和 cost 的主要来源是什么?