05. 12 周成长计划

这是一份面向 FE Engineer 的 12 周路线。每周都包含主题、学习材料、练习项目和验收标准。

第 1 周:LLM API 和结构化输出

学习主题:

  • messages / roles
  • system prompt
  • streaming
  • structured output
  • token / latency / cost

练习:

  • 做一个 TypeScript chat endpoint。
  • 支持 streaming。
  • 要求模型返回结构化 JSON。

验收:

  • 能解释一次请求的输入、输出、token、latency。
  • 能处理 JSON schema validation 失败。
  • UI 有 loading、streaming、error 状态。

资料:

第 2 周:Tool Calling

学习主题:

  • tool schema
  • tool description
  • tool choice
  • tool error handling
  • permission boundary

练习:

  • 封装 2-3 个真实工具。
  • 让 Agent 根据用户问题选择工具。
  • 工具失败时返回可解释错误。

验收:

  • trace 中能看到 tool input / output。
  • 工具参数通过 schema 校验。
  • Agent 不会在工具失败时编造结果。

资料:

第 3 周:RAG 基础

学习主题:

  • document loading
  • chunking
  • embedding
  • vector search
  • citation
  • no-answer

练习:

  • 用一组文档做问答 Agent。
  • 回答必须带引用。
  • 没有证据时拒答。

验收:

  • 能展示检索到的 chunks。
  • 能说明一次回答基于哪些证据。
  • 收集至少 10 个 retrieval failure。

资料:

第 4 周:LangSmith Tracing

学习主题:

  • trace
  • span
  • run metadata
  • tool tracing
  • retriever tracing
  • latency / cost

练习:

  • 给前 3 周项目接入 LangSmith。
  • 为每次请求添加 metadata。
  • 从 trace 中定位 3 个失败案例。

验收:

  • 能在 LangSmith 中看到完整请求链路。
  • 能从 trace 解释模型、工具、检索的行为。
  • 能识别最慢步骤和主要成本来源。

资料:

第 5 周:Datasets 和 Offline Eval

学习主题:

  • dataset
  • experiment
  • evaluator
  • regression
  • LLM-as-judge

练习:

  • 创建 30 条 dataset。
  • 比较两版 prompt 或两种模型。
  • 记录失败分类。

验收:

  • 能说明哪个版本更好以及为什么。
  • 能列出主要失败类型。
  • 能把线上失败样例加入 dataset。

资料:

第 6 周:LangGraph Workflow

学习主题:

  • state
  • nodes
  • edges
  • router
  • checkpoint
  • durable execution

练习:

  • 用 LangGraph 做一个 router workflow。
  • 至少 3 个 node。
  • 每个 node 有明确职责。

验收:

  • graph 能处理不同类型问题。
  • state 结构清晰。
  • trace 能看清节点流转。

资料:

第 7 周:Memory 和 Human-in-the-loop

学习主题:

  • thread state
  • short-term memory
  • long-term memory
  • approval
  • interrupt / resume

练习:

  • 支持 thread 级状态恢复。
  • 对高风险工具调用加入人工确认。

验收:

  • 用户能继续上次任务。
  • destructive action 前必须确认。
  • confirm / reject 都被记录进 trace。

资料:

第 8 周:Guardrails 和安全

学习主题:

  • prompt injection
  • PII redaction
  • output validation
  • tool permission
  • policy refusal

练习:

  • 加入输入检测。
  • 给工具加权限边界。
  • 对敏感输出做 redaction。

验收:

  • Agent 能拒绝越权请求。
  • 高风险工具不能被 prompt injection 诱导调用。
  • 有安全相关 eval cases。

资料:

第 9 周:成本和延迟优化

学习主题:

  • model routing
  • caching
  • streaming
  • parallel tool calls
  • prompt compression
  • retrieval limit

练习:

  • 记录 baseline latency / cost。
  • 做 2-3 个优化。
  • 用 LangSmith 对比优化前后。

验收:

  • 有量化对比。
  • 不牺牲关键 eval 分数。
  • 能解释主要瓶颈在哪里。

资料:

第 10 周:线上监控和 Feedback Loop

学习主题:

  • dashboard
  • alert
  • online evaluator
  • feedback
  • annotation queue

练习:

  • 加入 thumbs up / down。
  • 建 dashboard。
  • 配置关键 alert。

验收:

  • 线上差评能关联 trace。
  • 差评可以进入人工标注流程。
  • 重要质量指标可被监控。

资料:

第 11 周:CI Eval Gate 和发布流程

学习主题:

  • prompt versioning
  • environment promotion
  • CI eval
  • regression blocking
  • rollback

练习:

  • 每次 prompt / workflow 修改跑关键 eval。
  • 低于阈值阻止合并或上线。

验收:

  • CI 能运行 eval。
  • 有明确通过阈值。
  • 有失败报告和回滚策略。

资料:

第 12 周:作品集和贡献

学习主题:

  • case study
  • failure analysis
  • open source contribution
  • docs / cookbook PR

练习:

  • 整理两个作品集项目。
  • 写一篇 case study。
  • 尝试给 LangChain / LangGraph / LangSmith 示例或文档提 PR。

验收:

  • 作品集能展示 trace、eval、失败修复、上线监控。
  • 能讲清楚技术取舍。
  • 有至少一个可公开链接或可演示项目。

最终验收清单

  • 一个文档问答 Agent。
  • 一个 LangGraph workflow Agent。
  • 每个项目都有 LangSmith trace。
  • 至少一个项目有 dataset eval。
  • 至少一个项目有 feedback loop。
  • 至少一个项目有 dashboard / alert。
  • 有一篇完整 case study。