05. 12 周成长计划
这是一份面向 FE Engineer 的 12 周路线。每周都包含主题、学习材料、练习项目和验收标准。
第 1 周:LLM API 和结构化输出
学习主题:
- messages / roles
- system prompt
- streaming
- structured output
- token / latency / cost
练习:
- 做一个 TypeScript chat endpoint。
- 支持 streaming。
- 要求模型返回结构化 JSON。
验收:
- 能解释一次请求的输入、输出、token、latency。
- 能处理 JSON schema validation 失败。
- UI 有 loading、streaming、error 状态。
资料:
第 2 周:Tool Calling
学习主题:
- tool schema
- tool description
- tool choice
- tool error handling
- permission boundary
练习:
- 封装 2-3 个真实工具。
- 让 Agent 根据用户问题选择工具。
- 工具失败时返回可解释错误。
验收:
- trace 中能看到 tool input / output。
- 工具参数通过 schema 校验。
- Agent 不会在工具失败时编造结果。
资料:
第 3 周:RAG 基础
学习主题:
- document loading
- chunking
- embedding
- vector search
- citation
- no-answer
练习:
- 用一组文档做问答 Agent。
- 回答必须带引用。
- 没有证据时拒答。
验收:
- 能展示检索到的 chunks。
- 能说明一次回答基于哪些证据。
- 收集至少 10 个 retrieval failure。
资料:
第 4 周:LangSmith Tracing
学习主题:
- trace
- span
- run metadata
- tool tracing
- retriever tracing
- latency / cost
练习:
- 给前 3 周项目接入 LangSmith。
- 为每次请求添加 metadata。
- 从 trace 中定位 3 个失败案例。
验收:
- 能在 LangSmith 中看到完整请求链路。
- 能从 trace 解释模型、工具、检索的行为。
- 能识别最慢步骤和主要成本来源。
资料:
第 5 周:Datasets 和 Offline Eval
学习主题:
- dataset
- experiment
- evaluator
- regression
- LLM-as-judge
练习:
- 创建 30 条 dataset。
- 比较两版 prompt 或两种模型。
- 记录失败分类。
验收:
- 能说明哪个版本更好以及为什么。
- 能列出主要失败类型。
- 能把线上失败样例加入 dataset。
资料:
第 6 周:LangGraph Workflow
学习主题:
- state
- nodes
- edges
- router
- checkpoint
- durable execution
练习:
- 用 LangGraph 做一个 router workflow。
- 至少 3 个 node。
- 每个 node 有明确职责。
验收:
- graph 能处理不同类型问题。
- state 结构清晰。
- trace 能看清节点流转。
资料:
第 7 周:Memory 和 Human-in-the-loop
学习主题:
- thread state
- short-term memory
- long-term memory
- approval
- interrupt / resume
练习:
- 支持 thread 级状态恢复。
- 对高风险工具调用加入人工确认。
验收:
- 用户能继续上次任务。
- destructive action 前必须确认。
- confirm / reject 都被记录进 trace。
资料:
第 8 周:Guardrails 和安全
学习主题:
- prompt injection
- PII redaction
- output validation
- tool permission
- policy refusal
练习:
- 加入输入检测。
- 给工具加权限边界。
- 对敏感输出做 redaction。
验收:
- Agent 能拒绝越权请求。
- 高风险工具不能被 prompt injection 诱导调用。
- 有安全相关 eval cases。
资料:
第 9 周:成本和延迟优化
学习主题:
- model routing
- caching
- streaming
- parallel tool calls
- prompt compression
- retrieval limit
练习:
- 记录 baseline latency / cost。
- 做 2-3 个优化。
- 用 LangSmith 对比优化前后。
验收:
- 有量化对比。
- 不牺牲关键 eval 分数。
- 能解释主要瓶颈在哪里。
资料:
第 10 周:线上监控和 Feedback Loop
学习主题:
- dashboard
- alert
- online evaluator
- feedback
- annotation queue
练习:
- 加入 thumbs up / down。
- 建 dashboard。
- 配置关键 alert。
验收:
- 线上差评能关联 trace。
- 差评可以进入人工标注流程。
- 重要质量指标可被监控。
资料:
第 11 周:CI Eval Gate 和发布流程
学习主题:
- prompt versioning
- environment promotion
- CI eval
- regression blocking
- rollback
练习:
- 每次 prompt / workflow 修改跑关键 eval。
- 低于阈值阻止合并或上线。
验收:
- CI 能运行 eval。
- 有明确通过阈值。
- 有失败报告和回滚策略。
资料:
第 12 周:作品集和贡献
学习主题:
- case study
- failure analysis
- open source contribution
- docs / cookbook PR
练习:
- 整理两个作品集项目。
- 写一篇 case study。
- 尝试给 LangChain / LangGraph / LangSmith 示例或文档提 PR。
验收:
- 作品集能展示 trace、eval、失败修复、上线监控。
- 能讲清楚技术取舍。
- 有至少一个可公开链接或可演示项目。
最终验收清单
- 一个文档问答 Agent。
- 一个 LangGraph workflow Agent。
- 每个项目都有 LangSmith trace。
- 至少一个项目有 dataset eval。
- 至少一个项目有 feedback loop。
- 至少一个项目有 dashboard / alert。
- 有一篇完整 case study。