12 周学习路线¶
每周目标不是“看完资料”,而是留下一个可运行、可评测或可复用的产物。按每周 8 到 12 小时设计。
| 周 | 主题 | 必须交付 |
|---|---|---|
| 1 | FDE 与业务发现 | 一页场景定义、用户流程、成功与失败指标 |
| 2 | Python/API/结构化输出 | 一个带 schema 校验、超时和错误处理的模型客户端 |
| 3 | 模型选型与提示词 | 20 条黄金集,比较至少 3 个模型或配置 |
| 4 | 本地模型与显存 | 本地 API、显存预算和 512/2K/8K 性能报告 |
| 5 | RAG 数据与切分 | 可追溯的解析、chunk、元数据和索引脚本 |
| 6 | 混合检索与重排 | Recall@K、最终证据覆盖和失败分类报告 |
| 7 | Agent 与工具 | 两个最小权限工具、审批、幂等和最大步数 |
| 8 | 推理部署 | vLLM/SGLang 或 llama.cpp 服务、容器和健康检查 |
| 9 | 性能与成本 | 并发扫描、TTFT/TPOT、每成功任务成本 |
| 10 | LoRA/QLoRA | 小模型 SFT 实验、基线/微调/量化后对比 |
| 11 | 安全与运维 | Prompt Injection 测试、权限检查、告警与回滚手册 |
| 12 | 综合交付 | 真实用户试点、验收报告、移交包和复盘 |
推荐综合项目¶
做一个“带权限和引用的企业知识助手”,比做普通聊天页更能覆盖 FDE 能力:
- 文档导入保留版本、权限、页码和来源。
- 混合检索、重排、引用与信息不足处理。
- 一个只读业务工具和一个需要确认的写工具。
- 模型路由、预算、超时、重试和降级。
- 离线黄金集、线上反馈与可观测 trace。
- 容器部署、灰度、回滚和移交文档。
每周复盘问题¶
- 本周结果能否由别人复现?
- 我能否用数据说明质量、时延和成本变化?
- 失败发生在哪一层,证据是什么?
- 新复杂度是否带来了可测量收益?
- 哪部分可以沉淀为下个项目复用的资产?
能力证明¶
求职或内部转岗时,展示以下证据比列技术名词更有效:
- 场景与约束如何从访谈变成验收标准。
- 系统架构、数据和权限如何设计。
- 固定评测集上的迭代记录,包括失败尝试。
- 压测、成本、故障和安全证据。
- 上线采用结果与移交材料。
四个阶段门禁¶
第 1 阶段:能构建¶
第 1 到 3 周结束时,你应能把模糊需求转成 schema 和评测样本,并写出带超时、错误处理和日志的 API 客户端。门禁是另一位同事能运行代码并得到相同的评测结果。
第 2 阶段:能解释¶
第 4 到 6 周结束时,你应能解释模型为什么需要这些显存、为什么某条证据没进入上下文、为什么一个候选在目标流量下更贵。门禁是所有结论都有原始数据和复现命令。
第 3 阶段:能运营¶
第 7 到 9 周结束时,你应能约束 Agent 权限、部署推理服务、找到 SLO 拐点并设计降级。门禁是至少完成一次超时、限流和实例故障演练。
第 4 阶段:能交付¶
第 10 到 12 周结束时,你应能判断微调是否值得、完成高风险回归,并把系统交给其他人运行。门禁是接手者不依赖口头指导完成发布与回滚。
每周时间盒¶
| 活动 | 建议时间 | 输出 |
|---|---|---|
| 阅读官方材料 | 1.5h | 一页决策笔记,不抄功能列表 |
| 构建最小版本 | 3h | 可运行代码和固定配置 |
| 设计与运行评测 | 2h | 原始输出、指标、失败样本 |
| 故障与边界测试 | 1.5h | 至少一个失败路径 |
| 复盘和文档 | 1h | 决策、代价、下一实验 |
时间不足时缩小场景和样本,不跳过评测与复盘。一个完整的 20 条闭环比 200 条不可追溯 Demo 更有学习价值。
三档综合项目¶
基础档本地模型、20 条评测、单一文档集、引用回答、Docker 启停。
进阶档混合检索、重排、两个工具、权限过滤、压测、灰度与回滚。
交付档真实用户、业务基线、模型路由、SLO、成本、事故演练和正式移交。
作品集证据结构¶
- 问题:原流程、损失、用户、数据与约束。
- 判断:为什么选择该模型、架构和安全边界,哪些方案被否决。
- 实现:架构图、关键代码、版本化配置和运行说明。
- 验证:黄金集、失败分类、性能矩阵、故障注入和成本。
- 结果:业务指标、采用、限制、复盘和下一步。
隐藏客户数据和密钥,但不要删掉失败实验。失败如何被识别和修正,往往比最终截图更能证明 FDE 能力。
偏科修正¶
| 当前优势 | 常见缺口 | 接下来刻意练习 |
|---|---|---|
| 后端工程 | 业务发现、模型行为评测 | 做访谈、rubric 和人工校准 |
| 算法/模型 | 系统可靠性、集成、运维 | 做网关、SLO、故障和回滚 |
| 产品/咨询 | 编码、可观测性、性能 | 写真实客户端、部署和压测 |
| 运维/平台 | 质量评测、RAG、交互 | 做黄金集、检索分层和用户试点 |
路线使用方法:每周只保留一个主项目,把新增能力叠加到同一个可运行系统。十二个互不关联的小 Demo 很难形成端到端交付能力。