跳转至

12 周学习路线

每周目标不是“看完资料”,而是留下一个可运行、可评测或可复用的产物。按每周 8 到 12 小时设计。

周 主题 必须交付
1 FDE 与业务发现 一页场景定义、用户流程、成功与失败指标
2 Python/API/结构化输出 一个带 schema 校验、超时和错误处理的模型客户端
3 模型选型与提示词 20 条黄金集,比较至少 3 个模型或配置
4 本地模型与显存 本地 API、显存预算和 512/2K/8K 性能报告
5 RAG 数据与切分 可追溯的解析、chunk、元数据和索引脚本
6 混合检索与重排 Recall@K、最终证据覆盖和失败分类报告
7 Agent 与工具 两个最小权限工具、审批、幂等和最大步数
8 推理部署 vLLM/SGLang 或 llama.cpp 服务、容器和健康检查
9 性能与成本 并发扫描、TTFT/TPOT、每成功任务成本
10 LoRA/QLoRA 小模型 SFT 实验、基线/微调/量化后对比
11 安全与运维 Prompt Injection 测试、权限检查、告警与回滚手册
12 综合交付 真实用户试点、验收报告、移交包和复盘

推荐综合项目

做一个“带权限和引用的企业知识助手”,比做普通聊天页更能覆盖 FDE 能力:

  • 文档导入保留版本、权限、页码和来源。
  • 混合检索、重排、引用与信息不足处理。
  • 一个只读业务工具和一个需要确认的写工具。
  • 模型路由、预算、超时、重试和降级。
  • 离线黄金集、线上反馈与可观测 trace。
  • 容器部署、灰度、回滚和移交文档。

每周复盘问题

  1. 本周结果能否由别人复现?
  2. 我能否用数据说明质量、时延和成本变化?
  3. 失败发生在哪一层,证据是什么?
  4. 新复杂度是否带来了可测量收益?
  5. 哪部分可以沉淀为下个项目复用的资产?

能力证明

求职或内部转岗时,展示以下证据比列技术名词更有效:

  • 场景与约束如何从访谈变成验收标准。
  • 系统架构、数据和权限如何设计。
  • 固定评测集上的迭代记录,包括失败尝试。
  • 压测、成本、故障和安全证据。
  • 上线采用结果与移交材料。

四个阶段门禁

第 1 阶段:能构建

第 1 到 3 周结束时,你应能把模糊需求转成 schema 和评测样本,并写出带超时、错误处理和日志的 API 客户端。门禁是另一位同事能运行代码并得到相同的评测结果。

第 2 阶段:能解释

第 4 到 6 周结束时,你应能解释模型为什么需要这些显存、为什么某条证据没进入上下文、为什么一个候选在目标流量下更贵。门禁是所有结论都有原始数据和复现命令。

第 3 阶段:能运营

第 7 到 9 周结束时,你应能约束 Agent 权限、部署推理服务、找到 SLO 拐点并设计降级。门禁是至少完成一次超时、限流和实例故障演练。

第 4 阶段:能交付

第 10 到 12 周结束时,你应能判断微调是否值得、完成高风险回归,并把系统交给其他人运行。门禁是接手者不依赖口头指导完成发布与回滚。

每周时间盒

活动 建议时间 输出
阅读官方材料 1.5h 一页决策笔记,不抄功能列表
构建最小版本 3h 可运行代码和固定配置
设计与运行评测 2h 原始输出、指标、失败样本
故障与边界测试 1.5h 至少一个失败路径
复盘和文档 1h 决策、代价、下一实验

时间不足时缩小场景和样本,不跳过评测与复盘。一个完整的 20 条闭环比 200 条不可追溯 Demo 更有学习价值。

三档综合项目

基础档本地模型、20 条评测、单一文档集、引用回答、Docker 启停。
进阶档混合检索、重排、两个工具、权限过滤、压测、灰度与回滚。
交付档真实用户、业务基线、模型路由、SLO、成本、事故演练和正式移交。

作品集证据结构

  1. 问题:原流程、损失、用户、数据与约束。
  2. 判断:为什么选择该模型、架构和安全边界,哪些方案被否决。
  3. 实现:架构图、关键代码、版本化配置和运行说明。
  4. 验证:黄金集、失败分类、性能矩阵、故障注入和成本。
  5. 结果:业务指标、采用、限制、复盘和下一步。

隐藏客户数据和密钥,但不要删掉失败实验。失败如何被识别和修正,往往比最终截图更能证明 FDE 能力。

偏科修正

当前优势 常见缺口 接下来刻意练习
后端工程 业务发现、模型行为评测 做访谈、rubric 和人工校准
算法/模型 系统可靠性、集成、运维 做网关、SLO、故障和回滚
产品/咨询 编码、可观测性、性能 写真实客户端、部署和压测
运维/平台 质量评测、RAG、交互 做黄金集、检索分层和用户试点
路线使用方法:每周只保留一个主项目,把新增能力叠加到同一个可运行系统。十二个互不关联的小 Demo 很难形成端到端交付能力。