FIELD ENGINEERING / 现场交付手册
FDE 实战 Wiki
从客户问题定义、GPU 与模型选型,到部署、性能调优、评测和生产运维。每章都以决策、命令、产物和验收标准组织,目标是让你能独立完成一次可复现的 AI 交付。
30+个 Wiki 页面
8个研究与交付阶段
6类重点数据中心 GPU
1套端到端项目模板
按任务进入
不要求顺序阅读。先选择眼前要解决的问题,再沿章节末尾的产物清单收敛结果。
我需要从零完成一次交付
用需求矩阵明确价值和边界,完成容量估算、部署、评测、上线门禁及移交。适合首次承担端到端项目的人。
进入交付主线我需要选 GPU 和模型
先算权重、KV Cache 和并发,再比较 B300、B200、H200、H100、H20、L20。
开始容量估算我需要把服务跑快
用 TTFT、TPOT、吞吐、显存和错误率定位瓶颈,然后按证据调整批处理、并行与量化。
进入性能实验交付地图
每个阶段必须留下可审计产物。没有基线、日志和验收记录的“跑通”不算完成。
本期重点
前沿模型和 GPU 价格变化很快。这里优先记录可核实状态、更新时间和采购前的复核动作。
MODEL WATCH
Kimi K3、DeepSeek V4.1-Flash、GLM-5.3 / Flash
已按官方仓库、模型卡和 API 更新日志拆分“开放权重”“托管 API”“兼容路由”和“已退役”状态。
GPU WATCH
B300、B200、H200、H100、H20、L20
数据中心规格、显存、带宽、互连和公开云价格均列出来源;采购价只作为询价基线。
OPERATING RULE
先证据,后结论
模型版本、许可证、计费和区域可用性必须在正式方案中记录查询日期与原始链接。
Agent 与模型观察
把“会回答”拆成模型能力、harness 控制面、工具权限、评测和发布门禁,适合做前沿调研后的工程判断。
最短实践闭环
把阅读转化为一次可以复盘的实验,而不是停留在工具安装。
完成定义:同事拿到你的仓库后,不询问口头背景,也能在同一环境重现服务、基线和结论。