数据中心内的 FDE 工程工作台,背景为 GPU 机柜和服务监控屏幕
FIELD ENGINEERING / 现场交付手册

FDE 实战 Wiki

从客户问题定义、GPU 与模型选型,到部署、性能调优、评测和生产运维。每章都以决策、命令、产物和验收标准组织,目标是让你能独立完成一次可复现的 AI 交付。

30+个 Wiki 页面
8个研究与交付阶段
6类重点数据中心 GPU
1套端到端项目模板

按任务进入

不要求顺序阅读。先选择眼前要解决的问题,再沿章节末尾的产物清单收敛结果。

PATH 01 / DELIVERY

我需要从零完成一次交付

用需求矩阵明确价值和边界,完成容量估算、部署、评测、上线门禁及移交。适合首次承担端到端项目的人。

进入交付主线
PATH 02 / INFRA

我需要选 GPU 和模型

先算权重、KV Cache 和并发,再比较 B300、B200、H200、H100、H20、L20。

开始容量估算
PATH 03 / PERFORMANCE

我需要把服务跑快

用 TTFT、TPOT、吞吐、显存和错误率定位瓶颈,然后按证据调整批处理、并行与量化。

进入性能实验

交付地图

每个阶段必须留下可审计产物。没有基线、日志和验收记录的“跑通”不算完成。

01定义问题

业务目标、用户旅程、风险边界、验收指标。

FDE 基础
02选择系统

模型能力、许可证、上下文、算力、成本和供应风险。

模型全景
03测算容量

权重、KV Cache、运行时开销、峰值并发和余量。

显存计算
04部署服务

单机、多 GPU、Kubernetes、灰度和回滚路径。

部署模式
05优化验证

性能基线、RAG/Agent、离线评测和上线门禁。

评测体系
06运营移交

SLO、告警、事故处理、安全审计和成本复盘。

生产运维

本期重点

前沿模型和 GPU 价格变化很快。这里优先记录可核实状态、更新时间和采购前的复核动作。

MODEL WATCH

Kimi K3、DeepSeek V4.1-Flash、GLM-5.3 / Flash
已按官方仓库、模型卡和 API 更新日志拆分“开放权重”“托管 API”“兼容路由”和“已退役”状态。

GPU WATCH

B300、B200、H200、H100、H20、L20
数据中心规格、显存、带宽、互连和公开云价格均列出来源;采购价只作为询价基线。

OPERATING RULE

先证据,后结论
模型版本、许可证、计费和区域可用性必须在正式方案中记录查询日期与原始链接。

Agent 与模型观察

把“会回答”拆成模型能力、harness 控制面、工具权限、评测和发布门禁,适合做前沿调研后的工程判断。

07拆解 Agent

dsh、pi、Muse、OpenCode、Codex 及相邻 coding Agent 的源码、权限和状态模型。

Agent 全景
08设计 Harness

代码修复、浏览器研究、RAG、CI、多 Agent 和 judge 的可重放组合。

Harness 场景
09比较模型

Claude、Gemini、DeepSeek、Kimi、Qwen、MiniMax、GLM、ChatGPT 与 Jev 的训练、对齐和工程边界。

模型研究

最短实践闭环

把阅读转化为一次可以复盘的实验,而不是停留在工具安装。

1. 在 [快速开始](05-practice/quickstart.md) 跑起一个兼容 OpenAI API 的本地推理服务。 2. 用 [显存估算](02-infrastructure/vram-calculator.md) 写下估算值,再和真实峰值比较。 3. 记录 TTFT、TPOT、吞吐、显存和输出质量,按 [推理优化](04-optimization/inference-optimization.md) 只改变一个变量。 4. 把命令、配置、结果和回滚方法收进 [项目模板](05-practice/project-template.md)。
完成定义:同事拿到你的仓库后,不询问口头背景,也能在同一环境重现服务、基线和结论。