跳转至

使用这套 Wiki

这不是按章节背诵的教材,而是一套把模型、GPU、部署、评测和 Agent harness 串成证据链的现场手册。每一章都应该产出可以复制、比较或回滚的工件。

先判断你要解决的是什么

任务 先读 读完应留下的工件
第一次交付 项目交付方法 → 本地快速开始 需求矩阵、环境清单、验收指标
选 GPU GPU 选型与价格 → 显存计算 模型驻留计算、拓扑假设、成本表
选模型 前沿模型地图 → 国产前沿模型 固定 model ID、许可证记录、候选评测表
上生产 部署方式 → 高级部署 镜像 digest、健康检查、灰度与回滚命令
跑得更快 推理性能优化 → 评测体系 一变量实验、P95、显存峰值、每成功任务成本
做 Agent Agent 全景 → Harness 场景 工具权限表、trace schema、重放样本
研究模型 训练、对齐与工程差异 → Judge 模型 公开字段矩阵、未知项、人工校准集

本 Wiki 的证据等级

等级 含义 允许做出的结论
A 官方模型卡、官方仓库、官方 API 文档、原始论文 版本、参数、接口、许可证等事实
B 厂商官方博客或产品页,缺少可下载制品 已宣布,能力和部署边界仍需验证
C 合作伙伴、云厂商、可信媒体 作为观察项和线索,不作为采购门禁
D 社区截图、聚合站、匿名消息 不写进事实表

每个结论还要有三行说明:

  • 适用条件:什么 workload、数据边界、硬件和风险下成立。
  • 代价:显存、时延、许可证、运维、供应或人工成本。
  • 验证方式:命令、数据集、指标、观察窗口和回滚条件。

一个模型从研究到生产要经过什么

官方资料
  -> 固定版本和许可证
  -> 显存/网络/成本估算
  -> 最小可运行服务
  -> 真实 workload 黄金集
  -> 性能与安全门禁
  -> 1% 灰度
  -> 生产别名与回滚
  -> 每月复核退役、价格和行为变化

不要跳过中间步骤。特别是“能生成一次”不等于“能稳定服务”,而“开放权重”也不等于“可以按你的方式商用或做模型服务”。

每次实验都记录这 12 个字段

date: 2026-09-26
workload: ticket-routing-v2
model_requested: deepseek-flash
model_observed: <provider-returned-id>
engine: vllm@<image-digest>
gpu_topology: H100-SXM x 8 / NVSwitch
precision: fp8
context_limit: 32768
concurrency: 16
dataset_revision: golden-2026-09-20
metrics: [pass_rate, severe_error, ttft_p95, e2e_p95, cost_per_success]
decision: keep / rollback / investigate

阅读顺序建议

一天内跑通

先完成 快速开始,再用 项目模板 保存命令和结果。目标是让另一个人能在同一环境重新启动,而不是把笔记写得很长。

一周内形成判断

选择一个真实任务,比较一个托管模型、一个开放权重模型和一个轻量回退模型。使用同一提示、工具、知识库和评分规则;把失败样本加入 评测体系。

进入生产前

完成 高级部署与集群验收、权限审计、灰度、回滚和成本归属。没有这些证据时,结论应写成“候选”,而不是“推荐”。

完成定义:你不仅能回答“哪个模型更强”,还能够说明在什么条件下更强、付出了什么代价、如何复测,以及失败后怎样退回上一版本。