主流模型训练、对齐与工程差异¶
调研快照:2026-09-26。这里只写官方报告、模型卡、透明度页面明确披露的内容;“未公开”不是“没有”,也不用社区估算替代。
先给结论¶
- 公开参数最多的是开放权重团队:DeepSeek、Kimi、Qwen、MiniMax、GLM 会公开总参数、激活参数、上下文和部分训练 recipe;Claude、Gemini、ChatGPT 的完整参数规模通常不公开。
- Agent 能力不是参数量的直接函数:工具轨迹、环境交互、可验证奖励、长任务数据和 harness 共同决定实际完成率。
- 推理模型的“对齐”不只等于 RLHF:公开资料显示 RL、可验证奖励、拒答/安全训练、偏好数据、工具轨迹和模型路由都可能参与;各家公司披露粒度不同。
- 开放权重不等于训练数据开放:权重、训练代码、训练数据、许可证和 API 是五个不同维度。
- FDE 选型应按 workload 分层:强推理模型建立质量上限,Agent 模型看工具成功率和恢复能力,轻量模型负责路由/抽取/守门。
横向总表¶
| 系列 | 当前公开可核对对象 | 参数披露 | 训练数据披露 | 对齐/后训练公开信息 | 工程判断 |
|---|---|---|---|---|---|
| Claude | Claude 系列、Opus/Sonnet/Haiku | 精确规模通常未公开 | 官方披露来源类别与安全处理,但不公开完整配方 | Constitutional AI、偏好/安全训练、工具与安全系统卡 | 强在可靠长任务与安全产品化,需 API/条款验证,不能按参数采购 |
| Gemini | Gemini 系列和 API 变体 | 精确规模多数未公开;早期技术报告披露多模态架构方向 | 多模态数据和筛选/安全流程有报告 | SFT、偏好/安全训练、工具/搜索/路由,具体版本不同 | 多模态、上下文和 Google 工具生态强,版本与 preview 语义需锁定 |
| DeepSeek | V3/V3.2/V4、R1 系列 | V3:671B 总/37B 激活;V4 具体字段按透明度中心核对 | V3 公开 14.8T tokens;V4 有 training data summary | SFT + RL;R1 公开 cold-start 与 RL;透明度中心持续更新 | 开放权重、训练披露和低成本推理研究价值高,许可证与版本需单独记录 |
| Kimi | K2/K3 | K3:2.8T,总体为 MoE,官方开放日披露 16/896 experts | 技术报告披露 recipe 方向,完整数据清单不等于公开 | 长任务、Agent、视觉和推理后训练,细节依报告版本 | 超大 MoE、长上下文和原生视觉突出,部署成本与许可证是硬约束 |
| Qwen | Qwen3、Qwen3-Coder 等 | Qwen3 覆盖 0.6B-235B;dense/MoE 以总/激活参数表示 | 多语言、多模态和高质量后训练数据;具体清单有限 | thinking/non-thinking、SFT、DPO、GRPO 等公开工具链 | 开放生态和中文/本地部署强,适合作为本地基线与路由候选 |
| MiniMax | M2/M2.1/M2.5/M2.7/M3 产品线 | 以具体模型卡为准;M2.1 官方文章给出约 230B 总/10B 激活,M3 参数细节仍按模型卡核对 | M2.1 公开 SWE/AppDev/WebExplorer 数据构造与 Forge 训练框架,完整 token 配方待核 | Agent/code/tool-use 后训练、CISPO、Agent-as-a-Verifier;M2.7 强调自演进 harness | 速度、成本、工具使用和 harness 协同是卖点,先在目标 harness 测成功任务成本 |
| GLM | GLM-5/5.3/Flash | GLM-5:744B 总/40B 激活;具体版本看官方仓库 | GLM-5 README 披露 28.5T pretraining tokens | Slime、SFT、PPO、GRPO 等公开入口,Agentic Engineering 方向明显 | 中文/代码/Agent 与国产部署友好,显存和多卡通信仍是核心成本 |
| ChatGPT / GPT | GPT-5 系列与 ChatGPT 路由系统 | 精确参数通常未公开 | 官方系统卡披露公开、合作和人类/用户/研究者数据类别及过滤 | fast/thinking/router、RL reasoning、safe-completions | 应按系统能力、工具和路由评估,不能把一个 GPT 型号当作静态模型 |
| Jev / TypeSafe AI | Jev,System One 模型 | 参数、训练 token、权重未公开 | 完整训练数据未公开 | 官方提出 RLCD、并行 sampler、概率/置信度与 workflow eval | 不是生成模型;作为 Agent 路由、守门、评分和 judge 层评估 |
训练阶段怎么比较¶
预训练¶
| 维度 | 开放权重团队常披露 | 闭源产品常披露 |
|---|---|---|
| 数据来源类别 | 公网、授权、合成、多语言/多模态 | 来源类别、过滤、安全和版权原则 |
| token 数 | DeepSeek V3 14.8T、GLM-5 28.5T 等具体值 | 通常不公开精确 token 数 |
| 总/激活参数 | MoE 团队经常公开 | 通常不公开 |
| 训练硬件/成本 | 部分公开 GPU hours、集群和并行方法 | 通常只在系统卡公开高层描述 |
| 复现代码 | Qwen、GLM、DeepSeek 及社区生态提供部分 recipe | 以 API/产品控制为主 |
后训练与对齐¶
预训练 base
-> instruction / SFT
-> preference / reward / safety data
-> reasoning RL 或可验证奖励
-> tool / environment / agent trajectories
-> policy / router / deployment-specific adaptation
不同公司可能把这些阶段合并或反复迭代。报告中出现“RL”不代表目标、奖励、采样策略和安全约束相同。
逐系列判断¶
Claude¶
Anthropic 的公开材料更重视 Constitutional AI、模型行为、安全评估和系统卡,而不是开放参数或完整数据配方。适合把 Claude 当作高质量托管模型和 reviewer 候选,不适合做本地显存/训练成本推演。
适用条件:高价值知识工作、编码、长任务、严格安全边界。
代价:API 价格、区域/条款、数据处理与版本锁定。
验证方式:在本地 harness 固定工具、预算和 reviewer rubric,比较任务成功率而非聊天偏好。
Gemini¶
Gemini 的差异是多模态与 Google 工具生态。技术报告披露了多模态训练和 post-training 方向,但具体 Gemini API 变体要按官方模型页区分 stable、preview、latest 和实验版本。
结论:如果 workload 包含图像、视频、文档、搜索或 Google Workspace,Gemini 候选价值高;如果需要自托管或严格版本可复现,先确认 API 版本和区域。
DeepSeek¶
DeepSeek V3 技术报告公开 671B 总参数、37B 激活、14.8T 预训练 token、MLA、DeepSeekMoE、SFT 和 RL;R1 公开 cold-start 数据和 reasoning RL;透明度中心进一步列出 V4 及训练数据摘要入口。
结论:DeepSeek 是“开放权重 + 训练透明度 + 推理成本优化”研究的首选参照;但 MoE 总权重、长上下文和多卡通信决定真实部署成本,激活参数不能直接代替显存规划。
Kimi¶
Kimi K3 官方开放日披露 2.8T 参数、KDA、Attention Residuals、Stable LatentMoE、896 专家激活 16 个、原生视觉和 1M 上下文,并同步发布权重、技术报告和 MoonEP/FlashKDA/AgentEnv 等 Infra。
结论:Kimi K3 更像“超大 MoE + Agent/视觉 + Infra 协同”的研究对象;不适合作为普通工作站起步模型,应先看完整权重大小、并行 recipe、互连和许可证。
Qwen¶
Qwen3 技术报告与官方仓库覆盖 dense 和 MoE、0.6B 到 235B,并提供 SFT/DPO/GRPO 等生态入口。它的工程优势不是单一最大模型,而是从本地小模型到大 MoE 的连续选择,以及中文、工具、思考模式和微调工具覆盖。
结论:Qwen 适合做本地开发、路由、蒸馏和 FDE 教学基线;把 thinking/non-thinking、模型尺寸、量化和工具模板作为独立实验变量。
MiniMax¶
MiniMax M2 官方定位为 Agent 与代码模型,强调 Shell、Browser、Python、MCP 等工具长链,并开放权重与 vLLM/SGLang 部署。M2.1 文章进一步披露约 230B 总参数/约 10B 激活参数、SWE/AppDev/WebExplorer 数据构造、Forge Agent RL 框架和 CISPO 方向。M3 官方文章强调 MSA、最高 1M context、原生多模态和 open-weight;M2.7 则把 Agent Teams、skills、memory 和 harness 自我演进作为重点。不同版本不能互相推断参数或许可证。
结论:MiniMax 是当前最值得研究“模型训练与 harness 共演”的团队之一;但官网 benchmark 和自演进案例仍需要独立 workload、固定 scaffold 和人工抽样验证。先用“每成功任务成本、工具调用成功率、tokens/s、长任务完成率、回滚率”判断,不用单一通用 benchmark 替代。
GLM¶
GLM-5 官方仓库披露从 GLM-4.5 的 355B/32B active 扩大到 744B/40B active,预训练数据从 23T 到 28.5T,并公开 Slime、ms-swift 的微调/强化学习入口。GLM-5.3 与 Flash 需要按独立模型卡核对,因为 Flash 的激活参数和架构不能从旗舰版推断。
结论:GLM 是中文、代码、Agent 和国产算力适配的重要候选;部署评估要把显存驻留、TP/EP 通信、reasoning effort 和 parser 版本一起固定。
ChatGPT / GPT¶
GPT-5 系统卡明确描述 fast model、thinking model 和实时 router 的统一系统;reasoning models 通过 reinforcement learning 学习推理,安全侧使用 safe-completions。参数规模和完整训练配方没有像开放权重团队那样公开。
结论:ChatGPT/GPT 应被视为“模型 + 路由 + 工具 + 安全系统”的系统能力,不能只比较一个静态 model ID。FDE 需要记录实际路由、reasoning effort、工具、上下文和版本。
Jev / TypeSafe AI¶
Jev 的训练叙事与生成式模型不同。TypeSafe AI 将其称为 System One 模型,公开方向包括新架构、并行 sampler 和 RLCD(Reinforcement Learning for Calibrated Decisions),目标是让软件消费带概率/置信度的 Choice、Score、Noul,而不是生成字符串。官方文档还建议把复杂任务拆成原子问题,在代码中组合。
结论:Jev 应当作为 harness 中的决策层来测,而不是加入“谁的聊天能力更强”的排行榜。它可能减少 JSON 解析、短路和路由延迟,但不负责长文本、复杂推理、权限或最终生成。参数量、训练 token、完整数据、权重和本地部署目前未公开,不能做显存预算或自托管承诺。
选型决策¶
| 目标 | 首选研究组合 | 原因 |
|---|---|---|
| 本地中文 Agent 基线 | Qwen + DeepSeek + GLM | 开放权重、工具链和中文生态覆盖 |
| 超长上下文/原生视觉 | Kimi + Gemini | 模态和上下文能力值得专门测 |
| 低成本高吞吐 Agent | MiniMax + DeepSeek Flash + GLM Flash | 激活效率和服务成本需要 workload 验证 |
| 高风险 reviewer | Claude / GPT / Gemini 交叉 | 不能用执行模型自己评判自己 |
| 训练与对齐研究 | DeepSeek / Qwen / GLM / Kimi | 技术报告、权重或训练入口更公开 |
| 高频路由/守门/judge | Jev + 生成式模型 | 让 Jev 做窄决策,让 Claude/Gemini/DeepSeek/Qwen 等做生成和复杂推理 |