跳转至

主流模型训练、对齐与工程差异

调研快照:2026-09-26。这里只写官方报告、模型卡、透明度页面明确披露的内容;“未公开”不是“没有”,也不用社区估算替代。

先给结论

  1. 公开参数最多的是开放权重团队:DeepSeek、Kimi、Qwen、MiniMax、GLM 会公开总参数、激活参数、上下文和部分训练 recipe;Claude、Gemini、ChatGPT 的完整参数规模通常不公开。
  2. Agent 能力不是参数量的直接函数:工具轨迹、环境交互、可验证奖励、长任务数据和 harness 共同决定实际完成率。
  3. 推理模型的“对齐”不只等于 RLHF:公开资料显示 RL、可验证奖励、拒答/安全训练、偏好数据、工具轨迹和模型路由都可能参与;各家公司披露粒度不同。
  4. 开放权重不等于训练数据开放:权重、训练代码、训练数据、许可证和 API 是五个不同维度。
  5. FDE 选型应按 workload 分层:强推理模型建立质量上限,Agent 模型看工具成功率和恢复能力,轻量模型负责路由/抽取/守门。

横向总表

系列 当前公开可核对对象 参数披露 训练数据披露 对齐/后训练公开信息 工程判断
Claude Claude 系列、Opus/Sonnet/Haiku 精确规模通常未公开 官方披露来源类别与安全处理,但不公开完整配方 Constitutional AI、偏好/安全训练、工具与安全系统卡 强在可靠长任务与安全产品化,需 API/条款验证,不能按参数采购
Gemini Gemini 系列和 API 变体 精确规模多数未公开;早期技术报告披露多模态架构方向 多模态数据和筛选/安全流程有报告 SFT、偏好/安全训练、工具/搜索/路由,具体版本不同 多模态、上下文和 Google 工具生态强,版本与 preview 语义需锁定
DeepSeek V3/V3.2/V4、R1 系列 V3:671B 总/37B 激活;V4 具体字段按透明度中心核对 V3 公开 14.8T tokens;V4 有 training data summary SFT + RL;R1 公开 cold-start 与 RL;透明度中心持续更新 开放权重、训练披露和低成本推理研究价值高,许可证与版本需单独记录
Kimi K2/K3 K3:2.8T,总体为 MoE,官方开放日披露 16/896 experts 技术报告披露 recipe 方向,完整数据清单不等于公开 长任务、Agent、视觉和推理后训练,细节依报告版本 超大 MoE、长上下文和原生视觉突出,部署成本与许可证是硬约束
Qwen Qwen3、Qwen3-Coder 等 Qwen3 覆盖 0.6B-235B;dense/MoE 以总/激活参数表示 多语言、多模态和高质量后训练数据;具体清单有限 thinking/non-thinking、SFT、DPO、GRPO 等公开工具链 开放生态和中文/本地部署强,适合作为本地基线与路由候选
MiniMax M2/M2.1/M2.5/M2.7/M3 产品线 以具体模型卡为准;M2.1 官方文章给出约 230B 总/10B 激活,M3 参数细节仍按模型卡核对 M2.1 公开 SWE/AppDev/WebExplorer 数据构造与 Forge 训练框架,完整 token 配方待核 Agent/code/tool-use 后训练、CISPO、Agent-as-a-Verifier;M2.7 强调自演进 harness 速度、成本、工具使用和 harness 协同是卖点,先在目标 harness 测成功任务成本
GLM GLM-5/5.3/Flash GLM-5:744B 总/40B 激活;具体版本看官方仓库 GLM-5 README 披露 28.5T pretraining tokens Slime、SFT、PPO、GRPO 等公开入口,Agentic Engineering 方向明显 中文/代码/Agent 与国产部署友好,显存和多卡通信仍是核心成本
ChatGPT / GPT GPT-5 系列与 ChatGPT 路由系统 精确参数通常未公开 官方系统卡披露公开、合作和人类/用户/研究者数据类别及过滤 fast/thinking/router、RL reasoning、safe-completions 应按系统能力、工具和路由评估,不能把一个 GPT 型号当作静态模型
Jev / TypeSafe AI Jev,System One 模型 参数、训练 token、权重未公开 完整训练数据未公开 官方提出 RLCD、并行 sampler、概率/置信度与 workflow eval 不是生成模型;作为 Agent 路由、守门、评分和 judge 层评估

训练阶段怎么比较

预训练

维度 开放权重团队常披露 闭源产品常披露
数据来源类别 公网、授权、合成、多语言/多模态 来源类别、过滤、安全和版权原则
token 数 DeepSeek V3 14.8T、GLM-5 28.5T 等具体值 通常不公开精确 token 数
总/激活参数 MoE 团队经常公开 通常不公开
训练硬件/成本 部分公开 GPU hours、集群和并行方法 通常只在系统卡公开高层描述
复现代码 Qwen、GLM、DeepSeek 及社区生态提供部分 recipe 以 API/产品控制为主

后训练与对齐

预训练 base
  -> instruction / SFT
  -> preference / reward / safety data
  -> reasoning RL 或可验证奖励
  -> tool / environment / agent trajectories
  -> policy / router / deployment-specific adaptation

不同公司可能把这些阶段合并或反复迭代。报告中出现“RL”不代表目标、奖励、采样策略和安全约束相同。

逐系列判断

Claude

Anthropic 的公开材料更重视 Constitutional AI、模型行为、安全评估和系统卡,而不是开放参数或完整数据配方。适合把 Claude 当作高质量托管模型和 reviewer 候选,不适合做本地显存/训练成本推演。

适用条件:高价值知识工作、编码、长任务、严格安全边界。
代价:API 价格、区域/条款、数据处理与版本锁定。
验证方式:在本地 harness 固定工具、预算和 reviewer rubric,比较任务成功率而非聊天偏好。

Gemini

Gemini 的差异是多模态与 Google 工具生态。技术报告披露了多模态训练和 post-training 方向,但具体 Gemini API 变体要按官方模型页区分 stable、preview、latest 和实验版本。

结论:如果 workload 包含图像、视频、文档、搜索或 Google Workspace,Gemini 候选价值高;如果需要自托管或严格版本可复现,先确认 API 版本和区域。

DeepSeek

DeepSeek V3 技术报告公开 671B 总参数、37B 激活、14.8T 预训练 token、MLA、DeepSeekMoE、SFT 和 RL;R1 公开 cold-start 数据和 reasoning RL;透明度中心进一步列出 V4 及训练数据摘要入口。

结论:DeepSeek 是“开放权重 + 训练透明度 + 推理成本优化”研究的首选参照;但 MoE 总权重、长上下文和多卡通信决定真实部署成本,激活参数不能直接代替显存规划。

Kimi

Kimi K3 官方开放日披露 2.8T 参数、KDA、Attention Residuals、Stable LatentMoE、896 专家激活 16 个、原生视觉和 1M 上下文,并同步发布权重、技术报告和 MoonEP/FlashKDA/AgentEnv 等 Infra。

结论:Kimi K3 更像“超大 MoE + Agent/视觉 + Infra 协同”的研究对象;不适合作为普通工作站起步模型,应先看完整权重大小、并行 recipe、互连和许可证。

Qwen

Qwen3 技术报告与官方仓库覆盖 dense 和 MoE、0.6B 到 235B,并提供 SFT/DPO/GRPO 等生态入口。它的工程优势不是单一最大模型,而是从本地小模型到大 MoE 的连续选择,以及中文、工具、思考模式和微调工具覆盖。

结论:Qwen 适合做本地开发、路由、蒸馏和 FDE 教学基线;把 thinking/non-thinking、模型尺寸、量化和工具模板作为独立实验变量。

MiniMax

MiniMax M2 官方定位为 Agent 与代码模型,强调 Shell、Browser、Python、MCP 等工具长链,并开放权重与 vLLM/SGLang 部署。M2.1 文章进一步披露约 230B 总参数/约 10B 激活参数、SWE/AppDev/WebExplorer 数据构造、Forge Agent RL 框架和 CISPO 方向。M3 官方文章强调 MSA、最高 1M context、原生多模态和 open-weight;M2.7 则把 Agent Teams、skills、memory 和 harness 自我演进作为重点。不同版本不能互相推断参数或许可证。

结论:MiniMax 是当前最值得研究“模型训练与 harness 共演”的团队之一;但官网 benchmark 和自演进案例仍需要独立 workload、固定 scaffold 和人工抽样验证。先用“每成功任务成本、工具调用成功率、tokens/s、长任务完成率、回滚率”判断,不用单一通用 benchmark 替代。

GLM

GLM-5 官方仓库披露从 GLM-4.5 的 355B/32B active 扩大到 744B/40B active,预训练数据从 23T 到 28.5T,并公开 Slime、ms-swift 的微调/强化学习入口。GLM-5.3 与 Flash 需要按独立模型卡核对,因为 Flash 的激活参数和架构不能从旗舰版推断。

结论:GLM 是中文、代码、Agent 和国产算力适配的重要候选;部署评估要把显存驻留、TP/EP 通信、reasoning effort 和 parser 版本一起固定。

ChatGPT / GPT

GPT-5 系统卡明确描述 fast model、thinking model 和实时 router 的统一系统;reasoning models 通过 reinforcement learning 学习推理,安全侧使用 safe-completions。参数规模和完整训练配方没有像开放权重团队那样公开。

结论:ChatGPT/GPT 应被视为“模型 + 路由 + 工具 + 安全系统”的系统能力,不能只比较一个静态 model ID。FDE 需要记录实际路由、reasoning effort、工具、上下文和版本。

Jev / TypeSafe AI

Jev 的训练叙事与生成式模型不同。TypeSafe AI 将其称为 System One 模型,公开方向包括新架构、并行 sampler 和 RLCD(Reinforcement Learning for Calibrated Decisions),目标是让软件消费带概率/置信度的 Choice、Score、Noul,而不是生成字符串。官方文档还建议把复杂任务拆成原子问题,在代码中组合。

结论:Jev 应当作为 harness 中的决策层来测,而不是加入“谁的聊天能力更强”的排行榜。它可能减少 JSON 解析、短路和路由延迟,但不负责长文本、复杂推理、权限或最终生成。参数量、训练 token、完整数据、权重和本地部署目前未公开,不能做显存预算或自托管承诺。

选型决策

目标 首选研究组合 原因
本地中文 Agent 基线 Qwen + DeepSeek + GLM 开放权重、工具链和中文生态覆盖
超长上下文/原生视觉 Kimi + Gemini 模态和上下文能力值得专门测
低成本高吞吐 Agent MiniMax + DeepSeek Flash + GLM Flash 激活效率和服务成本需要 workload 验证
高风险 reviewer Claude / GPT / Gemini 交叉 不能用执行模型自己评判自己
训练与对齐研究 DeepSeek / Qwen / GLM / Kimi 技术报告、权重或训练入口更公开
高频路由/守门/judge Jev + 生成式模型 让 Jev 做窄决策,让 Claude/Gemini/DeepSeek/Qwen 等做生成和复杂推理

官方来源