国产前沿模型¶
快照日期:2026-09-26。本页只收录已由厂商官方模型卡、官方仓库或官方 API 更新日志确认的状态。未确认的传闻、第三方同名仓库和模型聚合站不作为发布依据。
当前版本总表¶
| 模型 | 发布时间或状态 | 总参数 / 激活参数 | 上下文 | 模态 | 权重与许可 | 托管入口 |
|---|---|---|---|---|---|---|
| Kimi K3 | 2026-07-16 发布,2026-07-27 发布完整权重 | 2.8T / 104B | 1M | 文本、图像、视频输入 | 开放权重,Kimi K3 License | kimi-k3 |
| DeepSeek V4 Pro | 2026-08-13 API GA;官方权重可下载 | 1.6T / 49B | 1M | 文本 | 模型与权重 MIT | deepseek-v4-pro |
| DeepSeek V4 Flash | 2026-07-31 正式版 API 公测;官方权重可下载 | 284B / 13B | 1M | 文本 | 模型与权重 MIT | deepseek-v4-flash |
| DeepSeek V4 Flash Vision Exp | 2026-08-21 实验版 API | 官方更新日志未在同页给出 | 以 API 文档为准 | 图像、文本 | 本轮未确认对应开放权重 | deepseek-v4-flash-vision-exp |
| DeepSeek V4.1-Flash | 2026-09-10 API 上线;2026-09-14 起承接旧 Pro 路由 | 官方 API 未披露完整参数 | 以 API 文档为准 | 原生多模态 | 当前按托管 API 跟踪,开放权重待官方模型卡确认 | deepseek-flash |
| GLM-5.3 | 2026-08 发布;官方权重可下载 | 744B / 40B | 1M | 文本 | 开放权重,GLM-5.3 License | 使用前在 Z.ai 模型目录核对 ID |
| GLM-5.3-Flash | 2026-09-04 发布;官方权重可下载 | 320B / 18B | 最高 1M | 文本、图像、视频、文件输入 | 开放权重,MIT | 使用前在 Z.ai 模型目录核对 ID |
参数和发布日期来源:Kimi K3 官方仓库、DeepSeek V4 官方模型卡、DeepSeek API 更新日志、GLM-5 官方仓库、GLM-5.3-Flash 官方模型卡。
DeepSeek V4:开放权重与 API 必须同时跟踪¶
DeepSeek V4 Pro 和 V4 Flash 都不是“只有 API 的闭源模型”。官方 Hugging Face 组织已提供 Base 与 Instruct 权重,模型卡声明仓库和模型权重使用 MIT License。
| 版本 | 定位 | 架构规模 | 部署判断 |
|---|---|---|---|
| V4 Pro | 旗舰知识、复杂推理、编码与长时 Agent | 1.6T MoE,49B 激活 | 完整权重是大型多 GPU/多节点工作负载;不能按 49B 激活参数估算显存 |
| V4 Flash | 低成本、高吞吐和多数生产任务 | 284B MoE,13B 激活 | 权重驻留仍按 284B 规模考虑;比 Pro 更适合自托管,但不是消费级单卡模型 |
| V4 Flash Vision Exp | 实验性视觉 Agent | 以官方 API 文档为准 | 只用于试验路由,不能把实验模型设为没有回退路径的生产默认值 |
API 版本状态¶
deepseek-v4-pro:2026-08-13 已 GA,并原生支持 Responses API。deepseek-v4-flash:2026-07-31 发布正式权重对应版本,API 仍以 public beta 标注。deepseek-v4-flash-vision-exp:2026-08-21 实验版本。- 旧别名
deepseek-chat与deepseek-reasoner已进入弃用流程,新项目不应继续依赖。
2026-09-10 之后的生命周期变化¶
DeepSeek 官方更新说明:deepseek-flash 指向 V4.1-Flash;V4-Flash 与 V4-Flash-Vision-Exp 进入退役流程;deepseek-v4-pro 请求暂时按 V4.1-Flash 计费和路由,直到 V4.1-Pro 发布。这里的“暂时路由”不等于模型 API、离线权重和训练配方相同。
迁移时至少做三组对照:
| 对照 | 目的 | 必须固定 |
|---|---|---|
deepseek-v4-pro 旧配置 vs deepseek-flash |
发现兼容路由带来的真实行为变化 | 同一 API、工具、思考模式和超时 |
| V4-Pro 离线权重 vs V4.1-Flash API | 区分开放权重部署与托管服务差异 | 数据集、模板、量化和输出上限 |
| V4.1-Flash vs 当前回退模型 | 判断是否能改变生产默认 | 任务通过率、P95、成本和严重错误 |
工程判断:如果需要稳定的离线复现,保留 V4-Pro/V4-Flash 的不可变权重 revision;如果需要最新 API 能力,使用 deepseek-flash,但必须把路由日期和供应商状态写进发布记录。
生产环境记录的不应只有 model=deepseek-v4-pro,还应保存供应商、接口类型、实际 revision、思考模式、采样参数和部署侧 chat template。对 deepseek-flash 还要记录 API 返回的实际模型标识和价格快照。
Kimi K3:开放权重的超大 MoE¶
Kimi K3 是原生多模态 MoE,2.8T 总参数、104B 激活参数、1M 上下文,使用 KDA 与 Gated MLA,并从训练阶段采用 MXFP4 权重和 MXFP8 激活。
部署判断¶
- 104B 激活参数不能用于计算模型下载大小或总显存;完整 2.8T 权重需要集群级容量。
- 官方建议使用 vLLM、SGLang 或 TokenSpeed。
- API 多轮对话与工具调用需要原样回传包含
reasoning_content和tool_calls的 assistant 消息。 - K3 始终启用思考,通过
reasoning_effort=low|high|max控制,默认max。
许可证判断¶
Kimi K3 是开放权重,但不是 MIT 或 Apache 2.0。其自定义许可证对达到特定收入规模的 Model-as-a-Service 业务、超大用户量或收入的商业产品设置了额外条款。商业部署必须阅读完整许可证,不能只看“开放权重”四个字。
GLM-5.3:旗舰与 Flash 不是同一基座¶
| 项目 | GLM-5.3 | GLM-5.3-Flash |
|---|---|---|
| 规模 | 744B-A40B | 320B-A18B |
| 训练关系 | 沿用 GLM-5.2 基座,主要提升来自后训练 | 新训练基座,面向能力和效率重新设计 |
| 模态 | 文本 | 原生多模态 |
| 注意力 | GLM-5 系列稀疏注意力路线 | 稀疏注意力与线性注意力混合 |
| 官方权重 | FP8、BF16 | FP8、BF16 |
| 许可证 | GLM-5.3 License | MIT |
| 推荐引擎 | SGLang、vLLM、Transformers、KTransformers 等 | 另支持 TokenSpeed、Unsloth 等 |
两者都支持 reasoning_effort=low|high|max,默认 max。官方仓库还提示:聊天场景应显式传入 clear_thinking=true,否则 chat template 默认会保留之前的思考内容。
GLM-5.3-Flash 虽然每 token 只激活 18B 参数,但完整 FP8 权重仍是 320B 规模,常规部署需要多卡。评估成本时要分开计算权重驻留、KV cache、并发批量和多卡通信。
选型建议¶
| 需求 | 第一批候选 | 理由 |
|---|---|---|
| 复杂编码和长时 Agent | Kimi K3、DeepSeek V4 Pro、GLM-5.3 | 都针对长任务和工具使用强化,但成本、许可证和部署规模差异很大 |
| 成本敏感的文本 Agent | DeepSeek V4 Flash、GLM-5.3-Flash | 激活参数较少,适合先测吞吐和每成功任务成本 |
| 原生多模态与文档视觉 | Kimi K3、GLM-5.3-Flash | 官方模型卡明确包含视觉能力 |
| 可宽松商用的开放权重 | DeepSeek V4 Pro/Flash、GLM-5.3-Flash | 当前模型卡标注 MIT,仍需保留许可证文本和依赖清单 |
| 中国算力平台部署 | GLM-5.3/Flash 优先进入兼容性验证 | 官方仓库提供 Ascend 等部署入口,但必须在目标硬件上实测算子覆盖和吞吐 |
不要直接照搬厂商榜单排序。为自己的任务建立固定输入、工具、超时、思考强度和评分器,至少比较任务通过率、严重错误率、P95 时延、输入输出 token、GPU 小时和每成功任务成本。
新模型更新检查表¶
每次更新本页时逐项填写:
厂商与模型:
官方发布日期:
API 模型 ID 与状态(preview/beta/GA):
权重仓库与不可变 revision:
总参数 / 激活参数:
上下文 / 最大输出:
输入输出模态:
权重精度与大致存储量:
许可证及商用限制:
官方支持推理引擎:
推荐 chat template / reasoning 参数:
已验证硬件与框架版本:
内部评测集结果:
回退模型:
只有厂商博客而没有权重仓库时,写“已发布 API,权重未确认”;只有 Hugging Face 第三方量化时,不能写“官方已开源”。
证据等级与传闻隔离¶
新模型发布期最容易出现同名、预览版和第三方量化混在一起。本站采用四级证据:
| 等级 | 可接受证据 | 可以写什么 |
|---|---|---|
| A | 官方模型卡、官方仓库、官方 API 文档 | 已发布、参数、上下文、许可证、模型 ID |
| B | 厂商官方公告但无模型卡或 API 入口 | 已宣布;具体能力和开放状态待确认 |
| C | 合作伙伴页面或可信媒体转述 | 观察项,不进入选型总表 |
| D | 社区截图、聚合站、匿名爆料 | 不作为事实收录 |
Kimi K3、DeepSeek V4 Pro/Flash、GLM-5.3/Flash 当前条目均链接到 A 级来源。任何后续出现的 Pro、Flash、Preview 或视觉后缀,都必须按独立模型重新核对,不能从同系列名称推断参数和许可证。
超大 MoE 的部署判断¶
这些模型的总参数和激活参数差距很大。选卡时遵循:
因此“每 token 只激活 13B/18B/40B/49B/104B”不代表能像同尺寸 dense 模型一样部署在单张工作站卡上。先读取官方权重文件总大小和部署 recipe,再决定需要多少卡及何种并行。
候选验证矩阵¶
| 验证项 | Kimi K3 | DeepSeek V4 Pro | DeepSeek V4 Flash | GLM-5.3 | GLM-5.3-Flash |
|---|---|---|---|---|---|
| 官方 revision 固定 | |||||
| 许可证法务确认 | |||||
| 文本任务黄金集 | |||||
| 视觉/文件任务 | 不适用或待核 | 不适用或待核 | 以模型卡为准 | ||
| reasoning 参数核对 | |||||
| tool parser 核对 | |||||
| 目标硬件成功启动 | |||||
| P95 与每成功任务成本 |
更新操作¶
- 先更新
references/sources.md的官方链接和访问日期。 - 保存公告、模型卡和许可证各自支持的字段,不用一条来源外推全部信息。
- API 与开放权重分别建版本记录,因为发布时间和能力可能不同。
- 运行既有黄金集,标注模板、Tokenizer、parser 和思考参数变化。
- 只有验证通过后才改变生产别名;否则保留为候选状态。