跳转至

国产前沿模型

快照日期:2026-09-26。本页只收录已由厂商官方模型卡、官方仓库或官方 API 更新日志确认的状态。未确认的传闻、第三方同名仓库和模型聚合站不作为发布依据。

当前版本总表

模型 发布时间或状态 总参数 / 激活参数 上下文 模态 权重与许可 托管入口
Kimi K3 2026-07-16 发布,2026-07-27 发布完整权重 2.8T / 104B 1M 文本、图像、视频输入 开放权重,Kimi K3 License kimi-k3
DeepSeek V4 Pro 2026-08-13 API GA;官方权重可下载 1.6T / 49B 1M 文本 模型与权重 MIT deepseek-v4-pro
DeepSeek V4 Flash 2026-07-31 正式版 API 公测;官方权重可下载 284B / 13B 1M 文本 模型与权重 MIT deepseek-v4-flash
DeepSeek V4 Flash Vision Exp 2026-08-21 实验版 API 官方更新日志未在同页给出 以 API 文档为准 图像、文本 本轮未确认对应开放权重 deepseek-v4-flash-vision-exp
DeepSeek V4.1-Flash 2026-09-10 API 上线;2026-09-14 起承接旧 Pro 路由 官方 API 未披露完整参数 以 API 文档为准 原生多模态 当前按托管 API 跟踪,开放权重待官方模型卡确认 deepseek-flash
GLM-5.3 2026-08 发布;官方权重可下载 744B / 40B 1M 文本 开放权重,GLM-5.3 License 使用前在 Z.ai 模型目录核对 ID
GLM-5.3-Flash 2026-09-04 发布;官方权重可下载 320B / 18B 最高 1M 文本、图像、视频、文件输入 开放权重,MIT 使用前在 Z.ai 模型目录核对 ID

参数和发布日期来源:Kimi K3 官方仓库、DeepSeek V4 官方模型卡、DeepSeek API 更新日志、GLM-5 官方仓库、GLM-5.3-Flash 官方模型卡。

DeepSeek V4:开放权重与 API 必须同时跟踪

DeepSeek V4 Pro 和 V4 Flash 都不是“只有 API 的闭源模型”。官方 Hugging Face 组织已提供 Base 与 Instruct 权重,模型卡声明仓库和模型权重使用 MIT License。

版本 定位 架构规模 部署判断
V4 Pro 旗舰知识、复杂推理、编码与长时 Agent 1.6T MoE,49B 激活 完整权重是大型多 GPU/多节点工作负载;不能按 49B 激活参数估算显存
V4 Flash 低成本、高吞吐和多数生产任务 284B MoE,13B 激活 权重驻留仍按 284B 规模考虑;比 Pro 更适合自托管,但不是消费级单卡模型
V4 Flash Vision Exp 实验性视觉 Agent 以官方 API 文档为准 只用于试验路由,不能把实验模型设为没有回退路径的生产默认值

API 版本状态

  • deepseek-v4-pro:2026-08-13 已 GA,并原生支持 Responses API。
  • deepseek-v4-flash:2026-07-31 发布正式权重对应版本,API 仍以 public beta 标注。
  • deepseek-v4-flash-vision-exp:2026-08-21 实验版本。
  • 旧别名 deepseek-chat 与 deepseek-reasoner 已进入弃用流程,新项目不应继续依赖。

2026-09-10 之后的生命周期变化

DeepSeek 官方更新说明:deepseek-flash 指向 V4.1-Flash;V4-Flash 与 V4-Flash-Vision-Exp 进入退役流程;deepseek-v4-pro 请求暂时按 V4.1-Flash 计费和路由,直到 V4.1-Pro 发布。这里的“暂时路由”不等于模型 API、离线权重和训练配方相同。

迁移时至少做三组对照:

对照 目的 必须固定
deepseek-v4-pro 旧配置 vs deepseek-flash 发现兼容路由带来的真实行为变化 同一 API、工具、思考模式和超时
V4-Pro 离线权重 vs V4.1-Flash API 区分开放权重部署与托管服务差异 数据集、模板、量化和输出上限
V4.1-Flash vs 当前回退模型 判断是否能改变生产默认 任务通过率、P95、成本和严重错误

工程判断:如果需要稳定的离线复现,保留 V4-Pro/V4-Flash 的不可变权重 revision;如果需要最新 API 能力,使用 deepseek-flash,但必须把路由日期和供应商状态写进发布记录。

生产环境记录的不应只有 model=deepseek-v4-pro,还应保存供应商、接口类型、实际 revision、思考模式、采样参数和部署侧 chat template。对 deepseek-flash 还要记录 API 返回的实际模型标识和价格快照。

Kimi K3:开放权重的超大 MoE

Kimi K3 是原生多模态 MoE,2.8T 总参数、104B 激活参数、1M 上下文,使用 KDA 与 Gated MLA,并从训练阶段采用 MXFP4 权重和 MXFP8 激活。

部署判断

  • 104B 激活参数不能用于计算模型下载大小或总显存;完整 2.8T 权重需要集群级容量。
  • 官方建议使用 vLLM、SGLang 或 TokenSpeed。
  • API 多轮对话与工具调用需要原样回传包含 reasoning_content 和 tool_calls 的 assistant 消息。
  • K3 始终启用思考,通过 reasoning_effort=low|high|max 控制,默认 max。

许可证判断

Kimi K3 是开放权重,但不是 MIT 或 Apache 2.0。其自定义许可证对达到特定收入规模的 Model-as-a-Service 业务、超大用户量或收入的商业产品设置了额外条款。商业部署必须阅读完整许可证,不能只看“开放权重”四个字。

GLM-5.3:旗舰与 Flash 不是同一基座

项目 GLM-5.3 GLM-5.3-Flash
规模 744B-A40B 320B-A18B
训练关系 沿用 GLM-5.2 基座,主要提升来自后训练 新训练基座,面向能力和效率重新设计
模态 文本 原生多模态
注意力 GLM-5 系列稀疏注意力路线 稀疏注意力与线性注意力混合
官方权重 FP8、BF16 FP8、BF16
许可证 GLM-5.3 License MIT
推荐引擎 SGLang、vLLM、Transformers、KTransformers 等 另支持 TokenSpeed、Unsloth 等

两者都支持 reasoning_effort=low|high|max,默认 max。官方仓库还提示:聊天场景应显式传入 clear_thinking=true,否则 chat template 默认会保留之前的思考内容。

GLM-5.3-Flash 虽然每 token 只激活 18B 参数,但完整 FP8 权重仍是 320B 规模,常规部署需要多卡。评估成本时要分开计算权重驻留、KV cache、并发批量和多卡通信。

选型建议

需求 第一批候选 理由
复杂编码和长时 Agent Kimi K3、DeepSeek V4 Pro、GLM-5.3 都针对长任务和工具使用强化,但成本、许可证和部署规模差异很大
成本敏感的文本 Agent DeepSeek V4 Flash、GLM-5.3-Flash 激活参数较少,适合先测吞吐和每成功任务成本
原生多模态与文档视觉 Kimi K3、GLM-5.3-Flash 官方模型卡明确包含视觉能力
可宽松商用的开放权重 DeepSeek V4 Pro/Flash、GLM-5.3-Flash 当前模型卡标注 MIT,仍需保留许可证文本和依赖清单
中国算力平台部署 GLM-5.3/Flash 优先进入兼容性验证 官方仓库提供 Ascend 等部署入口,但必须在目标硬件上实测算子覆盖和吞吐

不要直接照搬厂商榜单排序。为自己的任务建立固定输入、工具、超时、思考强度和评分器,至少比较任务通过率、严重错误率、P95 时延、输入输出 token、GPU 小时和每成功任务成本。

新模型更新检查表

每次更新本页时逐项填写:

厂商与模型:
官方发布日期:
API 模型 ID 与状态(preview/beta/GA):
权重仓库与不可变 revision:
总参数 / 激活参数:
上下文 / 最大输出:
输入输出模态:
权重精度与大致存储量:
许可证及商用限制:
官方支持推理引擎:
推荐 chat template / reasoning 参数:
已验证硬件与框架版本:
内部评测集结果:
回退模型:

只有厂商博客而没有权重仓库时,写“已发布 API,权重未确认”;只有 Hugging Face 第三方量化时,不能写“官方已开源”。

证据等级与传闻隔离

新模型发布期最容易出现同名、预览版和第三方量化混在一起。本站采用四级证据:

等级 可接受证据 可以写什么
A 官方模型卡、官方仓库、官方 API 文档 已发布、参数、上下文、许可证、模型 ID
B 厂商官方公告但无模型卡或 API 入口 已宣布;具体能力和开放状态待确认
C 合作伙伴页面或可信媒体转述 观察项,不进入选型总表
D 社区截图、聚合站、匿名爆料 不作为事实收录

Kimi K3、DeepSeek V4 Pro/Flash、GLM-5.3/Flash 当前条目均链接到 A 级来源。任何后续出现的 Pro、Flash、Preview 或视觉后缀,都必须按独立模型重新核对,不能从同系列名称推断参数和许可证。

超大 MoE 的部署判断

这些模型的总参数和激活参数差距很大。选卡时遵循:

权重驻留:主要看总参数 x 权重位宽
单 token 计算:主要受激活参数、注意力和路由影响
服务容量:再加入 KV Cache、并发、工作区和跨卡通信

因此“每 token 只激活 13B/18B/40B/49B/104B”不代表能像同尺寸 dense 模型一样部署在单张工作站卡上。先读取官方权重文件总大小和部署 recipe,再决定需要多少卡及何种并行。

候选验证矩阵

验证项 Kimi K3 DeepSeek V4 Pro DeepSeek V4 Flash GLM-5.3 GLM-5.3-Flash
官方 revision 固定
许可证法务确认
文本任务黄金集
视觉/文件任务 不适用或待核 不适用或待核 以模型卡为准
reasoning 参数核对
tool parser 核对
目标硬件成功启动
P95 与每成功任务成本

更新操作

  1. 先更新 references/sources.md 的官方链接和访问日期。
  2. 保存公告、模型卡和许可证各自支持的字段,不用一条来源外推全部信息。
  3. API 与开放权重分别建版本记录,因为发布时间和能力可能不同。
  4. 运行既有黄金集,标注模板、Tokenizer、parser 和思考参数变化。
  5. 只有验证通过后才改变生产别名;否则保留为候选状态。
防幻觉规则:搜索不到官方 A 级来源时,页面明确写“截至快照日期未确认”,绝不根据命名规律补齐型号、参数、价格或开放状态。