跳转至

前沿模型地图

快照日期:2026-09-26。模型页面变化很快。生产系统应固定具体模型 ID,并建立退役监控和回归评测。本页把“当前可用”“兼容路由”和“已退役”分开记录。

不要寻找一个“最好模型”

FDE 选的是每个工作流的最优组合:

业务质量 x 可控性 x 时延 x 成本 x 数据边界 x 供应可用性

高难推理、批量抽取、实时语音、文档视觉和本地私有化通常不该使用同一个模型。一个成熟系统会有默认模型、便宜模型、困难样本升级模型和故障降级模型。

托管 API 快照

“提供 API”不等于“闭源”。DeepSeek、Moonshot AI 和 Z.ai 同时提供托管 API 与开放权重,必须分别记录服务状态和权重许可证。

厂商 当前代表系列 适合先测试的场景 权重状态与工程提醒
OpenAI GPT-6 Astra、GPT-5.6 Sol/Terra/Luna 复杂推理、编码、工具调用、多模态 用 Responses API;生产记录实际 model ID、reasoning effort 和工具版本
Anthropic Claude Fable 5.1、Opus 5、Sonnet 5、Haiku 4.5 长任务、编码、知识工作、工具使用 不同代际的思考和采样参数语义会变
Google Gemini 3.1 Pro、3.x Flash 系列 高吞吐、多模态、长上下文、实时媒体 区分 stable、preview、latest、experimental;不要把别名当不可变版本
xAI Grok 4.6 系列 工具与搜索结合、通用 Agent 固定版本用于可重复工作流,搜索需显式启用
DeepSeek V4.1-Flash;V4 Pro/Flash 为兼容路由或历史版本 中文、推理、代码、成本敏感 API 2026-09-10 官方说明 V4-Flash 与 Vision Exp 退役,deepseek-v4-pro 暂时路由到 V4.1-Flash;新项目先用稳定 ID 并记录日期
Moonshot AI Kimi K3 原生多模态、长上下文、编码和 Agent K3 权重已发布,但使用自定义 Kimi K3 License,不等同于 MIT
Z.ai GLM-5.3、GLM-5.3-Flash 编码、长任务、中文、国产算力部署 两者均有官方权重;GLM-5.3 使用自定义许可,Flash 为 MIT

官方当前页:OpenAI Models、Claude Models、Gemini Models、Grok Models、DeepSeek 更新日志、Kimi K3、GLM-5。国产模型的精确版本、开放状态和部署注意事项见国产前沿模型。

本次快照的关键变化

DeepSeek:先区分“模型 ID”与“路由结果”

DeepSeek 在 2026-09-10 的官方更新中宣布 V4.1-Flash 上线,并说明 V4-Flash 与 V4-Flash-Vision-Exp 进入退役流程,旧的 deepseek-v4-pro 请求会暂时路由到 V4.1-Flash。这个变化有三个工程后果:

  1. 生产日志必须保存供应商返回的实际模型标识或响应头,不能只保存请求参数。
  2. V4 Pro、V4 Flash 的离线权重和 V4.1-Flash API 不能混写成一个“DeepSeek V4”基线。
  3. 旧别名的兼容期可能改变价格、能力和上下文行为,迁移评测要直接使用新模型 ID。

当前入口:V4.1-Flash 更新、API 变更日志、V4-Pro 开放权重。

读模型发布信息的四个层次

层次 要回答的问题 常见误判
发布状态 是 stable、preview、beta 还是兼容路由? 把“官网能调用”当成版本稳定
运行对象 请求的 ID、实际 revision、模板和推理模式是什么? 只在配置文件里写一个家族名
开放边界 API、权重、代码、训练数据和许可证分别开放到什么程度? 用“开源”覆盖所有边界
业务证据 在自己的输入、工具、权限和成本约束下是否更好? 用厂商 benchmark 代替验收

每次模型升级都应创建一条 model-release-record,至少包含:请求 ID、实际路由、区域、API 版本、输入输出 token、reasoning 参数、工具 parser、成本和回滚版本。

模型版本策略

  • 开发期可用 latest 或别名快速试验。
  • 生产期优先固定模型 ID,记录 API、区域和推理参数。
  • 升级前在固定评测集做成对比较,不能只看厂商基准。
  • 为模型退役设置至少 30、14、7 天提醒,并保留回滚模型。

开放权重快照

系列 当前可用代表 本地价值 关键注意
Qwen Qwen3.8-27B、Qwen3.8-2.4T-A95B 中文、多模态、工具调用,27B 适合工作站级部署 大 MoE 总权重巨大,激活参数小不等于单卡可装
DeepSeek V4 Pro 1.6T-A49B、V4 Flash 284B-A13B 中文、代码、推理、1M 上下文 这是开放权重线;V4.1-Flash 当前主要是 API 线,不能未经模型卡确认就写成可下载权重
Moonshot AI Kimi K3 2.8T-A104B 原生多模态、1M 上下文、长时 Agent 自定义 Kimi K3 License;完整权重属于集群级部署
Z.ai GLM-5.3 744B-A40B、GLM-5.3-Flash 320B-A18B 编码、Agent、中文、多模态与国产算力 GLM-5.3 为自定义许可;Flash 为 MIT,且采用不同的新基座和混合注意力架构
Llama Llama 3.1/后续开放系列 工具链与社区覆盖广 核对许可证、上下文和派生模型来源
Mistral Mistral Small/开放系列 欧洲部署、轻量模型与专用模型 “开放”可能指权重、代码或 API,需核对许可
OpenAI gpt-oss-20b、gpt-oss-120b Apache 2.0 开放权重,本地或自托管 120B 的官方定位是一张 H100 级 GPU

入口:Qwen3.8 官方仓库、DeepSeek V4 Pro 模型卡、Kimi K3 官方仓库、GLM-5 官方仓库、Meta Llama、Mistral 最新发布、OpenAI Models。

开放权重不是一个二元标签

必须同时记录权重是否可下载、推理代码是否开放、许可证是否允许商用和模型即服务、是否要求署名,以及安全与地域限制。不要把“可调用 API”“可下载权重”和“OSI 意义的开源”写成同一件事。

选型流程

第一步:确定部署边界

  1. 数据能否发给外部 API。
  2. 是否要求特定地域、私网或离线。
  3. 峰值并发和 P95 时延目标。
  4. 可接受的单任务成本与运维能力。

如果数据允许上云且流量未稳定,先用 API 建立质量上限通常更快。只有在数据、成本、时延、可定制性或供应稳定性形成明确理由时,才承担自托管复杂度。

第二步:建立候选梯队

  • 强模型:用于建立质量上限和处理困难样本。
  • 平衡模型:处理大部分生产流量。
  • 轻量模型:分类、路由、抽取、审核和降级。
  • 本地模型:满足隐私、离线或可控性要求。

第三步:真实评测

使用同一输入、工具、知识库快照和输出 schema,比较:任务通过率、严重错误、TTFT、总时延、输入/输出 token、每成功任务成本。不要用不同提示词随意“帮助”某个候选。

API 与开放权重的取舍

维度 托管 API 开放权重自托管
上线速度 快 慢,需要基础设施
前沿能力 通常更新最快 取决于开放进度与部署支持
数据控制 依赖供应商条款与区域 可完全在自有边界内
小流量成本 通常更低 GPU 空闲成本高
大而稳定流量 需谈折扣并测算 可能更可控,但需高利用率
定制 提示词、工具、部分微调 可量化、微调和修改推理栈
运维 供应商承担底层 团队承担驱动、容量、性能和升级

最实用的路由原则

  1. 先用轻量模型判断任务、风险与复杂度。
  2. 简单任务走低价模型,困难或高风险任务升级。
  3. 强制结构化输出,解析失败时有限重试。
  4. 外部 API 故障时降级到备用模型或只读流程。
  5. 记录路由原因,定期检查是否错误地把简单任务送到昂贵模型。

七天模型 Bake-off

日程 动作 产物
Day 1 固定 100 到 300 条真实样本、输出 schema 和风险分层 冻结的数据集版本
Day 2 用强模型建立质量上限,用轻模型建立成本下限 两条基线
Day 3 所有候选使用同一提示、工具和知识快照 原始响应与 trace
Day 4 盲评失败,校准模型 grader 与人工一致性 rubric 和分歧集
Day 5 复测 P50/P95 时延、限流、长输入和结构化输出 性能与稳定性报告
Day 6 设计默认、升级、降级和拒绝路由 路由策略草案
Day 7 做故障演练与成本敏感性分析 选型 ADR 与回滚模型

所有候选都保存模型 ID、发布日期或 revision、区域、API 版本、思考参数、temperature、最大输出和工具 schema。少一个变量,结果就可能无法复现。

路由策略示例

routes:
  - when: risk == "high"
    model: strong-pinned-version
    approval: required
  - when: task in [classify, extract] and input_tokens < 4000
    model: economy-pinned-version
  - when: data_classification == "restricted"
    model: self-hosted-private
fallbacks:
  timeout: read-only-template
  rate_limit: secondary-provider-version
limits:
  max_input_tokens: 32000
  max_output_tokens: 2000
  total_attempts: 2

生产代码通过稳定别名引用模型,别名背后指向不可变版本。变更别名必须触发回归评测和灰度,而不是由供应商的 latest 自动推进。

选型评分卡

先设硬门槛,再设加权分数。数据出域、许可证不符、严重错误或目标区域不可用属于硬阻断,不能靠更好的价格抵消。

维度 权重示例 评分证据
任务质量 35% 黄金集通过率、严重错误、稳定性
工具与结构化输出 15% 参数正确率、解析率、恢复能力
性能 15% TTFT、TPOT、E2E、并发拐点
成本 15% 每成功任务成本、缓存与重试
治理 10% 数据边界、审计、许可证、版本策略
运营 10% 限流、SLA、区域、退役通知、支持

本章实践

选择一个抽取任务和一个复杂推理任务,各准备 20 条样本。用同一 schema 比较一个强模型和一个轻量模型,最后写出“哪些请求应升级,哪些请求禁止升级”的规则。这样得到的是路由策略,不是简单排行榜。