前沿模型地图¶
快照日期:2026-09-26。模型页面变化很快。生产系统应固定具体模型 ID,并建立退役监控和回归评测。本页把“当前可用”“兼容路由”和“已退役”分开记录。
不要寻找一个“最好模型”¶
FDE 选的是每个工作流的最优组合:
高难推理、批量抽取、实时语音、文档视觉和本地私有化通常不该使用同一个模型。一个成熟系统会有默认模型、便宜模型、困难样本升级模型和故障降级模型。
托管 API 快照¶
“提供 API”不等于“闭源”。DeepSeek、Moonshot AI 和 Z.ai 同时提供托管 API 与开放权重,必须分别记录服务状态和权重许可证。
| 厂商 | 当前代表系列 | 适合先测试的场景 | 权重状态与工程提醒 |
|---|---|---|---|
| OpenAI | GPT-6 Astra、GPT-5.6 Sol/Terra/Luna | 复杂推理、编码、工具调用、多模态 | 用 Responses API;生产记录实际 model ID、reasoning effort 和工具版本 |
| Anthropic | Claude Fable 5.1、Opus 5、Sonnet 5、Haiku 4.5 | 长任务、编码、知识工作、工具使用 | 不同代际的思考和采样参数语义会变 |
| Gemini 3.1 Pro、3.x Flash 系列 | 高吞吐、多模态、长上下文、实时媒体 | 区分 stable、preview、latest、experimental;不要把别名当不可变版本 | |
| xAI | Grok 4.6 系列 | 工具与搜索结合、通用 Agent | 固定版本用于可重复工作流,搜索需显式启用 |
| DeepSeek | V4.1-Flash;V4 Pro/Flash 为兼容路由或历史版本 | 中文、推理、代码、成本敏感 API | 2026-09-10 官方说明 V4-Flash 与 Vision Exp 退役,deepseek-v4-pro 暂时路由到 V4.1-Flash;新项目先用稳定 ID 并记录日期 |
| Moonshot AI | Kimi K3 | 原生多模态、长上下文、编码和 Agent | K3 权重已发布,但使用自定义 Kimi K3 License,不等同于 MIT |
| Z.ai | GLM-5.3、GLM-5.3-Flash | 编码、长任务、中文、国产算力部署 | 两者均有官方权重;GLM-5.3 使用自定义许可,Flash 为 MIT |
官方当前页:OpenAI Models、Claude Models、Gemini Models、Grok Models、DeepSeek 更新日志、Kimi K3、GLM-5。国产模型的精确版本、开放状态和部署注意事项见国产前沿模型。
本次快照的关键变化¶
DeepSeek:先区分“模型 ID”与“路由结果”¶
DeepSeek 在 2026-09-10 的官方更新中宣布 V4.1-Flash 上线,并说明 V4-Flash 与 V4-Flash-Vision-Exp 进入退役流程,旧的 deepseek-v4-pro 请求会暂时路由到 V4.1-Flash。这个变化有三个工程后果:
- 生产日志必须保存供应商返回的实际模型标识或响应头,不能只保存请求参数。
- V4 Pro、V4 Flash 的离线权重和 V4.1-Flash API 不能混写成一个“DeepSeek V4”基线。
- 旧别名的兼容期可能改变价格、能力和上下文行为,迁移评测要直接使用新模型 ID。
当前入口:V4.1-Flash 更新、API 变更日志、V4-Pro 开放权重。
读模型发布信息的四个层次¶
| 层次 | 要回答的问题 | 常见误判 |
|---|---|---|
| 发布状态 | 是 stable、preview、beta 还是兼容路由? | 把“官网能调用”当成版本稳定 |
| 运行对象 | 请求的 ID、实际 revision、模板和推理模式是什么? | 只在配置文件里写一个家族名 |
| 开放边界 | API、权重、代码、训练数据和许可证分别开放到什么程度? | 用“开源”覆盖所有边界 |
| 业务证据 | 在自己的输入、工具、权限和成本约束下是否更好? | 用厂商 benchmark 代替验收 |
每次模型升级都应创建一条 model-release-record,至少包含:请求 ID、实际路由、区域、API 版本、输入输出 token、reasoning 参数、工具 parser、成本和回滚版本。
模型版本策略¶
- 开发期可用
latest或别名快速试验。 - 生产期优先固定模型 ID,记录 API、区域和推理参数。
- 升级前在固定评测集做成对比较,不能只看厂商基准。
- 为模型退役设置至少 30、14、7 天提醒,并保留回滚模型。
开放权重快照¶
| 系列 | 当前可用代表 | 本地价值 | 关键注意 |
|---|---|---|---|
| Qwen | Qwen3.8-27B、Qwen3.8-2.4T-A95B | 中文、多模态、工具调用,27B 适合工作站级部署 | 大 MoE 总权重巨大,激活参数小不等于单卡可装 |
| DeepSeek | V4 Pro 1.6T-A49B、V4 Flash 284B-A13B | 中文、代码、推理、1M 上下文 | 这是开放权重线;V4.1-Flash 当前主要是 API 线,不能未经模型卡确认就写成可下载权重 |
| Moonshot AI | Kimi K3 2.8T-A104B | 原生多模态、1M 上下文、长时 Agent | 自定义 Kimi K3 License;完整权重属于集群级部署 |
| Z.ai | GLM-5.3 744B-A40B、GLM-5.3-Flash 320B-A18B | 编码、Agent、中文、多模态与国产算力 | GLM-5.3 为自定义许可;Flash 为 MIT,且采用不同的新基座和混合注意力架构 |
| Llama | Llama 3.1/后续开放系列 | 工具链与社区覆盖广 | 核对许可证、上下文和派生模型来源 |
| Mistral | Mistral Small/开放系列 | 欧洲部署、轻量模型与专用模型 | “开放”可能指权重、代码或 API,需核对许可 |
| OpenAI | gpt-oss-20b、gpt-oss-120b | Apache 2.0 开放权重,本地或自托管 | 120B 的官方定位是一张 H100 级 GPU |
入口:Qwen3.8 官方仓库、DeepSeek V4 Pro 模型卡、Kimi K3 官方仓库、GLM-5 官方仓库、Meta Llama、Mistral 最新发布、OpenAI Models。
开放权重不是一个二元标签
必须同时记录权重是否可下载、推理代码是否开放、许可证是否允许商用和模型即服务、是否要求署名,以及安全与地域限制。不要把“可调用 API”“可下载权重”和“OSI 意义的开源”写成同一件事。
选型流程¶
第一步:确定部署边界¶
- 数据能否发给外部 API。
- 是否要求特定地域、私网或离线。
- 峰值并发和 P95 时延目标。
- 可接受的单任务成本与运维能力。
如果数据允许上云且流量未稳定,先用 API 建立质量上限通常更快。只有在数据、成本、时延、可定制性或供应稳定性形成明确理由时,才承担自托管复杂度。
第二步:建立候选梯队¶
- 强模型:用于建立质量上限和处理困难样本。
- 平衡模型:处理大部分生产流量。
- 轻量模型:分类、路由、抽取、审核和降级。
- 本地模型:满足隐私、离线或可控性要求。
第三步:真实评测¶
使用同一输入、工具、知识库快照和输出 schema,比较:任务通过率、严重错误、TTFT、总时延、输入/输出 token、每成功任务成本。不要用不同提示词随意“帮助”某个候选。
API 与开放权重的取舍¶
| 维度 | 托管 API | 开放权重自托管 |
|---|---|---|
| 上线速度 | 快 | 慢,需要基础设施 |
| 前沿能力 | 通常更新最快 | 取决于开放进度与部署支持 |
| 数据控制 | 依赖供应商条款与区域 | 可完全在自有边界内 |
| 小流量成本 | 通常更低 | GPU 空闲成本高 |
| 大而稳定流量 | 需谈折扣并测算 | 可能更可控,但需高利用率 |
| 定制 | 提示词、工具、部分微调 | 可量化、微调和修改推理栈 |
| 运维 | 供应商承担底层 | 团队承担驱动、容量、性能和升级 |
最实用的路由原则¶
- 先用轻量模型判断任务、风险与复杂度。
- 简单任务走低价模型,困难或高风险任务升级。
- 强制结构化输出,解析失败时有限重试。
- 外部 API 故障时降级到备用模型或只读流程。
- 记录路由原因,定期检查是否错误地把简单任务送到昂贵模型。
七天模型 Bake-off¶
| 日程 | 动作 | 产物 |
|---|---|---|
| Day 1 | 固定 100 到 300 条真实样本、输出 schema 和风险分层 | 冻结的数据集版本 |
| Day 2 | 用强模型建立质量上限,用轻模型建立成本下限 | 两条基线 |
| Day 3 | 所有候选使用同一提示、工具和知识快照 | 原始响应与 trace |
| Day 4 | 盲评失败,校准模型 grader 与人工一致性 | rubric 和分歧集 |
| Day 5 | 复测 P50/P95 时延、限流、长输入和结构化输出 | 性能与稳定性报告 |
| Day 6 | 设计默认、升级、降级和拒绝路由 | 路由策略草案 |
| Day 7 | 做故障演练与成本敏感性分析 | 选型 ADR 与回滚模型 |
所有候选都保存模型 ID、发布日期或 revision、区域、API 版本、思考参数、temperature、最大输出和工具 schema。少一个变量,结果就可能无法复现。
路由策略示例¶
routes:
- when: risk == "high"
model: strong-pinned-version
approval: required
- when: task in [classify, extract] and input_tokens < 4000
model: economy-pinned-version
- when: data_classification == "restricted"
model: self-hosted-private
fallbacks:
timeout: read-only-template
rate_limit: secondary-provider-version
limits:
max_input_tokens: 32000
max_output_tokens: 2000
total_attempts: 2
生产代码通过稳定别名引用模型,别名背后指向不可变版本。变更别名必须触发回归评测和灰度,而不是由供应商的 latest 自动推进。
选型评分卡¶
先设硬门槛,再设加权分数。数据出域、许可证不符、严重错误或目标区域不可用属于硬阻断,不能靠更好的价格抵消。
| 维度 | 权重示例 | 评分证据 |
|---|---|---|
| 任务质量 | 35% | 黄金集通过率、严重错误、稳定性 |
| 工具与结构化输出 | 15% | 参数正确率、解析率、恢复能力 |
| 性能 | 15% | TTFT、TPOT、E2E、并发拐点 |
| 成本 | 15% | 每成功任务成本、缓存与重试 |
| 治理 | 10% | 数据边界、审计、许可证、版本策略 |
| 运营 | 10% | 限流、SLA、区域、退役通知、支持 |
本章实践¶
选择一个抽取任务和一个复杂推理任务,各准备 20 条样本。用同一 schema 比较一个强模型和一个轻量模型,最后写出“哪些请求应升级,哪些请求禁止升级”的规则。这样得到的是路由策略,不是简单排行榜。