GPU 选型与价格¶
快照日期:2026-09-04。价格只是选型起点,不是报价。官方首发价、当前零售价、二手成交价和云租赁价口径不同。
先看结论¶
- 只学习和跑 3B 到 8B 量化模型:12GB 到 16GB 显存可起步。
- 想稳定跑 14B 到 32B 量化模型或做 7B QLoRA:优先 24GB 到 32GB。
- 想在单卡放下 70B 4-bit、较长上下文或做 14B/32B QLoRA:48GB 到 96GB 更实用。
- 训练、超大模型和高并发生产:不要按单卡价格选,按吞吐、互联、可用性和总拥有成本选数据中心 GPU 或云。
- 没有明确的 AMD/Intel 兼容性验证时,学习大模型工程默认选 NVIDIA。原因是 CUDA、训练框架、量化内核和部署工具覆盖更完整,不是因为其他 GPU 没有算力。
消费级与工作站 GPU¶
官方价格采用发布价或厂商商城标价,便于跨地区比较。
| GPU | 显存 | 官方参考价 | 适合 | 主要限制 |
|---|---|---|---|---|
| NVIDIA RTX 5070 | 12GB GDDR7 | US$549 首发 | 3B 到 8B 推理、入门开发 | 显存很快成为瓶颈 |
| NVIDIA RTX 5070 Ti | 16GB GDDR7 | US$749 首发 | 7B/14B 量化推理、轻量视觉模型 | 32B 和长上下文吃紧 |
| NVIDIA RTX 5080 | 16GB GDDR7 | US$999 首发 | 更高吞吐的 7B/14B 推理 | 对 LLM 来说显存容量仍是硬上限 |
| NVIDIA RTX 5090 | 32GB GDDR7 | US$1,999 首发 | 14B/32B 量化、7B/14B QLoRA | 功耗、散热和购置价高 |
| NVIDIA RTX 3090 | 24GB GDDR6X | US$1,499 首发;二手波动大 | 低预算本地 24GB、双卡实验 | 二手风险、功耗高、无新架构特性 |
| NVIDIA RTX PRO 6000 Blackwell | 96GB GDDR7 ECC | US$16,000 厂商商城快照 | 单卡大显存、企业工作站、70B | 价格远高于消费卡 |
| AMD RX 7900 XTX | 24GB GDDR6 | US$999 首发 | 熟悉 ROCm/Linux 的本地推理 | 项目和内核支持需逐项确认 |
| Intel Arc B580 | 12GB GDDR6 | US$249 首发 | 低成本 SYCL/llama.cpp 实验 | 主流训练栈覆盖较弱 |
规格与首发价来源:NVIDIA RTX 50 系列、RTX 3090、RTX PRO 6000、AMD RX 7900 XTX、Intel Arc B580。
中国市场快照怎么读¶
2026 年 9 月初抓取到的京东公开列表样本中,RTX 5080 16GB 多数挂牌约为 ¥13,399 到 ¥17,651,RTX 5070 Ti 16GB 约为 ¥10,999,RTX 5090 32GB 约为 ¥39,899 到 ¥45,999。这些是特定店铺和非公版型号的挂牌价,不代表成交价,也可能包含缺货溢价、税票差异或进口渠道成本。购买前应重新抽样至少三家自营或授权店。
二手 RTX 3090 更应该按具体卡况、显存温度、维修史和压力测试报价,而不是引用固定“行情”。24GB 显存有吸引力,但不能用首发价格或国外成交价替代本地验机。
数据中心 GPU¶
第一次接触 PCIe、NVLink、NVSwitch、SXM、NUMA 或 RDMA,可先看硬件互连术语表。选型时必须把卡的计算规格和服务器拓扑一起判断。
NVIDIA 六类重点卡¶
| GPU | 架构与形态 | 单卡显存 | 显存带宽 | 适合的工作负载 | 选型提醒 |
|---|---|---|---|---|---|
| NVIDIA L20 | Ada Lovelace、PCIe | 48GB GDDR6 ECC | 864GB/s | 7B 到 32B 推理、短上下文 70B 4-bit、图形与视频混合负载 | 容量够用但带宽远低于 HBM 卡;多卡通常依赖 PCIe/RDMA,不要按 H100 的扩展方式估算 |
| NVIDIA H20 | Hopper、SXM5 | 96GB HBM3;另有 141GB HBM3e 规格 | 96GB 版本约 4.0TB/s | 中国市场大模型推理、长上下文、MIG 切分 | 计算能力与 H100 不同,不能因显存和带宽更高就认定更快;采购前核对 96GB/141GB SKU、驱动和供应限制 |
| NVIDIA H100 SXM | Hopper、SXM5 | 80GB HBM3 | 3.35TB/s | 训练、高吞吐推理、成熟 CUDA 集群 | 80GB 容量可能比算力先成为 70B、长上下文和大批量的瓶颈 |
| NVIDIA H200 SXM | Hopper、SXM5 | 141GB HBM3e | 4.8TB/s | 大模型推理、长上下文、更大 KV cache | 相比 H100 的直接价值主要是容量与带宽;仍应按目标模型实测每 token 成本 |
| NVIDIA B200 SXM6 | Blackwell | 180GB HBM3e | 最高 8TB/s | 大规模训练、FP4/FP8 推理和高密度服务 | 通常按 HGX 8 卡节点获得,电力、液冷/风冷、网络和软件版本都会影响落地 |
| NVIDIA B300 SXM6 | Blackwell Ultra | 288GB HBM3e | 最高 8TB/s | 超大模型、长上下文、推理时扩展和大规模训练 | HGX 8 卡节点合计 2.30TB;云平台约 270GiB 的显示值与 288GB 十进制标称值并不矛盾 |
NVIDIA 当前参考架构给出的 B300 标称容量为 288GB,B200 为 180GB,H200 为 141GB;B300、B200 的峰值显存带宽均为 8TB/s。H20 还应注意版本变化:NVIDIA 当前 vGPU 文档同时列出 96GB 和 141GB 版本,因此合同不能只写“H20”,必须写清完整 SKU。
来源:NVIDIA HGX H200/B200/B300 规格、NVIDIA H100/H200/B200 规格、NVIDIA Hopper vGPU 类型、NVIDIA L20 vGPU 类型、阿里云 L20 实例规格。
AMD 容量型加速卡¶
| GPU | 单卡显存 | 显存带宽 | 典型用途 |
|---|---|---|---|
| AMD MI300X | 192GB HBM3 | 5.3TB/s | ROCm 训练与推理 |
| AMD MI325X | 256GB HBM3e | 6TB/s | 超大模型与高容量工作负载 |
六类 NVIDIA 卡怎么选¶
| 主要目标 | 优先比较 | 原因 |
|---|---|---|
| 单机低成本推理 | L20 | 48GB、FP8、标准 PCIe 服务器,适合常规企业推理 |
| 中国大陆可采购的大显存推理 | H20 96GB/141GB | HBM 容量和带宽高,但实际供货、合规和 SKU 变化必须重新确认 |
| 训练与通用高性能基线 | H100 | 生态成熟,便于和大量公开基准对齐 |
| 内存受限的 Hopper 迁移 | H200 | 软件迁移成本通常小于跨架构升级,KV cache 空间明显增加 |
| 新建大规模训练或高密度推理集群 | B200 | Blackwell 计算格式、180GB HBM3e 和新一代 NVLink |
| 单卡容量、推理时扩展或超大模型优先 | B300 | 288GB HBM3e,适合容量和推理算力都很紧张的项目 |
数据中心 GPU 通常随服务器、网络、支持和批量合同采购,公开“单卡价”没有可比性。FDE 做预算时应使用整机或云实例的有效单 GPU 小时成本。
云 GPU 价格快照¶
Lambda Cloud 在本次快照中的自助实例价如下,未含税:
| GPU | 显存 | 每 GPU 每小时 |
|---|---|---|
| B200 SXM6 | 180GB | US$6.99 |
| H100 SXM | 80GB | US$4.29 |
| H100 PCIe | 80GB | US$3.29 |
| GH200 | 96GB | US$2.29 |
| A100 SXM/PCIe | 40GB | US$1.99 |
| A6000 | 48GB | US$1.09 |
| A10 | 24GB | US$1.29 |
AWS EC2 Capacity Blocks 的口径不同,例如东京单 H100 的有效小时价为 US$4.720,美国商业区域 B200 为 US$12.355。它是容量预留方案,不能与裸 GPU 租赁平台只按数字直接比较。CPU、内存、存储、网络、最短租期、可用区和空闲计费都会改变总成本。
B300、H200、H100 的另一组公开云价¶
DigitalOcean GPU Droplets 自 2026-08-01 生效的公开价格可作为另一组对照:
| GPU | 计费方式 | 每 GPU 每小时 |
|---|---|---|
| B300 | 12 个月预留 | US$7.94 |
| B300 | 可中断 Spot 快照 | US$11.19 |
| H200 | 12 个月预留 / 按需 | US$3.40 / US$4.47 |
| H100 | 12 个月预留 / 按需 | US$3.26 / US$4.41 |
这里出现 Spot 高于预留价并非录入错误:两者的承诺期限、容量保障和回收条件不同。跨云比较必须同时记录计费模式,不能假设名为 Spot 就一定更便宜。
中国云上的 L20 与 H20 价格样本¶
腾讯云 DLC 官方计费页 的包年包月整机快照如下。价格含配套 CPU/内存,不能当作裸 GPU 卡价:
| GPU 实例 | 地域与配置样本 | 月价 |
|---|---|---|
| L20 48GB | PNV5b,48CU/1GPU,北京、广州、南京 | ¥9,513/月 |
| H20 96GB | PNV6,16CU/1GPU,北京、广州 | ¥17,814/月 |
| H20 96GB | PNV6,16CU/1GPU,上海、重庆 | ¥19,793/月 |
| H20 96GB | HCCPNV6c,128CU/8GPU,北京、上海、南京 | ¥173,972/月 |
腾讯云注明 GPU 计算引擎当前为白名单功能,且购买页价格优先于文档页。采购 H20 时还要重新确认出口、地域供应、完整 SKU、最小卡数和交付周期。
买卡还是租云¶
用下面的粗算做第一轮判断:
通常买卡¶
- 每天稳定使用,数据必须留在本地。
- 任务规模适合 1 到 2 张卡,不依赖高速多卡互联。
- 团队有人维护驱动、散热、电源和备份。
通常租云¶
- 负载突发,训练一周后长期闲置。
- 需要 H100/H200/B200 或多机高速互联。
- 需要快速试错多个 GPU 型号。
- 业务需要 SLA、弹性和异地容灾。
常见最优解:混合¶
本地 24GB 到 32GB 做开发、评测和小规模 QLoRA;云端 80GB 以上做短期训练、压测和高峰扩容。模型、容器和评测脚本保持一致,避免“本地能跑,云上重做”。
选购检查表¶
- 先按 显存计算 验证模型、精度、上下文和并发。
- 检查目标框架是否支持 GPU、量化格式和算子。
- 计算整机电源、机箱空间、散热、噪声与 24 小时运行条件。
- 双卡消费级方案检查主板槽距、PCIe 通道、电源和跨卡通信,不能只把显存相加。
- 企业场景检查 ECC、保修、远程管理、虚拟化和驱动生命周期。
- 采购前用目标模型跑一个真实基准,不按游戏帧率或理论 TOPS 决策。
一次完整的选型算例¶
假设要部署一个 70B 4-bit 内部问答服务,典型输入 2K、P95 输入 8K、平均输出 300 token,目标 12 路并发。选择过程应是:
- 权重理论值约 35GB,加量化元数据后按 40GB 左右起算。
- 根据目标模型的层数与 KV heads 计算 12 路 KV Cache,不能套用其他 70B 模型。
- 加入运行时、CUDA graph 和 15% 左右安全余量。
- 如果 48GB L20 只能满足短上下文或低并发,就比较两条路线:多副本 L20,或单卡大显存 H20/H200。
- 在目标流量分布上测每张卡的“每秒成功任务”,而不是只看单请求 tokens/s。
- 把整机、网络、存储、支持和最低租期计入单位成本。
可能出现的结论不是“某卡更快”,而是:L20 副本更便宜且故障隔离好;H200 长上下文余量更大;H20 在特定地区供应和总价更合适。最终选择取决于真实基准,而不是产品代际。
吞吐成本计算¶
每百万输出 token GPU 成本
= GPU 小时价 / (稳定输出 tokens/s x 3600) x 1,000,000
每成功任务基础设施成本
= 测试窗口总基础设施成本 / 通过业务验收的任务数
第二个指标更重要。一个便宜模型如果失败率高、频繁重试或需要大量人工复核,每 token 便宜也可能使每成功任务更贵。
| 候选 | 卡数 | GPU 小时价 | 稳定 tok/s | 任务通过率 | 每成功任务成本 | P95 | 结论 |
|---|---|---|---|---|---|---|---|
| L20 | |||||||
| H20 | |||||||
| H100 | |||||||
| H200 | |||||||
| B200/B300 |
服务器级检查¶
数据中心 GPU 不能脱离节点配置比较。询价或租用时同时确认:
- GPU 是 PCIe 还是 SXM,卡间是 PCIe、NVLink 还是 NVSwitch。
- CPU 核数、NUMA 拓扑、主机内存和本地 NVMe 是否匹配数据加载。
- InfiniBand/RoCE 型号、带宽、拓扑与跨节点集合通信实测。
- 功率上限、散热方式、机架功率密度和降频记录。
- 驱动、CUDA/ROCm、固件、容器工具链和可升级窗口。
- ECC、Xid、链路错误、坏卡替换 SLA 和备件策略。