跳转至

GPU 选型与价格

快照日期:2026-09-04。价格只是选型起点,不是报价。官方首发价、当前零售价、二手成交价和云租赁价口径不同。

先看结论

  • 只学习和跑 3B 到 8B 量化模型:12GB 到 16GB 显存可起步。
  • 想稳定跑 14B 到 32B 量化模型或做 7B QLoRA:优先 24GB 到 32GB。
  • 想在单卡放下 70B 4-bit、较长上下文或做 14B/32B QLoRA:48GB 到 96GB 更实用。
  • 训练、超大模型和高并发生产:不要按单卡价格选,按吞吐、互联、可用性和总拥有成本选数据中心 GPU 或云。
  • 没有明确的 AMD/Intel 兼容性验证时,学习大模型工程默认选 NVIDIA。原因是 CUDA、训练框架、量化内核和部署工具覆盖更完整,不是因为其他 GPU 没有算力。

消费级与工作站 GPU

官方价格采用发布价或厂商商城标价,便于跨地区比较。

GPU 显存 官方参考价 适合 主要限制
NVIDIA RTX 5070 12GB GDDR7 US$549 首发 3B 到 8B 推理、入门开发 显存很快成为瓶颈
NVIDIA RTX 5070 Ti 16GB GDDR7 US$749 首发 7B/14B 量化推理、轻量视觉模型 32B 和长上下文吃紧
NVIDIA RTX 5080 16GB GDDR7 US$999 首发 更高吞吐的 7B/14B 推理 对 LLM 来说显存容量仍是硬上限
NVIDIA RTX 5090 32GB GDDR7 US$1,999 首发 14B/32B 量化、7B/14B QLoRA 功耗、散热和购置价高
NVIDIA RTX 3090 24GB GDDR6X US$1,499 首发;二手波动大 低预算本地 24GB、双卡实验 二手风险、功耗高、无新架构特性
NVIDIA RTX PRO 6000 Blackwell 96GB GDDR7 ECC US$16,000 厂商商城快照 单卡大显存、企业工作站、70B 价格远高于消费卡
AMD RX 7900 XTX 24GB GDDR6 US$999 首发 熟悉 ROCm/Linux 的本地推理 项目和内核支持需逐项确认
Intel Arc B580 12GB GDDR6 US$249 首发 低成本 SYCL/llama.cpp 实验 主流训练栈覆盖较弱

规格与首发价来源:NVIDIA RTX 50 系列、RTX 3090、RTX PRO 6000、AMD RX 7900 XTX、Intel Arc B580。

中国市场快照怎么读

2026 年 9 月初抓取到的京东公开列表样本中,RTX 5080 16GB 多数挂牌约为 ¥13,399 到 ¥17,651,RTX 5070 Ti 16GB 约为 ¥10,999,RTX 5090 32GB 约为 ¥39,899 到 ¥45,999。这些是特定店铺和非公版型号的挂牌价,不代表成交价,也可能包含缺货溢价、税票差异或进口渠道成本。购买前应重新抽样至少三家自营或授权店。

二手 RTX 3090 更应该按具体卡况、显存温度、维修史和压力测试报价,而不是引用固定“行情”。24GB 显存有吸引力,但不能用首发价格或国外成交价替代本地验机。

数据中心 GPU

第一次接触 PCIe、NVLink、NVSwitch、SXM、NUMA 或 RDMA,可先看硬件互连术语表。选型时必须把卡的计算规格和服务器拓扑一起判断。

NVIDIA 六类重点卡

GPU 架构与形态 单卡显存 显存带宽 适合的工作负载 选型提醒
NVIDIA L20 Ada Lovelace、PCIe 48GB GDDR6 ECC 864GB/s 7B 到 32B 推理、短上下文 70B 4-bit、图形与视频混合负载 容量够用但带宽远低于 HBM 卡;多卡通常依赖 PCIe/RDMA,不要按 H100 的扩展方式估算
NVIDIA H20 Hopper、SXM5 96GB HBM3;另有 141GB HBM3e 规格 96GB 版本约 4.0TB/s 中国市场大模型推理、长上下文、MIG 切分 计算能力与 H100 不同,不能因显存和带宽更高就认定更快;采购前核对 96GB/141GB SKU、驱动和供应限制
NVIDIA H100 SXM Hopper、SXM5 80GB HBM3 3.35TB/s 训练、高吞吐推理、成熟 CUDA 集群 80GB 容量可能比算力先成为 70B、长上下文和大批量的瓶颈
NVIDIA H200 SXM Hopper、SXM5 141GB HBM3e 4.8TB/s 大模型推理、长上下文、更大 KV cache 相比 H100 的直接价值主要是容量与带宽;仍应按目标模型实测每 token 成本
NVIDIA B200 SXM6 Blackwell 180GB HBM3e 最高 8TB/s 大规模训练、FP4/FP8 推理和高密度服务 通常按 HGX 8 卡节点获得,电力、液冷/风冷、网络和软件版本都会影响落地
NVIDIA B300 SXM6 Blackwell Ultra 288GB HBM3e 最高 8TB/s 超大模型、长上下文、推理时扩展和大规模训练 HGX 8 卡节点合计 2.30TB;云平台约 270GiB 的显示值与 288GB 十进制标称值并不矛盾

NVIDIA 当前参考架构给出的 B300 标称容量为 288GB,B200 为 180GB,H200 为 141GB;B300、B200 的峰值显存带宽均为 8TB/s。H20 还应注意版本变化:NVIDIA 当前 vGPU 文档同时列出 96GB 和 141GB 版本,因此合同不能只写“H20”,必须写清完整 SKU。

来源:NVIDIA HGX H200/B200/B300 规格、NVIDIA H100/H200/B200 规格、NVIDIA Hopper vGPU 类型、NVIDIA L20 vGPU 类型、阿里云 L20 实例规格。

AMD 容量型加速卡

GPU 单卡显存 显存带宽 典型用途
AMD MI300X 192GB HBM3 5.3TB/s ROCm 训练与推理
AMD MI325X 256GB HBM3e 6TB/s 超大模型与高容量工作负载

来源:AMD MI300X、AMD MI325X 数据表。

六类 NVIDIA 卡怎么选

主要目标 优先比较 原因
单机低成本推理 L20 48GB、FP8、标准 PCIe 服务器,适合常规企业推理
中国大陆可采购的大显存推理 H20 96GB/141GB HBM 容量和带宽高,但实际供货、合规和 SKU 变化必须重新确认
训练与通用高性能基线 H100 生态成熟,便于和大量公开基准对齐
内存受限的 Hopper 迁移 H200 软件迁移成本通常小于跨架构升级,KV cache 空间明显增加
新建大规模训练或高密度推理集群 B200 Blackwell 计算格式、180GB HBM3e 和新一代 NVLink
单卡容量、推理时扩展或超大模型优先 B300 288GB HBM3e,适合容量和推理算力都很紧张的项目

数据中心 GPU 通常随服务器、网络、支持和批量合同采购,公开“单卡价”没有可比性。FDE 做预算时应使用整机或云实例的有效单 GPU 小时成本。

云 GPU 价格快照

Lambda Cloud 在本次快照中的自助实例价如下,未含税:

GPU 显存 每 GPU 每小时
B200 SXM6 180GB US$6.99
H100 SXM 80GB US$4.29
H100 PCIe 80GB US$3.29
GH200 96GB US$2.29
A100 SXM/PCIe 40GB US$1.99
A6000 48GB US$1.09
A10 24GB US$1.29

AWS EC2 Capacity Blocks 的口径不同,例如东京单 H100 的有效小时价为 US$4.720,美国商业区域 B200 为 US$12.355。它是容量预留方案,不能与裸 GPU 租赁平台只按数字直接比较。CPU、内存、存储、网络、最短租期、可用区和空闲计费都会改变总成本。

B300、H200、H100 的另一组公开云价

DigitalOcean GPU Droplets 自 2026-08-01 生效的公开价格可作为另一组对照:

GPU 计费方式 每 GPU 每小时
B300 12 个月预留 US$7.94
B300 可中断 Spot 快照 US$11.19
H200 12 个月预留 / 按需 US$3.40 / US$4.47
H100 12 个月预留 / 按需 US$3.26 / US$4.41

这里出现 Spot 高于预留价并非录入错误:两者的承诺期限、容量保障和回收条件不同。跨云比较必须同时记录计费模式,不能假设名为 Spot 就一定更便宜。

中国云上的 L20 与 H20 价格样本

腾讯云 DLC 官方计费页 的包年包月整机快照如下。价格含配套 CPU/内存,不能当作裸 GPU 卡价:

GPU 实例 地域与配置样本 月价
L20 48GB PNV5b,48CU/1GPU,北京、广州、南京 ¥9,513/月
H20 96GB PNV6,16CU/1GPU,北京、广州 ¥17,814/月
H20 96GB PNV6,16CU/1GPU,上海、重庆 ¥19,793/月
H20 96GB HCCPNV6c,128CU/8GPU,北京、上海、南京 ¥173,972/月

腾讯云注明 GPU 计算引擎当前为白名单功能,且购买页价格优先于文档页。采购 H20 时还要重新确认出口、地域供应、完整 SKU、最小卡数和交付周期。

买卡还是租云

用下面的粗算做第一轮判断:

月云成本 = GPU 小时价 x 每月有效使用小时 + 存储 + 流量 + 闲置
硬件月成本 = (主机总价 - 残值) / 使用月数 + 电费 + 运维 + 故障风险

通常买卡

  • 每天稳定使用,数据必须留在本地。
  • 任务规模适合 1 到 2 张卡,不依赖高速多卡互联。
  • 团队有人维护驱动、散热、电源和备份。

通常租云

  • 负载突发,训练一周后长期闲置。
  • 需要 H100/H200/B200 或多机高速互联。
  • 需要快速试错多个 GPU 型号。
  • 业务需要 SLA、弹性和异地容灾。

常见最优解:混合

本地 24GB 到 32GB 做开发、评测和小规模 QLoRA;云端 80GB 以上做短期训练、压测和高峰扩容。模型、容器和评测脚本保持一致,避免“本地能跑,云上重做”。

选购检查表

  • 先按 显存计算 验证模型、精度、上下文和并发。
  • 检查目标框架是否支持 GPU、量化格式和算子。
  • 计算整机电源、机箱空间、散热、噪声与 24 小时运行条件。
  • 双卡消费级方案检查主板槽距、PCIe 通道、电源和跨卡通信,不能只把显存相加。
  • 企业场景检查 ECC、保修、远程管理、虚拟化和驱动生命周期。
  • 采购前用目标模型跑一个真实基准,不按游戏帧率或理论 TOPS 决策。

一次完整的选型算例

假设要部署一个 70B 4-bit 内部问答服务,典型输入 2K、P95 输入 8K、平均输出 300 token,目标 12 路并发。选择过程应是:

  1. 权重理论值约 35GB,加量化元数据后按 40GB 左右起算。
  2. 根据目标模型的层数与 KV heads 计算 12 路 KV Cache,不能套用其他 70B 模型。
  3. 加入运行时、CUDA graph 和 15% 左右安全余量。
  4. 如果 48GB L20 只能满足短上下文或低并发,就比较两条路线:多副本 L20,或单卡大显存 H20/H200。
  5. 在目标流量分布上测每张卡的“每秒成功任务”,而不是只看单请求 tokens/s。
  6. 把整机、网络、存储、支持和最低租期计入单位成本。

可能出现的结论不是“某卡更快”,而是:L20 副本更便宜且故障隔离好;H200 长上下文余量更大;H20 在特定地区供应和总价更合适。最终选择取决于真实基准,而不是产品代际。

吞吐成本计算

每百万输出 token GPU 成本
  = GPU 小时价 / (稳定输出 tokens/s x 3600) x 1,000,000

每成功任务基础设施成本
  = 测试窗口总基础设施成本 / 通过业务验收的任务数

第二个指标更重要。一个便宜模型如果失败率高、频繁重试或需要大量人工复核,每 token 便宜也可能使每成功任务更贵。

候选 卡数 GPU 小时价 稳定 tok/s 任务通过率 每成功任务成本 P95 结论
L20
H20
H100
H200
B200/B300

服务器级检查

数据中心 GPU 不能脱离节点配置比较。询价或租用时同时确认:

  • GPU 是 PCIe 还是 SXM,卡间是 PCIe、NVLink 还是 NVSwitch。
  • CPU 核数、NUMA 拓扑、主机内存和本地 NVMe 是否匹配数据加载。
  • InfiniBand/RoCE 型号、带宽、拓扑与跨节点集合通信实测。
  • 功率上限、散热方式、机架功率密度和降频记录。
  • 驱动、CUDA/ROCm、固件、容器工具链和可升级窗口。
  • ECC、Xid、链路错误、坏卡替换 SLA 和备件策略。
采购门禁:供应商应提供目标模型、目标精度、目标序列长度与并发下的原始测试脚本和结果。只有厂商理论 FLOPS 或单条生成速度,不能支持生产容量决策。