跳转至

术语表

本页按一次 FDE 项目实际遇到术语的顺序组织:硬件与互连、模型与推理、并行与部署、RAG/Agent、训练与评测。定义后面的“工程影响”比缩写本身更重要。

硬件、显存与互连

术语 含义 对部署的实际影响
GPU Graphics Processing Unit,擅长大规模并行计算的处理器 型号之外还要看显存、带宽、互连、功率和软件生态
VRAM GPU 可直接访问的显存 决定能否容纳权重、KV Cache、激活和运行时工作区
HBM High Bandwidth Memory,高带宽堆叠内存 H100/H200/B200/B300 等数据中心卡使用,带宽和容量适合大模型,但成本高
GDDR Graphics Double Data Rate memory,显卡常用显存 消费卡和 L20 等使用;容量、带宽及 ECC 能力因型号而异
Memory bandwidth GPU 与显存之间单位时间可传输的数据量 Decode 常受显存带宽限制;容量相同的两张卡不一定有相同生成速度
PCIe Peripheral Component Interconnect Express,CPU、GPU、网卡和存储之间的通用高速总线 GPU 之间经 PCIe 传数据时通常慢于 NVLink;多卡推理必须检查代际、通道数、交换芯片和拓扑
PCIe generation PCIe 4.0、5.0、6.0 等协议代际 代际越新,单通道理论速率越高;实际吞吐还受主板、CPU、设备和拓扑限制
PCIe x16 使用 16 条 PCIe lane 的连接 插槽外形是 x16 不代表一定提供完整 x16 电气通道,双卡工作站尤其要核对主板说明
PCIe switch 在有限 CPU PCIe 通道下连接多张 GPU 或设备的交换芯片 可能形成共享上行带宽;需查看 GPU 到 GPU、GPU 到 NIC 的实际路径
NVLink NVIDIA 的 GPU 高速点对点互连 让支持的 GPU 之间以高于常规 PCIe 的带宽通信,适合 Tensor Parallel 和大规模训练;不能把多卡自动当成一块统一显存
NVSwitch 把多张 NVLink GPU 连接成高带宽交换网络的芯片/系统 常见于 HGX/DGX 节点,可让多 GPU 通信拓扑更均匀;仍需要并行框架显式切分模型
SXM NVIDIA 数据中心 GPU 的高功率模块形态,不是普通 PCIe 插卡 常与 NVLink/NVSwitch、高带宽和更高功率配置配套,需要专用服务器底板和散热
PCIe GPU 通过标准 PCIe 卡形态安装的 GPU 部署灵活,但多卡互连、功率和散热能力取决于具体服务器
HGX NVIDIA 面向服务器厂商的多 GPU 基板与参考平台 采购 B200/B300/H200 等集群时通常以完整 HGX 节点评估,不只计算“单卡价格”
DGX NVIDIA 提供的完整 AI 系统产品 包含 GPU、CPU、网络、存储与软件支持;口径不同于单卡或 HGX 基板
MIG Multi-Instance GPU,把一张受支持的 GPU 隔离成多个硬件实例 适合小模型、多租户和稳定隔离;每个实例的显存、计算和引擎资源受切分规格限制
GPU memory pooling 多设备间以软件或互连组织内存使用 不代表所有显存都能像本地显存一样透明、等速访问,必须按引擎和模型实测
BAR1 CPU 或其他设备映射 GPU 显存的地址窗口 大模型、GPU Direct 或虚拟化故障排查时可能相关,通常不是模型容量本身

拓扑与多节点网络

术语 含义 对部署的实际影响
Topology GPU、CPU、内存、PCIe switch、NIC 之间的物理连接关系 相同卡数可能因连接路径不同产生明显性能差异,可先用 nvidia-smi topo -m 查看
NUMA Non-Uniform Memory Access,多路 CPU 系统中不同内存区域访问代价不同 GPU 进程、CPU 线程和 NIC 跨 NUMA 节点可能降低数据加载与通信性能
NIC Network Interface Card,网络接口卡 多节点训练/推理时要确认 GPU 到目标 NIC 的路径和带宽
RDMA Remote Direct Memory Access,绕过较多 CPU 参与进行远程内存传输 降低多节点通信延迟和 CPU 开销,是高性能集群的重要基础能力
InfiniBand 面向高性能计算的低延迟高速网络 常用于大规模训练、多节点并行和存储网络,需同时关注交换网络与 RDMA 配置
RoCE RDMA over Converged Ethernet,在以太网上实现 RDMA 可复用以太网生态,但对无损网络、拥塞控制和交换机配置要求较高
GPUDirect RDMA GPU 与远端网卡/设备间更直接的数据传输机制 减少 CPU 中转;需要 GPU、NIC、驱动、拓扑和软件栈共同支持
NCCL NVIDIA Collective Communications Library,多 GPU 集合通信库 TP、DP 和分布式训练常依赖它;hang 或性能低时要检查拓扑、网卡和环境配置
Collective communication AllReduce、AllGather、ReduceScatter、AllToAll 等多进程通信操作 不同并行策略产生不同通信模式;MoE 的 AllToAll 尤其依赖网络
AllReduce 汇总多个设备的数据并把结果发回各设备 数据并行梯度同步常用,慢节点或慢链路会拖慢整体
AllToAll 每个设备向其他多个设备交换不同数据 Expert Parallel 常见,对网络带宽、延迟和负载均衡敏感
Oversubscription 多个设备共享的上行带宽小于所有下行带宽之和 峰值并发通信时出现拥塞,不能只按单端口标称速率估算
Gang scheduling 一组分布式 worker 必须同时获得资源后再启动 避免多节点模型只拿到部分 GPU 后长期占用资源等待

PCIe、NVLink、NVSwitch 怎么区分

PCIe:通用设备总线
  CPU <-> GPU
  GPU <-> NIC / NVMe
  GPU <-> GPU(可通信,但受 PCIe 路径限制)

NVLink:GPU 之间的专用高速链路
  GPU <========> GPU

NVSwitch:把多张 NVLink GPU 接入交换网络
  GPU ==\
  GPU === NVSwitch === GPU
  GPU ==/              GPU

常见误解

  1. “两张 24GB 卡就是一张 48GB 卡”:错误。模型框架必须执行 Tensor/Pipeline Parallel 或 offload,跨卡张量还会产生通信。
  2. “有 NVLink 就能合并显存”:不准确。NVLink 提供高速传输,如何放置权重和计算仍由 CUDA、框架与推理引擎决定。
  3. “插在两个 x16 插槽就是双 x16”:不一定。部分主板安装双卡后会变成 x8/x8,或经过共享 switch。
  4. “PCIe 卡一定没有 NVLink”:要按具体型号判断,不能只从卡的物理形态推断。
  5. “NVLink 带宽高,多卡一定更快”:小模型或低并发可能被通信和调度开销抵消;单卡能放下时通常先测单卡副本。

模型与推理

术语 含义 工程提示
Foundation model 在广泛数据上训练、可适配多任务的基础模型 仍需通过具体任务评测决定是否适用
LLM / VLM 大语言模型 / 视觉语言模型 VLM 还要计算视觉编码与图像 token 的资源
Open weight 权重可获取 不自动等于开源软件,也不代表无限制商用
Parameter 模型训练得到的权重数量,常以 B 表示十亿 Dense 与 MoE 的参数解释不同
Dense model 每个 token 大体使用全部模型参数的稠密模型 总参数和激活参数通常接近
MoE Mixture of Experts,每个 token 只激活部分专家 显存通常仍需容纳全部驻留权重
Token 模型处理内容的基本单位 不等同于汉字、英文单词或字节
Context window 一次请求可处理的输入与输出 token 范围 标称上限不等于目标硬件可经济运行的长度
Prefill 并行处理输入上下文的阶段 主要影响 TTFT,长输入会增加计算量
Decode 逐 token 生成输出的阶段 常受显存带宽、批量和跨卡通信影响
KV Cache 保存注意力 Key/Value 的运行时缓存 随活跃 token 和并发增长,是服务容量关键项
TTFT Time to First Token,从请求到首 token 的时间 包含排队、预处理与 prefill
TPOT Time per Output Token,首 token 后每个输出 token 的时间 用于衡量 decode 速度
Throughput 单位时间完成的请求数或生成 token 数 必须连同输入、输出和并发分布报告
Quantization 用更低数值精度表示权重、激活或 KV Cache 节省资源不保证更快,必须重测质量
FP16 / BF16 常见 16-bit 浮点格式 BF16 动态范围较大,支持情况依硬件
FP8 / INT8 8-bit 浮点或整数格式 常用于推理,也可用于受支持硬件上的训练
INT4 / 4-bit 低位宽权重量化 理论权重约为 FP16 的四分之一,另有元数据和未量化层
GGUF llama.cpp 生态常用模型文件格式 常见于本地 CPU/GPU 混合推理
AWQ / GPTQ 常见的校准式低位宽权重量化方法 引擎、GPU 和 kernel 支持决定实际性能

并行、调度与部署

术语 含义 工程提示
Tensor Parallel / TP 将同一层计算切分到多张 GPU 频繁跨卡通信,优先使用高速互连
Pipeline Parallel / PP 将不同模型层放到不同 GPU 或节点 可能产生流水线气泡,偏向解决容量问题
Data Parallel / DP 多个完整模型副本处理不同请求或数据 适合模型单卡可放下时扩大吞吐
Expert Parallel / EP 把 MoE 专家分布到不同设备 常涉及 AllToAll 与专家负载不均
Continuous batching 动态把不同时间到达的请求组合执行 提高吞吐,但要观察交互请求 TTFT
PagedAttention 以分页方式管理 KV Cache 的推理技术 减少碎片并提高缓存利用率,不消除总容量限制
Prefix caching 复用多个请求相同前缀的计算结果 只有前缀稳定且命中率足够时才有收益
Speculative decoding 小模型或预测头提出多个 token,再由目标模型验证 接受率决定收益,还会增加额外资源
Admission control 在请求进入推理队列前执行容量、配额和风险检查 防止无限排队与显存耗尽
Model replica 拥有完整或完整并行组的一份可服务模型 副本用于吞吐、故障隔离和滚动升级
Cold start 从无实例到模型加载完成并可服务的时间 大权重可能需要数分钟,扩缩容必须提前量
Canary / 灰度 先把少量真实流量送到新版本 同时观察质量、性能、错误和成本
Readiness probe 判断实例当前是否能接收新请求 模型加载中或过载时应摘流
Liveness probe 判断进程是否需要被重启 不应使用容易被负载拖慢的深度推理探针
MIG 将支持的 GPU 切成隔离实例 适合多租户小模型,但不是所有工作负载都适合

RAG 与 Agent

术语 含义
RAG Retrieval-Augmented Generation,检索增强生成
Embedding 将内容映射到向量,用于相似度检索等任务
BM25 基于词项匹配和统计权重的经典关键词检索方法
Hybrid retrieval 组合关键词与向量召回
Reranker 对召回候选进行更精细的相关性排序
Chunk 从原始材料切出的可检索内容单元,应保留来源与权限
Agent 根据目标循环选择工具、执行、观察并继续或停止的系统
Tool calling 模型按 schema 提出函数或外部工具调用
Idempotency 同一写请求重复执行不会产生重复副作用的性质

训练、评测与运营

术语 含义
SFT Supervised Fine-Tuning,监督微调
LoRA 通过低秩矩阵训练少量适配参数的方法
QLoRA 量化冻结基础模型后训练 LoRA adapter
DPO Direct Preference Optimization,用偏好对直接优化模型
GRPO Group Relative Policy Optimization,使用组内相对奖励的优化方法
Golden set 经审核、版本化、用于回归的代表性评测集
Grader 根据确定性规则、模型或人工标准评判输出的组件
P50 / P95 / P99 50%、95%、99% 请求不超过的指标分位点
SLI Service Level Indicator,用于度量服务行为的实际指标
SLO Service Level Objective,例如 P95 时延和可用性目标
SLA Service Level Agreement,对外承诺并可能包含责任的服务协议
PII Personally Identifiable Information,可识别个人身份的信息
RTO Recovery Time Objective,故障后目标恢复时间
RPO Recovery Point Objective,可接受的数据回退时间点

看到互连术语时怎么判断

场景 首先检查 不要直接下的结论
单卡能放下模型 单卡吞吐与副本扩展 多卡一定更快
同机 TP 性能低 nvidia-smi topo -m、NCCL 测试、NUMA GPU 算力不足
双消费卡工作站 插槽电气通道、间距、电源、PCIe 路径 显存可以无代价相加
HGX 8 卡节点 NVSwitch 域、功率、散热、引擎支持 只按单卡参数估算节点性能
跨节点模型 RDMA、NIC、交换网络、NCCL、gang scheduling 服务器数量翻倍,性能也翻倍
MoE 多卡 EP 路由、AllToAll、专家负载 激活参数小,网络就不重要

官方参考