术语表
本页按一次 FDE 项目实际遇到术语的顺序组织:硬件与互连、模型与推理、并行与部署、RAG/Agent、训练与评测。定义后面的“工程影响”比缩写本身更重要。
硬件、显存与互连
| 术语 |
含义 |
对部署的实际影响 |
| GPU |
Graphics Processing Unit,擅长大规模并行计算的处理器 |
型号之外还要看显存、带宽、互连、功率和软件生态 |
| VRAM |
GPU 可直接访问的显存 |
决定能否容纳权重、KV Cache、激活和运行时工作区 |
| HBM |
High Bandwidth Memory,高带宽堆叠内存 |
H100/H200/B200/B300 等数据中心卡使用,带宽和容量适合大模型,但成本高 |
| GDDR |
Graphics Double Data Rate memory,显卡常用显存 |
消费卡和 L20 等使用;容量、带宽及 ECC 能力因型号而异 |
| Memory bandwidth |
GPU 与显存之间单位时间可传输的数据量 |
Decode 常受显存带宽限制;容量相同的两张卡不一定有相同生成速度 |
| PCIe |
Peripheral Component Interconnect Express,CPU、GPU、网卡和存储之间的通用高速总线 |
GPU 之间经 PCIe 传数据时通常慢于 NVLink;多卡推理必须检查代际、通道数、交换芯片和拓扑 |
| PCIe generation |
PCIe 4.0、5.0、6.0 等协议代际 |
代际越新,单通道理论速率越高;实际吞吐还受主板、CPU、设备和拓扑限制 |
| PCIe x16 |
使用 16 条 PCIe lane 的连接 |
插槽外形是 x16 不代表一定提供完整 x16 电气通道,双卡工作站尤其要核对主板说明 |
| PCIe switch |
在有限 CPU PCIe 通道下连接多张 GPU 或设备的交换芯片 |
可能形成共享上行带宽;需查看 GPU 到 GPU、GPU 到 NIC 的实际路径 |
| NVLink |
NVIDIA 的 GPU 高速点对点互连 |
让支持的 GPU 之间以高于常规 PCIe 的带宽通信,适合 Tensor Parallel 和大规模训练;不能把多卡自动当成一块统一显存 |
| NVSwitch |
把多张 NVLink GPU 连接成高带宽交换网络的芯片/系统 |
常见于 HGX/DGX 节点,可让多 GPU 通信拓扑更均匀;仍需要并行框架显式切分模型 |
| SXM |
NVIDIA 数据中心 GPU 的高功率模块形态,不是普通 PCIe 插卡 |
常与 NVLink/NVSwitch、高带宽和更高功率配置配套,需要专用服务器底板和散热 |
| PCIe GPU |
通过标准 PCIe 卡形态安装的 GPU |
部署灵活,但多卡互连、功率和散热能力取决于具体服务器 |
| HGX |
NVIDIA 面向服务器厂商的多 GPU 基板与参考平台 |
采购 B200/B300/H200 等集群时通常以完整 HGX 节点评估,不只计算“单卡价格” |
| DGX |
NVIDIA 提供的完整 AI 系统产品 |
包含 GPU、CPU、网络、存储与软件支持;口径不同于单卡或 HGX 基板 |
| MIG |
Multi-Instance GPU,把一张受支持的 GPU 隔离成多个硬件实例 |
适合小模型、多租户和稳定隔离;每个实例的显存、计算和引擎资源受切分规格限制 |
| GPU memory pooling |
多设备间以软件或互连组织内存使用 |
不代表所有显存都能像本地显存一样透明、等速访问,必须按引擎和模型实测 |
| BAR1 |
CPU 或其他设备映射 GPU 显存的地址窗口 |
大模型、GPU Direct 或虚拟化故障排查时可能相关,通常不是模型容量本身 |
拓扑与多节点网络
| 术语 |
含义 |
对部署的实际影响 |
| Topology |
GPU、CPU、内存、PCIe switch、NIC 之间的物理连接关系 |
相同卡数可能因连接路径不同产生明显性能差异,可先用 nvidia-smi topo -m 查看 |
| NUMA |
Non-Uniform Memory Access,多路 CPU 系统中不同内存区域访问代价不同 |
GPU 进程、CPU 线程和 NIC 跨 NUMA 节点可能降低数据加载与通信性能 |
| NIC |
Network Interface Card,网络接口卡 |
多节点训练/推理时要确认 GPU 到目标 NIC 的路径和带宽 |
| RDMA |
Remote Direct Memory Access,绕过较多 CPU 参与进行远程内存传输 |
降低多节点通信延迟和 CPU 开销,是高性能集群的重要基础能力 |
| InfiniBand |
面向高性能计算的低延迟高速网络 |
常用于大规模训练、多节点并行和存储网络,需同时关注交换网络与 RDMA 配置 |
| RoCE |
RDMA over Converged Ethernet,在以太网上实现 RDMA |
可复用以太网生态,但对无损网络、拥塞控制和交换机配置要求较高 |
| GPUDirect RDMA |
GPU 与远端网卡/设备间更直接的数据传输机制 |
减少 CPU 中转;需要 GPU、NIC、驱动、拓扑和软件栈共同支持 |
| NCCL |
NVIDIA Collective Communications Library,多 GPU 集合通信库 |
TP、DP 和分布式训练常依赖它;hang 或性能低时要检查拓扑、网卡和环境配置 |
| Collective communication |
AllReduce、AllGather、ReduceScatter、AllToAll 等多进程通信操作 |
不同并行策略产生不同通信模式;MoE 的 AllToAll 尤其依赖网络 |
| AllReduce |
汇总多个设备的数据并把结果发回各设备 |
数据并行梯度同步常用,慢节点或慢链路会拖慢整体 |
| AllToAll |
每个设备向其他多个设备交换不同数据 |
Expert Parallel 常见,对网络带宽、延迟和负载均衡敏感 |
| Oversubscription |
多个设备共享的上行带宽小于所有下行带宽之和 |
峰值并发通信时出现拥塞,不能只按单端口标称速率估算 |
| Gang scheduling |
一组分布式 worker 必须同时获得资源后再启动 |
避免多节点模型只拿到部分 GPU 后长期占用资源等待 |
PCIe、NVLink、NVSwitch 怎么区分
PCIe:通用设备总线
CPU <-> GPU
GPU <-> NIC / NVMe
GPU <-> GPU(可通信,但受 PCIe 路径限制)
NVLink:GPU 之间的专用高速链路
GPU <========> GPU
NVSwitch:把多张 NVLink GPU 接入交换网络
GPU ==\
GPU === NVSwitch === GPU
GPU ==/ GPU
常见误解
- “两张 24GB 卡就是一张 48GB 卡”:错误。模型框架必须执行 Tensor/Pipeline Parallel 或 offload,跨卡张量还会产生通信。
- “有 NVLink 就能合并显存”:不准确。NVLink 提供高速传输,如何放置权重和计算仍由 CUDA、框架与推理引擎决定。
- “插在两个 x16 插槽就是双 x16”:不一定。部分主板安装双卡后会变成 x8/x8,或经过共享 switch。
- “PCIe 卡一定没有 NVLink”:要按具体型号判断,不能只从卡的物理形态推断。
- “NVLink 带宽高,多卡一定更快”:小模型或低并发可能被通信和调度开销抵消;单卡能放下时通常先测单卡副本。
模型与推理
| 术语 |
含义 |
工程提示 |
| Foundation model |
在广泛数据上训练、可适配多任务的基础模型 |
仍需通过具体任务评测决定是否适用 |
| LLM / VLM |
大语言模型 / 视觉语言模型 |
VLM 还要计算视觉编码与图像 token 的资源 |
| Open weight |
权重可获取 |
不自动等于开源软件,也不代表无限制商用 |
| Parameter |
模型训练得到的权重数量,常以 B 表示十亿 |
Dense 与 MoE 的参数解释不同 |
| Dense model |
每个 token 大体使用全部模型参数的稠密模型 |
总参数和激活参数通常接近 |
| MoE |
Mixture of Experts,每个 token 只激活部分专家 |
显存通常仍需容纳全部驻留权重 |
| Token |
模型处理内容的基本单位 |
不等同于汉字、英文单词或字节 |
| Context window |
一次请求可处理的输入与输出 token 范围 |
标称上限不等于目标硬件可经济运行的长度 |
| Prefill |
并行处理输入上下文的阶段 |
主要影响 TTFT,长输入会增加计算量 |
| Decode |
逐 token 生成输出的阶段 |
常受显存带宽、批量和跨卡通信影响 |
| KV Cache |
保存注意力 Key/Value 的运行时缓存 |
随活跃 token 和并发增长,是服务容量关键项 |
| TTFT |
Time to First Token,从请求到首 token 的时间 |
包含排队、预处理与 prefill |
| TPOT |
Time per Output Token,首 token 后每个输出 token 的时间 |
用于衡量 decode 速度 |
| Throughput |
单位时间完成的请求数或生成 token 数 |
必须连同输入、输出和并发分布报告 |
| Quantization |
用更低数值精度表示权重、激活或 KV Cache |
节省资源不保证更快,必须重测质量 |
| FP16 / BF16 |
常见 16-bit 浮点格式 |
BF16 动态范围较大,支持情况依硬件 |
| FP8 / INT8 |
8-bit 浮点或整数格式 |
常用于推理,也可用于受支持硬件上的训练 |
| INT4 / 4-bit |
低位宽权重量化 |
理论权重约为 FP16 的四分之一,另有元数据和未量化层 |
| GGUF |
llama.cpp 生态常用模型文件格式 |
常见于本地 CPU/GPU 混合推理 |
| AWQ / GPTQ |
常见的校准式低位宽权重量化方法 |
引擎、GPU 和 kernel 支持决定实际性能 |
并行、调度与部署
| 术语 |
含义 |
工程提示 |
| Tensor Parallel / TP |
将同一层计算切分到多张 GPU |
频繁跨卡通信,优先使用高速互连 |
| Pipeline Parallel / PP |
将不同模型层放到不同 GPU 或节点 |
可能产生流水线气泡,偏向解决容量问题 |
| Data Parallel / DP |
多个完整模型副本处理不同请求或数据 |
适合模型单卡可放下时扩大吞吐 |
| Expert Parallel / EP |
把 MoE 专家分布到不同设备 |
常涉及 AllToAll 与专家负载不均 |
| Continuous batching |
动态把不同时间到达的请求组合执行 |
提高吞吐,但要观察交互请求 TTFT |
| PagedAttention |
以分页方式管理 KV Cache 的推理技术 |
减少碎片并提高缓存利用率,不消除总容量限制 |
| Prefix caching |
复用多个请求相同前缀的计算结果 |
只有前缀稳定且命中率足够时才有收益 |
| Speculative decoding |
小模型或预测头提出多个 token,再由目标模型验证 |
接受率决定收益,还会增加额外资源 |
| Admission control |
在请求进入推理队列前执行容量、配额和风险检查 |
防止无限排队与显存耗尽 |
| Model replica |
拥有完整或完整并行组的一份可服务模型 |
副本用于吞吐、故障隔离和滚动升级 |
| Cold start |
从无实例到模型加载完成并可服务的时间 |
大权重可能需要数分钟,扩缩容必须提前量 |
| Canary / 灰度 |
先把少量真实流量送到新版本 |
同时观察质量、性能、错误和成本 |
| Readiness probe |
判断实例当前是否能接收新请求 |
模型加载中或过载时应摘流 |
| Liveness probe |
判断进程是否需要被重启 |
不应使用容易被负载拖慢的深度推理探针 |
| MIG |
将支持的 GPU 切成隔离实例 |
适合多租户小模型,但不是所有工作负载都适合 |
RAG 与 Agent
| 术语 |
含义 |
| RAG |
Retrieval-Augmented Generation,检索增强生成 |
| Embedding |
将内容映射到向量,用于相似度检索等任务 |
| BM25 |
基于词项匹配和统计权重的经典关键词检索方法 |
| Hybrid retrieval |
组合关键词与向量召回 |
| Reranker |
对召回候选进行更精细的相关性排序 |
| Chunk |
从原始材料切出的可检索内容单元,应保留来源与权限 |
| Agent |
根据目标循环选择工具、执行、观察并继续或停止的系统 |
| Tool calling |
模型按 schema 提出函数或外部工具调用 |
| Idempotency |
同一写请求重复执行不会产生重复副作用的性质 |
训练、评测与运营
| 术语 |
含义 |
| SFT |
Supervised Fine-Tuning,监督微调 |
| LoRA |
通过低秩矩阵训练少量适配参数的方法 |
| QLoRA |
量化冻结基础模型后训练 LoRA adapter |
| DPO |
Direct Preference Optimization,用偏好对直接优化模型 |
| GRPO |
Group Relative Policy Optimization,使用组内相对奖励的优化方法 |
| Golden set |
经审核、版本化、用于回归的代表性评测集 |
| Grader |
根据确定性规则、模型或人工标准评判输出的组件 |
| P50 / P95 / P99 |
50%、95%、99% 请求不超过的指标分位点 |
| SLI |
Service Level Indicator,用于度量服务行为的实际指标 |
| SLO |
Service Level Objective,例如 P95 时延和可用性目标 |
| SLA |
Service Level Agreement,对外承诺并可能包含责任的服务协议 |
| PII |
Personally Identifiable Information,可识别个人身份的信息 |
| RTO |
Recovery Time Objective,故障后目标恢复时间 |
| RPO |
Recovery Point Objective,可接受的数据回退时间点 |
看到互连术语时怎么判断
| 场景 |
首先检查 |
不要直接下的结论 |
| 单卡能放下模型 |
单卡吞吐与副本扩展 |
多卡一定更快 |
| 同机 TP 性能低 |
nvidia-smi topo -m、NCCL 测试、NUMA |
GPU 算力不足 |
| 双消费卡工作站 |
插槽电气通道、间距、电源、PCIe 路径 |
显存可以无代价相加 |
| HGX 8 卡节点 |
NVSwitch 域、功率、散热、引擎支持 |
只按单卡参数估算节点性能 |
| 跨节点模型 |
RDMA、NIC、交换网络、NCCL、gang scheduling |
服务器数量翻倍,性能也翻倍 |
| MoE 多卡 |
EP 路由、AllToAll、专家负载 |
激活参数小,网络就不重要 |
官方参考