术语表与索引(AI Infra 学习资料)
配套 00–13 系统教材。本文件提供术语速查与文件索引 + 学习进度追踪。本套资料的规矩是「每个技术名词第一次出现都解释」,遇到陌生词回来查。
⏱️ 数据截至 2026-08。
一、术语速查(按主题分组)
AI / ML 基础(01 补课)
| 术语 |
一句话解释 |
见章节 |
| AI / ML |
人工智能 / 机器学习,让机器从数据学规律 |
01.0 |
| 神经网络(NN) |
层层相连的计算单元,灵感来自大脑神经元 |
01.0 |
| LLM |
大语言模型,超大神经网络,参数达数十亿~千亿 |
01.0 |
| 参数 / 权重 |
神经网络里要学的数值 |
01.0 |
| 张量(Tensor) |
多维数组,GPU 计算的基本数据单元 |
01.0 |
| batch(批量) |
一次喂给模型的一组样本 |
01.0 |
| epoch |
训练数据完整过一遍 |
01.0 |
| checkpoint |
训练中途存盘的模型状态,崩了能恢复 |
01.0/12.4 |
| token |
大模型处理文本的最小单位 |
01.0 |
| 训练 / 推理 |
学参数 / 用模型预测 |
01.0 |
| 前向 / 反向传播 |
算输出 / 从 Loss 往回算梯度 |
01.0 |
| Loss(损失) |
预测与正确答案的误差 |
01.0 |
| 梯度(Gradient) |
参数该往哪调、调多少的方向 |
01.0 |
| 优化器(Optimizer) |
按梯度更新参数的算法(如 AdamW) |
01.0 |
| 激活值(Activation) |
前向时每层中间输出 |
01.0 |
| 矩阵乘法(MatMul) |
AI 计算的本质运算 |
01.0 |
| 注意力(Attention) |
Transformer 核心机制,让模型关注重要部分 |
10.2 |
| Transformer |
当今大模型核心网络架构 |
02.2 |
| SFT |
监督微调,用问答对教模型按指令回答 |
03.4 |
GPU 硬件基础(01-03)
| 术语 |
一句话解释 |
见章节 |
| GPU |
大规模并行处理器,AI 计算主力 |
01.1 |
| CPU |
中央处理器,擅长串行复杂逻辑 |
01.1 |
| CUDA Core |
GPU 通用计算核心(海量) |
01.3 |
| Tensor Core |
专做矩阵乘加的核心,AI 灵魂 |
01.3 |
| 显存 / HBM |
GPU 专属高速内存,容量决定能放多大模型 |
01.3 |
| 显存带宽 |
显存↔核心搬运速度,常是真实瓶颈 |
01.3 |
| NVLink / NVSwitch |
N 卡间/节点内高速互联 |
01.3/09.6 |
| SIMT |
单指令多线程,GPU 并行基础 |
01.2 |
| warp |
GPU 线程束(通常 32 线程),同步执行 |
01.2 |
| SM |
流多处理器,GPU 执行单元 |
05.3/11.5 |
| GPC |
图形处理簇,GPU 模块化计算单元(一组 SM),MIG 的计算切片 |
05.3 |
| L2 Cache |
GPU 片上缓存 |
01.3 |
| TDP |
热设计功耗,散热要应对的最大功耗 |
01.3 |
| DRAM |
动态随机存取内存(系统内存条) |
01.2 |
| HBM2e/HBM3/HBM3e |
HBM 不同代际,越新越快 |
02.2 |
| SXM / PCIe |
NVIDIA 服务器形态 / 通用总线接口 |
02.2 |
| MMA |
矩阵乘加,Tensor Core 一条指令完成 |
01.3 |
| kernel |
GPU 上执行的一个并行函数 |
11.2 |
| TFLOPS |
每秒万亿次浮点运算,算力单位 |
01.6 |
| TB/s |
每秒万亿字节,带宽单位 |
03.1 |
| 制程(nm) |
芯片工艺线宽,越小越先进 |
03.1 |
精度与量化(03/10)
| 术语 |
一句话解释 |
见章节 |
| 精度(Precision) |
一个数用多少比特存 |
03.2 |
| FP32/FP16/BF16/FP8/FP4 |
单精度/半/Brain Float/8位/4位浮点 |
03.2 |
| TF32 |
NVIDIA 自创中间精度 |
03.2 |
| INT8 |
8 位整型,推理量化 |
03.2 |
| 混合精度 |
训练用 FP16/BF16 算 + FP32 存主副本 |
01.5 |
| 量化(Quantization) |
用更低精度省显存提速 |
10.2 |
| AWQ / GPTQ |
激活感知/二阶信息 4-bit 量化 |
10.2 |
| LoRA / QLoRA |
低秩适配器微调 / +4-bit 量化基座 |
01.5 |
| ZeRO-3 / FSDP |
参数全分片,省显存跑大模型 |
09.4 |
K8s 接入与虚拟化(04-05)
| 术语 |
一句话解释 |
见章节 |
| Device Plugin |
K8s 扩展点,把 GPU 注册为扩展资源 |
04.2 |
| GPU Operator |
NVIDIA 一键管理驱动/device-plugin/GFD/DCGM 的 Operator(含 device-plugin) |
04.3 |
| CRD |
自定义资源定义,K8s 扩展 API |
04.3 |
| gRPC |
Google 高性能远程调用框架 |
04.2 |
| DaemonSet |
K8s 里每节点一个副本的工作负载 |
04.2 |
| GFD |
GPU Feature Discovery,自动给节点打 GPU 标签 |
04.6 |
| 节点亲和性 / 污点 |
让 Pod 调到特定节点 / 排除节点 |
04.6 |
| 异构硬件 |
和通用 CPU 不同的专用硬件 |
04.1 |
| MIG |
硬件级 GPU 切分(A100/H100 最多 7 实例) |
05.3 |
| GI / CI |
GPU Instance(物理隔离边界)/ 其内再分的 Compute Instance |
05.3 |
| 空间切分 / 时间复用 |
GPU 共享的两条基本路线(切资源 / 切时间) |
05.2 |
| vGPU / mediated passthrough |
驱动级虚拟化,Hypervisor 侧中介直通给 VM |
05.5 |
| qGPU / Elastic GPU |
腾讯 TKE 内核级容器虚拟化 / 其开源 CRD 框架 |
05.6 |
| MPS |
时间片复用,无隔离 |
05.7 |
调度(06-08)
| 术语 |
一句话解释 |
见章节 |
| kube-scheduler |
K8s 默认调度器 |
06.1 |
| Scheduler Framework |
调度器扩展点(Filter/Score/QueueSort…) |
06.3 |
| Filter / Score |
硬约束过滤 / 最优打分 |
06.2 |
| 抢占(Preemption) |
高优 Pod 驱逐低优腾位 |
06.2 |
| Scheduler Extender |
调度器外部 HTTP 扩展(如 qGPU) |
06.4 |
| Gang Scheduling |
整组 Pod 同时到位才启动,否则全等 |
07.3 |
| PodGroup |
Volcano 里把多 Pod 绑成一组的 CRD(Gang 载体) |
07.2 |
| Volcano |
CNCF 批处理调度(Queue/Job/PodGroup/Gang) |
07.2 |
| 公平份额(Fair Share) |
按权重瓜分资源 |
07.4 |
| binpack / spread |
装箱集中 / 打散容错 |
07.4 |
| NUMA |
非一致内存访问,跨 NUMA 慢 |
07.4 |
| 在离线混部(Colocation) |
在线+离线跑同集群提利用率 |
08.1 |
| 干扰隔离 |
在线忙时压制离线,保在线延迟 |
08.5 |
| Kueue |
K8s 原生队列/配额/抢占系统 |
08.4 |
| Koordinator |
阿里开源,在离线混部标准答案 |
08.5 |
| YuniKorn |
Apache 多租户批调度,可接管集群调度 |
08.6 |
| Gödel |
字节在离线统一调度,乐观并发高吞吐 |
08.2 |
| 乐观并发 |
先并行干、提交时检查冲突 |
08.2 |
| YARN |
Hadoop 资源调度器 |
08.6 |
训练与通信(09)
| 术语 |
一句话解释 |
见章节 |
| DDP |
数据并行,每卡完整模型+梯度 AllReduce |
09.4 |
| FSDP |
参数分片数据并行(ZeRO 思想) |
09.4 |
| ZeRO |
优化器/梯度/参数分片(DeepSpeed) |
09.4 |
| Megatron-LM |
NVIDIA 三维并行(TP+PP+DP)训练框架 |
09.5 |
| TP / PP |
张量并行 / 流水线并行 |
09.4 |
| micro-batch / 气泡 |
流水线小份 / 流水线空等 |
09.4 |
| Parameter Server |
老的分布式训练参数服务架构(已淘汰) |
09.4 |
| NCCL |
GPU 间集合通信库(AllReduce/AllGather…) |
09.6 |
| AllReduce / AllGather / ReduceScatter |
求和广播 / 收集分片 / 求和分散 |
09.6 |
| InfiniBand (IB) / RoCE / RDMA |
机间高速互联 / 以太网跑 RDMA / 远程直接内存访问 |
09.6 |
| WORLD_SIZE / RANK / MASTER_ADDR |
分布式训练环境变量 |
09.7 |
| torchrun |
PyTorch 内置分布式启动器 |
09.7 |
| Kubeflow Training Operator |
K8s 训练编排(PyTorchJob/MPIJob…) |
09.8 |
| Ray |
分布式计算框架(Ray Train / Ray Serve) |
09.8 |
| MPI / horovod |
HPC 通信标准 / 基于 MPI 的训练库 |
09.8 |
推理与服务化(10)
| 术语 |
一句话解释 |
见章节 |
| KV Cache |
推理时缓存注意力历史 K/V,省重复计算 |
10.2 |
| PagedAttention |
vLLM 分页管理 KV Cache,提显存利用率 |
10.2 |
| 连续批处理 |
请求逐个流入的批处理,提吞吐 |
10.2 |
| TTFT / QPS |
首 token 延迟 / 每秒查询数 |
10.1 |
| 流式输出(SSE/WebSocket) |
逐 token 返回 |
10.1 |
| vLLM / SGLang / TensorRT-LLM |
主流大模型推理框架 |
10.3 |
| RadixAttention / 前缀缓存 |
SGLang 基数树组织 KV,共享前缀 |
10.3 |
| 投机解码 |
小模型猜+大模型验,不损质降延迟 |
10.2 |
| TGI / Triton / KServe / Seldon |
HF推理服务 / NVIDIA多框架推理服务器 / K8s原生推理 / 复杂推理图 |
10.4 |
| Knative |
K8s Serverless 框架,支持缩到 0 |
10.4 |
| ONNX |
跨框架模型交换格式 |
10.4 |
| 推理/训练分离(Disaggregated) |
prefill 与 decode 拆不同 GPU 池 |
10.6 |
可观测与调优(11)
| 术语 |
一句话解释 |
见章节 |
| DCGM / DCGM-Exporter |
NVIDIA GPU 遥测库 / Prometheus 指标暴露 |
11.2 |
| nvidia-smi |
NVIDIA 命令行 GPU 状态查看 |
11.2 |
| SM 占用率(occupancy) |
SM 上活跃线程比例 |
11.5 |
| 算子融合(Operator Fusion) |
多小算子合一,减显存读写 |
11.5 |
| FlashAttention |
IO 感知注意力,降显存提速度 |
11.5 |
| materialize |
把中间结果实际写显存 |
11.5 |
| Nsight Systems/Compute |
NVIDIA 时间线/单 kernel 剖析 |
11.6 |
| torch.profiler / py-spy |
PyTorch 算子耗时 / 无侵入 Python 栈 |
11.6 |
| torch.compile / XLA / Triton |
PyTorch JIT / Google 编译器 / 易写 GPU 语言 |
11.5 |
| LayerNorm / 激活函数 |
层归一化 / 加非线性(如 ReLU) |
11.5 |
平台与综合(12-13)
| 术语 |
一句话解释 |
见章节 |
| TI-ONE / PAI / 百舸 / 火山方舟 |
腾讯/阿里/百度/字节 AI 平台 |
12.8 |
| 并行文件系统(Lustre/WEKA/3FS/JuiceFS) |
高吞吐并行读写文件系统 |
12.5 |
| Spot 实例 |
云上便宜但可被抢占的实例 |
12.4 |
| GPU-hour |
一张 GPU 用一小时的计费单位 |
12.6 |
| KFP |
Kubeflow Pipelines,自动化 ML 流水线 |
12.8 |
| TCO |
总拥有成本 |
03.5 |
| GPU-as-a-Service |
算力即服务,按需申请 GPU |
00.2 |
厂商与行业(02)
| 术语 |
一句话解释 |
见章节 |
| CUDA |
NVIDIA 并行计算平台,其护城河 |
01.3/02.8 |
| ROCm |
AMD 对标 CUDA 的软件栈 |
02.3 |
| CANN / 昇思(MindSpore) |
华为昇腾软件栈 / 深度学习框架 |
02.5 |
| 信创 |
信息技术应用创新(国产替代政策) |
02.5 |
| ASIC / FPGA |
专用集成电路 / 可编程门阵列 |
02.4 |
| TPU / Trainium / Inferentia |
Google / AWS 训练 / AWS 推理 ASIC |
02.9 |
| JAX / XLA / Neuron |
Google 框架 / 编译器 / AWS ASIC SDK |
02.9 |
| 出口管制 |
美国限制高端 AI 芯片对华销售的政策 |
02.7 |
| 中国特供版(H20/L20/L2) |
因管制降规的 NVIDIA 中国版 |
02.2 |
| Transformer 引擎 |
Hopper 起内置的自动精度选择硬件单元 |
02.2 |
| cuDNN / TensorRT |
NVIDIA 深度学习算子库 / 推理加速库 |
02.8 |
| Ultra Ethernet Consortium |
超以太网联盟,搞开源高速以太网替代 IB |
09.6 |
二、文件索引
| 编号 |
文件 |
阶段 |
主题 |
| 00 |
学习总纲与路线图 |
— |
路径/里程碑/行业现实/AI Infra 是什么 |
| 01 |
GPU 硬件基础与核心概念 |
一 |
AI/ML 基础速成 + GPU 是什么、显存拆解 |
| 02 |
GPU 厂商产品全景与市场格局 |
一 |
N/AMD/国产/TPU、份额、管制、2026 内幕 |
| 03 |
GPU 技术指标与选型方法论 |
一 |
精度/指标/选型/TCO/异构难点 |
| 04 |
K8s GPU 资源接入层 |
二 |
Device Plugin / GPU Operator / 多厂商 |
| 05 |
MIG 与 GPU 虚拟化 |
二 |
MIG / qGPU / vGPU / MPS |
| 06 |
K8s 调度器原理 |
二 |
Scheduler Framework / Extender |
| 07 |
Volcano 实战 |
二 |
Gang / Queue / 源码 |
| 08 |
工业级调度器 |
二 |
Gödel/qGPU/Kueue/Koordinator/YuniKorn |
| 09 |
分布式训练框架 |
三 |
并行/ZeRO/Megatron/NCCL/Kubeflow/Ray |
| 10 |
推理框架与服务化 |
三 |
vLLM/SGLang/量化/投机解码/KServe |
| 11 |
GPU 可观测与性能调优 |
三 |
DCGM/Prometheus/排查/Nsight/FlashAttention |
| 12 |
搭建迷你 TI-ONE 平台实战 |
四 |
平台全景图/容错/存储/多租户/对照 |
| 13 |
面试准备与职业发展 |
四 |
知识域/高频题/话术/简历/2026 岗位 |
| 附 |
AI-Infra转岗指南-格桑.md |
配套 |
速览/纠错汇总/项目骨架 |
| 附 |
术语表与索引.md |
配套 |
本文件 |
三、学习进度追踪(自行勾选)
[ ] 00 总纲与行业现实
[ ] 01 GPU 硬件基础(含 AI/ML 速成)
[ ] 02 厂商与格局(含 TPU/Trainium/2026 内幕)
[ ] 03 指标与选型
[ ] 04 K8s GPU 接入
[ ] 05 MIG 与虚拟化
[ ] 06 调度器原理
[ ] 07 Volcano 实战
[ ] 08 工业级调度器
[ ] 09 分布式训练框架
[ ] 10 推理服务化
[ ] 11 可观测与调优
[ ] 12 迷你 TI-ONE 实战
[ ] 13 面试准备
[ ] 配套 转岗指南 / 术语表
全部勾选 + 跑通 12 项目 = 达到「能讲清全链路 + 有可演示平台」的面试水准。