学习库/ AI Infra 转型/ 术语表与索引(AI Infra 学习资料)
🧠 AI Infra 转型 · 第 17 / 17 篇

术语表与索引(AI Infra 学习资料)

2957 字· 阅读约 7 分钟· 2026-08-23 更新

术语表与索引(AI Infra 学习资料)

配套 0013 系统教材。本文件提供术语速查文件索引 + 学习进度追踪。本套资料的规矩是「每个技术名词第一次出现都解释」,遇到陌生词回来查。

⏱️ 数据截至 2026-08。


一、术语速查(按主题分组)

AI / ML 基础(01 补课)

术语 一句话解释 见章节
AI / ML 人工智能 / 机器学习,让机器从数据学规律 01.0
神经网络(NN) 层层相连的计算单元,灵感来自大脑神经元 01.0
LLM 大语言模型,超大神经网络,参数达数十亿~千亿 01.0
参数 / 权重 神经网络里要学的数值 01.0
张量(Tensor) 多维数组,GPU 计算的基本数据单元 01.0
batch(批量) 一次喂给模型的一组样本 01.0
epoch 训练数据完整过一遍 01.0
checkpoint 训练中途存盘的模型状态,崩了能恢复 01.0/12.4
token 大模型处理文本的最小单位 01.0
训练 / 推理 学参数 / 用模型预测 01.0
前向 / 反向传播 算输出 / 从 Loss 往回算梯度 01.0
Loss(损失) 预测与正确答案的误差 01.0
梯度(Gradient) 参数该往哪调、调多少的方向 01.0
优化器(Optimizer) 按梯度更新参数的算法(如 AdamW) 01.0
激活值(Activation) 前向时每层中间输出 01.0
矩阵乘法(MatMul) AI 计算的本质运算 01.0
注意力(Attention) Transformer 核心机制,让模型关注重要部分 10.2
Transformer 当今大模型核心网络架构 02.2
SFT 监督微调,用问答对教模型按指令回答 03.4

GPU 硬件基础(01-03)

术语 一句话解释 见章节
GPU 大规模并行处理器,AI 计算主力 01.1
CPU 中央处理器,擅长串行复杂逻辑 01.1
CUDA Core GPU 通用计算核心(海量) 01.3
Tensor Core 专做矩阵乘加的核心,AI 灵魂 01.3
显存 / HBM GPU 专属高速内存,容量决定能放多大模型 01.3
显存带宽 显存↔核心搬运速度,常是真实瓶颈 01.3
NVLink / NVSwitch N 卡间/节点内高速互联 01.3/09.6
SIMT 单指令多线程,GPU 并行基础 01.2
warp GPU 线程束(通常 32 线程),同步执行 01.2
SM 流多处理器,GPU 执行单元 05.3/11.5
GPC 图形处理簇,GPU 模块化计算单元(一组 SM),MIG 的计算切片 05.3
L2 Cache GPU 片上缓存 01.3
TDP 热设计功耗,散热要应对的最大功耗 01.3
DRAM 动态随机存取内存(系统内存条) 01.2
HBM2e/HBM3/HBM3e HBM 不同代际,越新越快 02.2
SXM / PCIe NVIDIA 服务器形态 / 通用总线接口 02.2
MMA 矩阵乘加,Tensor Core 一条指令完成 01.3
kernel GPU 上执行的一个并行函数 11.2
TFLOPS 每秒万亿次浮点运算,算力单位 01.6
TB/s 每秒万亿字节,带宽单位 03.1
制程(nm) 芯片工艺线宽,越小越先进 03.1

精度与量化(03/10)

术语 一句话解释 见章节
精度(Precision) 一个数用多少比特存 03.2
FP32/FP16/BF16/FP8/FP4 单精度/半/Brain Float/8位/4位浮点 03.2
TF32 NVIDIA 自创中间精度 03.2
INT8 8 位整型,推理量化 03.2
混合精度 训练用 FP16/BF16 算 + FP32 存主副本 01.5
量化(Quantization) 用更低精度省显存提速 10.2
AWQ / GPTQ 激活感知/二阶信息 4-bit 量化 10.2
LoRA / QLoRA 低秩适配器微调 / +4-bit 量化基座 01.5
ZeRO-3 / FSDP 参数全分片,省显存跑大模型 09.4

K8s 接入与虚拟化(04-05)

术语 一句话解释 见章节
Device Plugin K8s 扩展点,把 GPU 注册为扩展资源 04.2
GPU Operator NVIDIA 一键管理驱动/device-plugin/GFD/DCGM 的 Operator( device-plugin) 04.3
CRD 自定义资源定义,K8s 扩展 API 04.3
gRPC Google 高性能远程调用框架 04.2
DaemonSet K8s 里每节点一个副本的工作负载 04.2
GFD GPU Feature Discovery,自动给节点打 GPU 标签 04.6
节点亲和性 / 污点 让 Pod 调到特定节点 / 排除节点 04.6
异构硬件 和通用 CPU 不同的专用硬件 04.1
MIG 硬件级 GPU 切分(A100/H100 最多 7 实例) 05.3
GI / CI GPU Instance(物理隔离边界)/ 其内再分的 Compute Instance 05.3
空间切分 / 时间复用 GPU 共享的两条基本路线(切资源 / 切时间) 05.2
vGPU / mediated passthrough 驱动级虚拟化,Hypervisor 侧中介直通给 VM 05.5
qGPU / Elastic GPU 腾讯 TKE 内核级容器虚拟化 / 其开源 CRD 框架 05.6
MPS 时间片复用,无隔离 05.7

调度(06-08)

术语 一句话解释 见章节
kube-scheduler K8s 默认调度器 06.1
Scheduler Framework 调度器扩展点(Filter/Score/QueueSort…) 06.3
Filter / Score 硬约束过滤 / 最优打分 06.2
抢占(Preemption) 高优 Pod 驱逐低优腾位 06.2
Scheduler Extender 调度器外部 HTTP 扩展(如 qGPU) 06.4
Gang Scheduling 整组 Pod 同时到位才启动,否则全等 07.3
PodGroup Volcano 里把多 Pod 绑成一组的 CRD(Gang 载体) 07.2
Volcano CNCF 批处理调度(Queue/Job/PodGroup/Gang) 07.2
公平份额(Fair Share) 按权重瓜分资源 07.4
binpack / spread 装箱集中 / 打散容错 07.4
NUMA 非一致内存访问,跨 NUMA 慢 07.4
在离线混部(Colocation) 在线+离线跑同集群提利用率 08.1
干扰隔离 在线忙时压制离线,保在线延迟 08.5
Kueue K8s 原生队列/配额/抢占系统 08.4
Koordinator 阿里开源,在离线混部标准答案 08.5
YuniKorn Apache 多租户批调度,可接管集群调度 08.6
Gödel 字节在离线统一调度,乐观并发高吞吐 08.2
乐观并发 先并行干、提交时检查冲突 08.2
YARN Hadoop 资源调度器 08.6

训练与通信(09)

术语 一句话解释 见章节
DDP 数据并行,每卡完整模型+梯度 AllReduce 09.4
FSDP 参数分片数据并行(ZeRO 思想) 09.4
ZeRO 优化器/梯度/参数分片(DeepSpeed) 09.4
Megatron-LM NVIDIA 三维并行(TP+PP+DP)训练框架 09.5
TP / PP 张量并行 / 流水线并行 09.4
micro-batch / 气泡 流水线小份 / 流水线空等 09.4
Parameter Server 老的分布式训练参数服务架构(已淘汰) 09.4
NCCL GPU 间集合通信库(AllReduce/AllGather…) 09.6
AllReduce / AllGather / ReduceScatter 求和广播 / 收集分片 / 求和分散 09.6
InfiniBand (IB) / RoCE / RDMA 机间高速互联 / 以太网跑 RDMA / 远程直接内存访问 09.6
WORLD_SIZE / RANK / MASTER_ADDR 分布式训练环境变量 09.7
torchrun PyTorch 内置分布式启动器 09.7
Kubeflow Training Operator K8s 训练编排(PyTorchJob/MPIJob…) 09.8
Ray 分布式计算框架(Ray Train / Ray Serve) 09.8
MPI / horovod HPC 通信标准 / 基于 MPI 的训练库 09.8

推理与服务化(10)

术语 一句话解释 见章节
KV Cache 推理时缓存注意力历史 K/V,省重复计算 10.2
PagedAttention vLLM 分页管理 KV Cache,提显存利用率 10.2
连续批处理 请求逐个流入的批处理,提吞吐 10.2
TTFT / QPS 首 token 延迟 / 每秒查询数 10.1
流式输出(SSE/WebSocket) 逐 token 返回 10.1
vLLM / SGLang / TensorRT-LLM 主流大模型推理框架 10.3
RadixAttention / 前缀缓存 SGLang 基数树组织 KV,共享前缀 10.3
投机解码 小模型猜+大模型验,不损质降延迟 10.2
TGI / Triton / KServe / Seldon HF推理服务 / NVIDIA多框架推理服务器 / K8s原生推理 / 复杂推理图 10.4
Knative K8s Serverless 框架,支持缩到 0 10.4
ONNX 跨框架模型交换格式 10.4
推理/训练分离(Disaggregated) prefill 与 decode 拆不同 GPU 池 10.6

可观测与调优(11)

术语 一句话解释 见章节
DCGM / DCGM-Exporter NVIDIA GPU 遥测库 / Prometheus 指标暴露 11.2
nvidia-smi NVIDIA 命令行 GPU 状态查看 11.2
SM 占用率(occupancy) SM 上活跃线程比例 11.5
算子融合(Operator Fusion) 多小算子合一,减显存读写 11.5
FlashAttention IO 感知注意力,降显存提速度 11.5
materialize 把中间结果实际写显存 11.5
Nsight Systems/Compute NVIDIA 时间线/单 kernel 剖析 11.6
torch.profiler / py-spy PyTorch 算子耗时 / 无侵入 Python 栈 11.6
torch.compile / XLA / Triton PyTorch JIT / Google 编译器 / 易写 GPU 语言 11.5
LayerNorm / 激活函数 层归一化 / 加非线性(如 ReLU) 11.5

平台与综合(12-13)

术语 一句话解释 见章节
TI-ONE / PAI / 百舸 / 火山方舟 腾讯/阿里/百度/字节 AI 平台 12.8
并行文件系统(Lustre/WEKA/3FS/JuiceFS) 高吞吐并行读写文件系统 12.5
Spot 实例 云上便宜但可被抢占的实例 12.4
GPU-hour 一张 GPU 用一小时的计费单位 12.6
KFP Kubeflow Pipelines,自动化 ML 流水线 12.8
TCO 总拥有成本 03.5
GPU-as-a-Service 算力即服务,按需申请 GPU 00.2

厂商与行业(02)

术语 一句话解释 见章节
CUDA NVIDIA 并行计算平台,其护城河 01.3/02.8
ROCm AMD 对标 CUDA 的软件栈 02.3
CANN / 昇思(MindSpore) 华为昇腾软件栈 / 深度学习框架 02.5
信创 信息技术应用创新(国产替代政策) 02.5
ASIC / FPGA 专用集成电路 / 可编程门阵列 02.4
TPU / Trainium / Inferentia Google / AWS 训练 / AWS 推理 ASIC 02.9
JAX / XLA / Neuron Google 框架 / 编译器 / AWS ASIC SDK 02.9
出口管制 美国限制高端 AI 芯片对华销售的政策 02.7
中国特供版(H20/L20/L2) 因管制降规的 NVIDIA 中国版 02.2
Transformer 引擎 Hopper 起内置的自动精度选择硬件单元 02.2
cuDNN / TensorRT NVIDIA 深度学习算子库 / 推理加速库 02.8
Ultra Ethernet Consortium 超以太网联盟,搞开源高速以太网替代 IB 09.6

二、文件索引

编号 文件 阶段 主题
00 学习总纲与路线图 路径/里程碑/行业现实/AI Infra 是什么
01 GPU 硬件基础与核心概念 AI/ML 基础速成 + GPU 是什么、显存拆解
02 GPU 厂商产品全景与市场格局 N/AMD/国产/TPU、份额、管制、2026 内幕
03 GPU 技术指标与选型方法论 精度/指标/选型/TCO/异构难点
04 K8s GPU 资源接入层 Device Plugin / GPU Operator / 多厂商
05 MIG 与 GPU 虚拟化 MIG / qGPU / vGPU / MPS
06 K8s 调度器原理 Scheduler Framework / Extender
07 Volcano 实战 Gang / Queue / 源码
08 工业级调度器 Gödel/qGPU/Kueue/Koordinator/YuniKorn
09 分布式训练框架 并行/ZeRO/Megatron/NCCL/Kubeflow/Ray
10 推理框架与服务化 vLLM/SGLang/量化/投机解码/KServe
11 GPU 可观测与性能调优 DCGM/Prometheus/排查/Nsight/FlashAttention
12 搭建迷你 TI-ONE 平台实战 平台全景图/容错/存储/多租户/对照
13 面试准备与职业发展 知识域/高频题/话术/简历/2026 岗位
AI-Infra转岗指南-格桑.md 配套 速览/纠错汇总/项目骨架
术语表与索引.md 配套 本文件

三、学习进度追踪(自行勾选)

[ ] 00 总纲与行业现实
[ ] 01 GPU 硬件基础(含 AI/ML 速成)
[ ] 02 厂商与格局(含 TPU/Trainium/2026 内幕)
[ ] 03 指标与选型
[ ] 04 K8s GPU 接入
[ ] 05 MIG 与虚拟化
[ ] 06 调度器原理
[ ] 07 Volcano 实战
[ ] 08 工业级调度器
[ ] 09 分布式训练框架
[ ] 10 推理服务化
[ ] 11 可观测与调优
[ ] 12 迷你 TI-ONE 实战
[ ] 13 面试准备
[ ] 配套 转岗指南 / 术语表

全部勾选 + 跑通 12 项目 = 达到「能讲清全链路 + 有可演示平台」的面试水准。

← 返回专栏