03 GPU 技术指标与选型方法论
03 GPU 技术指标与选型方法论
上一章认了产品和公司。这一章学怎么看一张卡的参数、怎么根据任务选卡。这是 AI Infra 工程师日常和企业/算法方对话的高频场景——「这个需求该用什么卡」。每个指标都会解释,不假设你懂。
3.1 必懂指标清单(带解读)
| 指标 | 含义 | 影响 |
|---|---|---|
| 算力(TFLOPS) | 每秒浮点运算次数(Tera = 万亿) | 算得快不快;注意分精度(见 3.2) |
| 精度 FP64/FP32/FP16/BF16/TF32/FP8/INT8 | 不同数值格式下的算力 | AI 多用 FP16/BF16/FP8,精度越低算力越高 |
| 显存容量(GB) | 能放下多大模型/数据 | 决定「能不能跑」 |
| 显存带宽(TB/s) | 数据搬运速度(Tera 字节/秒) | 决定「跑得畅不畅」,常是瓶颈 |
| 互联带宽(NVLink/IB) | 卡间/机间通信 | 多卡扩展效率 |
| TDP(功耗 W) | 整卡功耗 | 电费、散热、机柜密度 |
| 制程(nm) | 芯片工艺(纳米级) | 能效比 |
| MIG 支持 | 能否硬件切分 | 多团队共享能力 |
名词解释:
- TB/s(Tera Bytes per second):每秒万亿字节,带宽单位。1 TB/s = 1024 GB/s。
- nm(纳米):芯片制程的线宽,数字越小越先进(同样面积塞更多晶体管)。NVIDIA Blackwell 是 4nm,国产卡多在 7nm。
3.2 精度是什么(不用背公式,理解用途)
精度(Precision) 指一个数用多少比特(bit)来存储。比特越多越精确、但越占显存、算得越慢;比特越少越省显存、算得越快,但可能损失精度。
| 精度 | 全称 | 比特 | 用途 |
|---|---|---|---|
| FP64 | 双精度浮点 | 64 | 科学计算,AI 几乎不用 |
| FP32 | 单精度浮点 | 32 | 通用计算基准 |
| TF32 | TensorFloat-32 | 19(NVIDIA 自创) | NVIDIA Tensor Core 默认混合精度,省显存提速 |
| FP16 | 半精度 | 16 | 训练/推理常用 |
| BF16 | Brain Float 16 | 16 | 动态范围同 FP32、精度同 FP16,训练最稳,主流 |
| FP8 | 8 位浮点 | 8 | 新一代训练/推理,省一半显存带宽,Hopper/Blackwell 强化 |
| INT8 | 8 位整型 | 8 | 推理量化 |
| FP4 | 4 位浮点 | 4 | Blackwell 起强化,极致省显存 |
名词解释:
- 浮点数(Floating Point):用「尾数 + 指数」表示小数,能表示很大或很小的数。整型(Integer, INT) 只能表示整数。
- BF16(Brain Float 16):Google Brain 团队设计的 16 位格式,指数位和 FP32 一样多,所以「能表示的数值范围」和 FP32 相同,训练时不容易数值溢出——这是它比 FP16 训练更稳的原因。
⭐ 重点:精度越低,算力越高、越省显存,但可能损失精度。AI Infra 的推理优化大量围绕「用更低精度(FP8/INT8/4-bit)+ 量化」来提吞吐降成本。训练多用 BF16/FP16 保稳定。
⚠️ 内幕:同一张卡,FP16 算力往往是 FP32 的 2 倍,FP8 又是 FP16 的 2 倍。所以厂商宣传「算力 XX TFLOPS」时一定要看是哪个精度——用 FP4 拼出来的数字和 FP16 不在一个量级。面试时这是个常考的「数字陷阱」。
3.3 训练卡 vs 推理卡(核心区分)
| 维度 | 训练卡 | 推理卡 |
|---|---|---|
| 显存 | 大(80G+) | 中小即可 |
| 带宽 | 高 | 中高 |
| 算力 | 极高 | 够用即可 |
| 互联 | 必须强(NVLink/IB) | 可弱(单卡服务) |
| 典型 | A100/H100/H200/B200 | L4/L40S/T4、国产推理卡 |
| 关注点 | 能否放下模型+梯度+优化器 | 延迟、吞吐、成本/请求 |
经验法则:7B 模型推理单卡 L4 可;70B 推理需 H100/H200 级;预训练千亿模型需 H100/B200 八卡/百卡集群。
3.4 选型方法论(按三步走)
第一步:明确任务类型
- 预训练(Pretrain):从零训一个模型,吃显存+算力+互联 → 顶配训练卡(H100/B200 集群)。
- 微调(Finetune / SFT):在已有模型上继续训,比预训练省,但看模型大小 → A100 80G / H100。
- SFT(Supervised Fine-Tuning,监督微调):用「问题-答案」对教模型按指令回答。
- 推理(Serve):看 QPS 和延迟 → 性价比推理卡 + 量化。
- QPS(Queries Per Second,每秒查询数):吞吐指标。
第二步:看模型规模(粗略显存估算)
| 模型 | 推理最低显存(FP16) | 全参微调显存(含梯度/优化器) |
|---|---|---|
| 7B | ~14 GB | ~112 GB(多卡/ZeRO-3);LoRA 单卡可跑(~14–20 GB) |
| 13B | ~26 GB | ~200 GB+(多卡);LoRA 单卡 |
| 70B | ~140 GB | 多卡/ZeRO-3;LoRA 需较大显存卡 |
| 千亿级 | 数百 GB+ | 百卡集群 |
估算速算:推理显存 ≈ 参数量 × 2 字节(FP16);全参微调 ≈ 参数量 × 16 字节(AdamW 混合精度,含优化器状态,大头在此),所以 7B 全参微调约 112 GB、需多卡或 ZeRO/FSDP;想单卡就上 LoRA/QLoRA。
第三步:看预算与约束
- 有无出口管制限制(中国 → 特供版/国产)
- 单机多卡 vs 多机集群
- 国产替代要求(信创)?
3.5 成本模型(TCO 思维)
TCO(Total Cost of Ownership,总拥有成本) 不只看「一张卡多少钱」,要看全生命周期:
- 卡价:H100/H200/B200 波动大,以渠道/官方报价为准(不要死记数字)。参考量级:训一个 Llama 3 级模型用约 2.4 万张 H100,硬件花费约 7.2 亿美元。
- 集群成本:服务器、网络(IB/NVLink 交换机)、存储。
- 运维成本:电力(TDP×数量×电价)、散热、机房。液冷虽贵但高功耗卡必需。
- 利用率:同样投入,利用率从 30%→70%,等效算力翻倍 → 这就是调度器/qGPU 的价值。
- 隐性成本:国产卡适配工时、CUDA→CANN 迁移、人才稀缺溢价。
⭐ 重点:你作为 AI Infra 工程师,给企业省钱的最大杠杆是提高 GPU 利用率(调度、共享、虚拟化),而不是砍卡价。这也是元宝说的「利用率从 30% 提到 70%」的真正含义——后面
05/08/11都在服务这个目标。
3.6 选型实例(把方法用起来)
| 场景 | 推荐 | 理由 |
|---|---|---|
| 个人学分布式训练 | 1–2× RTX 4090 / 云 A100 | 小模型可跑,成本低 |
| 7B 模型推理服务 | L4 / 国产推理卡 | 性价比、够用 |
| 70B 微调 | A100 80G × 多卡 / H100 | 显存够、互联好 |
| 千亿模型预训练 | H100/H200/B200 百卡集群 + IB | 算力+互联+显存全要 |
| 信创合规训练 | 昇腾 910B/910C 集群 | 国产替代要求 |
| 中国受限场景 | H20 特供 + 国产混合 | 合规 + 补齐算力 |
3.7 ⭐ 异构集群选型的真实难点(中国场景)
在国内,你几乎不会遇到「纯 N 卡」的集群,真实场景是:
- 训练集群:可能 H800 + 昇腾 910B 混合,或纯昇腾(信创项目)。
- 推理集群:L40S + 国产推理卡 + 特供 H20 混合。
- 难点:不同卡算力/显存/互联差异大,调度器要「认卡」(GFD 标签,见
04);框架要适配多套软件栈(CUDA / CANN / ROCm);监控指标口径不一。
⚠️ 内幕:很多公司「卡多但用不好」的根因就是异构——算法方只懂 CUDA,国产卡算子缺失导致训不动/训得慢,最后卡闲置。能搞定异构适配的 AI Infra 工程师,在国内极稀缺、极值钱。这是你最大的差异化机会。
3.7 实战:GPU 选型决策模拟
3.7.1 选型模拟器
python3 -c "
cards = {'H100':(80,'N'),'H200':(141,'N'),'H20':(96,'N'),'A100':(80,'N'),'L40S':(48,'N'),'L4':(24,'N')}
def select(task,model,region='china'):
print(f'任务:{task} 模型:{model}B 地区:{region}')
for name,(mem,_) in cards.items():
need = model*(16 if task=='train' else 2)
fit = 'OK' if mem>=need else 'OOM'
print(f' {name:>6} mem={mem:>3}GB need={need:>3}GB {fit}')
select('inference',7)
select('train',70)
"
目的:把三步走选型变成可执行工具。面试被问 70B 推理用什么卡,能快速分析。
3.8 自测题
- 显存容量和显存带宽分别决定什么?哪个更常是瓶颈?
- BF16 相比 FP16 的优势?为什么训练爱用 BF16?
- FP8 为什么能在新一代卡上提速?厂商宣传算力时有什么「数字陷阱」?
- 训练卡和推理卡的核心区别?为什么推理卡对互联要求低?
- 估算 7B 模型 FP16 推理最少需要多少显存?微调为何要多倍?
- AI Infra 工程师「省钱」的最大杠杆是什么?为什么不是砍卡价?
- 给「70B 模型国内微调」和「7B 模型高并发推理」分别选卡,并说明理由。
- ⭐ 异构集群(N 卡 + 国产卡)选型与运维的真实难点是什么?
答上即可进入
04——正式从「硬件认知」跨入「K8s 怎么管 GPU」。