学习库/ AI Infra 转型/ 03 · 03 GPU 技术指标与选型方法论
🧠 AI Infra 转型 · 第 4 / 17 篇

03 GPU 技术指标与选型方法论

2140 字· 阅读约 5 分钟· 2026-08-23 更新

03 GPU 技术指标与选型方法论

上一章认了产品和公司。这一章学怎么看一张卡的参数、怎么根据任务选卡。这是 AI Infra 工程师日常和企业/算法方对话的高频场景——「这个需求该用什么卡」。每个指标都会解释,不假设你懂。


3.1 必懂指标清单(带解读)

指标 含义 影响
算力(TFLOPS) 每秒浮点运算次数(Tera = 万亿) 算得快不快;注意分精度(见 3.2)
精度 FP64/FP32/FP16/BF16/TF32/FP8/INT8 不同数值格式下的算力 AI 多用 FP16/BF16/FP8,精度越低算力越高
显存容量(GB) 能放下多大模型/数据 决定「能不能跑」
显存带宽(TB/s) 数据搬运速度(Tera 字节/秒) 决定「跑得畅不畅」,常是瓶颈
互联带宽(NVLink/IB) 卡间/机间通信 多卡扩展效率
TDP(功耗 W) 整卡功耗 电费、散热、机柜密度
制程(nm) 芯片工艺(纳米级) 能效比
MIG 支持 能否硬件切分 多团队共享能力

名词解释

  • TB/s(Tera Bytes per second):每秒万亿字节,带宽单位。1 TB/s = 1024 GB/s。
  • nm(纳米):芯片制程的线宽,数字越小越先进(同样面积塞更多晶体管)。NVIDIA Blackwell 是 4nm,国产卡多在 7nm。

3.2 精度是什么(不用背公式,理解用途)

精度(Precision) 指一个数用多少比特(bit)来存储。比特越多越精确、但越占显存、算得越慢;比特越少越省显存、算得越快,但可能损失精度。

精度 全称 比特 用途
FP64 双精度浮点 64 科学计算,AI 几乎不用
FP32 单精度浮点 32 通用计算基准
TF32 TensorFloat-32 19(NVIDIA 自创) NVIDIA Tensor Core 默认混合精度,省显存提速
FP16 半精度 16 训练/推理常用
BF16 Brain Float 16 16 动态范围同 FP32、精度同 FP16,训练最稳,主流
FP8 8 位浮点 8 新一代训练/推理,省一半显存带宽,Hopper/Blackwell 强化
INT8 8 位整型 8 推理量化
FP4 4 位浮点 4 Blackwell 起强化,极致省显存

名词解释

  • 浮点数(Floating Point):用「尾数 + 指数」表示小数,能表示很大或很小的数。整型(Integer, INT) 只能表示整数。
  • BF16(Brain Float 16):Google Brain 团队设计的 16 位格式,指数位和 FP32 一样多,所以「能表示的数值范围」和 FP32 相同,训练时不容易数值溢出——这是它比 FP16 训练更稳的原因。

重点精度越低,算力越高、越省显存,但可能损失精度。AI Infra 的推理优化大量围绕「用更低精度(FP8/INT8/4-bit)+ 量化」来提吞吐降成本。训练多用 BF16/FP16 保稳定。

⚠️ 内幕:同一张卡,FP16 算力往往是 FP32 的 2 倍,FP8 又是 FP16 的 2 倍。所以厂商宣传「算力 XX TFLOPS」时一定要看是哪个精度——用 FP4 拼出来的数字和 FP16 不在一个量级。面试时这是个常考的「数字陷阱」。


3.3 训练卡 vs 推理卡(核心区分)

维度 训练卡 推理卡
显存 大(80G+) 中小即可
带宽 中高
算力 极高 够用即可
互联 必须强(NVLink/IB) 可弱(单卡服务)
典型 A100/H100/H200/B200 L4/L40S/T4、国产推理卡
关注点 能否放下模型+梯度+优化器 延迟、吞吐、成本/请求

经验法则:7B 模型推理单卡 L4 可;70B 推理需 H100/H200 级;预训练千亿模型需 H100/B200 八卡/百卡集群


3.4 选型方法论(按三步走)

第一步:明确任务类型

  • 预训练(Pretrain):从零训一个模型,吃显存+算力+互联 → 顶配训练卡(H100/B200 集群)。
  • 微调(Finetune / SFT):在已有模型上继续训,比预训练省,但看模型大小 → A100 80G / H100。
    • SFT(Supervised Fine-Tuning,监督微调):用「问题-答案」对教模型按指令回答。
  • 推理(Serve):看 QPS 和延迟 → 性价比推理卡 + 量化。
    • QPS(Queries Per Second,每秒查询数):吞吐指标。

第二步:看模型规模(粗略显存估算)

模型 推理最低显存(FP16) 全参微调显存(含梯度/优化器)
7B ~14 GB ~112 GB(多卡/ZeRO-3);LoRA 单卡可跑(~14–20 GB)
13B ~26 GB ~200 GB+(多卡);LoRA 单卡
70B ~140 GB 多卡/ZeRO-3;LoRA 需较大显存卡
千亿级 数百 GB+ 百卡集群

估算速算:推理显存 ≈ 参数量 × 2 字节(FP16);全参微调 ≈ 参数量 × 16 字节(AdamW 混合精度,含优化器状态,大头在此),所以 7B 全参微调约 112 GB、需多卡或 ZeRO/FSDP;想单卡就上 LoRA/QLoRA。

第三步:看预算与约束

  • 有无出口管制限制(中国 → 特供版/国产)
  • 单机多卡 vs 多机集群
  • 国产替代要求(信创)?

3.5 成本模型(TCO 思维)

TCO(Total Cost of Ownership,总拥有成本) 不只看「一张卡多少钱」,要看全生命周期:

  • 卡价:H100/H200/B200 波动大,以渠道/官方报价为准(不要死记数字)。参考量级:训一个 Llama 3 级模型用约 2.4 万张 H100,硬件花费约 7.2 亿美元。
  • 集群成本:服务器、网络(IB/NVLink 交换机)、存储。
  • 运维成本:电力(TDP×数量×电价)、散热、机房。液冷虽贵但高功耗卡必需。
  • 利用率:同样投入,利用率从 30%→70%,等效算力翻倍 → 这就是调度器/qGPU 的价值。
  • 隐性成本:国产卡适配工时、CUDA→CANN 迁移、人才稀缺溢价。

重点:你作为 AI Infra 工程师,给企业省钱的最大杠杆是提高 GPU 利用率(调度、共享、虚拟化),而不是砍卡价。这也是元宝说的「利用率从 30% 提到 70%」的真正含义——后面 05/08/11 都在服务这个目标。


3.6 选型实例(把方法用起来)

场景 推荐 理由
个人学分布式训练 1–2× RTX 4090 / 云 A100 小模型可跑,成本低
7B 模型推理服务 L4 / 国产推理卡 性价比、够用
70B 微调 A100 80G × 多卡 / H100 显存够、互联好
千亿模型预训练 H100/H200/B200 百卡集群 + IB 算力+互联+显存全要
信创合规训练 昇腾 910B/910C 集群 国产替代要求
中国受限场景 H20 特供 + 国产混合 合规 + 补齐算力

3.7 ⭐ 异构集群选型的真实难点(中国场景)

在国内,你几乎不会遇到「纯 N 卡」的集群,真实场景是:

  • 训练集群:可能 H800 + 昇腾 910B 混合,或纯昇腾(信创项目)。
  • 推理集群:L40S + 国产推理卡 + 特供 H20 混合。
  • 难点:不同卡算力/显存/互联差异大,调度器要「认卡」(GFD 标签,见 04);框架要适配多套软件栈(CUDA / CANN / ROCm);监控指标口径不一。

⚠️ 内幕:很多公司「卡多但用不好」的根因就是异构——算法方只懂 CUDA,国产卡算子缺失导致训不动/训得慢,最后卡闲置。能搞定异构适配的 AI Infra 工程师,在国内极稀缺、极值钱。这是你最大的差异化机会。



3.7 实战:GPU 选型决策模拟

3.7.1 选型模拟器

python3 -c "
cards = {'H100':(80,'N'),'H200':(141,'N'),'H20':(96,'N'),'A100':(80,'N'),'L40S':(48,'N'),'L4':(24,'N')}
def select(task,model,region='china'):
    print(f'任务:{task} 模型:{model}B 地区:{region}')
    for name,(mem,_) in cards.items():
        need = model*(16 if task=='train' else 2)
        fit = 'OK' if mem>=need else 'OOM'
        print(f'  {name:>6} mem={mem:>3}GB need={need:>3}GB {fit}')
select('inference',7)
select('train',70)
"

目的:把三步走选型变成可执行工具。面试被问 70B 推理用什么卡,能快速分析。


3.8 自测题

  1. 显存容量和显存带宽分别决定什么?哪个更常是瓶颈?
  2. BF16 相比 FP16 的优势?为什么训练爱用 BF16?
  3. FP8 为什么能在新一代卡上提速?厂商宣传算力时有什么「数字陷阱」?
  4. 训练卡和推理卡的核心区别?为什么推理卡对互联要求低?
  5. 估算 7B 模型 FP16 推理最少需要多少显存?微调为何要多倍?
  6. AI Infra 工程师「省钱」的最大杠杆是什么?为什么不是砍卡价?
  7. 给「70B 模型国内微调」和「7B 模型高并发推理」分别选卡,并说明理由。
  8. ⭐ 异构集群(N 卡 + 国产卡)选型与运维的真实难点是什么?

答上即可进入 04——正式从「硬件认知」跨入「K8s 怎么管 GPU」。

← 返回专栏