学习库/ AI Infra 转型/ AI Infra 学习资料 · 全面评估报告
🧠 AI Infra 转型 · 第 15 / 17 篇

AI Infra 学习资料 · 全面评估报告

2725 字· 阅读约 6 分钟· 2026-08-23 更新

AI Infra 学习资料 · 全面评估报告

评估对象:blogs/ai infra/ 目录下 10 份文档(00 总纲 + 01~09) 评估日期:2026-08-03 评估维度:课程设置 / 完整性 / 准确性 / 正确性 / 需补充项 面向对象:格桑(云原生 → AI Infra 转型)


0. 总体结论

这套资料的"地基 + 框架层"写得相当扎实——00 总纲目标清晰、阶段划分合理,01~09 的硬件认知、K8s GPU 接入、MIG/虚拟化、调度器原理、Volcano、工业调度器、分布式训练这条主线逻辑连贯、准确度高、对云原生背景的学习者极其友好。纠错回顾(Operator 含 device-plugin、MIG 非"8 层"等)说明生成时有质量把控。

但存在两个阻断性完整性缺口 + 若干准确性/覆盖问题,目前状态只能算"完成了约 70% 的教材,且最值钱的后 30% 缺失":

维度 评分(5 分制) 说明
课程结构设计 4.5 四阶段递进清晰,定位精准
内容准确性(已写部分) 4.0 主线准确,个别数字偏乐观/版本过时
完整性 2.5 计划 14 文件仅交付 10,阶段三四全空 + 配套指南缺失
技术覆盖广度 3.0 漏 TPU/Trainium、Koordinator/YuniKorn、Kubeflow/Ray 等关键拼图
面向"搭 TI-ONE"的可用性 2.0 最关键的"平台实战+面试"整段缺失

1. 完整性问题(最严重,P0)

1.1 缺失文件 10~13(阶段三、四全空)

00 总纲明确列出 14 个文件(00 总纲 + 01~13 专题),并详细规划了:

  • 10 推理框架与服务化(vLLM/PagedAttention、Triton、KServe、量化、弹性部署)
  • 11 GPU 可观测与性能调优(Prometheus/DCGM/Grafana、CUDA 基础、FlashAttention、nsight)
  • 12 搭建迷你 TI-ONE 平台实战(架构、分步命令、README、对照 TI-ONE)
  • 13 面试准备与职业发展(知识域地图、高频题、话术、简历项目、发展路径)

实际目录只有 00~09。这意味着:

  • 你"从零搭出类 TI-ONE 训推平台"的终极目标,对应的阶段三四完全没给——而按你自己的目标,这恰是最值钱的部分。
  • 00 与 01~09 中大量前向引用成死链见 11进 10 推理框架12-13 平台/面试DCGM...见 11 等全部指向不存在的文件。

1.2 配套文件《AI-Infra转岗指南-格桑.md》全仓缺失

00 称其为「速览 + 技术点纠错 + 面试项目骨架」的核心依赖,且 04/05/08 的"纠错回顾"都标注"来自转岗指南"。

  • 好消息:纠错内容已内联进主文件,知识不丢。
  • 坏消息:学习者按 00 指引去找这份文件会落空;且"面试项目骨架/TI-ONE 对照"这类本该在指南里的交付物也一并缺了。

P0 行动:补齐 10~13,并补回转岗指南(或明确在 00 中删除引用、把项目骨架并入 12)。


2. 准确性 / 正确性需修正(影响理解,P1)

2.1 【正确性错误】7B 训练显存被严重低估(01 §1.5、03 §3.4)

  • 文档称:7B 训练"合计常需 50–70 GB",微调"40–70 GB"。
  • 事实(已核实,多源一致):混合精度 AdamW 全参微调 ≈ 16 字节/参数 → 7B ≈ 112 GB(参数 FP16 + 梯度 FP16 + 优化器 FP32 状态,未计激活);即便最乐观口径也 ≈ 70–80 GB,且优化器状态单独就 56–84 GB
  • 后果:文档会让学习者误以为"7B 全参微调 A100 80G 能直接跑"——实际 单张 A100 80GB 根本放不下,必须 ZeRO-3/FSDP 分片或多卡,或改用 LoRA/QLoRA。
  • 修正建议
    • 全参微调 7B ≈ 112 GB(需多卡 / ZeRO-3 / FSDP);
    • LoRA/QLoRA 才能降到单卡可跑(适配器参数量 0.1%~1%,显存 ≈ 14–20 GB 量级);
    • 把"50–70GB"改为明确区分「全参微调(~112GB,多卡)」vs「LoRA(单卡可跑)」。
  • 01 与 03 两处口径也不一致(01 写 50–70,03 写 40–70),需统一。

2.2 【新鲜度】02 硬件快照已落后约 1.5 代(截至 2026-08)

  • NVIDIA Blackwell Ultra(B300 / GB300):2025 下半年量产,288 GB HBM3e,推理强化;下一代 Rubin 预计 2026 H2(FP4 ~50 PFLOPS)。
  • AMD MI350X / MI355X:2025.6 发布,CDNA4,288 GB HBM3e,ROCm 7;MI400 预计 2026。
  • 缺 Intel Gaudi 3 实际出货/定位更新。
  • "NVIDIA 92%–94% 份额"建议标注"截至 2024/2025"——2025–2026 受 ASIC(TPU 等)与国产挤压,语境已变。
  • 修正建议:全册加"数据截至:2025-XX"水印;02 单列「2025–2026 新品速览」一节(B300/GB300、Rubin、MI350/355、MI400)。

2.3 【版本过时】07 Volcano Job API 用了已弃用的 v1alpha1

  • 文档示例:apiVersion: batch.volcano.sh/v1alpha1
  • 现状:Volcano Job 当前为 v1beta1v1alpha1 已弃用,照抄可能告警/失败。
  • 修正建议:示例统一改为 batch.volcano.sh/v1beta1;Queue 已是 scheduling.volcano.sh/v1beta1,保持一致。

2.4 【待核实】04 AMD device-plugin 的安装 URL

  • 文档给的 https://raw.githubusercontent.com/ROCm/k8s-device-plugin/master/docker-compose/yaml/amd-device-plugin.yml 路径可能随仓库结构调整变动,部署前需核实是否仍存在(资源名 amd.com/gpu 本身正确)。

3. 内容覆盖缺口(建议补充,P1/P2)

3.1 【重大缺类】非 GPU 加速器:Google TPU / AWS Trainium(02 章漏)

整章只覆盖 GPU 系(N/AMD/Intel/国产)。但 2025 起 ASIC 阵营突破明显:Google TPU 实测同代 1.5–2x GPU 速度、能效 +30%;AWS Trainium/Inferentia(Annapurna)、Meta MTIA、Tesla Dojo 也在规模部署。"类 TI-ONE 的多云/异构平台"必答题就是接入非 N 卡加速器

  • 补充建议:02 新增「非 GPU 加速器:TPU / Trainium / ASIC 路线与软件栈(JAX/XLA、Neuron SDK、PyTorch-XLA)」。

3.2 【缺关键调度器】Koordinator、YuniKorn(08 章漏)

  • 08.1 明确把"在离线混部"列为工业调度核心动因,却没介绍 Koordinator(阿里开源,K8s 在离线统一调度事实标准)——这正是最直接的答案。
  • Apache YuniKorn(Apple 开源,多租户批调度,YARN/K8s 通吃),与 Volcano/Kueue 定位互补,是面试常考点。
  • Volcano vs Kueue vs YuniKorn 三者定位对比表。
  • 补充建议:08 补「Koordinator(在离线混部)/ YuniKorn(多租户批调度)」+ 三者对比。

3.3 【缺训练编排桥梁】Kubeflow Training Operator / Ray / MPI Operator(09 章漏)

09 直接从「手写 Volcano Job YAML」收尾,但工业上跑训练几乎都用:

  • Kubeflow Training Operator(TFJob / PyTorchJob / MPIJob,K8s 训练事实标准);
  • Ray(Ray Train / Ray Serve,2025–2026 极度重要,分布式训练+服务统一框架);
  • MPI Operator(HPC 风格集合通信)。 这些正是"迷你 TI-ONE"(12,缺失)真正要组装的组件。
  • 补充建议:09 新增「K8s 上的训练编排:Kubeflow / Ray / MPI Operator」,作为 09→12 的桥。

3.4 【缺深度】集群互联与集合通信(03/09 提及但浅)

AI Infra 的核心难点在多机:IB / RoCE / RDMA、NCCL 集合通信原语(AllReduce / AllGather / ReduceScatter)、拓扑感知、通信-计算 overlap、NVSwitch。

  • 补充建议:独立一节「集群互联与集合通信基础」,否则"多卡扩展好不好"只停留在口号。

3.5 【缺进阶但平台必备】容错/弹性训练、AI 存储

  • 大模型训练数周,节点故障常态:checkpoint 续训、弹性训练(PyTorch Elastic / Elastic Horovod)、Spot 抢占回收。
  • AI 存储:并行文件系统(Lustre / WEKA / 3FS)、数据加载瓶颈往往是训练吞吐天花板。
  • 补充建议:并入 12(平台实战)或作为补充章节。

3.6 【缺装配图纸】平台层整体架构全景(12 缺失但最关键)

现有 00~09 是"零件清单",缺"装配图纸"。搭迷你 TI-ONE 需要一张 K8s AI 平台组件栈全景接入层(GPU Operator/device-plugin) → 调度层(Volcano/Kueue/Koordinator) → 训练编排(Kubeflow/Ray) → 推理服务(KServe/vLLM/SGLang) → 可观测(Prometheus/DCGM) → 队列配额 → UI/Notebook

  • 补充建议:12 以这张图为锚,分步装配。

3.7 【计划内但缺失,给 10/11 的内容建议】

虽 10/11 缺失无法审,但按目标建议务必覆盖:

  • 10 推理服务化:vLLM、SGLang(2025–2026 推理服务新王者)、Triton、TensorRT-LLM、TGI、KServe/Seldon、量化(AWQ/GPTQ/FP8)、PagedAttention、KV Cache、连续批处理(continuous batching)、弹性部署。
  • 11 可观测/调优:DCGM-Exporter、Prometheus、Grafana、Nsight Systems / Compute、py-spy、CUDA 内核与 kernel 融合、FlashAttention、NCCL 调试、nvidia-smi/dcgm 实战、GPU 利用率低的分维度排查法。

4. 课程结构与学习路径优化

  1. 阶段权重错位:最值钱的"平台实战 + 面试"(阶段三四)恰全缺。建议优先补 12/13,它们是前面所有知识的"出口"和"验收"。
  2. 加"数据截至"与新鲜度标注:AI 硬件/份额季度级变动,全册应标"截至 2025-XX",避免学习者拿旧数字面试翻车。
  3. 加术语表 / 索引 / 进度追踪:目前无统一 glossary,新人易在 CUDA Core/Tensor Core/MIG/qGPU/vGPU 等术语间迷失。
  4. 加"贯穿式动手项目":从 04 起每个文件都应挂一个可运行的最小实验(哪怕 fake-device-plugin + 文档说明),到 12 串成完整平台——比"每章自测题"更能形成面试作品。
  5. 一致性修复:00 的"共 14 个文件"须改为实际数量;01/03 的 7B 显存口径统一;07 API 版本统一 v1beta1。

5. 优化 & 补充优先级清单

优先级 事项 类型
P0 补齐文件 10(推理服务化)、11(可观测/调优)、12(迷你 TI-ONE 实战)、13(面试/职业) 完整性
P0 补回《AI-Infra转岗指南-格桑.md》或删除 00 引用并把项目骨架并入 12 完整性
P1 修正 7B 训练显存口径(50–70GB → 全参~112GB 多卡 / LoRA 单卡) 正确性
P1 02 硬件更新至 2025–2026(B300/GB300、Rubin、MI350/355、MI400)+ 加"数据截至" 新鲜度
P1 02 新增 TPU / Trainium / ASIC 章节 覆盖
P1 08 新增 Koordinator / YuniKorn + 三者对比 覆盖
P1 09 新增 Kubeflow Training Operator / Ray / MPI Operator 覆盖
P1 07 Volcano Job API 改 v1beta1 正确性
P2 新增「集群互联与集合通信(IB/RoCE/NCCL)」 覆盖
P2 新增/并入「容错弹性训练 + AI 存储」 覆盖
P2 12 以"平台组件栈全景图"为锚 结构
P2 全册补术语表/索引/进度追踪;00 文件数对齐 结构
P2 核实 04 AMD device-plugin raw URL 核实

6. 我可以直接帮你做的(请选)

  1. 续写 10~13:按现有风格与深度,补完推理服务化 / 可观测调优 / 迷你 TI-ONE 实战 / 面试准备,让课程闭环。
  2. 修正现有错误:改 7B 显存口径、07 改 v1beta1、统一 01/03 口径、核实 04 AMD URL、00 文件数对齐。
  3. 补充缺失章节:写 TPU/Trainium、Koordinator/YuniKorn、Kubeflow/Ray、集群互联与 NCCL、平台全景图等新增文档。
  4. 生成修订版总纲:对齐实际文件、加新鲜度标注、补术语表与进度追踪。

告诉我选哪个(可多选),或直接说"按 P0+P1 全做",我就开干。

← 返回专栏