00 学习总纲与路线图(从零开始的 AI Infra 转型)
00 学习总纲与路线图(从零开始的 AI Infra 转型)
你是谁:格桑——一位有多年 K8s / 云原生(Kubernetes 容器编排)经验的工程师,但 GPU 硬件、AI 算法几乎零基础,目标是转型成 AI Infra 工程师,能独立搭建一套类似腾讯云 TI-ONE 的 AI 训练/推理平台。 这套资料是什么:你的系统教材。核心 14 个文件
00–13,从「GPU 到底是什么」一路讲到「搭出一个迷你 AI 平台」。另有 2 份配套:《术语表与索引.md》速查、《AI-Infra转岗指南-格桑.md》速览+纠错+项目骨架。 ⏱️ 数据截至:2026-08。AI 硬件季度级迭代,学方法与心智模型比背数字重要;最新机型以一手官网/财报为准。
0.1 先搞清楚:AI Infra 到底是个什么岗位
在开始之前,先把最根本的概念讲透——很多人(包括半年前的你)对「AI Infra」到底是干嘛的其实很模糊。
AI Infra(AI Infrastructure,AI 基础设施) 指的是:把「算法科学家写的模型代码」变成「能大规模、稳定、低成本跑起来的产品」所需要的全部底层工程。它不设计神经网络,也不调模型参数,而是负责算力(GPU/加速器)、调度、存储、网络、训练/推理框架、监控这一整套「跑道」。
💡 类比:算法团队是「飞行员」,负责把飞机(模型)造出来、飞起来;AI Infra 工程师是「机场 + 空管 + 跑道维护团队」,负责让成百上千架飞机能同时安全起降、不撞机、不浪费跑道。飞机再好,没有机场也飞不起来——这就是 AI Infra 的价值。
AI Infra 工程师和算法工程师的区别:
| 维度 | 算法工程师 | AI Infra 工程师(你的目标) |
|---|---|---|
| 关心什么 | 模型结构、精度、loss 怎么降 | 算力怎么分配、利用率怎么提、训练怎么不崩 |
| 写什么代码 | Python / PyTorch 模型代码 | Go / YAML / Shell / Operator / 调度插件 |
| 用什么工具 | PyTorch、HuggingFace、Jupyter | Kubernetes、Volcano、vLLM、Prometheus |
| 衡量指标 | 模型准确率、F1 | GPU 利用率、吞吐、延迟、集群稳定性 |
| 你的优势 | ❌ 几乎零基础 | ✅ K8s/容器/分布式系统是看家本领 |
⭐ 重点(你的核心卖点):你已经会的 K8s、容器编排、Operator 思维、分布式系统排障,恰恰是 AI Infra 的入场券。大厂 AI 平台团队招人时,一个懂 K8s 的工程师学 GPU,远比一个懂算法的工程师学 K8s 容易——因为「平台工程」这一层你早就会了,缺的只是「GPU 这一层」和「AI 负载这一层」。本套资料就是补这两层。
0.2 2026 年的行业现实(你必须知道的「内幕」)
学之前,先建立行业全景感。这些是教科书不写、但面试和实战中决定你判断力的「内幕」:
-
英伟达(NVIDIA)仍是霸主,但护城河在被侵蚀。2025 年全球 AI 加速器市场,NVIDIA 占约 85%(IDC 数据),数据中心 GPU 段约 90%。它的真正护城河不是芯片快,而是 CUDA 生态(一套用了 20 年积累的并行计算软件栈,所有框架先适配它)。
-
中国市场是「异构 + 国产替代」的真实战场。受美国出口管制,NVIDIA 在中国的份额从 2025 年禁令前的约 95% 一度暴跌到接近 0%;2025 年 7 月 H20 恢复出口、12 月 H200 也被放行后回升到约 55%。而国产芯片已拿下约 41%(华为昇腾一家约 20%,平头哥、昆仑芯、寒武纪、海光等分食)。你在中国做 AI Infra,必然要面对「N 卡 + 国产卡 + 特供版」混合集群——这是欧美工程师不会遇到的复杂度,也是你的差异化机会。
-
GPU 是稀缺且昂贵的资源。一张 H100 单价数万美元,训练一个 Llama 3 级模型用了约 2.4 万张 H100、花费约 7.2 亿美元。所以「把 GPU 利用率从 30% 提到 70%」不是口号,而是省下数百万美元的真金白银——这是 AI Infra 工程师最大的业务价值,也是这套资料反复强调的主线。
-
2025-2026 进入「推理时代」。大模型预训练高峰过后,行业重心转向推理服务化(把训好的模型变成 API 给人用)。推理对延迟、吞吐、成本极度敏感,催生了 vLLM、SGLang 等专门推理框架——这是当前最热的招聘方向。
-
「算力即服务(GPU-as-a-Service)」成趋势。企业不再满足于「买卡放机房」,而是要像用云一样按需申请 GPU、按用量计费、多团队共享。这背后正是 K8s + 调度器 + 虚拟化的活——你的主场。
⚠️ 行业内幕:很多公司招「AI Infra」其实分两种——一种是偏平台开发(搭训推平台、写 Operator、做调度,你的最佳切入点),一种是偏性能调优(深入 CUDA/算子、Profiling,需要更深的硬件功底)。前者门槛对你友好得多,先切入前者,再慢慢补后者。
0.3 你站在哪、要去哪
| 现状(你已有的) | 缺口(要补的) | 终点(目标) | |
|---|---|---|---|
| 硬件 | ❌ 几乎零基础 | GPU 架构、显存/带宽、厂商产品、选型 | 看到一张卡能说出定位、算力、显存、为什么选它 |
| 资源层 | ✅ K8s/Operator | GPU 怎么接入 K8s、怎么切分共享 | 让集群「看见」并隔离管理成千上万张卡 |
| 调度层 | ✅ kube-scheduler 基础 | Gang 调度、队列配额、在离线混部 | 让昂贵的 GPU「整组到位、不浪费、不冲突」 |
| 负载层 | ❌ AI 负载特性 | 训练/推理差异、并行策略、通信、推理优化 | 能把模型以最优方式跑在集群上 |
| 可观测 | ✅ Prometheus 基础 | GPU 指标、性能剖析、利用率排查 | 看见 GPU 在干嘛、低效时能定位根因 |
| 平台 | ✅ 分布式系统思维 | 训推平台架构、容错、存储、对标 TI-ONE | 搭出一个能演示的迷你 AI 平台 |
一句话:你的 K8s 底子已经是 AI Infra 的入场券。本套资料补齐的是「GPU 这一层」和「AI 负载这一层」,让你从「会用平台的人」变成「能搭平台的人」。
0.4 四阶段学习路径
阶段一:硬件与行业认知(01-03) ← 你现在的起点(零基础)
GPU 是什么 → 厂商产品全景 → 市场格局 → 技术指标 → 选型方法论
│ 目标:建立「行业共同语言」,能和算法/业务方对话
▼
阶段二:资源层与调度层(04-08) ← 你的 K8s 经验直接兑现
K8s GPU 接入 → MIG/虚拟化 → kube-scheduler → Volcano → 工业级调度器
│ 目标:让集群高效、隔离、按需地管好 GPU
▼
阶段三:训练 / 推理 / 可观测(09-11)
分布式训练框架 → 推理服务化 → GPU 可观测与性能调优
│ 目标:让模型以最优方式「训得快、推得省、看得清」
▼
阶段四:平台实战与面试(12-13)
从零搭迷你 TI-ONE → 面试准备与职业发展
目标:有一个可演示项目 + 能讲清全链路
0.5 完整文件清单
| 编号 | 主题 | 阶段 | 核心内容 | 预估时长 |
|---|---|---|---|---|
| 00 | 学习总纲与路线图 | — | 本文件(路径/里程碑/行业现实) | 0.5h |
| 01 | GPU 硬件基础与核心概念 | 一 | 为什么 AI 用 GPU、CPU vs GPU、内部构件、训练/推理中 GPU 在干嘛、AI 基础概念补课 | 4h |
| 02 | GPU 厂商产品全景与市场格局 | 一 | NVIDIA/AMD/Intel/国产/TPU 全产品线、份额、出口管制、各公司路线、2026 内幕 | 5h |
| 03 | GPU 技术指标与选型方法论 | 一 | FP8/显存/带宽/互联、训练卡 vs 推理卡、按任务选型、成本模型 | 3h |
| 04 | K8s GPU 资源接入层 | 二 | Device Plugin、GPU Operator、多厂商接入、GFD 标签、实战命令 | 4h |
| 05 | MIG 与 GPU 虚拟化共享 | 二 | MIG 硬件隔离、qGPU/vGPU、多团队共享提利用率 | 3h |
| 06 | K8s 调度器原理 | 二 | 调度流程、Scheduler Framework 扩展点、Scheduler Extender | 4h |
| 07 | Volcano 实战 | 二 | Queue/Job/Task、Gang Scheduling、公平调度、部署与源码导读 | 4h |
| 08 | 工业级调度器(Gödel/qGPU/Kueue/Koordinator/YuniKorn) | 二 | 为何原生不够用、字节/腾讯/阿里/社区方案、自研思路 | 3h |
| 09 | 分布式训练框架 | 三 | PyTorch 流程、DDP/FSDP、DeepSpeed ZeRO、Megatron、NCCL 互联、K8s 编排 | 5h |
| 10 | 推理框架与服务化 | 三 | vLLM/SGLang/TensorRT-LLM、PagedAttention、量化、KServe/Triton、弹性部署 | 4h |
| 11 | GPU 可观测与性能调优 | 三 | Prometheus/DCGM/Grafana、CUDA 基础、FlashAttention、Nsight、排查法 | 4h |
| 12 | 搭建迷你 TI-ONE 平台实战 | 四 | 架构全景图、分步命令、容错/存储、README 模板、与 TI-ONE 对照 | 6h+ |
| 13 | 面试准备与职业发展 | 四 | 知识域地图、高频题、话术、简历项目写法、发展路径、2026 岗位 | 3h |
合计约 57 小时系统学习 + 一个实战项目。按每天 2–3h,约 1 个月可达到「能讲清全链路 + 有可演示项目」的面试水准。
2 份配套(不计入上面学时,作速查/加速器):
AI-Infra转岗指南-格桑.md:速览路线图 + 技术点纠错汇总 + 面试项目骨架 + TI-ONE 对照。术语表与索引.md:全册术语 glossary + 文件索引 + 学习进度追踪。
0.6 里程碑与自测(每阶段结束应能做到)
- 阶段一结束:看到一张 GPU 型号(如 H100 / 910B / MI300X / TPU),能说出它的定位(训练/推理/ASIC)、大致算力与显存量级、属于哪家公司、为什么这么选;能讲清 2026 中国市场的「异构+国产替代」格局。
- 阶段二结束:能手画「GPU 卡 → device-plugin → kube-scheduler/Volcano → Pod 跑训练」的链路,并讲清 Gang Scheduling 为什么必要、MIG/qGPU 怎么提利用率。
- 阶段三结束:能说清一次分布式训练怎么切分、推理为什么用 vLLM/SGLang、GPU 利用率低时从哪几个维度排查。
- 阶段四结束:有一个跑通或部分跑通的迷你训推平台项目,能 3 分钟讲清架构与取舍,并能对标 TI-ONE。
0.7 学习节奏建议
- 先通读后精读:每个文件先快速过一遍建立骨架,再回头精读标注「⭐重点」的段落。
- 动手优先:阶段二起,每个文件里的命令/部署步骤尽量真机或虚拟机跑一遍(无 GPU 可用 CPU 模拟 + 文档说明)。
- 画图为王:每阶段结束画一张架构/链路图(手画也行),这是面试最加分的能力。
- 对照 TI-ONE:阶段四把学到的每一层都映射到 TI-ONE 的对应组件,形成「工业级—自己实现」的对照思维。
- 术语不跳过:遇到不懂的词,先查《术语表》,再回正文看解释。本套资料的原则是每个技术名词第一次出现都解释,但复习时仍建议主动回忆。
0.8 与配套文件的关系
| 文件 | 用途 |
|---|---|
00–13(本套) |
系统教材:从零补齐每一层知识,循序渐进 |
AI-Infra转岗指南-格桑.md |
速览+纠错+项目骨架:技术点核实、学习路线速览、面试项目方案、TI-ONE 对照 |
术语表与索引.md |
术语速查+进度追踪:遇到陌生词回来查,勾选学习进度 |
建议顺序:先读本
00建立全局感 → 按本套01→13系统学 → 学完回到指南的项目方案落地12。
0.9 权威资料总入口(贯穿全教程)
- NVIDIA 数据中心:https://www.nvidia.com/en-us/data-center/
- GPU Operator:https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/
- K8s Device Plugin:https://kubernetes.io/docs/concepts/extend-kubernetes/compute-storage-net/device-plugins/
- K8s Scheduler Framework:https://kubernetes.io/docs/concepts/scheduling-eviction/scheduling-framework/
- Volcano:https://volcano.sh/zh-hans/docs/home/introduction/
- Kueue:https://kueue.sigs.k8s.io/ | Koordinator:https://koordinator.sh/ | YuniKorn:https://yunikorn.apache.org/
- vLLM:https://vllm.ai/ | SGLang:https://github.com/sgl-project/sglang | KServe:https://kserve.github.io/website/
- Ray:https://www.ray.io/ | Kubeflow Training:https://www.kubeflow.org/docs/components/training/
- 腾讯云 TI-ONE:https://cloud.tencent.com/product/tione
- GPU 调度中文手册(Jimmy Song):https://jimmysong.io/zh/book/gpu-infra/
开始吧:下一份读
01-GPU硬件基础与核心概念.md。那一章会先给你补一节**「AI/ML 基础概念速成」**(什么是模型、训练、推理、神经网络、矩阵乘法),因为不懂这些,后面所有 GPU 知识都悬在半空。然后才进入「GPU 到底是什么」。