学习库/ AI Infra 转型/ 00 · 00 学习总纲与路线图(从零开始的 AI Infra 转型)
🧠 AI Infra 转型 · 第 1 / 17 篇

00 学习总纲与路线图(从零开始的 AI Infra 转型)

3147 字· 阅读约 7 分钟· 2026-08-23 更新

00 学习总纲与路线图(从零开始的 AI Infra 转型)

你是谁:格桑——一位有多年 K8s / 云原生(Kubernetes 容器编排)经验的工程师,但 GPU 硬件、AI 算法几乎零基础,目标是转型成 AI Infra 工程师,能独立搭建一套类似腾讯云 TI-ONE 的 AI 训练/推理平台。 这套资料是什么:你的系统教材。核心 14 个文件 0013,从「GPU 到底是什么」一路讲到「搭出一个迷你 AI 平台」。另有 2 份配套:《术语表与索引.md》速查、《AI-Infra转岗指南-格桑.md》速览+纠错+项目骨架。 ⏱️ 数据截至:2026-08。AI 硬件季度级迭代,学方法与心智模型比背数字重要;最新机型以一手官网/财报为准。


0.1 先搞清楚:AI Infra 到底是个什么岗位

在开始之前,先把最根本的概念讲透——很多人(包括半年前的你)对「AI Infra」到底是干嘛的其实很模糊。

AI Infra(AI Infrastructure,AI 基础设施) 指的是:把「算法科学家写的模型代码」变成「能大规模、稳定、低成本跑起来的产品」所需要的全部底层工程。它不设计神经网络,也不调模型参数,而是负责算力(GPU/加速器)、调度、存储、网络、训练/推理框架、监控这一整套「跑道」。

💡 类比:算法团队是「飞行员」,负责把飞机(模型)造出来、飞起来;AI Infra 工程师是「机场 + 空管 + 跑道维护团队」,负责让成百上千架飞机能同时安全起降、不撞机、不浪费跑道。飞机再好,没有机场也飞不起来——这就是 AI Infra 的价值。

AI Infra 工程师和算法工程师的区别

维度 算法工程师 AI Infra 工程师(你的目标)
关心什么 模型结构、精度、loss 怎么降 算力怎么分配、利用率怎么提、训练怎么不崩
写什么代码 Python / PyTorch 模型代码 Go / YAML / Shell / Operator / 调度插件
用什么工具 PyTorch、HuggingFace、Jupyter Kubernetes、Volcano、vLLM、Prometheus
衡量指标 模型准确率、F1 GPU 利用率、吞吐、延迟、集群稳定性
你的优势 ❌ 几乎零基础 ✅ K8s/容器/分布式系统是看家本领

重点(你的核心卖点):你已经会的 K8s、容器编排、Operator 思维、分布式系统排障,恰恰是 AI Infra 的入场券。大厂 AI 平台团队招人时,一个懂 K8s 的工程师学 GPU,远比一个懂算法的工程师学 K8s 容易——因为「平台工程」这一层你早就会了,缺的只是「GPU 这一层」和「AI 负载这一层」。本套资料就是补这两层。


0.2 2026 年的行业现实(你必须知道的「内幕」)

学之前,先建立行业全景感。这些是教科书不写、但面试和实战中决定你判断力的「内幕」:

  1. 英伟达(NVIDIA)仍是霸主,但护城河在被侵蚀。2025 年全球 AI 加速器市场,NVIDIA 占约 85%(IDC 数据),数据中心 GPU 段约 90%。它的真正护城河不是芯片快,而是 CUDA 生态(一套用了 20 年积累的并行计算软件栈,所有框架先适配它)。

  2. 中国市场是「异构 + 国产替代」的真实战场。受美国出口管制,NVIDIA 在中国的份额从 2025 年禁令前的约 95% 一度暴跌到接近 0%;2025 年 7 月 H20 恢复出口、12 月 H200 也被放行后回升到约 55%。而国产芯片已拿下约 41%(华为昇腾一家约 20%,平头哥、昆仑芯、寒武纪、海光等分食)。你在中国做 AI Infra,必然要面对「N 卡 + 国产卡 + 特供版」混合集群——这是欧美工程师不会遇到的复杂度,也是你的差异化机会。

  3. GPU 是稀缺且昂贵的资源。一张 H100 单价数万美元,训练一个 Llama 3 级模型用了约 2.4 万张 H100、花费约 7.2 亿美元。所以「把 GPU 利用率从 30% 提到 70%」不是口号,而是省下数百万美元的真金白银——这是 AI Infra 工程师最大的业务价值,也是这套资料反复强调的主线。

  4. 2025-2026 进入「推理时代」。大模型预训练高峰过后,行业重心转向推理服务化(把训好的模型变成 API 给人用)。推理对延迟、吞吐、成本极度敏感,催生了 vLLM、SGLang 等专门推理框架——这是当前最热的招聘方向。

  5. 「算力即服务(GPU-as-a-Service)」成趋势。企业不再满足于「买卡放机房」,而是要像用云一样按需申请 GPU、按用量计费、多团队共享。这背后正是 K8s + 调度器 + 虚拟化的活——你的主场。

⚠️ 行业内幕:很多公司招「AI Infra」其实分两种——一种是偏平台开发(搭训推平台、写 Operator、做调度,你的最佳切入点),一种是偏性能调优(深入 CUDA/算子、Profiling,需要更深的硬件功底)。前者门槛对你友好得多,先切入前者,再慢慢补后者。


0.3 你站在哪、要去哪

现状(你已有的) 缺口(要补的) 终点(目标)
硬件 ❌ 几乎零基础 GPU 架构、显存/带宽、厂商产品、选型 看到一张卡能说出定位、算力、显存、为什么选它
资源层 ✅ K8s/Operator GPU 怎么接入 K8s、怎么切分共享 让集群「看见」并隔离管理成千上万张卡
调度层 ✅ kube-scheduler 基础 Gang 调度、队列配额、在离线混部 让昂贵的 GPU「整组到位、不浪费、不冲突」
负载层 ❌ AI 负载特性 训练/推理差异、并行策略、通信、推理优化 能把模型以最优方式跑在集群上
可观测 ✅ Prometheus 基础 GPU 指标、性能剖析、利用率排查 看见 GPU 在干嘛、低效时能定位根因
平台 ✅ 分布式系统思维 训推平台架构、容错、存储、对标 TI-ONE 搭出一个能演示的迷你 AI 平台

一句话:你的 K8s 底子已经是 AI Infra 的入场券。本套资料补齐的是「GPU 这一层」和「AI 负载这一层」,让你从「会用平台的人」变成「能搭平台的人」。


0.4 四阶段学习路径

阶段一:硬件与行业认知(01-03)   ← 你现在的起点(零基础)
   GPU 是什么 → 厂商产品全景 → 市场格局 → 技术指标 → 选型方法论
        │  目标:建立「行业共同语言」,能和算法/业务方对话
        ▼
阶段二:资源层与调度层(04-08)   ← 你的 K8s 经验直接兑现
   K8s GPU 接入 → MIG/虚拟化 → kube-scheduler → Volcano → 工业级调度器
        │  目标:让集群高效、隔离、按需地管好 GPU
        ▼
阶段三:训练 / 推理 / 可观测(09-11)
   分布式训练框架 → 推理服务化 → GPU 可观测与性能调优
        │  目标:让模型以最优方式「训得快、推得省、看得清」
        ▼
阶段四:平台实战与面试(12-13)
   从零搭迷你 TI-ONE → 面试准备与职业发展
        目标:有一个可演示项目 + 能讲清全链路

0.5 完整文件清单

编号 主题 阶段 核心内容 预估时长
00 学习总纲与路线图 本文件(路径/里程碑/行业现实) 0.5h
01 GPU 硬件基础与核心概念 为什么 AI 用 GPU、CPU vs GPU、内部构件、训练/推理中 GPU 在干嘛、AI 基础概念补课 4h
02 GPU 厂商产品全景与市场格局 NVIDIA/AMD/Intel/国产/TPU 全产品线、份额、出口管制、各公司路线、2026 内幕 5h
03 GPU 技术指标与选型方法论 FP8/显存/带宽/互联、训练卡 vs 推理卡、按任务选型、成本模型 3h
04 K8s GPU 资源接入层 Device Plugin、GPU Operator、多厂商接入、GFD 标签、实战命令 4h
05 MIG 与 GPU 虚拟化共享 MIG 硬件隔离、qGPU/vGPU、多团队共享提利用率 3h
06 K8s 调度器原理 调度流程、Scheduler Framework 扩展点、Scheduler Extender 4h
07 Volcano 实战 Queue/Job/Task、Gang Scheduling、公平调度、部署与源码导读 4h
08 工业级调度器(Gödel/qGPU/Kueue/Koordinator/YuniKorn) 为何原生不够用、字节/腾讯/阿里/社区方案、自研思路 3h
09 分布式训练框架 PyTorch 流程、DDP/FSDP、DeepSpeed ZeRO、Megatron、NCCL 互联、K8s 编排 5h
10 推理框架与服务化 vLLM/SGLang/TensorRT-LLM、PagedAttention、量化、KServe/Triton、弹性部署 4h
11 GPU 可观测与性能调优 Prometheus/DCGM/Grafana、CUDA 基础、FlashAttention、Nsight、排查法 4h
12 搭建迷你 TI-ONE 平台实战 架构全景图、分步命令、容错/存储、README 模板、与 TI-ONE 对照 6h+
13 面试准备与职业发展 知识域地图、高频题、话术、简历项目写法、发展路径、2026 岗位 3h

合计约 57 小时系统学习 + 一个实战项目。按每天 2–3h,约 1 个月可达到「能讲清全链路 + 有可演示项目」的面试水准。

2 份配套(不计入上面学时,作速查/加速器)

  • AI-Infra转岗指南-格桑.md:速览路线图 + 技术点纠错汇总 + 面试项目骨架 + TI-ONE 对照。
  • 术语表与索引.md:全册术语 glossary + 文件索引 + 学习进度追踪。

0.6 里程碑与自测(每阶段结束应能做到)

  • 阶段一结束:看到一张 GPU 型号(如 H100 / 910B / MI300X / TPU),能说出它的定位(训练/推理/ASIC)、大致算力与显存量级、属于哪家公司、为什么这么选;能讲清 2026 中国市场的「异构+国产替代」格局。
  • 阶段二结束:能手画「GPU 卡 → device-plugin → kube-scheduler/Volcano → Pod 跑训练」的链路,并讲清 Gang Scheduling 为什么必要、MIG/qGPU 怎么提利用率。
  • 阶段三结束:能说清一次分布式训练怎么切分、推理为什么用 vLLM/SGLang、GPU 利用率低时从哪几个维度排查。
  • 阶段四结束:有一个跑通或部分跑通的迷你训推平台项目,能 3 分钟讲清架构与取舍,并能对标 TI-ONE。

0.7 学习节奏建议

  1. 先通读后精读:每个文件先快速过一遍建立骨架,再回头精读标注「⭐重点」的段落。
  2. 动手优先:阶段二起,每个文件里的命令/部署步骤尽量真机或虚拟机跑一遍(无 GPU 可用 CPU 模拟 + 文档说明)。
  3. 画图为王:每阶段结束画一张架构/链路图(手画也行),这是面试最加分的能力。
  4. 对照 TI-ONE:阶段四把学到的每一层都映射到 TI-ONE 的对应组件,形成「工业级—自己实现」的对照思维。
  5. 术语不跳过:遇到不懂的词,先查《术语表》,再回正文看解释。本套资料的原则是每个技术名词第一次出现都解释,但复习时仍建议主动回忆。

0.8 与配套文件的关系

文件 用途
0013(本套) 系统教材:从零补齐每一层知识,循序渐进
AI-Infra转岗指南-格桑.md 速览+纠错+项目骨架:技术点核实、学习路线速览、面试项目方案、TI-ONE 对照
术语表与索引.md 术语速查+进度追踪:遇到陌生词回来查,勾选学习进度

建议顺序:先读本 00 建立全局感 → 按本套 0113 系统学 → 学完回到指南的项目方案落地 12


0.9 权威资料总入口(贯穿全教程)

  • NVIDIA 数据中心:https://www.nvidia.com/en-us/data-center/
  • GPU Operator:https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/
  • K8s Device Plugin:https://kubernetes.io/docs/concepts/extend-kubernetes/compute-storage-net/device-plugins/
  • K8s Scheduler Framework:https://kubernetes.io/docs/concepts/scheduling-eviction/scheduling-framework/
  • Volcano:https://volcano.sh/zh-hans/docs/home/introduction/
  • Kueue:https://kueue.sigs.k8s.io/ | Koordinator:https://koordinator.sh/ | YuniKorn:https://yunikorn.apache.org/
  • vLLM:https://vllm.ai/ | SGLang:https://github.com/sgl-project/sglang | KServe:https://kserve.github.io/website/
  • Ray:https://www.ray.io/ | Kubeflow Training:https://www.kubeflow.org/docs/components/training/
  • 腾讯云 TI-ONE:https://cloud.tencent.com/product/tione
  • GPU 调度中文手册(Jimmy Song):https://jimmysong.io/zh/book/gpu-infra/

开始吧:下一份读 01-GPU硬件基础与核心概念.md。那一章会先给你补一节**「AI/ML 基础概念速成」**(什么是模型、训练、推理、神经网络、矩阵乘法),因为不懂这些,后面所有 GPU 知识都悬在半空。然后才进入「GPU 到底是什么」。

← 返回专栏