学习库/AI Infra 转型
🧠

AI Infra 转型

从云原生容器编排工程师转型 AI Infra 的完整系统教材。从 GPU 硬件、显存与互联这些最底层的东西讲起,一路到 K8s GPU 接入、MIG 切分、Volcano 与工业级调度器、分布式训练、推理服务化、可观测调优,最后落到亲手搭一套类 TI-ONE 的迷你训推平台,并附面试准备。

GPUKubernetes调度分布式训练推理服务平台工程
17 篇资料· 56268 字· 通读约 140 分钟· 2026-08-23 更新
未开始
00

00 学习总纲与路线图(从零开始的 AI Infra 转型)

你是谁:格桑——一位有多年 K8s / 云原生(Kubernetes 容器编排)经验的工程师,但 GPU 硬件、AI 算法几乎零基础,目标是转型成 AI Infra 工程师,能独立搭建一套类似腾讯云 TI-ONE 的 AI 训练/推理平台。 这套资料是什么:你的系统教材。核心 14 个文件 00–13,从「GPU 到底是什么」一路讲到「搭出一个迷你 AI 平台」。另有 2 份配套:《术语表与索引.md》速查、《AI-Infra转岗指南-格桑.md》速览+纠错+项目骨架。 ⏱️ 数据截至:2026-08。AI 硬件季度级迭代,学方法与心智模型比背数字重要;最新机型以一手官网/财报为准。

3147 字 7 分钟
01

01 GPU 硬件基础与核心概念(零基础起点)

你声明对硬件和 AI 都几乎零基础。这一章从最底层讲起,分两部分:先补一节 AI/ML 基础概念(什么是模型、训练、推理、神经网络——不懂这些,GPU 知识就悬在半空),再讲 GPU 到底是什么、为什么 AI 离不开它、内部有哪些关键构件、在一次训练和推理中它具体在干什么。这是后面所有内容的根。 💡 给你的话:这一章会出现很多新名词。本套资料的规矩是——每个技术名词第一次出现都解释,并用 💡 标注类比。看不懂某个词别跳过,回《术语表》查或重读对应段落。慢就是快。

4020 字 10 分钟
02

02 GPU 厂商产品全景与市场格局

上一章讲了 GPU 是什么。这一章补齐你缺的行业知识:有哪些公司、各自什么产品、架构代际、市场地位、中国特供版、出口管制脉络,以及非 GPU 的 AI 加速器(TPU / Trainium / ASIC)。这是 AI Infra 工程师和算法/业务方对话的「共同语言」。 ⏱️ 数据截至:2026-08。AI 硬件季度级迭代,份额/型号会漂移,学方法比背数字重要;遇到最新机型以一手官网/财报为准。本章数字来自 IDC 2025-2026 报告及公开新闻。

3804 字 9 分钟
03

03 GPU 技术指标与选型方法论

上一章认了产品和公司。这一章学怎么看一张卡的参数、怎么根据任务选卡。这是 AI Infra 工程师日常和企业/算法方对话的高频场景——「这个需求该用什么卡」。每个指标都会解释,不假设你懂。

2140 字 5 分钟
04

04 K8s GPU 资源接入层

从这里起,你熟悉的 K8s 登场了。这一章解决一个核心问题:K8s 原生不懂 GPU,怎么让集群「看见」并管理成千上万张卡? 这是你云原生经验的直接延伸——学完你会发现,本质就是「给 kubelet 加一种新的可分配资源」。 💡 给你的话:这一章你应该学得最快。把 device-plugin 类比成你熟悉的 CSI/CNI 那种扩展机制就对了。但本章会深入到 gRPC 接口、Linux 内核机制、容器挂载细节——不要跳过,这些是你和算法方定位「Pod 为什么拿不到 GPU」时的底气。

5930 字 14 分钟
05

05 MIG 与 GPU 虚拟化共享

一张 A100 80GB 很贵,但很多小任务用不满整张卡 → 浪费。这一章学怎么把一张卡「切小」、让多个任务/团队共享,把利用率从 30% 拉到 70%。这正是 AI Infra 工程师「省钱」的核心技能。 💡 给你的话:这章的 K8s 类比是「把节点 CPU 切给多个 Pod」——只不过 GPU 切分远比 CPU 复杂:有硬件级(MIG)、驱动级(vGPU)、内核级(qGPU)、用户态库级(vCUDA/HAMi)、进程级(MPS)多种实现,隔离强度完全不同。学的时候始终抓三个问题:在哪一层切?切的是算力还是显存?隔离有多强?

6962 字 17 分钟
06

06 K8s 调度器原理

资源层把 GPU 注册好了,接下来是调度层:Pod 来了,谁来决定它跑在哪张卡上?这一章吃透 kube-scheduler——你作为云原生工程师的看家本领,要在这里深化成「AI 感知」的调度能力。 💡 给你的话:这章对你应该是复习+深化。你已经懂 K8s 调度,重点是理解「为什么 AI 负载让默认调度器力不从心」,引出 Volcano。但本章会把调度器的每个阶段、抢占机制、拓扑感知都讲透——不要跳过,这是 07/08 的基础。

3108 字 7 分钟
07

07 Volcano 实战

这一章解决上一章留下的「Gang 问题」。Volcano 是 CNCF 首个基于 K8s 的批处理调度系统(华为开源),AI/大数据训练的标配调度器。你之前对话里反复问的「Volcano 是什么、怎么用」,这里一次讲透。 💡 给你的话:Volcano 对你来说不陌生——它就是个装在 K8s 上的「批处理调度器」,用 CRD 描述作业,和你用过的任何 Operator 体系同构。

2802 字 7 分钟
08

08 工业级调度器(Gödel / qGPU / Kueue / Koordinator / YuniKorn)

你之前对话里问「大厂(字节/腾讯)用的真是 Volcano 吗」。答案是:开源 Volcano 是基线,但大厂都在它之上或之外做了自研/深度定制。这一章看几个真实工业方案,理解「为什么原生/Volcano 还不够」,并建立自研调度器的思路。 💡 给你的话:这章信息量大,但对你不难——本质上就是「K8s 调度生态的各家方案对比」,和你熟悉的服务网格/Ingress 生态对比是一个套路。

2384 字 5 分钟
09

09 分布式训练框架

资源层和调度层把「卡」管好了。这一章进入负载层:训练任务本身怎么写、怎么把一个模型切到多卡上跑,以及在 K8s 上用什么编排、多机之间靠什么通信。这是 AI Infra 工程师和算法团队协作的接口层,也是通向 12 平台实战的桥。 💡 给你的话:这章是 AI 味最浓的一章。你不需要会手写训练代码,但要懂「模型怎么切、多机怎么通信、为什么慢」——这样算法方说「训练扩展性差」时你能定位是调度问题还是通信问题。

3836 字 9 分钟
10

10 推理框架与服务化

训好的模型要「对外服务」才有价值。这一阶段(阶段三)前半段讲推理的独特性、核心优化技术、主流框架对比,以及在 K8s 上怎么把模型变成高吞吐低延迟的服务。这是你「类 TI-ONE」平台里「推」的那一半,也是 2025-2026 最热的招聘方向。 💡 给你的话:推理时代来了——大模型预训练高峰过后,行业重心转向「把模型变成 API」。这章对你来说是把「部署一个 Web 服务」的 K8s 经验迁移到「部署一个模型服务」,多了 KV Cache、批处理、量化这些 AI 特有优化。

3023 字 7 分钟
11

11 GPU 可观测与性能调优

阶段三后半段。前面你会「把模型跑起来」,这一章学怎么看见 GPU 在干嘛、怎么判断它健不健康、利用率低时从哪几个维度排查。这是 AI Infra 工程师的「运维之眼」,也是面试能讲出「我优化过」的关键。 💡 给你的话:这章是你的 SRE 老本行——Prometheus/Grafana 你熟,只是指标换成 GPU 的。核心是学会「利用率低≠要加卡,先找根因」。

2981 字 7 分钟
12

12 搭建迷你 TI-ONE 平台实战

阶段四前半段,也是整套资料的收口:把前面所有层(接入→调度→训练编排→推理→可观测→队列配额)组装成一个能跑训练+推理的迷你 AI 平台,并对标腾讯云 TI-ONE。这是你面试能「3 分钟讲清架构与取舍」的作品底座。 💡 给你的话:这一章就是把前 11 章的零件拼成一辆车。你的 K8s 工程经验在这里全用上——本质就是「在 K8s 上装一堆 Operator + CRD + 监控」,和你搭过的基础设施平台没本质区别,只是组件换成 AI 相关的。

2217 字 5 分钟
13

13 面试准备与职业发展

阶段四后半段,课程收官。前 12 章给了你「全链路知识 + 一个可演示平台」。这一章把它变成面试资本:知识域地图、高频题、转型话术、简历项目写法、发展路径,以及 2026 年真实的岗位与薪酬行情。 💡 给你的话:你的核心优势是「带着可演示的平台项目 + 读过源码」去面试,而不是空谈「我学过」。这一章教你怎么把这些变成 offer。

2716 字 6 分钟
·

AI Infra 学习资料 · 全面评估报告

评估对象:blogs/ai infra/ 目录下 10 份文档(00 总纲 + 01~09) 评估日期:2026-08-03 评估维度:课程设置 / 完整性 / 准确性 / 正确性 / 需补充项 面向对象:格桑(云原生 → AI Infra 转型)

2725 字 6 分钟
·

AI-Infra 转岗指南 · 格桑(配套速览)

用途:本文件是 00–13 系统教材的配套速览——主打四件事:① 转岗路线一眼看完;② 技术点纠错汇总(把分散在各章的「纠错回顾」集中,防踩坑);③ 面试项目骨架 + TI-ONE 对照;④ 2026 岗位与行情速览。 配合姿势:先读本指南建立全局感 → 按 01→13 系统学 → 学完回本指南落地 12 项目。 ⏱️ 数据截至:2026-08。

1516 字 3 分钟
·

术语表与索引(AI Infra 学习资料)

配套 00–13 系统教材。本文件提供术语速查与文件索引 + 学习进度追踪。本套资料的规矩是「每个技术名词第一次出现都解释」,遇到陌生词回来查。 ⏱️ 数据截至 2026-08。

2957 字 7 分钟