🧠 AI Infra 转型 · 第 16 / 17 篇
AI-Infra 转岗指南 · 格桑(配套速览)
AI-Infra 转岗指南 · 格桑(配套速览)
用途:本文件是
00–13系统教材的配套速览——主打四件事:① 转岗路线一眼看完;② 技术点纠错汇总(把分散在各章的「纠错回顾」集中,防踩坑);③ 面试项目骨架 + TI-ONE 对照;④ 2026 岗位与行情速览。 配合姿势:先读本指南建立全局感 → 按01→13系统学 → 学完回本指南落地12项目。 ⏱️ 数据截至:2026-08。
1. 转岗路线图速览(云原生 → AI Infra)
| 你已有的(入场券) | 要补的(三大短板) | 终点 |
|---|---|---|
| K8s / 容器编排 / Operator / 分布式系统 | ① GPU 硬件语义与选型 | 能搭/维护类 TI-ONE 的 AI 训推平台底座 |
| ② AI 负载特性(训练/推理差异、CUDA/算子) | ||
| ③ 性能调优与可观测(GPU 利用率排查) |
三大补强对应教材:
- 硬件/行业/选型 →
010203(含 AI/ML 基础速成) - 接入/虚拟化/调度 →
0405060708 - 训练/推理/可观测/平台 →
0910111213
⭐ 最佳切入点岗位:AI 平台工程师 / AI SRE——K8s 经验 100% 复用。详见
13.1。
2. ⭐ 技术点纠错汇总(防坑必看)
这些点是和元宝对话中确认过的易错点,已分别内联进对应章节,这里集中便于速记。
纠错 1:GPU Operator 与 device-plugin 是「包含」不是「并列」
- ❌ 错误认知:Operator 和 device-plugin 是两套独立东西。
- ✅ 正确:GPU Operator 内含 device-plugin(用 ClusterPolicy 一键管驱动+device-plugin+GFD+DCGM)。详见
04.3。
纠错 2:A100 MIG 不是「8 层显存 7 层计算」
- ❌ 错误说法:A100 有 8 层显存 7 层计算单元每层 5GB。
- ✅ 正确:A100 最多切 7 个独立 GPU 实例;A100-80G 最小 profile
1g.10gb,不存在「8 层」。详见05.2。
纠错 3:Volcano 是「完全开源」,大厂在其上扩展
- ❌ 错误说法:Volcano 是「半开源」,大厂从零自研调度器。
- ✅ 正确:Volcano 是 CNCF 完全开源;字节 Gödel、腾讯 qGPU 等多是在 kube-scheduler / Volcano 之上扩展,而非另起炉灶。详见
08.6/08.8。
纠错 4(最易踩):7B 全参微调显存不是 50–70GB
- ❌ 旧资料写:「训练 7B 合计常需 50–70 GB」。
- ✅ 正确:混合精度 AdamW 全参微调 ≈ 16 字节/参数 → 7B ≈ 112 GB(优化器状态 alone 就 ~84GB),单张 A100 80G 根本放不下,必须 ZeRO-3/FSDP 多卡或 LoRA/QLoRA。做容量规划务必用「参数 × 16 字节」。详见
01.5/03.4。
纠错 5(认知补全):异构不止 GPU
- 真实的「异构算力池化」还包含 Google TPU / AWS Trainium 等 ASIC(2025 起突破明显)。接入思路(device-plugin 标准化、调度亲和、框架编译)可迁移。详见
02.9。
纠错 6(认知补全):Volcano API 是 v1beta1 不是 v1alpha1
- ✅ 正确:Volcano Job/Queue API 已统一为 v1beta1(早期资料写 v1alpha1 已过时)。详见
07.5。
纠错 7(认知补全):混部的难点是隔离不是调度
- 很多人以为混部就是「调度在线+离线」,其实难点在干扰隔离——离线突发吃满资源会拖垮在线。Koordinator 的核心价值是干扰检测与压制,不是调度算法。详见
08.5。
纠错 8(2026 现实):NVIDIA 中国份额不是 95% 了
- 受出口管制,2025 年 H20 被禁后 NVIDIA 中国份额从约 95% 暴跌;H20/H200 相继放行后回升到约 55%,国产已拿下约 41%。别再背「NVIDIA 占 95%」的旧数字。详见
02.6。
3. 面试项目骨架:迷你 TI-ONE
完整版见
12。这里给「必做清单」,照着落地即可形成面试作品。
最小可用闭环(MVP):
- GPU Operator 接入多卡(验证
nvidia.com/gpu成资源)。 - Volcano 提交一个 8 卡 Gang 训练 Job(验证整组调度)。
- Kubeflow PyTorchJob 或 Ray 提交训练(验证编排抽象)。
- KServe + vLLM 起一个推理服务(验证推的一环)。
- Prometheus + DCGM + Grafana 看 GPU 指标(验证可观测)。
- 写一份 README(架构图 + 能力矩阵 + 与 TI-ONE 对照)。
加分项: MIG/qGPU 切分共享、Kueue 队列配额、Checkpoint+弹性容错、在离线混部(Koordinator)、读过 Volcano gang 源码、自定义 Scheduler Plugin、国产卡适配。
面试讲法: 不堆组件名,讲「我解决了什么」——提交从手写 YAML 变一条 CRD、利用率可观测可定位、架构对标 TI-ONE 可扩展、把单 token 成本降了 X%。详见 13.6。
4. 与腾讯云 TI-ONE 对照(精简)
| TI-ONE 能力 | 你的迷你版 | 可扩展方向 |
|---|---|---|
| 算力接入(多厂商) | GPU Operator | + 国产卡 / TPU operator(02.9/04.5) |
| 调度/训练 | Volcano + Kubeflow | 基本对齐 |
| 推理部署 | KServe + vLLM | 对齐 |
| 监控 | Prometheus + DCGM | 对齐 |
| 数据工程 | 对象存储 + 并行 FS(3FS/JuiceFS) | TI-ONE 有完整特征/标注链路 |
| 多租户/计费 | Kueue 配额(待补 RBAC/计费) | 需补 |
| Pipeline | 手动提交 | + KFP |
国内类似平台:阿里 PAI、百度 百舸、字节 火山方舟。完整对照见
12.8。
5. 2026 岗位与行情速览(详见 13.1-13.2)
- 最佳切入点:AI 平台工程师 / AI SRE(K8s 经验直接复用)。
- 最热方向:LLM Infrastructure(大模型推理服务,2025-2026 推理时代)。
- 招聘方:字节/腾讯/阿里/百度/美团、DeepSeek/智谱/月之暗面/MiniMax 等模型公司、云厂商、自动驾驶/金融科技。
- 薪酬(中国,仅供参考):1-3 年 40-70 万、3-5 年 70-120 万、资深 120-200 万+;创业公司现金略低但给期权。
- 卖方市场:会调 GPU 集群的人远不够用,但必须「真懂」——带项目 + 读过源码是硬通货。
6. 30 天冲刺节奏(每天 2–3h)
- 第 1–2 周:
00–05(行业现实→硬件→接入→虚拟化),动手装 GPU Operator + 跑 MIG。 - 第 3 周:
06–09(调度→训练编排→互联),读 Volcano gang 插件源码、跑 Kubeflow Job。 - 第 4 周:
10–13(推理→可观测→平台→面试),落地12项目,按13准备话术与简历。 - 全程画架构图(手画也行),这是面试最加分的能力。
与
00总纲的「约 1 个月」节奏一致。开始吧。