学习库/ AI Infra 转型/ AI-Infra 转岗指南 · 格桑(配套速览)
🧠 AI Infra 转型 · 第 16 / 17 篇

AI-Infra 转岗指南 · 格桑(配套速览)

1516 字· 阅读约 3 分钟· 2026-08-23 更新

AI-Infra 转岗指南 · 格桑(配套速览)

用途:本文件是 0013 系统教材的配套速览——主打四件事:① 转岗路线一眼看完;② 技术点纠错汇总(把分散在各章的「纠错回顾」集中,防踩坑);③ 面试项目骨架 + TI-ONE 对照;④ 2026 岗位与行情速览。 配合姿势:先读本指南建立全局感 → 按 0113 系统学 → 学完回本指南落地 12 项目。 ⏱️ 数据截至:2026-08


1. 转岗路线图速览(云原生 → AI Infra)

你已有的(入场券) 要补的(三大短板) 终点
K8s / 容器编排 / Operator / 分布式系统 ① GPU 硬件语义与选型 能搭/维护类 TI-ONE 的 AI 训推平台底座
② AI 负载特性(训练/推理差异、CUDA/算子)
③ 性能调优与可观测(GPU 利用率排查)

三大补强对应教材:

  • 硬件/行业/选型 → 01 02 03(含 AI/ML 基础速成)
  • 接入/虚拟化/调度 → 04 05 06 07 08
  • 训练/推理/可观测/平台 → 09 10 11 12 13

最佳切入点岗位:AI 平台工程师 / AI SRE——K8s 经验 100% 复用。详见 13.1


2. ⭐ 技术点纠错汇总(防坑必看)

这些点是和元宝对话中确认过的易错点,已分别内联进对应章节,这里集中便于速记。

纠错 1:GPU Operator 与 device-plugin 是「包含」不是「并列」

  • ❌ 错误认知:Operator 和 device-plugin 是两套独立东西。
  • ✅ 正确:GPU Operator 内含 device-plugin(用 ClusterPolicy 一键管驱动+device-plugin+GFD+DCGM)。详见 04.3

纠错 2:A100 MIG 不是「8 层显存 7 层计算」

  • ❌ 错误说法:A100 有 8 层显存 7 层计算单元每层 5GB。
  • ✅ 正确:A100 最多切 7 个独立 GPU 实例;A100-80G 最小 profile 1g.10gb,不存在「8 层」。详见 05.2

纠错 3:Volcano 是「完全开源」,大厂在其上扩展

  • ❌ 错误说法:Volcano 是「半开源」,大厂从零自研调度器。
  • ✅ 正确:Volcano 是 CNCF 完全开源;字节 Gödel、腾讯 qGPU 等多是在 kube-scheduler / Volcano 之上扩展,而非另起炉灶。详见 08.6/08.8

纠错 4(最易踩):7B 全参微调显存不是 50–70GB

  • ❌ 旧资料写:「训练 7B 合计常需 50–70 GB」。
  • ✅ 正确:混合精度 AdamW 全参微调 ≈ 16 字节/参数 → 7B ≈ 112 GB(优化器状态 alone 就 ~84GB),单张 A100 80G 根本放不下,必须 ZeRO-3/FSDP 多卡或 LoRA/QLoRA。做容量规划务必用「参数 × 16 字节」。详见 01.5/03.4

纠错 5(认知补全):异构不止 GPU

  • 真实的「异构算力池化」还包含 Google TPU / AWS Trainium 等 ASIC(2025 起突破明显)。接入思路(device-plugin 标准化、调度亲和、框架编译)可迁移。详见 02.9

纠错 6(认知补全):Volcano API 是 v1beta1 不是 v1alpha1

  • ✅ 正确:Volcano Job/Queue API 已统一为 v1beta1(早期资料写 v1alpha1 已过时)。详见 07.5

纠错 7(认知补全):混部的难点是隔离不是调度

  • 很多人以为混部就是「调度在线+离线」,其实难点在干扰隔离——离线突发吃满资源会拖垮在线。Koordinator 的核心价值是干扰检测与压制,不是调度算法。详见 08.5

纠错 8(2026 现实):NVIDIA 中国份额不是 95% 了

  • 受出口管制,2025 年 H20 被禁后 NVIDIA 中国份额从约 95% 暴跌;H20/H200 相继放行后回升到约 55%,国产已拿下约 41%。别再背「NVIDIA 占 95%」的旧数字。详见 02.6

3. 面试项目骨架:迷你 TI-ONE

完整版见 12。这里给「必做清单」,照着落地即可形成面试作品。

最小可用闭环(MVP):

  1. GPU Operator 接入多卡(验证 nvidia.com/gpu 成资源)。
  2. Volcano 提交一个 8 卡 Gang 训练 Job(验证整组调度)。
  3. Kubeflow PyTorchJob 或 Ray 提交训练(验证编排抽象)。
  4. KServe + vLLM 起一个推理服务(验证推的一环)。
  5. Prometheus + DCGM + Grafana 看 GPU 指标(验证可观测)。
  6. 写一份 README(架构图 + 能力矩阵 + 与 TI-ONE 对照)。

加分项: MIG/qGPU 切分共享、Kueue 队列配额、Checkpoint+弹性容错、在离线混部(Koordinator)、读过 Volcano gang 源码、自定义 Scheduler Plugin、国产卡适配。

面试讲法: 不堆组件名,讲「我解决了什么」——提交从手写 YAML 变一条 CRD、利用率可观测可定位、架构对标 TI-ONE 可扩展、把单 token 成本降了 X%。详见 13.6


4. 与腾讯云 TI-ONE 对照(精简)

TI-ONE 能力 你的迷你版 可扩展方向
算力接入(多厂商) GPU Operator + 国产卡 / TPU operator(02.9/04.5
调度/训练 Volcano + Kubeflow 基本对齐
推理部署 KServe + vLLM 对齐
监控 Prometheus + DCGM 对齐
数据工程 对象存储 + 并行 FS(3FS/JuiceFS) TI-ONE 有完整特征/标注链路
多租户/计费 Kueue 配额(待补 RBAC/计费) 需补
Pipeline 手动提交 + KFP

国内类似平台:阿里 PAI、百度 百舸、字节 火山方舟。完整对照见 12.8


5. 2026 岗位与行情速览(详见 13.1-13.2

  • 最佳切入点:AI 平台工程师 / AI SRE(K8s 经验直接复用)。
  • 最热方向:LLM Infrastructure(大模型推理服务,2025-2026 推理时代)。
  • 招聘方:字节/腾讯/阿里/百度/美团、DeepSeek/智谱/月之暗面/MiniMax 等模型公司、云厂商、自动驾驶/金融科技。
  • 薪酬(中国,仅供参考):1-3 年 40-70 万、3-5 年 70-120 万、资深 120-200 万+;创业公司现金略低但给期权。
  • 卖方市场:会调 GPU 集群的人远不够用,但必须「真懂」——带项目 + 读过源码是硬通货。

6. 30 天冲刺节奏(每天 2–3h)

  • 第 1–2 周0005(行业现实→硬件→接入→虚拟化),动手装 GPU Operator + 跑 MIG。
  • 第 3 周0609(调度→训练编排→互联),读 Volcano gang 插件源码、跑 Kubeflow Job。
  • 第 4 周1013(推理→可观测→平台→面试),落地 12 项目,按 13 准备话术与简历。
  • 全程画架构图(手画也行),这是面试最加分的能力。

00 总纲的「约 1 个月」节奏一致。开始吧。

← 返回专栏