13 面试准备与职业发展
13 面试准备与职业发展
阶段四后半段,课程收官。前 12 章给了你「全链路知识 + 一个可演示平台」。这一章把它变成面试资本:知识域地图、高频题、转型话术、简历项目写法、发展路径,以及 2026 年真实的岗位与薪酬行情。
💡 给你的话:你的核心优势是「带着可演示的平台项目 + 读过源码」去面试,而不是空谈「我学过」。这一章教你怎么把这些变成 offer。
13.1 2026 年 AI Infra 岗位地图(先搞清楚投什么)
不是所有「AI Infra」岗都一样。匹配你 K8s/SRE 背景的,按契合度排序:
| 岗位 | 做什么 | 和你的契合度 | 备注 |
|---|---|---|---|
| AI 平台工程师 / GPU 平台工程师 | 搭训推平台、管 GPU 集群、写 Operator | ⭐⭐⭐ 最佳切入点 | 直接用 K8s 经验 |
| ML Infrastructure 工程师 | 训练/推理基础设施、调度、编排 | ⭐⭐⭐ 高 | 偏训练侧 |
| LLM Infrastructure 工程师 | 大模型推理服务、vLLM/SGLang 部署优化 | ⭐⭐ 高(2026 最热) | 推理时代需求大 |
| MLOps 工程师 | 模型上线流水线、CI/CD、监控 | ⭐⭐ 中高 | 偏 DevOps 迁移 |
| AI SRE / Production ML | GPU 集群稳定性、on-call、排障 | ⭐⭐⭐ 高 | SRE 直接迁移 |
| 推理优化工程师 | 深入 CUDA/算子、量化、Kernel 优化 | ⭐ 中(需补硬件功底) | 门槛高、薪酬高 |
⚠️ 内幕:很多公司招「AI Infra」其实分平台开发型(搭平台、写 Operator、做调度——你的最佳切入点)和性能调优型(深入 CUDA/算子、Profiling——需更深硬件功底)。先切入前者,再慢慢补后者,不要一上来硬啃 CUDA。
⭐ 重点:你的最佳路径是 AI 平台工程师 / AI SRE ——K8s 经验 100% 复用,GPU/AI 负载知识补齐即可胜任。
13.2 谁在招、行情如何(2026 中国)
主要招聘方:
- 大厂:字节、腾讯、阿里、百度、美团——都有大规模 GPU 集群,最缺能把利用率提上去的人。
- AI 模型公司:DeepSeek、智谱、月之暗面、MiniMax、Qwen 团队等——训练/推理平台需求旺。
- 云厂商:腾讯云/阿里云/火山引擎——做 TI-ONE/PAI/方舟这类产品。
- 自动驾驶 / 金融科技 / 出海 AI——也有自建 GPU 集群需求。
薪酬区间(中国,2026,仅供参考,差异大):
| 级别 | 大厂年包(约) | AI 创业公司 |
|---|---|---|
| 1-3 年 | 40-70 万 | 可能给期权,现金略低 |
| 3-5 年 | 70-120 万 | 期权空间大 |
| 资深/专家 | 120-200 万+ | 期权可能很值钱(也可能归零) |
⚠️ 内幕:2025-2026 AI Infra 是卖方市场——GPU 稀缺 + 大模型热,会调 GPU 集群的人远不够用。但你必须是「真懂」而非「简历写学过」,面试一轮系统设计 + 一轮源码/排障就露馅。带项目 + 读过源码是硬通货。创业公司期权高风险高回报,大厂现金稳。
13.3 知识域地图(面试考什么)
AI Infra 工程师能力域
├─ 硬件与行业(01-03)
│ ├─ GPU 架构 / Tensor Core / 显存带宽
│ ├─ 厂商产品与格局(N/AMD/国产/TPU,含 2026 内幕)
│ └─ 选型与 TCO
├─ 资源接入与虚拟化(04-05)
│ ├─ Device Plugin / GPU Operator
│ └─ MIG / qGPU / vGPU
├─ 调度(06-08)
│ ├─ kube-scheduler / Scheduler Framework
│ ├─ Volcano / Gang / 公平
│ └─ Kueue / Koordinator / YuniKorn / Gödel / qGPU
├─ 训练(09)
│ ├─ 并行策略 / ZeRO / Megatron
│ ├─ NCCL / 互联 / 集合通信
│ └─ Kubeflow / Ray 编排
├─ 推理(10)
│ ├─ vLLM/SGLang/TensorRT-LLM
│ ├─ PagedAttention / 连续批 / 量化 / 投机解码
│ └─ KServe / Triton 服务化
├─ 可观测与调优(11)
│ ├─ DCGM / Prometheus / Grafana
│ └─ 利用率排查 / Nsight / FlashAttention
└─ 平台与综合(12)
├─ 平台架构 / 容错 / 存储 / 多租户
└─ 异构 / 信创 / 国产替代
⭐ 面试前对照这张图自测:每个叶子能不能讲 3 分钟。讲不出的回去补对应章节。
13.4 高频面试题(分模块)
硬件/选型
- 训练 7B 模型显存怎么估算?为什么单张 A100 80G 跑不了全参微调?(答:16 字节/参数 ≈ 112GB,需 ZeRO/多卡或 LoRA)
- H100 vs H200 vs B200 区别?中国为什么用 H20/昇腾?2025 年 H20 经历了什么?
- 显存带宽和算力,哪个更常是瓶颈?为什么?
接入/调度
- K8s 原生怎么管 GPU?Device Plugin 负责什么不负责什么?
- GPU Operator 和 device-plugin 什么关系?(答:包含)
- 什么是 Gang Scheduling?为什么分布式训练必须整组起?
- 写一个自定义 Scheduler Framework 插件的思路?
- Volcano / Kueue / YuniKorn 定位区别?混部的难点是调度还是隔离?
训练/通信
- DDP 和 FSDP 区别?ZeRO 分片了什么?
- 多机训练为什么慢?NCCL 走了 IB 还是以太网怎么查?
- AllReduce / AllGather 是什么?
推理/服务
- vLLM 为什么吞吐高?(连续批 + PagedAttention)
- KV Cache 是什么?为什么长上下文推理贵?量化怎么降成本?
- KServe 在 K8s 上解决什么?为什么能缩到 0?
- 怎么降低「每 1000 token 成本」?
平台/综合
- 怎么把 GPU 利用率从 30% 提到 70%?(MIG/qGPU + 调度 + 混部)
- 画一个 AI 训推平台架构图,并讲每层取舍。
- 国产卡/TPU 接入平台的难点?异构集群为什么常「卡多但用不好」?
- 万卡训练为什么必须有容错?哪三层?
13.5 ⭐ 转型话术(云原生 → AI Infra)
你的核心卖点:已有的 K8s/容器/Operator 能力,正是 AI Infra 的入场券;缺的「GPU 这一层 + AI 负载特性」已系统补齐,并有可演示项目 + 读过源码。
话术骨架:
- 「我做了 N 年云原生,深度懂 K8s 调度、Operator、分布式系统——这是 AI 平台的底座。」
- 「过去半年我系统补了 GPU 硬件语义、CUDA/算子、训练/推理负载特性,并搭了一个迷你训推平台(指
12),读过 Volcano gang 插件源码。」 - 「所以我能直接上手:GPU 资源接入、调度器扩展、训练编排、推理服务化、可观测——从『会用平台』变成『能搭平台』。」
- (差异化)「我在中国场景,熟悉异构(N 卡+国产卡)+ 出口管制约束,能搞定国产卡适配——这是欧美工程师不具备的经验。」
避坑:别只说「我学过」,要说「我搭过/优化过/读过源码」——
12的平台项目、11的排查法、07的源码导读就是你「做过」的证据。
⚠️ 内幕:AI Infra 面试和纯 SRE 面试的区别——多了「AI 负载特性理解」(为什么训练要 Gang、为什么推理要批处理)和「硬件基础」(显存/带宽/互联)。但这些你学了 01-11 已经覆盖。系统设计题大概率是「设计一个 AI 训推平台」——
12的全景图直接用。
13.6 简历项目写法(迷你 TI-ONE)
项目名:基于 K8s 的迷你 AI 训推平台(Mini-TI-ONE) 你的角色:平台设计与核心组件落地 技术栈:Kubernetes / GPU Operator / Volcano / Kueue / Kubeflow / KServe / vLLM / Prometheus+DCGM 做了什么(STAR):
- S:团队缺统一 GPU 平台,利用率低、训练提交靠手工 YAML。
- T:搭一套接入→调度→训练/推理编排→可观测的平台。
- A:用 GPU Operator 接入多卡;Volcano 做 Gang 调度、Kueue 做队列配额;Kubeflow PyTorchJob / Ray 做训练编排;KServe+vLLM 做推理;Prometheus+DCGM 做监控;并设计 Checkpoint+弹性容错。
- R:训练提交从「手写 YAML」变成「一条 CRD」;GPU 利用率可观测、定位瓶颈效率提升;形成对标本厂 TI-ONE 的架构。
⭐ 简历写「做过平台」不如写「解决了什么、量化了什么」。能说清架构图和每层选型理由,比罗列组件名值钱。
加分项(选写):读过 Volcano gang 插件源码、做过 MIG/qGPU 切分、写过自定义 Scheduler Plugin、做过国产卡适配。
13.7 发展路径
L1 平台开发/运维(上手期,1-3 月)
→ 管好 GPU 接入、调度、基础监控,能排障
L2 AI Infra 工程师(目标岗,3-12 月)
→ 独立设计调度策略、训练编排、推理服务化、性能调优
L3 资深 / 架构(进阶,1-2 年+)
→ 在离线混部、异构算力池化(国产/TPU)、自研调度、平台产品化
3-12 月 ramp 计划(针对你的背景):
- 月 1-2:学完 01-05(硬件→接入→虚拟化),动手装 GPU Operator + 跑 MIG。
- 月 3-4:学完 06-09(调度→训练→通信),读 Volcano gang 源码、跑 Kubeflow Job。
- 月 5-6:学完 10-13(推理→可观测→平台→面试),落地
12项目,准备话术。 - 全程画架构图(手画也行),这是面试最加分的能力。
13.8 常见踩坑(面试避雷)
- 只背组件名不懂原理:说「我会 vLLM」但答不出 PagedAttention → 露馅。
- 死记数字不看口径:报「NVIDIA 占 90%」不分口径 → 不专业。
- 忽视异构/国产:在国内不提国产卡适配 → 显得脱离现实。
- 说「利用率低就加卡」:不排查根因 → 不专业(见
11.4)。 - 没项目只说学过:没有
12的可演示作品 → 缺说服力。
13.8 实战:模拟面试与简历准备
13.8.1 3 分钟自我介绍模板
我是 [名字],[X] 年 K8s 经验。最近系统学了 AI Infra 全链路:
GPU 架构/选型 -> Device Plugin/GPU Operator -> Volcano Gang 调度 ->
DDP/FSDP 分布式训练 -> vLLM 推理服务 -> 搭建过迷你 AI 平台。
优势:带着可演示的平台项目 + 读过源码。
13.8.2 高频面试题自测(每题 2-3 分钟录音回答)
- K8s 里 GPU 怎么被调度到 Pod 里(完整链路)
- Gang 调度是什么,为什么 AI 训练需要
- KV Cache 为什么让长上下文推理贵
- MFU 是什么,怎么优化
- 混部的难点是什么
- 设计一个 AI 训推平台(6 步框架)
13.8.3 简历项目写法
项目: 迷你 AI 训推平台(K8s)
技术栈: K8s + Volcano + Kueue + vLLM + Prometheus
成果:
- Gang 调度避免训练死锁
- GPU 利用率 30%->65%
- vLLM 吞吐提升 2-3 倍
- 全链路可观测
目的:把学过变成做过 -- 有组件、有量化、有架构。
13.9 自测题
- 画出 AI Infra 知识域地图(至少 6 大域)。
- 2026 年匹配你背景的 AI Infra 岗位有哪些?最佳切入点是哪两个?
- 准备 1 分钟「云原生转 AI Infra」的自我介绍话术(含差异化)。
- 用 STAR 法口头描述你的迷你 TI-ONE 项目。
- 面试官问「7B 全参微调为什么 A100 80G 跑不下」,你怎么答?
- 面试官要求「画 AI 平台架构图」,你能默画并讲取舍吗?
- ⭐ AI Infra 面试和纯 SRE 面试的区别是什么?你补的是哪两块?
- 你未来 1–2 年的能力目标是什么?3-12 月 ramp 计划?
🎉 全套 00–13 完成。配合《AI-Infra转岗指南-格桑.md》与《术语表与索引.md》,你已具备「从零基础到能搭类 TI-ONE 平台」的系统能力。去面试吧。