学习库/ AI Infra 转型/ 13 · 13 面试准备与职业发展
🧠 AI Infra 转型 · 第 14 / 17 篇

13 面试准备与职业发展

2716 字· 阅读约 6 分钟· 2026-08-23 更新

13 面试准备与职业发展

阶段四后半段,课程收官。前 12 章给了你「全链路知识 + 一个可演示平台」。这一章把它变成面试资本:知识域地图、高频题、转型话术、简历项目写法、发展路径,以及 2026 年真实的岗位与薪酬行情。

💡 给你的话:你的核心优势是「带着可演示的平台项目 + 读过源码」去面试,而不是空谈「我学过」。这一章教你怎么把这些变成 offer。


13.1 2026 年 AI Infra 岗位地图(先搞清楚投什么)

不是所有「AI Infra」岗都一样。匹配你 K8s/SRE 背景的,按契合度排序:

岗位 做什么 和你的契合度 备注
AI 平台工程师 / GPU 平台工程师 搭训推平台、管 GPU 集群、写 Operator ⭐⭐⭐ 最佳切入点 直接用 K8s 经验
ML Infrastructure 工程师 训练/推理基础设施、调度、编排 ⭐⭐⭐ 高 偏训练侧
LLM Infrastructure 工程师 大模型推理服务、vLLM/SGLang 部署优化 ⭐⭐ 高(2026 最热) 推理时代需求大
MLOps 工程师 模型上线流水线、CI/CD、监控 ⭐⭐ 中高 偏 DevOps 迁移
AI SRE / Production ML GPU 集群稳定性、on-call、排障 ⭐⭐⭐ 高 SRE 直接迁移
推理优化工程师 深入 CUDA/算子、量化、Kernel 优化 ⭐ 中(需补硬件功底) 门槛高、薪酬高

⚠️ 内幕:很多公司招「AI Infra」其实分平台开发型(搭平台、写 Operator、做调度——你的最佳切入点)和性能调优型(深入 CUDA/算子、Profiling——需更深硬件功底)。先切入前者,再慢慢补后者,不要一上来硬啃 CUDA。

重点:你的最佳路径是 AI 平台工程师 / AI SRE ——K8s 经验 100% 复用,GPU/AI 负载知识补齐即可胜任。


13.2 谁在招、行情如何(2026 中国)

主要招聘方

  • 大厂:字节、腾讯、阿里、百度、美团——都有大规模 GPU 集群,最缺能把利用率提上去的人。
  • AI 模型公司:DeepSeek、智谱、月之暗面、MiniMax、Qwen 团队等——训练/推理平台需求旺。
  • 云厂商:腾讯云/阿里云/火山引擎——做 TI-ONE/PAI/方舟这类产品。
  • 自动驾驶 / 金融科技 / 出海 AI——也有自建 GPU 集群需求。

薪酬区间(中国,2026,仅供参考,差异大)

级别 大厂年包(约) AI 创业公司
1-3 年 40-70 万 可能给期权,现金略低
3-5 年 70-120 万 期权空间大
资深/专家 120-200 万+ 期权可能很值钱(也可能归零)

⚠️ 内幕:2025-2026 AI Infra 是卖方市场——GPU 稀缺 + 大模型热,会调 GPU 集群的人远不够用。但你必须是「真懂」而非「简历写学过」,面试一轮系统设计 + 一轮源码/排障就露馅。带项目 + 读过源码是硬通货。创业公司期权高风险高回报,大厂现金稳。


13.3 知识域地图(面试考什么)

AI Infra 工程师能力域
├─ 硬件与行业(01-03)
│   ├─ GPU 架构 / Tensor Core / 显存带宽
│   ├─ 厂商产品与格局(N/AMD/国产/TPU,含 2026 内幕)
│   └─ 选型与 TCO
├─ 资源接入与虚拟化(04-05)
│   ├─ Device Plugin / GPU Operator
│   └─ MIG / qGPU / vGPU
├─ 调度(06-08)
│   ├─ kube-scheduler / Scheduler Framework
│   ├─ Volcano / Gang / 公平
│   └─ Kueue / Koordinator / YuniKorn / Gödel / qGPU
├─ 训练(09)
│   ├─ 并行策略 / ZeRO / Megatron
│   ├─ NCCL / 互联 / 集合通信
│   └─ Kubeflow / Ray 编排
├─ 推理(10)
│   ├─ vLLM/SGLang/TensorRT-LLM
│   ├─ PagedAttention / 连续批 / 量化 / 投机解码
│   └─ KServe / Triton 服务化
├─ 可观测与调优(11)
│   ├─ DCGM / Prometheus / Grafana
│   └─ 利用率排查 / Nsight / FlashAttention
└─ 平台与综合(12)
    ├─ 平台架构 / 容错 / 存储 / 多租户
    └─ 异构 / 信创 / 国产替代

⭐ 面试前对照这张图自测:每个叶子能不能讲 3 分钟。讲不出的回去补对应章节。


13.4 高频面试题(分模块)

硬件/选型

  • 训练 7B 模型显存怎么估算?为什么单张 A100 80G 跑不了全参微调?(答:16 字节/参数 ≈ 112GB,需 ZeRO/多卡或 LoRA)
  • H100 vs H200 vs B200 区别?中国为什么用 H20/昇腾?2025 年 H20 经历了什么?
  • 显存带宽和算力,哪个更常是瓶颈?为什么?

接入/调度

  • K8s 原生怎么管 GPU?Device Plugin 负责什么不负责什么?
  • GPU Operator 和 device-plugin 什么关系?(答:包含)
  • 什么是 Gang Scheduling?为什么分布式训练必须整组起?
  • 写一个自定义 Scheduler Framework 插件的思路?
  • Volcano / Kueue / YuniKorn 定位区别?混部的难点是调度还是隔离?

训练/通信

  • DDP 和 FSDP 区别?ZeRO 分片了什么?
  • 多机训练为什么慢?NCCL 走了 IB 还是以太网怎么查?
  • AllReduce / AllGather 是什么?

推理/服务

  • vLLM 为什么吞吐高?(连续批 + PagedAttention)
  • KV Cache 是什么?为什么长上下文推理贵?量化怎么降成本?
  • KServe 在 K8s 上解决什么?为什么能缩到 0?
  • 怎么降低「每 1000 token 成本」?

平台/综合

  • 怎么把 GPU 利用率从 30% 提到 70%?(MIG/qGPU + 调度 + 混部)
  • 画一个 AI 训推平台架构图,并讲每层取舍。
  • 国产卡/TPU 接入平台的难点?异构集群为什么常「卡多但用不好」?
  • 万卡训练为什么必须有容错?哪三层?

13.5 ⭐ 转型话术(云原生 → AI Infra)

你的核心卖点:已有的 K8s/容器/Operator 能力,正是 AI Infra 的入场券;缺的「GPU 这一层 + AI 负载特性」已系统补齐,并有可演示项目 + 读过源码。

话术骨架:

  1. 「我做了 N 年云原生,深度懂 K8s 调度、Operator、分布式系统——这是 AI 平台的底座。」
  2. 「过去半年我系统补了 GPU 硬件语义、CUDA/算子、训练/推理负载特性,并搭了一个迷你训推平台(指 12),读过 Volcano gang 插件源码。」
  3. 「所以我能直接上手:GPU 资源接入、调度器扩展、训练编排、推理服务化、可观测——从『会用平台』变成『能搭平台』。」
  4. (差异化)「我在中国场景,熟悉异构(N 卡+国产卡)+ 出口管制约束,能搞定国产卡适配——这是欧美工程师不具备的经验。」

避坑:别只说「我学过」,要说「我搭过/优化过/读过源码」——12 的平台项目、11 的排查法、07 的源码导读就是你「做过」的证据。

⚠️ 内幕:AI Infra 面试和纯 SRE 面试的区别——多了「AI 负载特性理解」(为什么训练要 Gang、为什么推理要批处理)和「硬件基础」(显存/带宽/互联)。但这些你学了 01-11 已经覆盖。系统设计题大概率是「设计一个 AI 训推平台」——12 的全景图直接用。


13.6 简历项目写法(迷你 TI-ONE)

项目名:基于 K8s 的迷你 AI 训推平台(Mini-TI-ONE) 你的角色:平台设计与核心组件落地 技术栈:Kubernetes / GPU Operator / Volcano / Kueue / Kubeflow / KServe / vLLM / Prometheus+DCGM 做了什么(STAR)

  • S:团队缺统一 GPU 平台,利用率低、训练提交靠手工 YAML。
  • T:搭一套接入→调度→训练/推理编排→可观测的平台。
  • A:用 GPU Operator 接入多卡;Volcano 做 Gang 调度、Kueue 做队列配额;Kubeflow PyTorchJob / Ray 做训练编排;KServe+vLLM 做推理;Prometheus+DCGM 做监控;并设计 Checkpoint+弹性容错。
  • R:训练提交从「手写 YAML」变成「一条 CRD」;GPU 利用率可观测、定位瓶颈效率提升;形成对标本厂 TI-ONE 的架构。

⭐ 简历写「做过平台」不如写「解决了什么、量化了什么」。能说清架构图和每层选型理由,比罗列组件名值钱。

加分项(选写):读过 Volcano gang 插件源码、做过 MIG/qGPU 切分、写过自定义 Scheduler Plugin、做过国产卡适配。


13.7 发展路径

L1 平台开发/运维(上手期,1-3 月)
   → 管好 GPU 接入、调度、基础监控,能排障
L2 AI Infra 工程师(目标岗,3-12 月)
   → 独立设计调度策略、训练编排、推理服务化、性能调优
L3 资深 / 架构(进阶,1-2 年+)
   → 在离线混部、异构算力池化(国产/TPU)、自研调度、平台产品化

3-12 月 ramp 计划(针对你的背景)

  • 月 1-2:学完 01-05(硬件→接入→虚拟化),动手装 GPU Operator + 跑 MIG。
  • 月 3-4:学完 06-09(调度→训练→通信),读 Volcano gang 源码、跑 Kubeflow Job。
  • 月 5-6:学完 10-13(推理→可观测→平台→面试),落地 12 项目,准备话术。
  • 全程画架构图(手画也行),这是面试最加分的能力。

13.8 常见踩坑(面试避雷)

  1. 只背组件名不懂原理:说「我会 vLLM」但答不出 PagedAttention → 露馅。
  2. 死记数字不看口径:报「NVIDIA 占 90%」不分口径 → 不专业。
  3. 忽视异构/国产:在国内不提国产卡适配 → 显得脱离现实。
  4. 说「利用率低就加卡」:不排查根因 → 不专业(见 11.4)。
  5. 没项目只说学过:没有 12 的可演示作品 → 缺说服力。


13.8 实战:模拟面试与简历准备

13.8.1 3 分钟自我介绍模板

我是 [名字],[X] 年 K8s 经验。最近系统学了 AI Infra 全链路:
GPU 架构/选型 -> Device Plugin/GPU Operator -> Volcano Gang 调度 ->
DDP/FSDP 分布式训练 -> vLLM 推理服务 -> 搭建过迷你 AI 平台。
优势:带着可演示的平台项目 + 读过源码。

13.8.2 高频面试题自测(每题 2-3 分钟录音回答)

  1. K8s 里 GPU 怎么被调度到 Pod 里(完整链路)
  2. Gang 调度是什么,为什么 AI 训练需要
  3. KV Cache 为什么让长上下文推理贵
  4. MFU 是什么,怎么优化
  5. 混部的难点是什么
  6. 设计一个 AI 训推平台(6 步框架)

13.8.3 简历项目写法

项目: 迷你 AI 训推平台(K8s)
技术栈: K8s + Volcano + Kueue + vLLM + Prometheus
成果:
  - Gang 调度避免训练死锁
  - GPU 利用率 30%->65%
  - vLLM 吞吐提升 2-3 倍
  - 全链路可观测

目的:把学过变成做过 -- 有组件、有量化、有架构。


13.9 自测题

  1. 画出 AI Infra 知识域地图(至少 6 大域)。
  2. 2026 年匹配你背景的 AI Infra 岗位有哪些?最佳切入点是哪两个?
  3. 准备 1 分钟「云原生转 AI Infra」的自我介绍话术(含差异化)。
  4. 用 STAR 法口头描述你的迷你 TI-ONE 项目。
  5. 面试官问「7B 全参微调为什么 A100 80G 跑不下」,你怎么答?
  6. 面试官要求「画 AI 平台架构图」,你能默画并讲取舍吗?
  7. ⭐ AI Infra 面试和纯 SRE 面试的区别是什么?你补的是哪两块?
  8. 你未来 1–2 年的能力目标是什么?3-12 月 ramp 计划?

🎉 全套 00–13 完成。配合《AI-Infra转岗指南-格桑.md》与《术语表与索引.md》,你已具备「从零基础到能搭类 TI-ONE 平台」的系统能力。去面试吧。

← 返回专栏