Kubernetes AI Infra
Kubernetes、GPU 资源管理与 vLLM 推理服务
用命令、对象状态和日志分析系统运行过程
5 个学习阶段 19 章课程 1 个贯穿项目
课程大纲
Kubernetes、GPU 资源管理、vLLM、分布式推理与性能分析
已开放
即将开放
学习阶段
章节
主题与关键内容
01
Kubernetes
Kubernetes
基础与生产集群
第 1–3 章
-
01
第 1 章一个 GPU Pod 是如何被创建的
- 02第 2 章Kubernetes 核心对象与控制面深入
- 03第 3 章生产级集群搭建与高可用
API Server、etcd、Controller、Scheduler、Kubelet、容器运行时、网络、存储、GPU 设备与 Pod 生命周期
02
GPU 资源管理与
GPU 资源管理与
AI 工作负载调度
第 4–5 章
- 04第 4 章GPU 资源管理与设备插件
- 05第 5 章AI 工作负载调度与队列管理
NVIDIA Device Plugin、GPU 拓扑、Node Feature Discovery、调度器扩展、优先级与抢占、队列与配额
03
vLLM 核心原理与
vLLM 核心原理与
功能特性
第 6–11 章
- 06第 6 章vLLM 架构总览与执行引擎
- 07第 7 章KV Cache 与内存管理
- 08第 8 章并发请求与批处理调度
- 09第 9 章分布式执行与张量并行
- 10第 10 章混合精度与量化处理
- 11第 11 章vLLM 与生态集成
PagedAttention、显存优化、调度策略、并行策略、OpenAI 兼容 API、生态工具链
04
分布式推理与
分布式推理与
生产调优
第 12–16 章
- 12第 12 章多机多卡部署与集群拓扑
- 13第 13 章负载均衡与请求路由
- 14第 14 章弹性伸缩与容量规划
- 15第 15 章推理性能调优方法论
- 16第 16 章故障恢复与高可用设计
KServe、Gateway API、HPA/VPA、缓存策略、限流熔断、混部、SLO 与稳定性保障
05
可观测性与
可观测性与
性能分析
第 17–19 章
- 17第 17 章可观测性体系与监控告警
- 18第 18 章性能分析与 Profiling
- 19第 19 章日志追踪与问题定位
Prometheus、Grafana、OpenTelemetry、链路追踪、eBPF、火焰图、端到端排障方法
适用人群
- 平台工程师/SRE:负责 Kubernetes 集群和基础设施
- 云原生工程师:负责 Kubernetes 应用交付与平台建设
- AI Infra 工程师:负责大模型训练或推理基础设施
- 开发者与架构师:希望系统学习 AI 基础设施
学习方法
运行过程
按照工作负载的运行顺序介绍组件及其实现
实验验证
使用命令、对象状态和日志验证组件行为
故障取证
将跨组件事件组成时间线,定位第一处失败