跳转至

Kubernetes AI Infra

Kubernetes、GPU 资源管理与 vLLM 推理服务
用命令、对象状态和日志分析系统运行过程

5 个学习阶段 19 章课程 1 个贯穿项目

课程大纲

Kubernetes、GPU 资源管理、vLLM、分布式推理与性能分析

已开放 即将开放
学习阶段 章节 主题与关键内容
01

Kubernetes
基础与生产集群

第 1–3 章

  1. 01
  2. 02
    第 2 章Kubernetes 核心对象与控制面深入
  3. 03
    第 3 章生产级集群搭建与高可用

API Server、etcd、Controller、Scheduler、Kubelet、容器运行时、网络、存储、GPU 设备与 Pod 生命周期

02

GPU 资源管理与
AI 工作负载调度

第 4–5 章

  1. 04
    第 4 章GPU 资源管理与设备插件
  2. 05
    第 5 章AI 工作负载调度与队列管理

NVIDIA Device Plugin、GPU 拓扑、Node Feature Discovery、调度器扩展、优先级与抢占、队列与配额

03

vLLM 核心原理与
功能特性

第 6–11 章

  1. 06
    第 6 章vLLM 架构总览与执行引擎
  2. 07
    第 7 章KV Cache 与内存管理
  3. 08
    第 8 章并发请求与批处理调度
  4. 09
    第 9 章分布式执行与张量并行
  5. 10
    第 10 章混合精度与量化处理
  6. 11
    第 11 章vLLM 与生态集成

PagedAttention、显存优化、调度策略、并行策略、OpenAI 兼容 API、生态工具链

04

分布式推理与
生产调优

第 12–16 章

  1. 12
    第 12 章多机多卡部署与集群拓扑
  2. 13
    第 13 章负载均衡与请求路由
  3. 14
    第 14 章弹性伸缩与容量规划
  4. 15
    第 15 章推理性能调优方法论
  5. 16
    第 16 章故障恢复与高可用设计

KServe、Gateway API、HPA/VPA、缓存策略、限流熔断、混部、SLO 与稳定性保障

05

可观测性与
性能分析

第 17–19 章

  1. 17
    第 17 章可观测性体系与监控告警
  2. 18
    第 18 章性能分析与 Profiling
  3. 19
    第 19 章日志追踪与问题定位

Prometheus、Grafana、OpenTelemetry、链路追踪、eBPF、火焰图、端到端排障方法

适用人群

  • 平台工程师/SRE:负责 Kubernetes 集群和基础设施
  • 云原生工程师:负责 Kubernetes 应用交付与平台建设
  • AI Infra 工程师:负责大模型训练或推理基础设施
  • 开发者与架构师:希望系统学习 AI 基础设施

学习方法

运行过程

按照工作负载的运行顺序介绍组件及其实现

实验验证

使用命令、对象状态和日志验证组件行为

故障取证

将跨组件事件组成时间线,定位第一处失败