课程介绍
从零构建企业级 AI 基础设施与大模型生产线,覆盖网络、容器、Kubernetes、GPU 集群、镜像供应、数据存储、模型训练、评估、分布式推理、性能优化与可观测性。课程兼顾 NVIDIA 官方方案与开源技术路线,强调可落地、可复现的 AI 全栈实战能力。
CURRICULUM
课程目录
14
-
01
账号、DNS、NTP、CA、.env、域名
-
02
BCM HeadNode 图形安装和基础工具
-
03
cnode image、Harbor trust、NVIDIA 用户态、Pyxis/Enroot
-
04
DOCA-OFED、PXE 装机、硬件验收
-
05
Docker、Kubernetes、GPU/Network/NIM Operator、BCM Gateway 与 MIG 配置
-
06
Harbor 安装、project、镜像预热与验收
-
07
MinIO 安装、bucket、对象路径
-
08
Lustre 服务端/客户端与 Kubernetes PV/PVC
-
09
GPU/MIG 标签、Run:AI CP/Cluster、Project/Lab Space
-
10
NeMo Platform、资产导入、NCCL、Customizer、MIG Evaluator、NIM
-
11
Dynamo TensorRT-LLM 主线上线、KV 四幕与 TP Rank/GPU/NIC/Rail 理想对应
-
12
BCM Prometheus/Grafana 监控 live Dynamo
-
13
Slurm 基础、CPU 案例、Pyxis/Enroot、两 RTX 训练
-
14
SGLang PD 分离、KV-aware routing 四幕、OpenAI API、Grafana Dashboard
COURSE RECORDINGS
课程录像
公开试听录像,可以直接播放或前往原视频平台观看。
B 站01
PUBLIC PREVIEW
