NVIDIA AI Factory 企业级大模型生产线全栈实战(NCP-AIO)

QYTANG VIP PROGRAM · Nvidia

NVIDIA AI Factory 企业级大模型生产线全栈实战(NCP-AIO)

公开试听1 条录像14 项目录
COURSE INTRODUCTION

课程介绍

从零构建企业级 AI 基础设施与大模型生产线,覆盖网络、容器、Kubernetes、GPU 集群、镜像供应、数据存储、模型训练、评估、分布式推理、性能优化与可观测性。课程兼顾 NVIDIA 官方方案与开源技术路线,强调可落地、可复现的 AI 全栈实战能力。

CURRICULUM

课程目录

14
  1. 01

    账号、DNS、NTP、CA、.env、域名

  2. 02

    BCM HeadNode 图形安装和基础工具

  3. 03

    cnode image、Harbor trust、NVIDIA 用户态、Pyxis/Enroot

  4. 04

    DOCA-OFED、PXE 装机、硬件验收

  5. 05

    Docker、Kubernetes、GPU/Network/NIM Operator、BCM Gateway 与 MIG 配置

  6. 06

    Harbor 安装、project、镜像预热与验收

  7. 07

    MinIO 安装、bucket、对象路径

  8. 08

    Lustre 服务端/客户端与 Kubernetes PV/PVC

  9. 09

    GPU/MIG 标签、Run:AI CP/Cluster、Project/Lab Space

  10. 10

    NeMo Platform、资产导入、NCCL、Customizer、MIG Evaluator、NIM

  11. 11

    Dynamo TensorRT-LLM 主线上线、KV 四幕与 TP Rank/GPU/NIC/Rail 理想对应

  12. 12

    BCM Prometheus/Grafana 监控 live Dynamo

  13. 13

    Slurm 基础、CPU 案例、Pyxis/Enroot、两 RTX 训练

  14. 14

    SGLang PD 分离、KV-aware routing 四幕、OpenAI API、Grafana Dashboard

COURSE RECORDINGS

课程录像

公开试听录像,可以直接播放或前往原视频平台观看。