Implementing AI Data Center Networks One-Day Workshop (IAIDCNW)

 

Kursüberblick

Dieser eintägige Workshop für Fortgeschrittene vermittelt den Teilnehmern Kenntnisse, die beim Aufbau und bei der Arbeit mit Juniper Apstra™ hilfreich sein können. in einem Rechenzentrum für künstliche Intelligenz (KI-Rechenzentrum). Dieser Workshop vermittelt den Teilnehmern das notwendige Hintergrundwissen, um die Funktionsweise des im Juniper Validated Design (JVD) mit dem Titel „AI Data Center“ beschriebenen Backend-GPU-Netzwerks verstehen Vernetzung mit Juniper Apstra, NVIDIA-GPUs und WEKA Storage. Die Studierenden lernen, KI-Modelle mithilfe des PyTorch-Frameworks auf folgenden Plattformen zu trainieren:

  • ein einzelner Server mit mehreren GPUs (einschließlich des NVSwitch von NVIDIA); und
  • mehrere Server, von denen jeder über mehrere GPUs verfügt.

Die Studierenden machen sich mit Netzwerkschnittstellenkarten (NICs) für KI (NVIDIA ConnectX-7 und Broadcom P2200G), Nvidia H100-GPUs und einem Rechenplattformarchitektur (NVIDIA DGX H100). Die Studierenden erhalten einen Überblick über die auf NVIDIA ausgerichtete JVD für das KI-Rechenzentrum. Im Zusammenhang mit dem Back-End-GPU-Netzwerk lernen die Studierenden, dass mithilfe der NVIDIA Collective Communication Library (NCCL) Remote Direct Memory Zugriff (RDMA) über Converged Ethernet (RoCEv2), und ein für die Schiene optimiertes Netzwerkdesign gewährleistet einen optimalen Kommunikationspfad für das gesamte System Abläufe bei NCCL. Die Studierenden lernen, wie man sowohl die „Data Center Quantized Congestion Notification“ (DCQCN) als auch den „Dynamic Load Balancing“ (DLB) einsetzt. um eine verlustfreie Datenübertragung über ein Ethernet-basiertes Netzwerk zu gewährleisten. Die Studierenden lernen zudem, wie sie mit Apstra das Backend-GPU-Netzwerk bereitstellen können sowie die Koordinierung des Trainingsclusters mithilfe von Slurm. Ausschließlich durch Vorlesungen erwerben die Studierenden Kenntnisse über die Bereitstellung und das Training von KI-Modellen in einem Rechenzentrum auf der Grundlage des JVD mit dem Titel „AI Data Center Networks“ mit Juniper Apstra, NVIDIA-GPUs und WEKA Storage.

Dieser Text wurde automatisiert übersetzt. Um den englischen Originaltext anzuzeigen, klicken Sie bitte hier.

Zielgruppe

  • Personen, die verstehen möchten, wie man ein Machine-Learning-Modell in einem Rechenzentrum trainiert, das für das Training von KI-Modellen optimiert ist.
  • Personen, die ein Rechenzentrum verwalten und betreiben, das für das Training von KI-Modellen optimiert ist.

Voraussetzungen

  • Umfassende Erfahrung in den Bereichen Netzwerkdesign und -betrieb
  • Grundlagen der Clos-IP-Struktur
  • Kenntnisse in den Grundlagen der Automatisierungsplanung und der Arbeitsabläufe
  • Kenntnisse in Linux, Python und Junos-basierten Class-of-Service-Lösungen
  • Absolvierung des Kurses „Automatisierung von Rechenzentren mit Juniper Apstra (APSTRA)“ oder gleichwertige Kenntnisse

Kursziele

  • Beschreiben Sie die Grundlagen des maschinellen Lernens
  • Beschreiben Sie den Zweck der Rahmenwerke für KI.
  • Beschreiben Sie eine Rechenplattform für das KI-Rechenzentrum
  • Beschreiben Sie, wie ein Modell auf mehreren Rechenknoten unter Verwendung mehrerer GPUs trainiert wird.
  • Beschreiben Sie validierte Entwürfe
  • Beschreiben Sie das Backend-GPU-Netzwerk für das JVD.
  • Beschreiben Sie die Analysefunktionen von Juniper Apstra für das Backend-GPU-Netzwerk.

Kursinhalt

Tag eins
  • Modul 1: Was ist maschinelles Lernen?
    • Beschreiben Sie die verschiedenen Formen des maschinellen Lernens
    • Erläutern Sie die Gründe für den Aufbau eines KI-Rechenzentrums.
    • Beschreiben Sie Datentypen und Operationen im Bereich des maschinellen Lernens
    • Beschreiben Sie den Prozess des Trainings eines KI-Modells
  • Modul 2: Machine-Learning-Stack
    • Beschreiben Sie eine Rechenplattform, die für künstliche Intelligenz entwickelt wurde.
    • Beschreiben Sie den Machine-Learning-Stack
  • Modul 3: Maschinelles Lernen – Einzelne GPU
    • Beschreiben Sie den CUDA-Verarbeitungsablauf.
  • Modul 4: KI-Rechenplattformen
    • Beschreiben Sie die NVIDIA DGX H100-Rechenplattformen
  • Modul 5: Maschinelles Lernen – Mehrere GPUs
    • Beschreiben Sie den Verarbeitungsablauf von CUDA und NCCL innerhalb eines einzelnen Rechenknotens.
    • Beschreiben Sie, wie man mit PyTorch ein einfaches Modell unter Verwendung mehrerer GPUs trainiert.
  • Modul 6: Maschinelles Lernen – Mehrere Knoten
    • Beschreiben Sie den Verarbeitungsablauf von CUDA und NCCL zwischen mehreren Rechenknoten.
    • Beschreiben Sie, wie man mit Slurm parallele Aufgaben koordiniert
    • Beschreiben Sie, wie man mit PyTorch und Slurm ein einfaches Modell unter Verwendung mehrerer Knoten trainiert.
  • Modul 7: Referenzdesigns
    • Beschreiben Sie die von Juniper validierten Designs für das KI-Rechenzentrum
  • Modul 8: Von Juniper validiertes Design – Rechennetzwerk
    • Beschreiben Sie die Topologie des Backend-GPU-Netzwerks.
    • Beschreiben Sie, wie das Backend-GPU-Netzwerk mit Juniper Apstra entworfen wird.
    • Beschreiben Sie verlustfreies Ethernet unter Verwendung von DCQCN
    • Beschreiben Sie den dynamischen Lastausgleich
  • Modul 9: Automatisierung und Analytik
    • Beschreiben Sie die Analysefunktionen von Juniper Apstra für das KI-Rechenzentrum

Preise & Trainingsmethoden

Online Training

Dauer
1 Tage

Preis
  • auf Anfrage
Classroom Training

Dauer
1 Tage

Preis
  • auf Anfrage

Derzeit gibt es keine Trainingstermine für diesen Kurs.