NVIDIA Hopper 1 Cluster-Netzwerkprofil
Das Hopper 1-Cluster-Netzwerkprofil (hopper-1) bietet isolierte Netzwerke für Hopper HGX-Instanzen von NVIDIA, auf denen Workloads ausgeführt werden,
die eine Interkonnektivität mit hoher Bandbreite und geringer Latenz erfordern, wie z. B. KI-Training und groß angelegte Simulationen.
Das Hopper 1-Cluster-Netzwerkprofil, das sowohl die Instanzprofile „ NVIDIA “ ( H100 ) als auch „ H200 “ () unterstützt, ersetzt das veraltete Cluster-Netzwerkprofil „ H100 “.
Übersicht
Das Hopper 1-Cluster-Netzwerkprofil unterstützt Remote Direct Memory Access (RDMA) über das Netzwerkprotokoll „Convergent Ethernet v2 “ ( RoCEv2 ) für einen höheren Durchsatz, geringere Latenzzeiten und eine verbesserte Systemleistung.
Eine Liste der unterstützten Instanzprofile für dieses Cluster-Netzwerk finden Sie unter Hopper HGX-Instanzprofile.
Verfügbarkeit
Derzeit ist die Verwendung des Hopper 1-Cluster-Netzwerkprofils in den folgenden unterstützten Regionen und Zonen verfügbar:
| Bereich | Zone | Universeller Zonenname |
|---|---|---|
Frankfurt (eu-de) |
eu-de-2 |
eu-de-fra04-a |
Washington DC (us-east) |
us-east-3 |
us-east-wdc07-a |
Chennai – Airtel (in-che) H200 nur |
in-che-1 |
in-che-che02-a |
Um zu verstehen, wie verschiedene Regionen den Zonen zugeordnet sind, siehe Zonenabbildung pro Konto.
Fähigkeiten und Einschränkungen
Das Cluster-Netzwerk Hopper 1-Profil hat die folgenden Funktionen und Einschränkungen:
- Art: Dediziert
- Bandbreite: 3.2 Tbps ( 8x 400 Gbps)
- Benutzerdefinierte Routing-Tabellen: Nein
- Dynamische Route-Server: Nein
- Endpunkt-Gateways: Nein
- Ungebundene IPs: Nein
- Durchflussprotokolle: Nein
- LBaaS: Nein
- NVLink: Ja (900 GB/s)
- Privatweg: Nein
- Öffentliches Tor: Nein
- Reservierte IPs: Ja
- Sekundäre IPs: Nein
- VPN: Nein
Getestete NCCL-Konfiguration
Die Netzwerk-Kommunikationsbibliothek ( NVIDIA, NCCL) kann anhand der von VSI bereitgestellten PCI-Topologieinformationen die optimalen Pfade zwischen Systemkomponenten, einschließlich GPUs und NICs, ermitteln. Diese Topologiedatei wurde für eine VSI-Instanz von „ H100 “ mit acht Cluster-Subnetzen getestet und kann verwendet werden, wenn Sie eine Topologiedatei bereitstellen möchten, die die NCCL_TOPO_FILE Umgebungsvariable verwendet.
Die folgenden Informationen enthalten getestete NCCL-Einstellungen für ein H100 VM Profil mit einem 8-Subnetz-Cluster-Netzwerk. Alle Tests wurden mit der NCCL-Version 2.22.3 durchgeführt. Weitere Informationen finden Sie in der Dokumentation NVIDIA NCCL.
export NCCL_IB_PCI_RELAXED_ORDERING=2
export NCCL_IB_QPS_PER_CONNECTION=16
export NCCL_IB_ADAPTIVE_ROUTING=1
export NCCL_IB_TIMEOUT=22
export NCCL_IB_RETRY_CNT=10
export NCCL_CHECKS_DISABLE=1
export NCCL_CHECK_POINTERS=0
export NCCL_CROSS_NIC=2
export NCCL_ASYNC_ERROR_HANDLING=1
export TORCH_NCCL_ASYNC_ERROR_HANDLING=1
export NCCL_SOCKET_NTHREADS=4
export NCCL_NSOCKS_PERTHREAD=4
export NCCL_IB_HCA=mlx5_0,mlx5_1,mlx5_2,mlx5_3,mlx5_4,mlx5_5,mlx5_6,mlx5_7 # valid for an 8-subnet cluster network
export NCCL_TOPO_FILE=<path-to-xml-topology-file> #Sample file provided below, valid for gx3d-160x1792x8h100 profile VSI, with an 8-subnet cluster network