NVIDIA Profil réseau du cluster Hopper 1

Le profil de réseau en grappe Hopper 1 (hopper-1) fournit des réseaux isolés pour les instances Hopper HGX d' NVIDIA s exécutant des charges de travail qui nécessitent une interconnectivité à haut débit et à faible latence, telles que la formation en IA et les simulations à grande échelle.

Le profil de réseau de cluster Hopper 1, qui prend en charge les profils d'instance NVIDIA H100 et H200, remplace le profil de réseau de cluster H100, désormais obsolète.

Présentation

Le profil réseau du cluster Hopper 1 prend en charge l'accès direct à la mémoire à distance (RDMA) via le protocole réseau Convergent Ethernet v2 ( RoCEv2 ) pour un débit accru, une latence réduite et des performances système améliorées.

Pour obtenir la liste des profils d'instance pris en charge avec ce réseau de cluster, consultez la section Profils d'instance Hopper HGX.

Disponibilité

Actuellement, l'utilisation du profil réseau de cluster Hopper 1 est disponible dans les régions et zones prises en charge suivantes :

Régions et zones prises en charge pour Hopper 1
Région Zone Nom de zone universel
Francfort (eu-de) eu-de-2 eu-de-fra04-a
Washington DC (us-east) us-east-3 us-east-wdc07-a
Chennai - Airtel (in-che) H200 uniquement in-che-1 in-che-che02-a

Pour comprendre comment les différentes régions correspondent aux zones, consultez la carte des zones par compte.

Capacités et restrictions

Le profil Hopper 1 du réseau de clusters présente les capacités et restrictions suivantes :

  • Type : Dédié
  • Largeur de bande : 3.2 Tbps ( 8x 400 Gbps)
  • Tables de routage personnalisées : Non
  • Serveurs d'itinéraires dynamiques : Non
  • Passerelles de point final : Non
  • IP flottantes : Non
  • Registres des flux : Non
  • LBaaS: Non
  • NVLink : Oui (900 Go/s)
  • Chemin privé : Non
  • Passerelle publique : Non
  • IP réservées : Oui
  • IP secondaires : Non
  • VPN : Non

Configuration testée du NCCL

La bibliothèque de communications collectives (NCCL) d' NVIDIA peut déterminer les chemins optimaux entre les composants du système, y compris les GPU et les cartes réseau, en se référant aux informations de topologie PCI fournies par VSI. Ce fichier de topologie a été testé pour une VSI d' H100 s avec huit sous-réseaux de cluster. Il peut être utilisé si vous souhaitez fournir un fichier de topologie qui utilise la variable NCCL_TOPO_FILE d'environnement.

Les informations suivantes présentent les réglages NCCL testés pour un profil H100 VM avec un réseau cluster à 8 sous-réseaux. Tous les tests ont été effectués sur la version 2.22.3 du NCCL. Pour plus d'informations, voir la documentation NVIDIA NCCL.

export NCCL_IB_PCI_RELAXED_ORDERING=2
export NCCL_IB_QPS_PER_CONNECTION=16
export NCCL_IB_ADAPTIVE_ROUTING=1
export NCCL_IB_TIMEOUT=22
export NCCL_IB_RETRY_CNT=10
export NCCL_CHECKS_DISABLE=1
export NCCL_CHECK_POINTERS=0
export NCCL_CROSS_NIC=2
export NCCL_ASYNC_ERROR_HANDLING=1
export TORCH_NCCL_ASYNC_ERROR_HANDLING=1
export NCCL_SOCKET_NTHREADS=4
export NCCL_NSOCKS_PERTHREAD=4
export NCCL_IB_HCA=mlx5_0,mlx5_1,mlx5_2,mlx5_3,mlx5_4,mlx5_5,mlx5_6,mlx5_7 # valid for an 8-subnet cluster network
export NCCL_TOPO_FILE=<path-to-xml-topology-file> #Sample file provided below, valid for gx3d-160x1792x8h100 profile VSI, with an 8-subnet cluster network