Gestion des GPU et des accélérateurs pour VPC
La gamme de profils optimisés pour les GPU offre un accès à la demande et économique aux GPU et aux accélérateurs. Les GPU et les accélérateurs permettent de réduire le temps de traitement nécessaire aux charges de travail gourmandes en ressources de calcul, telles que l'IA, l'apprentissage automatique, l'inférence, etc. Pour utiliser les GPU et les accélérateurs, veillez à installer le pilote approprié ainsi que la boîte à outils associée à vos charges de travail.
Configuration d'une instance de serveur virtuel avec un GPU NVIDIA
- Fournir une instance de serveur virtuel en choisissant un profil GPU d' NVIDIA s dans le champ Profil. Les images des systèmes d'exploitation standard et personnalisés sont prises en charge.
- Installez le pilote NVIDIA GPU pour l'image et le profil GPU de votre instance de serveur virtuel. Le tableau suivant décrit les niveaux de version minimum des pilotes et du logiciel CUDA pour les systèmes d'exploitation Linux et Windows. Pour plus d'informations, consultez la page de téléchargement de pilotes de NVIDIA. Pour une vue d'ensemble des pilotes pour les produits de centre de données NVIDIA, voir NVIDIA Data Center Drivers.
| Processeur graphique (GPU) | NVIDIA conducteur | Version CUDA |
|---|---|---|
| A100 | 550 | 12.4 |
| L4 | 550 | 12.4 |
| L40s | 550 | 12.4 |
| V100 | 535 | 12.2 |
| H100 | 550 | 12.4 |
| H200 | 570 | 12.8 |
| B300 Sélectionner la disponibilité | 590 | 13.1 |
| Processeur graphique (GPU) | NVIDIA conducteur | Version CUDA |
|---|---|---|
| A100 | 538 | 12.2 |
| L4 | 538 | 12.2 |
| L40s | 538 | 12.2 |
| V100 | 535 | 12.2 |
| H100 | N/A | N/A |
| H200 | N/A | N/A |
| B300 | N/A | N/A |
| Processeur graphique (GPU) | NVIDIA conducteur | Version CUDA |
|---|---|---|
| A100 | 529 | 12.0 |
| L4 | 529 | 12.0 |
| L40s | N/A | N/A |
| V100 | 535 | 12.0 |
| H100 | N/A | N/A |
| H200 | N/A | N/A |
| B300 | N/A | N/A |
- Installez le kit d'outils associé de votre charge de travail. Consultez la page de téléchargement de la boîte à outils CUDA sur NVIDIA.
Pour obtenir des instructions détaillées sur les étapes 2 et 3, d'autres outils GPU et des exemples, voir Comment utiliser les V100-Based sur IBM Cloud VPC.
Pour obtenir un guide axé sur l' Linux, consacré à l'installation des pilotes d' NVIDIA, consultez le Guide d'installation des pilotes d' NVIDIA.
Si vous souhaitez automatiser l'installation des pilotes, vous pouvez utiliser la section Données utilisateur du serveur virtuel. En utilisant le champ de données de l'utilisateur, vous pouvez entrer un script qui émet les commandes pour installer les pilotes NVIDIA.
Configuration d'une instance de serveur virtuel avec un GPU NVIDIA B300
NVIDIA Les profils de serveurs virtuels accélérés HGX B300 sont disponibles pour certains clients. Créez un dossier d'assistance si vous êtes intéressé par l'achat et l'utilisation de cette offre.
Lorsque vous utilisez le profil GPU B300, le système d'exploitation invité doit être mis à jour. Si le système d'exploitation invité n'est pas modifié, vous pouvez voir des erreurs telles que "NVRM : This PCI I/O region assigned to your NVIDIA device is invalid :" (NVRM : la région d'E/S PCI attribuée à votre périphérique n'est pas valide)
Pour configurer le système d'exploitation invité pour le GPU B300:
- Ces commandes doivent être exécutées en tant que root. Sudo à la racine.
sudo -i - Modifiez le fichier de configuration de GRUB. L'exemple suivant utilise vi.
vi /etc/default/grub.d/50-cloudimg-settings.cfg - Ajoutez les paramètres de noyau suivants à la ligne
GRUB_CMDLINE_LINUX_DEFAULT:
La ligne mise à jour devrait ressembler à ceci :pci=assign-busses pci=realloc pci=nocrs pci=big_root_window# CLOUD_IMG: This file was created/modified by the Cloud Image build process GRUB_CMDLINE_LINUX_DEFAULT="nofb console=ttyS0 console=tty1 pci=assign-busses pci=realloc pci=nocrs pci=big_root_window" - Mettez à jour grub pour appliquer les changements.
update-grub2 - Redémarrer le serveur virtuel.
reboot
Configuration d'une instance de serveur virtuel avec un accélérateur IA Intel Gaudi 3
- Fournir une instance de serveur virtuel en choisissant le profil d'instance Intel® Gaudi® 3 AI Accelerator dans le champ Profil. Les images des systèmes d'exploitation standard et personnalisés sont prises en charge.
- Installez le logiciel Intel Gaudi 3 AI Accelerator et les pilotes pour votre serveur virtuel. Pour télécharger les pilotes, consultez la page Installation des pilotes et logiciels Intel Gaudi.
Intégration de pilotes dans une image personnalisée à partir du volume
- Mettez à disposition une instance de serveur virtuel avec une GPU et installez les pilotes.
- Créez une image à partir du volume d'amorçage de l'image stockée de l'instance de serveur virtuel. Pour plus d'informations, voir Création d'une image à partir d'un volume.
- Répétez le processus d'image à partir du volume pour déployer sur plusieurs instances.
Configuration d'un serveur bare metal avec un accélérateur AMD Instinct MI300X
- Créez un serveur bare metal en sélectionnant le profil de serveur AMD Instinct™ MI300X Accelerator dans le champ Profil. Les images des systèmes d'exploitation standard et personnalisés sont prises en charge.
- Installez les pilotes nécessaires pour votre serveur bare metal. Pour télécharger les pilotes, consultez la page Installation de ROCm et des frameworks d'apprentissage automatique.
Etapes suivantes
Pour plus d’informations, consultez la documentation relative au pilote NVIDIA.