Verwaltung von GPUs und Beschleunigern für VPC
Die GPU-gestützte Profilfamilie bietet bedarfsorientierten und kostengünstigen Zugriff auf GPUs und Beschleuniger. GPUs und Beschleuniger tragen dazu bei, die Verarbeitungszeit für rechenintensive Workloads wie KI, maschinelles Lernen, Inferenz und mehr zu verkürzen. Um die GPUs und Beschleuniger nutzen zu können, stellen Sie sicher, dass Sie den entsprechenden Treiber und das zugehörige Toolkit für Ihre Workloads installieren.
Konfigurieren einer virtuellen Serverinstanz mit einer NVIDIA-GPU
- Stellen Sie eine virtuelle Serverinstanz bereit, indem Sie im Feld "Profil" ein NVIDIA -GPU-Profil auswählen. Es werden sowohl Archivimages als auch angepasste Betriebssystemimages unterstützt.
- Installieren Sie den NVIDIA-GPU-Treiber für das Image und das GPU-Profil Ihrer virtuellen Serverinstanz. Die folgende Tabelle beschreibt die Mindestversionen von Treibern und CUDA Software für die Betriebssysteme Linux und Windows. Weitere Informationen finden Sie unter NVIDIA auf der Seite Treiber herunterladen. Einen Überblick über die Treiber für NVIDIA Data Center Produkte finden Sie unter NVIDIA Data Center Drivers.
| GPU | NVIDIA fahrer | CUDA-Version |
|---|---|---|
| A100 | 550 | 12.4 |
| L4 | 550 | 12.4 |
| L40s | 550 | 12.4 |
| V100 | 535 | 12.2 |
| H100 | 550 | 12.4 |
| H200 | 570 | 12.8 |
| B300 Verfügbarkeit auswählen | 590 | 13.1 |
| GPU | NVIDIA fahrer | CUDA-Version |
|---|---|---|
| A100 | 538 | 12.2 |
| L4 | 538 | 12.2 |
| L40s | 538 | 12.2 |
| V100 | 535 | 12.2 |
| H100 | Nicht zutreffend | Nicht zutreffend |
| H200 | Nicht zutreffend | Nicht zutreffend |
| B300 | Nicht zutreffend | Nicht zutreffend |
| GPU | NVIDIA fahrer | CUDA-Version |
|---|---|---|
| A100 | 529 | 12.0 |
| L4 | 529 | 12.0 |
| L40s | Nicht zutreffend | Nicht zutreffend |
| V100 | 535 | 12.0 |
| H100 | Nicht zutreffend | Nicht zutreffend |
| H200 | Nicht zutreffend | Nicht zutreffend |
| B300 | Nicht zutreffend | Nicht zutreffend |
- Installieren Sie das zugehörige Toolkit für Ihre Workload. Siehe die Seite „ CUDA-Toolkit-Downloads “ auf NVIDIA.
Detaillierte Anweisungen zur Ausführung der Schritte 2 und 3, andere GPU-Tools und Beispiele finden Sie unter Verwendung von V100-Based GPUs auf IBM Cloud VPC.
Eine speziell auf Linux ausgerichtete Anleitung zur Installation der NVIDIA-Treiber finden Sie im NVIDIA Driver Installation Guide.
Wenn Sie die Installation der Treiber automatisieren möchten, können Sie den Abschnitt Benutzerdaten des virtuellen Servers verwenden. Über das Feld für die Benutzerdaten können Sie ein Skript eingeben, das die Befehle zur Installation der NVIDIA Treiber ausgibt.
Konfigurieren einer virtuellen Serverinstanz mit einer NVIDIA B300 GPU
NVIDIA HGX B300 beschleunigte virtuelle Serverprofile sind für ausgewählte Kunden verfügbar. Erstellen Sie einen Support-Fall, wenn Sie am Kauf und der Nutzung dieses Angebots interessiert sind.
Wenn Sie das GPU-Profil B300 verwenden, muss das Gastbetriebssystem aktualisiert werden. Wenn das Gastbetriebssystem nicht geändert wird, werden möglicherweise Fehler wie "NVRM: Diese PCI-I/O-Region, die dem Gerät NVIDIA zugewiesen ist, ist ungültig:" angezeigt
So konfigurieren Sie das Gastbetriebssystem für die GPU B300:
- Diese Befehle müssen als root ausgeführt werden. Sudo zu verwurzeln.
sudo -i - Bearbeiten Sie die GRUB-Konfigurationsdatei. Im folgenden Beispiel wird vi verwendet.
vi /etc/default/grub.d/50-cloudimg-settings.cfg - Fügen Sie die folgenden Kernel-Parameter in die Zeile
GRUB_CMDLINE_LINUX_DEFAULTein:
Die aktualisierte Zeile sollte wie folgt aussehen:pci=assign-busses pci=realloc pci=nocrs pci=big_root_window# CLOUD_IMG: This file was created/modified by the Cloud Image build process GRUB_CMDLINE_LINUX_DEFAULT="nofb console=ttyS0 console=tty1 pci=assign-busses pci=realloc pci=nocrs pci=big_root_window" - Aktualisieren Sie grub, um die Änderungen zu übernehmen.
update-grub2 - Starten Sie den virtuellen Server neu.
reboot
Konfiguration einer virtuellen Serverinstanz mit einem Intel Gaudi 3 AI Accelerator
- Stellen Sie eine virtuelle Serverinstanz bereit, indem Sie im Feld "Profil" das Instanzprofil Intel® Gaudi® 3 AI Accelerator auswählen. Es werden sowohl Archivimages als auch angepasste Betriebssystemimages unterstützt.
- Installieren Sie die Intel Gaudi 3 AI Accelerator-Software und die Treiber für Ihren virtuellen Server. Zum Herunterladen der Treiber siehe Intel Gaudi-Treiber und Software-Installationsseite.
Einbinden von Treibern in ein benutzerdefiniertes Image von einem Datenträger
- Richten Sie eine Virtual Server-Instanz mit einer GPU ein und installieren Sie die Treiber.
- Erstellen Sie ein Image aus dem Bootdatenträger des Archivimage für die Virtual Server-Instanz. Weitere Informationen finden Sie unter Informationen zum Erstellen eines Image aus einem Datenträger.
- Wiederholen Sie den Prozess für die Erstellung des Image aus dem Datenträger für die Bereitstellung auf mehreren Instanzen.
Konfigurieren eines Bare-Metal-Servers mit einem AMD Instinct- MI300X-Beschleuniger
- Erstellen Sie einen Bare-Metal-Server, indem Sie im Feld Profil das Bare-Metal-Server-Profil AMD Instinct™ MI300X Accelerator auswählen. Es werden sowohl Archivimages als auch angepasste Betriebssystemimages unterstützt.
- Installieren Sie die erforderlichen Treiber für Ihren Bare-Metal-Server. Informationen zum Herunterladen der Treiber finden Sie auf der Seite Installation von ROCm und Machine-Learning-Frameworks.
Nächste Schritte
Weitere Informationen finden Sie in der Dokumentation zum NVIDIA-Treiber.