Verwaltung von GPUs und Beschleunigern für VPC

Die GPU-gestützte Profilfamilie bietet bedarfsorientierten und kostengünstigen Zugriff auf GPUs und Beschleuniger. GPUs und Beschleuniger tragen dazu bei, die Verarbeitungszeit für rechenintensive Workloads wie KI, maschinelles Lernen, Inferenz und mehr zu verkürzen. Um die GPUs und Beschleuniger nutzen zu können, stellen Sie sicher, dass Sie den entsprechenden Treiber und das zugehörige Toolkit für Ihre Workloads installieren.

Konfigurieren einer virtuellen Serverinstanz mit einer NVIDIA-GPU

  1. Stellen Sie eine virtuelle Serverinstanz bereit, indem Sie im Feld "Profil" ein NVIDIA -GPU-Profil auswählen. Es werden sowohl Archivimages als auch angepasste Betriebssystemimages unterstützt.
  2. Installieren Sie den NVIDIA-GPU-Treiber für das Image und das GPU-Profil Ihrer virtuellen Serverinstanz. Die folgende Tabelle beschreibt die Mindestversionen von Treibern und CUDA Software für die Betriebssysteme Linux und Windows. Weitere Informationen finden Sie unter NVIDIA auf der Seite Treiber herunterladen. Einen Überblick über die Treiber für NVIDIA Data Center Produkte finden Sie unter NVIDIA Data Center Drivers.
NVIDIA treiber und CUDA-Version für Linux
GPUs und minimale NVIDIA Treiber und CUDA Versionen
GPU NVIDIA fahrer CUDA-Version
A100 550 12.4
L4 550 12.4
L40s 550 12.4
V100 535 12.2
H100 550 12.4
H200 570 12.8
B300 Verfügbarkeit auswählen 590 13.1
NVIDIA treiber und CUDA Version für Windows 2019, 2022, 2025
GPUs und minimale NVIDIA Treiber und CUDA Versionen
GPU NVIDIA fahrer CUDA-Version
A100 538 12.2
L4 538 12.2
L40s 538 12.2
V100 535 12.2
H100 Nicht zutreffend Nicht zutreffend
H200 Nicht zutreffend Nicht zutreffend
B300 Nicht zutreffend Nicht zutreffend
NVIDIA treiber und CUDA Version für Windows 2016
GPUs und minimale NVIDIA Treiber und CUDA Versionen
GPU NVIDIA fahrer CUDA-Version
A100 529 12.0
L4 529 12.0
L40s Nicht zutreffend Nicht zutreffend
V100 535 12.0
H100 Nicht zutreffend Nicht zutreffend
H200 Nicht zutreffend Nicht zutreffend
B300 Nicht zutreffend Nicht zutreffend
  1. Installieren Sie das zugehörige Toolkit für Ihre Workload. Siehe die Seite „ CUDA-Toolkit-Downloads “ auf NVIDIA.

Detaillierte Anweisungen zur Ausführung der Schritte 2 und 3, andere GPU-Tools und Beispiele finden Sie unter Verwendung von V100-Based GPUs auf IBM Cloud VPC.

Eine speziell auf Linux ausgerichtete Anleitung zur Installation der NVIDIA-Treiber finden Sie im NVIDIA Driver Installation Guide.

Wenn Sie die Installation der Treiber automatisieren möchten, können Sie den Abschnitt Benutzerdaten des virtuellen Servers verwenden. Über das Feld für die Benutzerdaten können Sie ein Skript eingeben, das die Befehle zur Installation der NVIDIA Treiber ausgibt.

Konfigurieren einer virtuellen Serverinstanz mit einer NVIDIA B300 GPU

NVIDIA HGX B300 beschleunigte virtuelle Serverprofile sind für ausgewählte Kunden verfügbar. Erstellen Sie einen Support-Fall, wenn Sie am Kauf und der Nutzung dieses Angebots interessiert sind.

Wenn Sie das GPU-Profil B300 verwenden, muss das Gastbetriebssystem aktualisiert werden. Wenn das Gastbetriebssystem nicht geändert wird, werden möglicherweise Fehler wie "NVRM: Diese PCI-I/O-Region, die dem Gerät NVIDIA zugewiesen ist, ist ungültig:" angezeigt

So konfigurieren Sie das Gastbetriebssystem für die GPU B300:

  1. Diese Befehle müssen als root ausgeführt werden. Sudo zu verwurzeln.
    sudo -i
    
  2. Bearbeiten Sie die GRUB-Konfigurationsdatei. Im folgenden Beispiel wird vi verwendet.
    vi /etc/default/grub.d/50-cloudimg-settings.cfg
    
  3. Fügen Sie die folgenden Kernel-Parameter in die Zeile GRUB_CMDLINE_LINUX_DEFAULT ein:
    pci=assign-busses pci=realloc pci=nocrs pci=big_root_window
    
    Die aktualisierte Zeile sollte wie folgt aussehen:
    # CLOUD_IMG: This file was created/modified by the Cloud Image build process
    GRUB_CMDLINE_LINUX_DEFAULT="nofb console=ttyS0 console=tty1 pci=assign-busses pci=realloc pci=nocrs pci=big_root_window"
    
  4. Aktualisieren Sie grub, um die Änderungen zu übernehmen.
    update-grub2
    
  5. Starten Sie den virtuellen Server neu.
    reboot
    

Konfiguration einer virtuellen Serverinstanz mit einem Intel Gaudi 3 AI Accelerator

  1. Stellen Sie eine virtuelle Serverinstanz bereit, indem Sie im Feld "Profil" das Instanzprofil Intel® Gaudi® 3 AI Accelerator auswählen. Es werden sowohl Archivimages als auch angepasste Betriebssystemimages unterstützt.
  2. Installieren Sie die Intel Gaudi 3 AI Accelerator-Software und die Treiber für Ihren virtuellen Server. Zum Herunterladen der Treiber siehe Intel Gaudi-Treiber und Software-Installationsseite.

Einbinden von Treibern in ein benutzerdefiniertes Image von einem Datenträger

  1. Richten Sie eine Virtual Server-Instanz mit einer GPU ein und installieren Sie die Treiber.
  2. Erstellen Sie ein Image aus dem Bootdatenträger des Archivimage für die Virtual Server-Instanz. Weitere Informationen finden Sie unter Informationen zum Erstellen eines Image aus einem Datenträger.
  3. Wiederholen Sie den Prozess für die Erstellung des Image aus dem Datenträger für die Bereitstellung auf mehreren Instanzen.

Konfigurieren eines Bare-Metal-Servers mit einem AMD Instinct- MI300X-Beschleuniger

  1. Erstellen Sie einen Bare-Metal-Server, indem Sie im Feld Profil das Bare-Metal-Server-Profil AMD Instinct™ MI300X Accelerator auswählen. Es werden sowohl Archivimages als auch angepasste Betriebssystemimages unterstützt.
  2. Installieren Sie die erforderlichen Treiber für Ihren Bare-Metal-Server. Informationen zum Herunterladen der Treiber finden Sie auf der Seite Installation von ROCm und Machine-Learning-Frameworks.

Nächste Schritte

Weitere Informationen finden Sie in der Dokumentation zum NVIDIA-Treiber.