Gestione di GPU e acceleratori per VPC

La famiglia di profili basati su GPU offre un accesso su richiesta ed economico alle GPU e agli acceleratori. Le GPU e gli acceleratori contribuiscono a ridurre i tempi di elaborazione necessari per carichi di lavoro ad alta intensità di calcolo, quali l'intelligenza artificiale, l'apprendimento automatico, l'inferenza e altro ancora. Per utilizzare le GPU e gli acceleratori, assicurati di installare il driver appropriato e il toolkit associato per i tuoi carichi di lavoro.

Configurazione di un'istanza di server virtuale con una GPU ( NVIDIA )

  1. Fornire un'istanza di server virtuale scegliendo un profilo GPU ( NVIDIA ) nel campo Profilo. Sono supportate immagini stock e del sistema operativo personalizzate.
  2. Installare il driver GPU NVIDIA per l'immagine e il profilo GPU dell'istanza del server virtuale. La tabella seguente descrive i livelli minimi di versione del driver e del software CUDA per i sistemi operativi Linux e Windows. Per ulteriori informazioni, consultare la pagina Download drivers di NVIDIA. Per una panoramica dei driver per i prodotti per data center NVIDIA, vedere Driver per data center NVIDIA.
NVIDIA e la versione di CUDA per Linux
GPU e driver minimi NVIDIA e versioni CUDA
GPU NVIDIA autista Versione CUDA
A100 550 12.4
L4 550 12.4
L40s 550 12.4
V100 535 12.2
H100 550 12.4
H200 570 12.8
B300 Selezionare la disponibilità 590 13.1
NVIDIA driver e versione CUDA per Windows 2019, 2022, 2025
GPU e driver minimi NVIDIA e versioni CUDA
GPU NVIDIA autista Versione CUDA
A100 538 12.2
L4 538 12.2
L40s 538 12.2
V100 535 12.2
H100 N/D N/D
H200 N/D N/D
B300 N/D N/D
NVIDIA driver e versione CUDA per Windows 2016
GPU e driver minimi NVIDIA e versioni CUDA
GPU NVIDIA autista Versione CUDA
A100 529 12.0
L4 529 12.0
L40s N/D N/D
V100 535 12.0
H100 N/D N/D
H200 N/D N/D
B300 N/D N/D
  1. Installare il toolkit associato per il carico di lavoro. Vedi la pagina dei download del toolkit CUDA su NVIDIA.

Per istruzioni dettagliate sul completamento dei passi 2 e 3, altri strumenti per le GPU ed esempi, vedere Come usare le GPU V100-Based su IBM Cloud VPC.

Per una guida incentrata su Linux sull'installazione dei driver NVIDIA, consultare la Guida all'installazione dei driver NVIDIA.

Se si desidera automatizzare l'installazione dei driver, è possibile utilizzare la sezione Dati utente del server virtuale. Utilizzando il campo dei dati utente, è possibile immettere uno script che impartisce i comandi per l'installazione dei driver NVIDIA.

Configurazione di un'istanza di server virtuale con una GPU NVIDIA B300

NVIDIA I profili dei server virtuali accelerati HGX B300 sono disponibili per clienti selezionati. Create un caso di assistenza se siete interessati ad acquistare e utilizzare questa offerta.

Quando si utilizza il profilo GPU B300, il sistema operativo guest necessita di un aggiornamento. Se il sistema operativo guest non è stato modificato, è possibile che vengano visualizzati errori come "NVRM: Questa regione PCI I/O assegnata al dispositivo NVIDIA non è valida"

Per configurare il sistema operativo guest per la GPU B300:

  1. Questi comandi devono essere eseguiti come root. Sudo alle radici.
    sudo -i
    
  2. Modificare il file di configurazione di grub. L'esempio seguente utilizza vi.
    vi /etc/default/grub.d/50-cloudimg-settings.cfg
    
  3. Aggiungete i seguenti parametri del kernel alla riga GRUB_CMDLINE_LINUX_DEFAULT:
    pci=assign-busses pci=realloc pci=nocrs pci=big_root_window
    
    La riga aggiornata dovrebbe avere il seguente aspetto:
    # CLOUD_IMG: This file was created/modified by the Cloud Image build process
    GRUB_CMDLINE_LINUX_DEFAULT="nofb console=ttyS0 console=tty1 pci=assign-busses pci=realloc pci=nocrs pci=big_root_window"
    
  4. Aggiornare grub per applicare le modifiche.
    update-grub2
    
  5. Riavviare il server virtuale.
    reboot
    

Configurazione di un'istanza di server virtuale con un acceleratore IA Intel Gaudi 3

  1. Fornire un'istanza di server virtuale scegliendo il profilo di istanza Intel® Gaudi® 3 AI Accelerator nel campo Profilo. Sono supportate immagini stock e del sistema operativo personalizzate.
  2. Installa il software Intel Gaudi 3 AI Accelerator e i driver per il tuo server virtuale. Per scaricare i driver, consultare la pagina Intel Gaudi Driver and Software Installation.

Integrazione dei driver in un'immagine personalizzata da volume

  1. Esegui il provisioning di un'istanza del server virtuale con una GPU e installa i driver.
  2. Crea un'immagine dal volume di avvio dell'immagine stock dell'istanza del server virtuale. Per ulteriori informazioni, vedi Creazione di un'immagine da un volume.
  3. Ripeti il processo Immagine dal volume per distribuire tra più istanze.

Configurazione di un server bare metal con un acceleratore AMD Instinct MI300X

  1. Creare un server bare metal selezionando l'acceleratore AMD Instinct™ MI300X Profilo del server bare metal nel campo "Profilo". Sono supportate immagini stock e del sistema operativo personalizzate.
  2. Installa i driver necessari per il tuo server bare metal. Per scaricare i driver, consultare la pagina " Installazione di ROCm e dei framework di machine learning ".

Passi successivi

Per ulteriori informazioni, consultare la documentazione del driver NVIDIA.