Descrizione di alta disponibilità e di ripristino di emergenza per IBM Cloud VPC

L' alta disponibilitàLa capacità di un servizio o di un carico di lavoro di resistere ai guasti e di continuare a fornire capacità di elaborazione secondo un livello di servizio predefinito. (HA) è la capacità di un servizio di rimanere operativo e accessibile in presenza di guasti imprevisti. Il disaster recoveryLa capacità di un servizio o di un carico di lavoro di riprendersi da incidenti rari e gravi e da guasti su larga scala, come l'interruzione del servizio. Ciò include un disastro fisico che colpisce un'intera regione, il danneggiamento di un database o la perdita di un servizio che contribuisce a un carico di lavoro. L'impatto supera la capacità del progetto di alta disponibilità di gestirlo. è il processo di ripristino dell'istanza di servizio in uno stato funzionante.

IBM Cloud® Virtual Private Cloud è un servizio ad alta disponibilità progettato per soddisfare gli obiettivi del livello di servizio(SLO). È composto da servizi zonali e regionali.

Per ulteriori informazioni sulle regioni e sui data center disponibili, consultare la sezione Disponibilità di servizi e infrastrutture per località.

Architettura ad alta disponibilità

Le risorse VPC sono suddivise in servizi del piano di controllo e del piano dati per consentire ai clienti di creare applicazioni altamente disponibili in cima a VPC. Il piano di controllo esiste per il provisioning e la gestione delle risorse VPC (creazione, aggiornamento, eliminazione) e per fornire funzioni di controllo. Il piano dati è l'insieme delle risorse VPC fornite, come le istanze di server virtuali, gli indirizzi IP flottanti, i gruppi di sicurezza, lo storage a blocchi e altro ancora.

Il piano di controllo è ospitato su hardware ridondante tra le zone, in modo da garantire la resilienza in caso di guasti hardware e zonali. Il piano di controllo e il piano dati si trovano su domini di guasto diversi. Ad esempio, un'interruzione del piano di controllo non influisce sulla disponibilità del piano dati. Tutte le risorse esistenti dei clienti continuano a funzionare senza alcun impatto. Per una maggiore resilienza, gli utenti possono creare applicazioni da risorse ridondanti del piano dati.

Le risorse VPC sono classificate in risorse zonali e risorse regionali in base alla loro portata. Alcune risorse, come la VPC, si estendono su più zone e sono considerate risorse regionali. La maggior parte delle risorse ha un ambito zonale ed è disponibile in una zona specifica. Ad esempio, le sottoreti, gli elenchi di controllo degli accessi, i gruppi di sicurezza, le tabelle di routing, i gateway pubblici e i gateway Virtual Private Endpoint esistono nella zona in cui sono stati creati.

Per ulteriori informazioni sulla protezione del piano dati dai guasti del piano di controllo, sull'indipendenza dei servizi zonali e sulla ridondanza dei servizi regionali, vedere IBM Cloud service architecture for high availability and resiliency.

malfunzionamento zona

Se si verifica un guasto completo della zona, sia il piano di controllo che il piano dati subiscono un impatto sulla zona. Le funzioni di controllo nelle zone interessate non sono disponibili e tutte le risorse zonali sono disattivate. Ad esempio, le istanze del server virtuale nella zona interessata non sono disponibili e non vengono spostate in un'altra zona sana. Tutte le modifiche apportate alle risorse regionali non hanno effetto sulla zona guasta finché questa non si riprende.

Il piano dati delle altre zone non è interessato e tutte le risorse zonali delle zone non interessate continuano a funzionare senza alcuna interruzione. Le risorse regionali come il VPC continuano a funzionare sulle zone sane. Il piano di controllo è altamente disponibile e consente ai servizi di gestire le risorse nelle altre zone non interessate.

I clienti devono sviluppare meccanismi per gestire l'alta disponibilità delle loro applicazioni distribuendo le risorse in zone (domini di guasto) e pianificare il disaster recovery.

Fallimento regionale

Nell'insolito caso di un disastro regionale, vengono risolti tutti i problemi sottostanti e viene ripristinato il piano di controllo della VPC con l'obiettivo di ridurre la perdita di dati per le risorse. Il piano dati viene ripristinato anche recuperando lo stato dei dati del cliente dallo storage con l'obiettivo di soddisfare l'obiettivo del punto di ripristino (RPO) e l'obiettivo del tempo di ripristino (RTO).

In una regione multizona con un solo campus (SC-MZR), un disastro del data center potrebbe avere un impatto sull'intera regione perché le zone sono più strettamente collegate. I servizi devono impiegare strategie di backup e ripristino in un altro MZR per evitare la perdita di dati.

Guasti hardware

Le risorse sono servite da hardware affidabile e spesso ridondante, ma un guasto hardware imprevisto potrebbe mettere fuori uso queste risorse. Ad esempio, un'istanza di server virtuale potrebbe fallire quando l'hardware sottostante si guasta. In questa situazione, il criterio di recupero dei guasti dell'host determina la modalità di recupero del server virtuale. Se si verifica un guasto e il criterio di ripristino dei guasti dell'host è impostato sull'impostazione predefinita, restart, il piano di controllo rileva il guasto hardware e migra il server virtuale su hardware disponibile nella stessa zona e riavvia il server virtuale. La memoria effimera del disco non viene ripristinata sul volume di avvio. I volumi di dati sono disponibili, ma potrebbero mancare le scritture della cache dell'applicazione o del sistema operativo che non sono state salvate al momento del guasto.

I volumi a blocchi sono supportati da hardware ridondante con tecniche di replica avanzate per migliorare la resilienza. Tuttavia, un disastro zonale o un guasto multi-hardware potrebbero causare un guasto al volume a blocchi. Il backup e il ripristino sono un approccio adeguato per ridurre la perdita o il danneggiamento dei dati. Questo approccio può essere utilizzato anche per mitigare un disastro regionale replicando i dati in altre regioni IBM Cloud. La funzionalità di snapshot può essere utilizzata per supportare il backup e il ripristino. I clienti possono anche distribuire le applicazioni in altre zone per evitare interruzioni e migliorare l'RPO/RTO.

Può esistere una forte correlazione di guasti tra l'archiviazione dei volumi e il guasto dell'applicazione server associata. Esaminare e testare i carichi di lavoro per determinare il comportamento dell'applicazione in presenza di un dispositivo di archiviazione guasto.

Per informazioni sui server bare metal e sullo storage associato, vedere Panoramica sullo storage per Bare Metal Servers for VPC. Le istantanee non sono disponibili per i dischi locali sui server bare metal. I clienti devono gestire l'alta disponibilità e il disaster recovery di questi dispositivi.

Creazione di applicazioni HA

È possibile utilizzare un bilanciatore di carico VPC per distribuire le richieste in arrivo a più server virtuali e server bare metal. I server virtuali e i server bare metal che diventano non disponibili smettono di rispondere ai controlli sullo stato di salute; il bilanciatore di carico bilancia quindi il carico sulle risorse disponibili. È possibile utilizzare un Application Load Balancer (ALB) per distribuire il traffico di un carico di lavoro ai server virtuali di più zone e creare carichi di lavoro disponibili anche quando un'intera zona diventa non disponibile.

Quando l'ALB stesso è configurato su sottoreti tra le zone, è resiliente rispetto a un guasto di una singola zona. Il Network Load Balancer è un servizio zonale distribuito su più server virtuali sottostanti e resiliente al guasto di un singolo server virtuale.

La strategia di base per migliorare la disponibilità dei carichi di lavoro costruiti con risorse VPC consiste nel distribuire il carico di lavoro su più risorse. È possibile distribuire le risorse all'interno di una zona, tra più zone in una regione multizona (MZR) o tra più regioni. Per ulteriori informazioni, vedere Distribuzione di carichi di lavoro isolati in più sedi e zone; questa strategia utilizza IBM Cloud Internet Services (CIS) e un Global Load Balancer.

Caratteristiche di alta disponibilità

IBM Cloud VPC supporta le seguenti funzioni di alta disponibilità:

Caratteristiche HA per IBM Cloud VPC
Funzione Descrizione Considerazione
Programma di bilanciamento del carico dell'applicazione Un ALB distribuisce il carico tra le zone agli indirizzi IP. Il carico di lavoro deve essere scalabile.
Programma di bilanciamento del carico della rete Un NLB distribuisce il carico agli indirizzi IP all'interno di una zona. Il carico di lavoro deve essere scalabile.
Ridimensionamento automatico per VPC Migliorate le prestazioni e i costi creando dinamicamente istanze di server virtuali per soddisfare le esigenze del vostro ambiente. Il carico di lavoro deve essere scalabile.
Bilanciatore di carico e gruppo di istanze I carichi di lavoro scalabili, gestiti da un bilanciatore di carico, distribuiscono il carico a più istanze nelle varie zone. Il carico di lavoro deve essere scalabile.

Come cliente, potete creare e supportare l'HA:

Caratteristiche HA del cliente per IBM Cloud VPC
Funzione Descrizione Considerazione
Carico di lavoro scalabile Creare un server virtuale o un carico di lavoro basato su server bare metal che può essere scalato orizzontalmente con più server. Non tutti i carichi di lavoro possono essere scalati orizzontalmente.

Carico di lavoro scalabile

I carichi di lavoro scalabili possono gestire un aumento della domanda aggiungendo altri server che eseguono la stessa immagine. Il carico di lavoro scalabile può essere implementato utilizzando bilanciatori di carico e Auto Scale for VPC.

Architettura di disaster recovery

La strategia per il ripristino di emergenza consiste nel fornire l'automazione dello scripting per ripristinare un carico di lavoro VPC in una posizione di ripristino. Ad esempio, quando una regione non è disponibile, è responsabilità del cliente migrare il carico di lavoro e i dati associati in una regione disponibile. IBM supporta l'infrastruttura Terraform come sistema di codice che può essere utilizzato per definire carichi di lavoro con posizioni e prestazioni parametrate. L'API, l'SDK e la CLI di VPC possono essere utilizzati dai clienti per creare script per il ripristino delle risorse in una posizione disponibile durante un disastro. Per ulteriori informazioni, vedere Pianificazione del ripristino di emergenza.

Per saperne di più sull'uso di IBM Cloud Object Storage, IBM Cloud Schematics che fornisce Terraform-as-a-Service e le architetture distribuibili, si può consultare la sezione Utilizzo dei servizi IBM Cloud per il disaster recovery.

Funzionalità di disaster recovery

IBM Cloud VPC supporta le seguenti funzioni di disaster recovery:

Caratteristiche DR per IBM Cloud VPC
Funzione Descrizione Considerazione
Istantanee di un singolo volume Una snapshot è una copia point-in-time del volume di avvio o di dati. Block Storage le istantanee sono memorizzate nell'istanza regionale di Cloud Object Storage. Un'istantanea è indipendente dal volume di origine. Se la zona del volume sorgente non è disponibile, lo snapshot può essere usato per creare un nuovo volume in una zona diversa della regione. Le istantanee possono essere create su richiesta nella console, dalla CLI, con l'API o con Terraform. Possono anche essere pianificati utilizzando il servizio Backup for VPC.
Copie istantanee interregionali È possibile utilizzare copie di snapshot interregionali indipendenti dalle snapshot di origine per creare nuovi volumi. Le istantanee possono essere copiate in un'altra regione manualmente nella console, dalla CLI o in modo programmatico con l'API o Terraform. È inoltre possibile includere nel criterio di backup la creazione di una copia in un'altra regione.
Istantanee del gruppo di coerenza Un gruppo di coerenza di snapshot contiene snapshot di più volumi Block Storage collegati alla stessa istanza di server virtuale. Quando si richiede un'istantanea di un gruppo di coerenza, il sistema genera istantanee di tutti i volumi taggati Block Storage che sono collegati all'istanza del server virtuale nello stesso momento. È possibile includere o escludere i volumi di avvio. Lo storage dell'istanza non è incluso.
Ripristino rapido delle istantanee Le istantanee di ripristino rapido sono istantanee che vengono memorizzate nella zona con il volume a blocchi padre. Quando si crea un server virtuale con una snapshot di ripristino rapido avviabile, il server diventa completamente operativo più rapidamente rispetto al provisioning del volume di avvio da una snapshot normale.
Replica di file share Se la condivisione sorgente diventa indisponibile, è possibile avviare un failover di replica sulla condivisione di replica. È possibile creare una condivisione di replica in un'altra zona della stessa regione. È possibile creare una replica anche in un'altra regione della stessa area geografica. È possibile replicare i dati ogni 15 minuti.

Il ripristino di un volume o di una quota da una snapshot è un'operazione manuale che richiede tempo. Se desiderate un livello di servizio superiore per il ripristino d'emergenza, consultate i servizi di backup e ripristino di IBM Cloud.

Come cliente, potete creare e supportare ulteriori opzioni di disaster recovery:

Caratteristiche DR del cliente per IBM Cloud VPC
Funzione Descrizione Considerazione
Fonte esterna di verità per la configurazione VPC Costruzione di VPC, rete e server acquisiti in file di configurazione gestiti dal cliente come script Terraform, script di shell o programmi. Il cliente deve creare lo script e conservare la configurazione in modo che possa essere utilizzata durante un potenziale disastro.
Script creati dal cliente per il backup e la copia dei file di archiviazione Copiare il contenuto di una condivisione di file per renderlo disponibile in un'altra posizione. Il cliente deve creare lo script o utilizzare il backup e il ripristino continui gestiti dal cliente.
Backup e ripristino continui gestiti dal cliente per volumi a blocchi e archiviazione di file I clienti possono installare agenti di terze parti e driver del sistema operativo sui server che si integrano con sistemi di backup e ripristino come Veeam. Il cliente deve installare e gestire la soluzione di backup e ripristino di terze parti.

Pianificazione del ripristino in caso di disastro

Le fasi di disaster recovery devono essere praticate regolarmente. Nel costruire il vostro piano, considerate i seguenti scenari di fallimento e le relative soluzioni.

Scenari di DR per IBM Cloud VPC
Operazione non riuscita Risoluzione
Guasto del volume di avvio È possibile creare un nuovo volume da un' immagine personalizzata creata dal proprio volume. È inoltre possibile ripristinare un volume da un'istantanea nella console, dalla CLI, con l'API, Terraform o utilizzando una soluzione di backup e ripristino continuo gestita dal cliente. Quando si ripristina un volume di avvio da una snapshot, si prevede una certa riduzione delle prestazioni mentre i dati vengono copiati sul volume di avvio dalla snapshot. Utilizzando le istantanee di ripristino rapido, è possibile raggiungere gli obiettivi di tempo di ripristinoNella pianificazione del disaster recovery, la durata del tempo necessario per ripristinare un processo aziendale dopo un disastro. (RTO) più rapidamente rispetto al ripristino da un'istantanea normale, in quanto tutti i dati sono disponibili e le prestazioni non vengono compromesse.
Guasto del volume di dati o corruzione dei dati Ripristinare un volume da un'istantanea nella console, dalla CLI, con l'API, Terraform o utilizzando una soluzione di backup e ripristino continuo gestita dal cliente. Le istantanee di ripristino rapido sono disponibili anche per i volumi di dati.
Corruzione dei dati della condivisione file È possibile creare istantanee della condivisione di file per conservare i dati sulla condivisione di file in un momento specifico. È quindi possibile ripristinare i dati da un'istantanea della condivisione di file se il contenuto della condivisione di file viene accidentalmente cancellato o sovrascritto.
Guasto alla condivisione dei file Mitigato avviando un failover verso una replica esistente in un'altra zona. Testare il processo di failover per vedere quanto tempo impiega.
Guasto del server virtuale Mitigato utilizzando le funzioni di alta disponibilità di un bilanciatore di carico e Auto Scale per VPC, creando un carico di lavoro scalabile. Potrebbe essere necessario riavviare il server virtuale. Potrebbe essere necessaria la risoluzione dei guasti del volume dei blocchi.
Guasto del server Bare Metal Soluzione di backup e ripristino gestita dal cliente.
malfunzionamento zona Mitigato utilizzando le funzioni di alta disponibilità di un bilanciatore di carico e Auto Scale per VPC, creando un carico di lavoro scalabile. Utilizzare una fonte di verità esterna per la configurazione della zona VPC per creare risorse in una zona disponibile utilizzando la risoluzione dei guasti del server e la risoluzione dei guasti del volume dei blocchi.
Fallimento regionale Utilizzare una fonte di verità esterna per la configurazione della regione VPC per creare risorse in una regione disponibile. Ripristinare i volumi e l'archiviazione dei file ai valori precedenti utilizzando la risoluzione dei guasti del server.

Le vostre responsabilità per l'alta disponibilità e il disaster recovery

Per maggiori informazioni, si veda la sezione " Comprendere le proprie responsabilità nell'uso del Virtual Private Cloud ". È vostra responsabilità testare continuamente il vostro piano per HA e DR. Per ulteriori informazioni, vedere Test di disaster recovery.

Potrebbero verificarsi interruzioni della connettività di rete e brevi periodi di indisponibilità di un servizio. È responsabilità dell'utente assicurarsi che il codice sorgente dell'applicazione includa la logica di riprova della disponibilità del client per mantenere l'alta disponibilità dell'applicazione.

Potete utilizzare le seguenti liste di controllo per aiutarvi a creare e mettere in pratica il vostro piano.

  • Istantanea del volume a blocchi

  • Replica dello storage dei file

  • Fonte esterna di verità per la configurazione VPC

Gestione delle modifiche

La gestione delle modifiche comprende attività quali aggiornamenti, modifiche alla configurazione e cancellazioni.

Assegnare agli utenti e ai processi i ruoli e le azioni IAM con il minimo privilegio richiesto per il loro lavoro. Per ulteriori informazioni, vedere Come posso evitare la cancellazione accidentale dei servizi?

Considerare la creazione di un backup manuale prima di apportare modifiche alle configurazioni dell'infrastruttura.

Come IBM® aiuta a supportare la pianificazione del disaster recovery

IBM® intraprende azioni di ripristino specifiche per IBM Cloud VPC in caso di disastro.

Se un singolo host si guasta inaspettatamente, i server virtuali sull'host guasto possono essere riavviati automaticamente su un host sano. Per ulteriori informazioni su come IBM monitora l'infrastruttura e risponde ai guasti degli host, vedere Criteri di ripristino dei guasti degli host.

Come IBM recupera i guasti di una zona

I guasti della zona possono essere causati da disastri naturali, problemi di infrastruttura come un'interruzione di corrente, azioni accidentali o dolose che eliminano le informazioni, oppure aggiornamenti del software che contengono un bug o un errore. In caso di guasto di una zona, IBM lavora per recuperare strutture e data center, rete fisica e dispositivi, storage fisico, server fisici e memoria e hypervisor. Per ulteriori informazioni, vedere Responsabilità condivise per l'utilizzo dei prodotti IBM Cloud.

Come IBM si riprende dai fallimenti regionali

Nel caso in cui un'intera regione subisca un guasto, IBM si occupa nuovamente del ripristino di strutture e data center, rete e dispositivi fisici, server fisici e memoria e hypervisor, server fisici e memoria e hypervisor. Per ulteriori informazioni, vedere Responsabilità condivise per l'utilizzo dei prodotti IBM Cloud e FAQ per il ripristino d'emergenza.

Se IBM non è in grado di ripristinare l'istanza del servizio, è necessario ripristinare il servizio come descritto nell'architettura del disaster recovery.

Come IBM mantiene i servizi

Quando si esegue la manutenzione ordinaria su server virtuali, host e data center, si seguono i protocolli di routine. Per ulteriori informazioni, vedere Comprendere le operazioni di manutenzione del cloud.

Tutti gli aggiornamenti seguono le best practice del servizio IBM, compresi i piani di ripristino e i processi di rollback. La manutenzione periodica potrebbe causare brevi interruzioni, mitigate dalla logica di riprova della disponibilità del client. Le modifiche vengono distribuite in modo sequenziale, regione per regione e zona per zona all'interno di una regione. IBM ripristina gli aggiornamenti al primo segno di difetto.

Le modifiche complesse vengono attivate e disattivate con flag di funzione per controllare l'esposizione.

Le modifiche che hanno un impatto sui carichi di lavoro dei clienti sono dettagliate nelle notifiche di IBM Cloud. Per ulteriori informazioni sulla manutenzione programmata, gli annunci e le note di rilascio che hanno un impatto su questo servizio, vedere Notifiche e stato del monitoraggio.