Descrizione di alta disponibilità e di ripristino di emergenza per Event Streams

L' alta disponibilitàLa capacità di un servizio o di un carico di lavoro di resistere ai guasti e di continuare a fornire capacità di elaborazione secondo un livello di servizio predefinito. Per i servizi, la disponibilità è definita nell'Accordo sul livello dei servizi. La disponibilità comprende sia gli eventi pianificati che quelli non pianificati, come manutenzione, guasti e disastri. (HA) è la capacità di un servizio di rimanere operativo e accessibile in presenza di guasti imprevisti. Il disaster recoveryLa capacità di un servizio o di un carico di lavoro di riprendersi da incidenti rari e gravi e da guasti su larga scala, come l'interruzione del servizio. Ciò include un disastro fisico che colpisce un'intera regione, il danneggiamento di un database o la perdita di un servizio che contribuisce a un carico di lavoro. L'impatto supera la capacità del progetto di alta disponibilità di gestirlo. è il processo di ripristino dell'istanza di servizio in uno stato funzionante.

IBM® Event Streams for IBM Cloud® è un servizio globale ed è possibile trovare le regioni e i data center disponibili nella documentazione sulla disponibilità di servizi e infrastrutture per località. Come servizio globale, Event Streams soddisfa gli obiettivi di livello di servizio(SLO) definiti con i piani Standard ed Enterprise. Lo SLO non è una garanzia e IBM® non rilascerà crediti per il mancato raggiungimento di un obiettivo.

Architettura ad alta disponibilità

Architettura
Event Streams architettura ad alta disponibilità

Caratteristiche di alta disponibilità

Event Streams supporta le seguenti funzionalità di alta disponibilità:

Caratteristiche HA per Event Streams
Funzione Descrizione Considerazione
Ripetizione di regioni multizona Distribuito in tre zone di disponibilità per la tolleranza ai guasti e l'alta disponibilità In Event Streams, i dati di ogni partizione sono distribuiti in tre zone di disponibilità (per le implementazioni MZR) per garantire la continuità aziendale in caso di perdita dei dati di una zona di disponibilità.
Numero minimo di repliche sincronizzate È necessario avere sempre un minimo di due repliche in sincronia Event Streams monitora continuamente e assicura che almeno due repliche siano sincronizzate tra le disponibilità, per garantire che i messaggi non vadano persi in caso di guasto di un broker o di una zona, assicurando che i dati critici rimangano durevoli.

Architettura di disaster recovery

Architettura
Event Streams architettura di disaster recovery

Funzionalità di disaster recovery

Event Streams supporta le seguenti funzioni di disaster recovery:

Caratteristiche DR per Event Streams
Funzione Descrizione Considerazione
Specchiatura Mirroring per la replica del cluster Event Streams offre una funzione di mirroring che consente ai messaggi di un'istanza di Event Streams di essere copiati continuamente in una seconda istanza. È possibile utilizzare la funzione di mirroring Event Streams O scegliere di gestire una propria soluzione di mirroring.

Mirroring per Event Streams

Il mirroring consente ai messaggi di un'istanza del servizio Event Streams di essere copiati continuamente in una seconda istanza. La resilienza delle applicazioni può essere migliorata utilizzando il mirroring, in modo che se la prima istanza del servizio diventa indisponibile, le applicazioni possono riconnettersi alla seconda istanza e continuare il loro normale funzionamento.

Questa funzione fa parte del servizio completamente gestito e può essere utilizzata solo tra le istanze del servizio che utilizzano il piano Event Streams Piano Enterprise.

  1. Caratteristiche del mirroring:
  • Rispecchia gli argomenti, i dati dei messaggi e gli offset dei gruppi di consumatori tra due istanze del servizio Event Streams, che possono essere fornite in diversi account IBM Cloud®.
  • SLA del 99.99 di disponibilità, in linea con il servizio Event Streams.
  • Può essere monitorato usando IBM Cloud® Monitoring.
  1. Limiti del mirroring:
  • Unidirezionale: I dati possono essere riprodotti in una sola direzione alla volta tra una coppia di istanze di servizio. Ciò significa che il mirroring offre uno stile di alta disponibilità "attivo-passivo" e non "attivo-attivo".
  • Asincrono: i messaggi devono essere prodotti con successo nell'istanza di origine prima di poter essere replicati nell'istanza di destinazione. Ciò significa che quando si verifica un guasto, alcuni dati dei messaggi potrebbero andare persi.
  • Consumo di messaggi almeno una volta: Quando un consumatore si sposta da un'istanza all'altra, potrebbe aver bisogno di rielaborare i messaggi che ha già elaborato.

Pianificazione del ripristino in caso di disastro

Le fasi di disaster recovery devono essere praticate regolarmente. Nel costruire il vostro piano, considerate i seguenti scenari di fallimento e le relative soluzioni.

Scenari di ripristino di emergenza per Event Streams
Operazione non riuscita Risoluzione
Guasto hardware (punto singolo) Event Streams è resistente a un singolo punto di guasto hardware all'interno di una zona, senza necessità di configurazione.
malfunzionamento zona Un'istanza Event Streams distribuita in una regione multizona è resiliente al guasto di una singola zona, senza necessità di configurazione. Per le distribuzioni a zona singola, configurare un altro cluster Event Streams come coppia speculare per evitare un guasto alla zona.
Dati danneggiati Event Streams non include alcun meccanismo integrato per il recupero dei dati danneggiati. È necessario pianificare tali circostanze come parte di un piano di ripristino di emergenza e potrebbe essere necessario utilizzare la funzione di mirroring o configurare una nuova istanza.
Fallimento regionale Se l'istanza Event Streams è stata configurata in una regione multizona, è improbabile che si verifichi un disastro regionale. Se si verifica un guasto regionale, è necessario configurare una nuova istanza in un'altra regione. Per ulteriori informazioni, vedere Comprendere le proprie responsabilità.

Le vostre responsabilità per HA e DR

Le seguenti informazioni possono aiutarvi a creare e a mettere in pratica costantemente il vostro piano per l'HA e il DR.

È importante comprendere le responsabilità di gestione e i termini e le condizioni che si hanno quando si utilizza Event Streams. La pagina sulle responsabilità del cliente è un punto di partenza per creare un piano di alta disponibilità e disaster recovery.

Nell'ambito del ripristino d'emergenza, si consiglia di assegnare agli utenti e ai processi i ruoli e le azioni IAM con il minimo privilegio richiesto per il loro lavoro. Per ulteriori informazioni, vedere Come posso evitare la cancellazione accidentale dei servizi?

Tutti i piani Event Streams (escluso Satellite ) possono recuperare un'istanza cancellata entro un periodo di bonifica di tre giorni, dopodiché i dati vengono distrutti in modo irreversibile. È possibile controllare lo stato di una bonifica e forzare o annullare una bonifica pianificata utilizzando l'IBM Cloud CLI.

Se Event Streams non è possibile ripristinare l'istanza del servizio, è necessario ripristinare come descritto in Mirroring in uno scenario di disaster recovery.

Come IBM mantiene i servizi

Tutti gli aggiornamenti seguono le best practice del servizio IBM e prevedono un piano di ripristino e un processo di rollback. Gli aggiornamenti regolari per le nuove funzionalità e la manutenzione fanno parte delle normali operazioni. Tale manutenzione può occasionalmente causare brevi intervalli di interruzione che vengono gestiti dalla logica di riprova della disponibilità del client. Le modifiche vengono introdotte in modo sequenziale, regione per regione e zona per zona all'interno di una stessa regione. Gli aggiornamenti vengono annullati al primo segno di difetto.

Le modifiche complesse vengono attivate e disattivate con flag di funzione per controllare l'esposizione.

Le modifiche che hanno un impatto sui carichi di lavoro dei clienti sono dettagliate nelle notifiche. Per ulteriori informazioni, consultare le notifiche e lo stato di monitoraggio della manutenzione programmata, degli annunci e delle note di rilascio che hanno un impatto sui Event Streams.