Conoscere l'alta disponibilità
IBM Cloud implementa modelli di architettura per progettare i servizi di IBM Cloud per l'alta disponibilità (HA), contribuendo a garantire la resilienza contro diversi tipi di guasti che potrebbero colpire l'infrastruttura distribuita di IBM Cloud.
Che cos'è l'alta disponibilità?
Se si eseguono carichi di lavoro aziendali in un ambiente cloud, i componenti e i servizi di sistema devono rimanere operativi e accessibili per lunghi periodi senza interruzioni durante le interruzioni pianificate o non pianificate. Questo livello di resilienza è noto come alta disponibilitàLa capacità di un servizio o di un carico di lavoro di resistere ai guasti e di continuare a fornire capacità di elaborazione secondo un livello di servizio predefinito.. L'alta disponibilità si ottiene utilizzando componenti e servizi di sistema ridondanti e distribuendo questi componenti in ambienti diversi. IBM Cloud offre servizi cloud ad alta disponibilità utilizzando componenti ridondanti ed eliminando i singoli punti di guasto.
A livello di regioni multizonaUna regione distribuita in più zone fisiche per aumentare la tolleranza ai guasti. (MZR), HA significa avere carichi di lavoro in esecuzione in più zone di disponibilitàUna posizione all'interno di una regione in cui gira IBM Cloud Kubernetes Service. nell'MZR, che forniscono la ridondanza per i guasti locali.
Per quanto riguarda l'HA nel cloud, è importante comprendere i concetti di alto livello che è necessario affrontare se si sta costruendo o gestendo un sistema cloud ad alta disponibilità.
Formula per l'alta disponibilità
Una formula standard per l'alta disponibilità è MTBF/(MTBF+MTTR), dove MTBF è il tempo medio tra i guasti e MTTR è il tempo medio di riparazione. Poiché MTBF è il tempo in
cui il sistema è attivo e MTTR è il tempo in cui il sistema è inattivo, questa formula può essere riassunta come segue:
- Disponibilità = (Il tempo in cui il sistema è attivo)/(Il tempo in cui il sistema è attivo + Il tempo in cui il sistema è inattivo).
La formula è utile perché mostra come migliorare la disponibilità. Si consideri uno scenario in cui si richiede che il server sia sempre disponibile per un mese di 30 giorni. In quel mese, supponiamo che il server sia stato interrotto una volta per un totale di 1 ora.
- Per ottenere il tempo totale del mese, moltiplicare 30 giorni x 24 ore/giorno = 720 ore
- MTBF = Tempo di funzionamento totale / Numero di guasti = 720 ore / 1 = 720 ore
- MTTR = Tempo di inattività totale / Numero di guasti = 1 ora / 1 = 1 ora
- Disponibilità = (MTBF / (MTBF + MTTR)) x 100 = (720 / 721) x 100 = 99.86 %
È possibile aumentare l'MTBF, ridurre l'MTTR o entrambi. Ciò significa che la disponibilità può essere migliorata aumentando l'affidabilità o risolvendo i problemi quando si rompono in modo più efficiente. Entrambi gli approcci sono comuni nei sistemi informatici. Il mainframe, che utilizza componenti ad alta affidabilità, parti ridondanti e modularità per consentire riparazioni più rapide, dimostra che con questo approccio è possibile raggiungere livelli significativi di disponibilità. Per ulteriori informazioni sulla disponibilità di specifici servizi IBM Cloud, consultare gli Accordi sui livelli di servizio(SLA).
Perché è necessaria l'alta disponibilità?
Con IBM Cloud, potete proteggere i vostri carichi di lavoro critici distribuendoli su un'infrastruttura resiliente e altamente disponibile. Utilizzando le funzioni di backup, disaster recovery e alta disponibilità, è possibile ridurre al minimo i tempi di inattività in caso di guasti gravi. Creando infrastrutture cloud protette da singoli punti di guasto ed eseguendo il backup dei dati, si mantengono altamente disponibili i carichi di lavoro e le applicazioni.
Un'infrastruttura resiliente mantiene in funzione la vostra soluzione cloud, anche se uno o più componenti dell'infrastruttura presentano un problema, ad esempio:
- Perdita di potenza in un centro dati
- Guasto hardware in uno dei centri dati
- Interruzione della rete a causa di un problema del router virtuale
- Manutenzione pianificata o non pianificata di un servizio
- Disastro naturale a raggio d'azione limitato
- Attacco ransomware su istanza di server virtuale