FAQ per il ripristino d'emergenza
Le domande più frequenti per il ripristino d'emergenza possono includere domande su cosa si intende per disastro e sul ripristino dei carichi di lavoro in un'altra regione. Per trovare tutte le FAQ per IBM Cloud, consultare il sito Biblioteca Domande frequenti.
L'alta disponibilità è la stessa cosa del disaster recovery? Sono necessari entrambi?
L'alta disponibilità (HA) e il disaster recovery (DR) sono facilmente confusi, ma sono nettamente diversi.
La progettazione dell'alta disponibilità in un carico di lavoro è uno sforzo per evitare che il carico di lavoro si guasti. Ad esempio, la distribuzione dei dati su più dischi in un array RAID è un tentativo di prevenire un'interruzione causata da un guasto del disco. Gli alimentatori multipli in un server sono un tentativo di prevenire un guasto causato da un'interruzione del circuito di alimentazione. L'esecuzione delle applicazioni su più server in zone diverse è un tentativo di prevenire un'interruzione causata da un guasto del server e da un guasto della zona.
Il disaster recovery è la pratica di recupero di un carico di lavoro dopo un guasto, nonostante la disponibilità di risorse a disposizione. Ad esempio, un carico di lavoro potrebbe essere altamente disponibile e resistente ai guasti perché viene eseguito su più dispositivi hardware in più data center, il che potrebbe garantire al sistema una disponibilità 99.999. Tuttavia, è ancora suscettibile di disastri come la cancellazione accidentale o dolosa dei dati, o una catastrofe naturale che distrugga un'ampia area comprendente tutti i data center.
Di solito, più un carico di lavoro deve essere altamente disponibile, più è prezioso e vitale per l'azienda. Poiché un carico di lavoro è vitale per l'azienda, è necessario che abbia un piano di disaster recovery ben documentato e rigoroso.
Cosa si intende per disastro?
Un disastro informatico è un evento che interrompe gravemente un'applicazione o un ambiente, rendendolo incapace di funzionare come previsto. Gli eventi disastrosi possono essere di breve o lunga durata, ma in genere causano danni significativi all'azienda, sia dal punto di vista finanziario che della reputazione o di entrambi.
Gli eventi disastrosi possono essere il risultato dei seguenti scenari:
- Disastri naturali come inondazioni, incendi, terremoti.
- Problemi infrastrutturali, come interruzioni di corrente o guasti più ampi della rete.
- Azioni accidentali o dolose che eliminano dati, servizi o configurazione.
- Rilascio di un aggiornamento software che contiene un bug o un altro errore non previsto.
In ogni caso, è essenziale disporre di un piano di ripristino che permetta di ripristinare i servizi entro un determinato periodo di tempo e a un punto precedente al disastro. È importante anche considerare i costi, che comprendono sia l'impatto dei tempi di inattività sull'azienda sia le spese per la soluzione di ripristino.
La DR può avvenire in una sola regione?
Sì, il DR può avvenire nella stessa regione e potrebbe essere più veloce grazie alla minore latenza e alla non necessità di replicare i dati da una regione all'altra. Tuttavia, si consiglia di utilizzare una regione separata per una migliore resilienza. Se la regione primaria è gravemente colpita, il recupero nella stessa regione potrebbe non essere possibile.
IBM Cloud cerca di recuperare i servizi all'interno della regione, in linea con gli obiettivi di livello di servizio(SLO) pubblicati. Il recupero può richiedere minuti o ore, ma negli scenari peggiori, magari in caso di distruzione fisica dei beni, può richiedere giorni, settimane o mesi.
In IBM Cloud, se si verifica un'interruzione in cui IBM Cloud chiama un disastro, IBM Cloud potrebbe dover recuperare i servizi prima di poter recuperare i carichi di lavoro. In tal caso, è necessario aggiungere il tempo necessario a IBM Cloud per completare il proprio recupero al tempo necessario per fare il proprio. Tenetelo presente quando decidete se affidarvi a una sola regione.
Tutti i disastri richiedono il recupero in una seconda regione?
Non tutti i disastri richiedono il recupero in una seconda regione. Un amministratore di database potrebbe accidentalmente eliminare una tabella del database, un rilascio automatico potrebbe andare storto o un servizio cloud gestito essenziale potrebbe smettere di funzionare correttamente. In questi casi, il recupero dei dati è fondamentale. A seconda dell'ampiezza del problema, della preparazione dell'organizzazione e della rapidità del ripristino, un tale disastro potrebbe non costringere a un failover in un'altra regione. A seconda dello scenario, il recupero può avvenire nella stessa regione. Considerate diversi scenari di disastro nel vostro piano.
Come posso evitare la cancellazione accidentale dei servizi?
Molti servizi di IBM Cloud dispongono di protezioni integrate contro l'eliminazione accidentale, ma è possibile implementare ulteriori protezioni utilizzando account con diritti di accesso appropriati. Usare Cloud Identity and Access Management (IAM) per creare account con diversi livelli di accesso e permessi. Utilizzate quindi un account appropriato per l'attività operativa in questione e assicuratevi che altri utenti, come gli sviluppatori, abbiano solo l'accesso e i permessi necessari.
Se si usa Terraform, utilizzare ID di servizio che abbiano accesso all'aggiornamento ma non alla cancellazione.