Entendendo a alta disponibilidade e a recuperação de desastre para o IBM Cloud® Object Storage
Alta disponibilidadeA capacidade de um serviço ou carga de trabalho de resistir a falhas e continuar fornecendo capacidade de processamento de acordo com algum nível de serviço predefinido.
(HA) é a capacidade de um serviço permanecer operacional e acessível na presença de falhas inesperadas.
A recuperação de desastresA capacidade de um serviço ou carga de trabalho de se recuperar de incidentes raros e importantes e de falhas em larga escala, como a interrupção do serviço. Isso inclui um desastre físico que afeta toda uma região, a corrupção de um banco de dados ou a perda de um serviço que contribui para uma carga de trabalho. O impacto excede a capacidade do projeto de alta disponibilidade de lidar com ele.
é o processo de recuperação da instância de serviço para um estado de funcionamento.
IBM Cloud Object Storage é um serviço global que permite configurar a resiliência dos dados de armazenamento, mantendo a alta disponibilidade. Para obter mais informações, consulte Contrato de nível de serviço(SLA). Você também pode encontrar a região disponível e os locais do data center na documentação Disponibilidade de serviço e infraestrutura por local.
Arquitetura de alta disponibilidade
Object Storage é um serviço global e você tem a opção de configurar a resiliência do armazenamento. A resiliência de um bucket é definida pelo endpoint usado para criá-lo, ou seja, Cross Region, Regional e Single Site.
-
A resiliência entre regiões distribuirá seus dados por várias áreas metropolitanas
-
A resiliência regional distribuirá os dados por uma única área metropolitana
-
A resiliência do Data Center Único distribui os dados por vários dispositivos dentro de um único data center
Os buckets regionais e inter-regionais podem manter a disponibilidade durante uma interrupção do site ou da zona sem a necessidade de nenhuma alteração na configuração, portanto, é recomendável usar essas configurações de resiliência do bucket de armazenamento ao configurar suas cargas de trabalho para alta disponibilidade. Os dados armazenados em um único local ainda são distribuídos por vários dispositivos de armazenamento físico, mas estão contidos em um único data center sem qualquer suporte zonal.
Recursos de alta disponibilidade
Object Storage fornece os seguintes recursos para ajudá-lo a planejar a alta disponibilidade no caso de uma interrupção:
| Recursos | Descrição | Consideração |
|---|---|---|
| Resiliência do bucket de armazenamento | Capacidade de configurar opções específicas de resiliência para os dados do cliente. | { Object Storage compartimentos criados em um ponto de extremidade regional distribuem dados em três ou mais zonas contidas em uma área metropolitana. Qualquer uma dessas zonas pode sofrer uma interrupção ou até mesmo destruição sem
afetar a disponibilidade. Os buckets criados em um endpoint entre regiões distribuem os dados por três regiões em uma localização geográfica. Qualquer uma dessas regiões pode sofrer uma indisponibilidade ou até mesmo a destruição sem afetar a disponibilidade. As solicitações são encaminhadas para a área metropolitana inter-regional mais próxima usando o Global Server Load Balancing (GSLB). Consulte Endpoints e locais de armazenamento para obter mais informações. |
| Replicação | A replicação copia objetos recém-criados e atualizações de objetos de um bucket de origem para um bucket de destino e permite que você defina regras para a cópia automática e assíncrona de objetos. | Para garantir que você tenha uma cópia de backup disponível em caso de desastre, recomenda-se que a replicação seja configurada e definida. Saiba mais sobre o rastreamento de eventos de replicação. |
Arquitetura de recuperação de desastres
Os buckets inter-regionais, regionais e de site único oferecem níveis variados de tolerância contra cenários de desastres específicos. Escolha o modelo de resiliência correto para seu balde que se alinhe aos requisitos de recuperação de desastres de sua empresa. Para muitos cenários de desastres no centro de dados ou no nível regional, IBM planeja atingir um tempo de recuperação do serviço e do conteúdo associado em menos de 24 horas com um RPO de 1 hora.
Arquiteturas opcionais adicionais podem ser implementadas pelo cliente para melhorar os tempos de recuperação.
Por exemplo, para se recuperar do evento improvável de uma interrupção regional completa do COS, em que a restauração dos dados originais não é possível, um bucket duplicado pode ser criado em uma região alternativa. Esperar que IBM Cloud recupere uma região ou serviço afetado também é um caminho válido, mas lembre-se de que isso pode levar muitas horas ou mais e pode haver perda de dados, dependendo do cenário do desastre.
O bucket duplicado pode ser configurado para espelhar o bucket de produção, mas com referências atualizadas aos serviços regionais. Por exemplo, se estiver usando o Key Protect, um bucket duplicado em Madri deverá fazer referência às chaves raiz armazenadas em uma instância Key Protect de Madri. No caso de um cenário de desastre, em que não é possível esperar que IBM recupere totalmente a região, os clientes podem preencher novamente esse bucket duplicado com uma cópia de backup dos dados originais no bucket de origem. Como alternativa, os clientes podem configurar regras de replicação antes de qualquer interrupção para manter os dados sincronizados entre o bucket de origem e o bucket duplicado. Para obter o mais alto nível de resiliência, esse bucket duplicado deve ser criado antes do fato (antes de qualquer desastre em potencial) e mantido em sincronia com o bucket de origem que usa replicação. O uso do recurso de replicação de objetos deve ser considerado juntamente com o modelo de resiliência do seu bucket de origem e com os objetivos gerais de recuperação de desastres da empresa.
Planeje a recuperação em uma região de recuperação. O bucket replicado deve estar alinhado com as abordagens de recuperação de desastres da carga de trabalho no IBM Cloud. Se o desastre não afetar a configuração ou a disponibilidade do bucket de origem de produção (por exemplo, apenas perda de dados), pode ser possível para um cliente reparar os dados no bucket de origem no local. Caso seja necessário fazer failover para um bucket replicado, o aplicativo cliente precisará ser reconfigurado para chamar o endpoint do bucket replicado de destino.
Recursos de recuperação de desastres
IBM COS fornece os seguintes recursos de recuperação de desastres que podem ser configurados pelos clientes:
| Recursos | Descrição | Consideração |
|---|---|---|
| Replicação de objetos | A replicação copia objetos recém-criados e atualizações de objetos de um bucket de origem para um bucket de destino e permite que você defina regras para a cópia automática e assíncrona de objetos. | Para garantir que você tenha uma segunda cópia disponível no caso de um desastre, é possível configurar a replicação entre um bucket de produção e um bucket de recuperação de destino. Dependendo dos requisitos de resiliência de sua empresa, a replicação pode não ser necessária se estiver usando buckets regionais ou entre regiões. Saiba mais sobre o rastreamento de eventos de replicação. |
| Versionamento de objetos | Ative o controle de versão de objetos para manter versões anteriores de objetos que possam ser restauradas em caso de corrupção ou exclusão de dados. | Os clientes podem ativar o controle de versão de objetos em buckets e restaurar versões antigas em caso de corrupção de dados. O bucket deve estar disponível para executar a recuperação de versão. Saiba mais |
| Bloqueio de objeto | O Object Lock impede a exclusão de versões de objetos durante um período de retenção especificado. | Ative o bloqueio de objetos para proteger contra exclusões ou substituições acidentais ou não autorizadas de objetos. Certifique-se de que as versões seguras dos objetos estejam disponíveis para recuperação. Saiba mais |
Outras opções de recuperação de desastres são criadas e suportadas pelo cliente.
| Recursos | Descrição | Consideração |
|---|---|---|
| Backup e restauração | Use scripts ou aplicativos de backup de terceiros para fazer backup dos dados em buckets de origem para uma região de recuperação. | O cliente deve hospedar e gerenciar qualquer script ou solução de backup de terceiros para fazer backup dos dados armazenados nos buckets COS. |
Planejamento para DR
As etapas do DR devem ser praticadas regularmente. Ao criar seu plano, considere os seguintes cenários de falha e resoluções.
| Falha | Resolução |
|---|---|
| Falha de hardware (ponto único) | os buckets Object Storage são resistentes a falhas de hardware de ponto único em uma zona. Não é necessária nenhuma configuração. |
| Falha no data center | Os buckets de COS regionais e entre regiões são resilientes a falhas individuais do data center. O cliente não precisa de nenhuma configuração ou failover. Os clientes com buckets em zonas de data center único podem configurar a replicação ou usar soluções de backup de terceiros para garantir que uma cópia segura dos dados esteja disponível fora da zona. Aguardar que o IBM Cloud recupere uma região ou serviço afetado também é uma opção válida, mas lembre-se de que isso pode levar muitas horas ou mais, dependendo da natureza da interrupção do data center. |
| Distorção de dados | Use controle de versão de objetos, replicação de objetos ou soluções de backup de terceiros para garantir que existam versões intactas dos objetos para recuperação em caso de corrupção de dados ou exclusão acidental. |
| Falha regional | Os buckets COS entre regiões são resistentes a falhas regionais. Alguns serviços regionais integrados, como o Key Protect, podem exigir etapas adicionais de failover para buckets entre regiões. Os clientes com buckets em COS regionais ou de um único data center devem seguir as etapas de recuperação de desastres acima no caso de falhas regionais totais. Esperar que IBM Cloud recupere uma região ou serviço afetado também é um caminho válido, mas lembre-se de que isso pode levar muitas horas ou mais, dependendo da natureza da interrupção regional. |
Uso do IBM Cloud Key Management Service para adicionar criptografia de envelope:
Se estiver usando qualquer outra integração de serviço do IBM Cloud, por exemplo, o IBM Cloud Key Management Service, como o Key Protect ou o Hyper Protect, para adicionar criptografia de envelope, será necessário garantir que o plano de configuração apropriado para réplica de chave seja usado. Isso é essencial ao usar uma configuração entre regiões, o que garante que uma chave de réplica esteja disponível no caso de uma interrupção. Consulte a documentação Key Protect para obter informações sobre alta disponibilidade e recuperação de desastres.
Suas responsabilidades com HA e DR
| Responsabilidade | Descrição |
|---|---|
| Resiliência | Provisione buckets Object Storage com a opção de resiliência apropriada, a classe de armazenamento, a localidade dos dados e as configurações opcionais necessárias para a carga de trabalho e o caso de uso específicos. |
| Backup de Dados | Garantir backups dos dados do cliente, se necessário, de acordo com os requisitos de sua organização. |
| Rede | Monitore e gerencie recursos de rede que IBM sejam da IBM para garantir o acesso adequado aos endpoints do serviço IBM Cloud, incluindo capacidade e disponibilidade. |
| Usando o IBM Cloud KMS para adicionar criptografia de envelope | Se estiver usando o IBM Cloud Key Protect ou o Hyper Protect Crypto Services para adicionar criptografia de envelope, certifique-se de revisar a respectiva documentação de alta disponibilidade e recuperação de desastres para entender completamente as implicações. Pode ser necessário usar um local de instância de chave que tenha uma réplica de chave que possa ser usada no caso de um failover. Certifique-se também de revisar as informações apropriadas sobre licenças e planos. |
Para saber mais sobre a propriedade de responsabilidade entre o cliente e Object Storage, consulte [Suas responsabilidades ao usar Object Storage (/docs/cloud-object-storage?topic=cloud-object-storage-responsibilities)].
Objetivo de tempo de recuperação (RTO) e objetivo de ponto de recuperação (RPO)
A oferta IBM Cloud Object Storage tem planos para fornecer a recuperação do Cloud Service e do conteúdo associado, o que acontece em poucas horas no caso de um desastre correspondente.
| Recursos | RTO e RPO |
|---|---|
| Recuperação de falha de hardware (ponto único) | RTO = 0, RPO = 0 para todos os modelos de resiliência |
| Recuperação de uma interrupção do data center | RTO = 0, RPO = 0 para modelos de resiliência regional e entre regiões |
| Restaurar a versão anterior do objeto | RTO = segundos, RPO = próximo de 0 |
| Recuperação para um bucket em uma região separada com replicação ativa | RTO = minutos, a criação de scripts pode melhorar ainda mais o tempo e também considerar o tempo para ajustar as cargas de trabalho para direcionar o bucket de recuperação, RPO = quase 1 hora |
| Recuperação para um novo bucket em uma nova região sem replicação ativa | RTO = minutos a dias, considere a quantidade de tempo para reconfigurar um novo bucket e ajustar as cargas de trabalho para direcionar o novo endpoint do bucket. Considere também o tempo para preencher o bucket com uma cópia dos dados originais. O RPO está sujeito ao plano de backup e recuperação do cliente |
Gerenciamento de mudanças
A gestão de alterações inclui tarefas como atualizações, alterações de configuração e eliminação. Para garantir que os usuários recebam acesso de acordo com os requisitos da função, consulte Introdução ao IAM.
Recomenda-se conceder aos usuários e processos as funções e ações do IAM com o mínimo de privilégio necessário para o trabalho deles. Veja Como posso evitar a exclusão acidental de serviços?
Como IBM® ajuda a garantir a recuperação de desastres
IBM® toma medidas específicas de recuperação no caso de um desastre.
- Recuperação de falhas regionais ou de zona
No caso de uma falha de zona, IBM Cloud resolverá a interrupção da zona e, quando a zona voltar a funcionar, o balanceador de carga global retomará o envio de solicitações de API para o nó de instância restaurado sem a necessidade de ação do cliente. - { IBM® realiza testes anuais de vários cenários de desastres e aprimora continuamente nossa documentação de recuperação com base nas descobertas feitas durante esses testes.
- o suporte global 24 horas por dia, 7 dias por semana, está disponível para os clientes com IBM® Especialistas no assunto que estão de plantão para ajudar em caso de desastre.
Todos os IBM® Os especialistas no assunto são treinados anualmente em políticas e procedimentos de continuidade de negócios e recuperação de desastres para garantir a preparação em caso de desastre.
Como IBM mantém os serviços
Todos os upgrades seguem as práticas recomendadas de serviço IBM e têm um plano de recuperação e um processo de reversão em vigor. Atualizações regulares para novos recursos e manutenção ocorrem como parte das operações normais. Essa manutenção pode ocasionalmente causar curtos intervalos de interrupção que são tratados pela lógica de nova tentativa de disponibilidade do cliente. As alterações são implementadas sequencialmente, região por região e zona por zona dentro de uma região. As atualizações são canceladas ao primeiro sinal de defeito.
As alterações complexas são ativadas e desativadas com sinalizadores de recursos para controlar a exposição.
As alterações que afetam as cargas de trabalho dos clientes são detalhadas nas notificações. Para obter mais informações, consulte notificações de monitoramento e status para manutenção planejada, anúncios e notas de versão que afetam esse serviço.