Entendendo a alta disponibilidade e a recuperação de desastre para o Event Streams
Alta disponibilidadeA capacidade de um serviço ou carga de trabalho de resistir a falhas e continuar fornecendo capacidade de processamento de acordo com algum nível de serviço predefinido. Para serviços, a disponibilidade é definida no Contrato de Nível de Serviço. A disponibilidade inclui eventos planejados e não planejados, como manutenção, falhas e desastres. (HA) é a capacidade de um serviço permanecer operacional e acessível na presença de falhas inesperadas. A recuperação de desastresA capacidade de um serviço ou carga de trabalho de se recuperar de incidentes raros e importantes e de falhas em larga escala, como a interrupção do serviço. Isso inclui um desastre físico que afeta toda uma região, a corrupção de um banco de dados ou a perda de um serviço que contribui para uma carga de trabalho. O impacto excede a capacidade do projeto de alta disponibilidade para lidar com ele. é o processo de recuperação da instância de serviço para um estado de funcionamento.
IBM® Event Streams for IBM Cloud® é um serviço global e você pode encontrar a região disponível e os locais do data center na documentação Disponibilidade de serviço e infraestrutura por local. Como um serviço global, Event Streams cumpre os Objetivos de Nível de Serviço(SLO) definidos com os planos Standard e Enterprise. O SLO não é uma garantia e o site IBM® não emitirá créditos pelo não cumprimento de um objetivo.
Arquitetura de alta disponibilidade
Recursos de alta disponibilidade
Event Streams oferece suporte aos seguintes recursos de alta disponibilidade:
| Recursos | Descrição | Consideração |
|---|---|---|
| Reimplantação de regiões com várias zonas | Distribuído em três zonas de disponibilidade para tolerância a falhas e alta disponibilidade | Em Event Streams, os dados de cada partição são distribuídos em três zonas de disponibilidade (para implantações MZR) para garantir a continuidade dos negócios em caso de perda de dados de uma zona de disponibilidade. |
| Mínimo de réplicas em sincronização | Um mínimo de duas réplicas sincronizadas é necessário em todos os momentos | Event Streams monitora continuamente e garante que pelo menos duas réplicas sejam sincronizadas em toda a disponibilidade para assegurar que as mensagens não sejam perdidas no caso de falha de um broker ou de uma zona, garantindo que os dados críticos permaneçam duráveis. |
Arquitetura de recuperação de desastres
Recursos de recuperação de desastres
Event Streams oferece suporte aos seguintes recursos de recuperação de desastres:
| Recursos | Descrição | Consideração |
|---|---|---|
| Espelhamento | Espelhamento para replicação de cluster | Event Streams fornece um recurso de espelhamento que permite que as mensagens em uma instância Event Streams sejam continuamente copiadas em uma segunda instância. Você pode usar o recurso Event Streams Ou optar por gerenciar sua própria solução de espelhamento. |
Espelhamento para Event Streams
O espelhamento permite que as mensagens em uma instância do serviço Event Streams sejam continuamente copiadas para uma segunda instância. A resiliência dos aplicativos pode ser aprimorada com o uso de espelhamento, de modo que, se a primeira instância de serviço ficar indisponível, os aplicativos poderão se reconectar à segunda instância e continuar sua operação normal.
Esse recurso faz parte do serviço totalmente gerenciado e só pode ser usado entre instâncias de serviço que usam o plano Event Streams Plano Enterprise.
- Recursos de espelhamento:
- Espelhar tópicos, dados de mensagens e compensações de grupos de consumidores entre duas instâncias de serviço Event Streams, que podem ser provisionadas em diferentes contas IBM Cloud®.
- SLA de 99.99 disponibilidade, consistente com o serviço Event Streams.
- Pode ser monitorado usando IBM Cloud® Monitoring.
- Limitações do espelhamento:
- Unidirecional: Os dados só podem ser espelhados em uma direção de cada vez entre um par de instâncias de serviço. Isso significa que o espelhamento oferece um estilo "ativo-passivo" de alta disponibilidade, não um estilo "ativo-ativo".
- Assíncrono: as mensagens devem ser produzidas com êxito na instância de origem antes de serem espelhadas na instância de destino. Isso significa que, quando ocorre uma falha, alguns dados da mensagem podem ser perdidos.
- Consumo de mensagens pelo menos uma vez: Quando um consumidor se move entre instâncias, ele pode precisar reprocessar mensagens que já processou.
Planejando a Recuperação de Desastre
As etapas de recuperação de desastres devem ser praticadas regularmente. Ao criar seu plano, considere os cenários de falha e as resoluções a seguir.
| Falha | Resolução |
|---|---|
| Falha de hardware (ponto único) | Event Streams é resistente a um único ponto de falha de hardware em uma zona, sem necessidade de configuração. |
| falha da zona | Uma instância Event Streams implantada em uma região com várias zonas é resiliente à falha de uma única zona, sem necessidade de configuração. Para implantações de zona única, configure outro cluster Event Streams como um par espelhado para mitigar uma falha de zona. |
| Distorção de dados | Event Streams não inclui nenhum mecanismo interno de recuperação de corrupção de dados. É necessário planejar essas circunstâncias como parte de um plano de recuperação de desastres e talvez seja necessário usar o recurso de espelhamento ou configurar uma nova instância. |
| Falha regional | Se você configurou a instância do Event Streams em uma região com várias zonas, é improvável que ocorra um desastre regional. Se ocorrer uma falha regional, será necessário configurar uma nova instância em outra região. Para obter mais informações, consulte Compreensão de suas responsabilidades. |
Suas responsabilidades com HA e DR
As informações a seguir podem ajudá-lo a criar e praticar continuamente seu plano de HA e DR.
É importante entender as responsabilidades de gerenciamento e os termos e condições que você tem ao usar Event Streams. A página de responsabilidades do cliente ajuda como ponto de partida para criar um plano de alta disponibilidade e recuperação de desastres.
Como parte da recuperação de desastres, é recomendável conceder aos usuários e processos as funções e ações do IAM com o mínimo de privilégio necessário para o trabalho deles. Para obter mais informações, consulte Como posso evitar a exclusão acidental de serviços?
Todos os planos Event Streams (exceto Satellite ) podem recuperar uma instância excluída dentro do período de recuperação de três dias, após o qual os dados são irreversivelmente destruídos. Você pode verificar o status de uma recuperação e forçar ou cancelar uma recuperação programada usando o IBM Cloud CLI.
Se Event Streams não puder restaurar a instância do serviço, será necessário restaurar conforme descrito em Espelhamento em um cenário de recuperação de desastres.
Como IBM mantém os serviços
Todas as atualizações seguem as práticas recomendadas de serviço IBM e têm um plano de recuperação e um processo de reversão em vigor. Atualizações regulares para novos recursos e manutenção ocorrem como parte das operações normais. Essa manutenção pode ocasionalmente causar curtos intervalos de interrupção que são tratados pela lógica de nova tentativa de disponibilidade do cliente. As alterações são implementadas sequencialmente, região por região e zona por zona dentro de uma região. As atualizações são canceladas ao primeiro sinal de defeito.
As alterações complexas são ativadas e desativadas com sinalizadores de recursos para controlar a exposição.
As alterações que afetam as cargas de trabalho dos clientes são detalhadas nas notificações. Para obter mais informações, consulte notificações de monitoramento e status de manutenção planejada, anúncios e notas de versão que afetam os Event Streams.