Visión general de la alta disponibilidad y la recuperación tras desastre para Event Streams

La alta disponibilidadCapacidad de un servicio o carga de trabajo para soportar fallos y seguir proporcionando capacidad de procesamiento de acuerdo con algún nivel de servicio predefinido. En el caso de los servicios, la disponibilidad se define en el Acuerdo de Nivel de Servicio. La disponibilidad incluye tanto los eventos planificados como los no planificados, como el mantenimiento, los fallos y las catástrofes. (HA) es la capacidad de un servicio de permanecer operativo y accesible ante fallos inesperados. La recuperación de desastresCapacidad de un servicio o carga de trabajo para recuperarse de incidentes graves poco frecuentes y fallos a gran escala, como la interrupción del servicio. Esto incluye un desastre físico que afecte a toda una región, la corrupción de una base de datos o la pérdida de un servicio que contribuya a una carga de trabajo. El impacto supera la capacidad del diseño de alta disponibilidad para gestionarlo. es el proceso de recuperación de la instancia de servicio a un estado de funcionamiento.

IBM® Event Streams for IBM Cloud® es un servicio global y puede encontrar las ubicaciones de regiones y centros de datos disponibles en la documentación Disponibilidad de servicios e infraestructuras por ubicación. Como servicio global, Event Streams cumple los Objetivos de Nivel de Servicio(SLO ) definidos con los planes Standard y Enterprise. El SLO no es una garantía y IBM® no otorgará créditos por el incumplimiento de un objetivo.

Arquitectura de alta disponibilidad

Arquitectura
Event Streams arquitectura de alta disponibilidad

Funciones de alta disponibilidad

Event Streams admite las siguientes funciones de alta disponibilidad:

Funciones HA para Event Streams
Característica Descripción Consideración
Reasignación de regiones multizona Distribuida en tres zonas de disponibilidad para ofrecer tolerancia a fallos y alta disponibilidad En Event Streams, los datos de cada partición se distribuyen en tres zonas de disponibilidad (para despliegues MZR) para garantizar la continuidad del negocio en caso de pérdida de datos de una zona de disponibilidad.
Mínimo de réplicas en sincronización Se requiere un mínimo de dos réplicas sincronizadas en todo momento Event Streams supervisa continuamente y garantiza que al menos dos réplicas se sincronicen a través de la disponibilidad para asegurarse de que los mensajes no se pierdan en caso de fallo de un corredor o zona, garantizando que los datos críticos sigan siendo duraderos.

Arquitectura de recuperación en caso de catástrofe

Arquitectura
Event Streams arquitectura de recuperación en caso de catástrofe

Funciones de recuperación en caso de catástrofe

Event Streams admite las siguientes funciones de recuperación de desastres:

Características DR para Event Streams
Característica Descripción Consideración
Duplicación Replicación en clúster Event Streams proporciona una función de duplicación que permite que los mensajes de una instancia de Event Streams se copien continuamente en una segunda instancia. Puede utilizar la función Event Streams U optar por gestionar su propia solución de mirroring.

Replicación para Event Streams

La duplicación permite que los mensajes de una instancia del servicio Event Streams se copien continuamente en una segunda instancia. La capacidad de recuperación de las aplicaciones puede mejorarse mediante el uso de réplicas, de modo que si la primera instancia de servicio deja de estar disponible, las aplicaciones pueden volver a conectarse a la segunda instancia y continuar su funcionamiento normal.

Esta función forma parte del servicio totalmente gestionado y sólo puede utilizarse entre instancias de servicio que utilicen el Event Streams Plan Enterprise.

  1. Características de la duplicación:
  • Refleje temas, datos de mensajes y compensaciones de grupos de consumidores entre dos instancias de servicio Event Streams, que se pueden aprovisionar en diferentes cuentas IBM Cloud®.
  • SLA del 99.99 disponibilidad, coherente con el servicio Event Streams.
  • Puede supervisarse mediante IBM Cloud® Monitoring.
  1. Limitaciones de la duplicación:
  • Unidireccional: Los datos sólo pueden reflejarse en una dirección a la vez entre un par de instancias de servicio. Esto significa que el mirroring ofrece un estilo "activo-pasivo" de alta disponibilidad, no un estilo "activo-activo".
  • Asíncrono: los mensajes deben producirse correctamente en la instancia de origen antes de que puedan reflejarse en la instancia de destino. Esto significa que, cuando se produce un fallo, pueden perderse algunos datos de los mensajes.
  • Consumo de mensajes al menos una vez: Cuando un consumidor se mueve entre instancias, puede necesitar reprocesar mensajes que ya ha procesado.

Planificación de la recuperación tras desastre

Las medidas de recuperación en caso de catástrofe deben practicarse con regularidad. Cuando elabore su plan, tenga en cuenta los siguientes escenarios de fracaso y resoluciones.

Escenarios de recuperación de desastres para Event Streams
Anomalía Resolución
Fallo de hardware (punto único) Event Streams es resistente a un único punto de fallo de hardware dentro de una zona, sin necesidad de configuración.
error de zona Una instancia Event Streams desplegada en una región multizona es resistente al fallo de una sola zona, sin necesidad de configuración. Para implementaciones de una sola zona, configure otro clúster Event Streams como un par duplicado para mitigar un fallo de zona.
Corrupción de datos Event Streams no incluye ningún mecanismo incorporado para recuperarse de la corrupción de datos. Debe planificar estas circunstancias como parte de un plan de recuperación ante desastres y puede que tenga que utilizar la función de duplicación o configurar una nueva instancia.
Fracaso regional Si ha configurado su instancia Event Streams en una región multizona, es poco probable que se produzca un desastre regional. Si se produce un fallo regional, deberá configurar una nueva instancia en otra región. Para más información, consulte Comprender sus responsabilidades.

Sus responsabilidades en HA y DR

La siguiente información puede ayudarle a crear y practicar continuamente su plan de HA y DR.

Es importante entender las responsabilidades de gestión y los términos y condiciones que tienes cuando utilizas Event Streams. La página de responsabilidades del cliente sirve de punto de partida para crear un plan de alta disponibilidad y recuperación en caso de catástrofe.

Como parte de la recuperación ante desastres, se recomienda conceder a los usuarios y procesos las funciones y acciones de IAM con los menores privilegios necesarios para su trabajo. Para más información, consulta ¿Cómo puedo evitar el borrado accidental de servicios?

Todos los planes Event Streams (excepto Satellite ) pueden recuperar una instancia eliminada en un periodo de reclamación de tres días, tras el cual los datos se destruyen irreversiblemente. Puede comprobar el estado de una reclamación y forzar o cancelar una reclamación programada mediante la CLI IBM Cloud.

Si Event Streams no puede restaurar la instancia de servicio, debe restaurar como se describe en Replicación en un escenario de recuperación de desastres.

Cómo IBM mantiene los servicios

Todas las actualizaciones siguen las mejores prácticas de servicio de IBM y cuentan con un plan de recuperación y un proceso de reversión. Las actualizaciones periódicas para nuevas funciones y el mantenimiento forman parte de las operaciones normales. Este mantenimiento puede causar ocasionalmente breves intervalos de interrupción que son gestionados por la lógica de reintento de disponibilidad del cliente. Los cambios se introducen secuencialmente, región por región y zona por zona dentro de una misma región. Las actualizaciones se echan atrás a la primera señal de un defecto.

Los cambios complejos se activan y desactivan con indicadores de función para controlar la exposición.

Los cambios que afectan a las cargas de trabajo de los clientes se detallan en las notificaciones. Para obtener más información, consulte las notificaciones de supervisión y el estado del mantenimiento planificado, los anuncios y las notas de la versión que afectan a Event Streams.