Visión general de la alta disponibilidad y la recuperación tras desastre para IBM Cloud VPC

La alta disponibilidadCapacidad de un servicio o carga de trabajo para soportar fallos y seguir proporcionando capacidad de procesamiento de acuerdo con algún nivel de servicio predefinido. (HA) es la capacidad de un servicio de permanecer operativo y accesible ante fallos inesperados. La recuperación de desastresCapacidad de un servicio o carga de trabajo para recuperarse de incidentes graves poco frecuentes y fallos a gran escala, como la interrupción del servicio. Esto incluye un desastre físico que afecte a toda una región, la corrupción de una base de datos o la pérdida de un servicio que contribuya a una carga de trabajo. El impacto supera la capacidad del diseño de alta disponibilidad para gestionarlo. es el proceso de recuperación de la instancia de servicio a un estado de funcionamiento.

IBM Cloud® Virtual Private Cloud es un servicio de alta disponibilidad diseñado para cumplir los Objetivos de Nivel de Servicio(SLO). Se compone de servicios zonales y regionales.

Para obtener más información sobre la región disponible y las ubicaciones de los centros de datos, consulte Disponibilidad de servicios e infraestructuras por ubicación.

Arquitectura de alta disponibilidad

Los recursos de VPC se dividen en servicios de plano de control y plano de datos para que los clientes puedan crear aplicaciones de alta disponibilidad sobre VPC. El plano de control existe para aprovisionar y gestionar los recursos de la VPC (crear, actualizar, eliminar) y para proporcionar funciones de control. El plano de datos es el conjunto de recursos de VPC aprovisionados, como instancias de servidor virtual, direcciones IP flotantes, grupos de seguridad, almacenamiento en bloque, etc.

El plano de control se aloja en hardware redundante en todas las zonas, lo que proporciona resistencia ante fallos de hardware y zonales. El plano de control y el plano de datos se encuentran en dominios de fallo diferentes. Por ejemplo, una interrupción del plano de control no afecta a la disponibilidad del plano de datos. Todos los recursos existentes de los clientes siguen funcionando sin ningún impacto. Para aumentar la resistencia, los usuarios pueden crear aplicaciones a partir de recursos redundantes del plano de datos.

Los recursos del VPC se clasifican en recursos zonales y recursos regionales en función de su alcance. Algunos recursos, como la VPC, abarcan varias zonas y se consideran recursos regionales. La mayoría de los recursos tienen un alcance zonal y están disponibles en una zona específica. Por ejemplo, las subredes, las listas de control de acceso, los grupos de seguridad, las tablas de enrutamiento, las pasarelas públicas y las pasarelas de punto final privado virtual existen en la zona en la que se crean.

Para obtener más información sobre la protección del plano de datos frente a fallos del plano de control, la independencia del servicio zonal y la redundancia del servicio regional, consulte IBM Cloud service architecture for high availability and resiliency.

error de zona

Si se produce un fallo de zona completo, tanto el plano de control como el plano de datos se ven afectados en la zona. Las funciones de control en las zonas afectadas no están disponibles y todos los recursos zonales están fuera de servicio. Por ejemplo, las instancias de servidor virtual de la zona afectada no están disponibles y no se trasladan a otra zona sana. Los cambios que se realicen en los recursos regionales no surtirán efecto en la zona que ha fallado hasta que ésta se recupere.

El plano de datos de otras zonas no se ve afectado y todos los recursos zonales de las zonas no afectadas siguen funcionando sin interrupción. Los recursos regionales como VPC siguen funcionando en las zonas sanas. El plano de control está altamente disponible y permite a los servicios gestionar los recursos de las otras zonas no afectadas.

Los clientes deben desarrollar mecanismos para gestionar la alta disponibilidad de sus aplicaciones repartiendo los recursos por zonas (dominios de fallo) y planificar la recuperación en caso de catástrofe.

Fracaso regional

En el caso poco habitual de que se produzca un desastre regional, se resuelven los problemas subyacentes y se restaura el plano de control de la VPC centrándose en reducir la pérdida de datos para los recursos. El plano de datos también se restaura recuperando el estado de los datos del cliente desde el almacenamiento con el objetivo de cumplir el objetivo de punto de recuperación (RPO) y el objetivo de tiempo de recuperación (RTO).

En una región multizona de un solo campus (SC-MZR), el desastre de un centro de datos podría afectar a toda la región porque las zonas están más estrechamente relacionadas. Los servicios deben emplear estrategias de copia de seguridad y recuperación en otro MZR para evitar la pérdida de datos.

Fallos de hardware

Los recursos se sirven desde un hardware fiable y a menudo redundante, pero un fallo de hardware imprevisto podría hacer caer estos recursos. Por ejemplo, una instancia de servidor virtual puede fallar cuando falla el hardware subyacente. En esta situación, la política de recuperación de fallos del host determina cómo se recupera el servidor virtual. Si se produce el fallo y la política de recuperación de fallos de host se establece en la configuración predeterminada, restart, el plano de control detecta el fallo de hardware y migra el servidor virtual al hardware disponible en la misma zona y reinicia el servidor virtual. El almacenamiento en disco efímero no se restaura en el volumen de arranque. Los volúmenes de datos están disponibles, pero pueden faltar escrituras de caché de aplicaciones o del sistema operativo que no se guardan en el momento del fallo.

Los volúmenes de bloques están respaldados por hardware redundante con técnicas de replicación avanzadas para mejorar la capacidad de recuperación. Sin embargo, un desastre zonal o un fallo multi-hardware puede provocar el fallo del volumen de bloques. La copia de seguridad y la restauración son un enfoque adecuado para mitigar la pérdida o corrupción de datos. Este enfoque también puede utilizarse para mitigar un desastre regional replicando los datos en otras regiones de IBM Cloud. La función de instantáneas puede utilizarse para realizar copias de seguridad y restauraciones. Los clientes también pueden distribuir sus aplicaciones por otras zonas para evitar interrupciones y mejorar el RPO/RTO.

Puede existir una fuerte correlación de fallos entre el almacenamiento de volúmenes y el fallo de la aplicación de servidor asociada. Asegúrese de examinar y probar las cargas de trabajo para determinar el comportamiento de la aplicación en presencia de un dispositivo de almacenamiento defectuoso.

Para obtener información sobre los servidores bare metal y su almacenamiento asociado, consulte Storage overview for Bare Metal Servers for VPC. Las instantáneas no están disponibles para los discos locales en los servidores bare metal. Los clientes deben gestionar la alta disponibilidad y la recuperación ante desastres de estos dispositivos.

Creación de aplicaciones de HA

Puede utilizar un equilibrador de carga VPC para distribuir las solicitudes entrantes a varios servidores virtuales y servidores bare metal. Los servidores virtuales y los servidores bare metal que dejan de estar disponibles dejan de responder a las comprobaciones de estado; el equilibrador de carga equilibra entonces la carga en los recursos disponibles. Puede utilizar un Application Load Balancer (ALB) para distribuir el tráfico de una carga de trabajo entre servidores virtuales de varias zonas y crear cargas de trabajo que estén disponibles incluso cuando una zona entera deje de estarlo.

Cuando el propio ALB está configurado en subredes a través de zonas, es resistente al fallo de una sola zona. El Network Load Balancer es un servicio zonal que se distribuye en múltiples servidores virtuales subyacentes y resiste el fallo de un único servidor virtual.

La estrategia básica para mejorar la disponibilidad de las cargas de trabajo que se construyen a partir de recursos VPC consiste en distribuir la carga de trabajo entre varios recursos. Es posible distribuir recursos dentro de una zona, entre varias zonas en una región multizona (MZR) o entre varias regiones. Para obtener más información, consulte Despliegue de cargas de trabajo aisladas en varias ubicaciones y zonas; esta estrategia utiliza IBM Cloud Internet Services (CIS) y un equilibrador de carga global.

Funciones de alta disponibilidad

IBM Cloud VPC admite las siguientes funciones de alta disponibilidad:

Funciones HA para IBM Cloud VPC
Característica Descripción Consideración
Equilibrador de carga de aplicaciones Un ALB distribuye la carga por zonas a direcciones IP. La carga de trabajo debe ser escalable.
Equilibrador de carga de red Un NLB distribuye la carga entre las direcciones IP de una zona. La carga de trabajo debe ser escalable.
Escalado automático para VPC Mejore el rendimiento y los costes creando dinámicamente instancias de servidores virtuales para satisfacer las demandas de su entorno. La carga de trabajo debe ser escalable.
Equilibrador de carga y grupo de instancias Las cargas de trabajo escalables dirigidas por un equilibrador de carga distribuyen la carga entre varias instancias de distintas zonas. La carga de trabajo debe ser escalable.

Como cliente, puede crear y apoyar la HA:

Funciones de HA del cliente para IBM Cloud VPC
Característica Descripción Consideración
Carga de trabajo escalable Cree un servidor virtual o una carga de trabajo basada en un servidor bare metal que pueda escalarse horizontalmente con más servidores. No todas las cargas de trabajo pueden escalarse horizontalmente.

Carga de trabajo escalable

Las cargas de trabajo escalables pueden gestionar el aumento de la demanda añadiendo más servidores que ejecuten la misma imagen. La carga de trabajo escalable puede implementarse utilizando balanceadores de carga y Auto Scale para VPC.

Arquitectura de recuperación en caso de catástrofe

La estrategia para la recuperación ante desastres consiste en proporcionar automatización de scripts para restaurar una carga de trabajo de VPC en una ubicación de recuperación. Por ejemplo, cuando una región deja de estar disponible, es responsabilidad del cliente migrar la carga de trabajo y los datos asociados a una región disponible. IBM es compatible con el sistema de infraestructura como código Terraform, que puede utilizarse para definir cargas de trabajo con ubicaciones y rendimiento parametrizados. Los clientes pueden utilizar la API, el SDK y la CLI de VPC para crear secuencias de comandos para recuperar recursos en una ubicación disponible durante un desastre. Para más información, consulte Planificación de la recuperación en caso de catástrofe.

Puede obtener más información sobre el uso de IBM Cloud Object Storage, IBM Cloud Schematics que proporcionan Terraform-as-a-Service, y arquitecturas desplegables en Using IBM Cloud services in your disaster recovery.

Funciones de recuperación en caso de catástrofe

IBM Cloud VPC admite las siguientes funciones de recuperación ante desastres:

Funciones DR para IBM Cloud VPC
Característica Descripción Consideración
Instantáneas de un solo volumen Una instantánea es una copia puntual de tu volumen de arranque o de datos. Block Storage las instantáneas se almacenan en la instancia regional de Cloud Object Storage. Una instantánea es independiente de su volumen de origen. Si la zona del volumen de origen no está disponible, la instantánea puede utilizarse para crear un nuevo volumen en una zona diferente de la región. Las instantáneas pueden crearse bajo demanda en la consola, desde la CLI, con la API o Terraform. También pueden programarse mediante el servicio Backup for VPC.
Copias instantáneas interregionales Puede utilizar copias instantáneas interregionales independientes de sus instantáneas de origen para crear nuevos volúmenes. Las instantáneas pueden copiarse a otra región manualmente en la consola, desde la CLI o mediante programación con la API o Terraform. También puede incluir en su política de copias de seguridad la creación de una copia en otra región.
Instantáneas de grupos de coherencia Un grupo de consistencia de instantáneas contiene instantáneas de múltiples volúmenes Block Storage que están adjuntos a la misma instancia de servidor virtual. Cuando se solicita una instantánea de un grupo de coherencia, el sistema genera instantáneas de todos los volúmenes etiquetados Block Storage que están adjuntos a la instancia de servidor virtual al mismo tiempo. Puede incluir o excluir volúmenes de arranque. El almacenamiento de instancias no está incluido.
Restauración rápida de instantáneas Las instantáneas de restauración rápida son instantáneas que se almacenan en caché en la zona con el volumen de bloques padre. Cuando se crea un servidor virtual con una instantánea de restauración rápida de arranque, el servidor se vuelve totalmente operativo más rápido que cuando se aprovisiona su volumen de arranque desde una instantánea normal.
Replicación de archivos compartidos Si el recurso compartido de origen deja de estar disponible, puede iniciar una conmutación por error de replicación en el recurso compartido de réplica. Puede crear una réplica compartida en otra zona de la misma región. También puede crear una réplica en otra región de la misma geografía. Puedes replicar tus datos cada 15 minutos.

Restaurar un volumen o un recurso compartido a partir de una instantánea es una operación manual que lleva tiempo. Si necesita un servicio de mayor nivel para la recuperación en caso de catástrofe, consulte IBM Cloud 's Backup and recovery services.

Como cliente, puede crear y dar soporte a opciones adicionales de recuperación ante desastres:

Funciones de RD del cliente para IBM Cloud VPC
Característica Descripción Consideración
Fuente externa de verdad para la configuración de la VPC Construcción de VPC, red y servidores capturados en archivos de configuración gestionados por el cliente como scripts Terraform, shell scripts o programas. El cliente debe crear la secuencia de comandos y persistir la configuración donde se puede utilizar durante un desastre potencial.
Scripts creados por el cliente para copias de seguridad y almacenamiento de archivos Copiar el contenido de un archivo compartido para que esté disponible en otra ubicación. El cliente debe crear la secuencia de comandos o utilizar copias de seguridad y restauraciones continuas gestionadas por el cliente.
Copia de seguridad y restauración continuas gestionadas por el cliente para volúmenes de bloques y almacenamiento de archivos Los clientes pueden instalar agentes de terceros y controladores de SO en los servidores que se integran con sistemas de copia de seguridad y recuperación como Veeam. El cliente debe instalar y gestionar la solución de copia de seguridad y recuperación de terceros.

Planificación de la recuperación tras desastre

Las medidas de recuperación en caso de catástrofe deben practicarse con regularidad. Cuando elabore su plan, tenga en cuenta los siguientes escenarios de fracaso y resoluciones.

Escenarios de RD para IBM Cloud VPC
Anomalía Resolución
Fallo del volumen de arranque Puedes crear un nuevo volumen a partir de una imagen personalizada que hayas creado a partir de tu volumen. También puede restaurar un volumen a partir de una instantánea en la consola, desde la CLI, con la API, Terraform o utilizando una solución de copia de seguridad y restauración continua gestionada por el cliente. Cuando restaure un volumen de arranque desde una instantánea, espere cierta degradación del rendimiento mientras los datos se copian al volumen de arranque desde la instantánea. Al utilizar instantáneas de restauración rápida, puede alcanzar los objetivos de tiempo de recuperaciónEn la planificación de la recuperación en caso de catástrofe, el tiempo que tarda en restablecerse un proceso empresarial tras una catástrofe. (RTO) más rápidamente que restaurando a partir de una instantánea normal, ya que todos los datos están disponibles y el rendimiento no se ve afectado.
Fallo del volumen de datos o corrupción de datos Restaure un volumen a partir de una instantánea en la consola, desde la CLI, con la API, Terraform o utilizando una solución de copia de seguridad y restauración continua gestionada por el cliente. Las instantáneas de restauración rápida también están disponibles para los volúmenes de datos.
Corrupción de datos de archivos compartidos Puede crear instantáneas de archivos compartidos para conservar los datos de su archivo compartido en un momento determinado. A continuación, puede restaurar los datos de una instantánea de un recurso compartido de archivos si el contenido del recurso compartido de archivos se elimina o sobrescribe accidentalmente.
Fallo en la compartición de archivos Se mitiga iniciando una conmutación por error a una réplica existente en otra zona. Prueba el proceso de conmutación por error para ver cuánto tarda.
Fallo del servidor virtual Mitigado mediante el uso de las funciones de alta disponibilidad de un equilibrador de carga y Auto Scale para VPC, creando una carga de trabajo escalable. Puede ser necesario reiniciar el servidor virtual. Podría ser necesaria la resolución de fallos en el volumen de bloques.
Fallo del servidor de metal desnudo Solución de copia de seguridad y restauración gestionada por el cliente.
error de zona Mitigado mediante el uso de las funciones de alta disponibilidad de un equilibrador de carga y Auto Scale para VPC, creando una carga de trabajo escalable. Utilice una fuente externa de verdad para la configuración de la zona VPC para crear recursos en una zona disponible utilizando la resolución de fallos de servidor y la resolución de fallos de volumen de bloque.
Fracaso regional Utilice una fuente externa de verdad para la configuración de la región VPC para crear recursos en una región disponible. Restaure los volúmenes y el almacenamiento de archivos a sus valores anteriores mediante la resolución de fallos del servidor.

Sus responsabilidades en materia de alta disponibilidad y recuperación en caso de catástrofe

Para más información, consulte "Comprender sus responsabilidades al utilizar la Nube Virtual Privada ". Es su responsabilidad probar continuamente su plan de HA y DR. Para más información, consulte Pruebas de recuperación en caso de catástrofe.

Pueden producirse interrupciones en la conectividad de la red y breves periodos de indisponibilidad de un servicio. Es su responsabilidad asegurarse de que el código fuente de la aplicación incluye lógica de reintento de disponibilidad del cliente para mantener la alta disponibilidad de la aplicación.

Puede utilizar las siguientes listas de control para ayudarle a crear y poner en práctica su plan.

  • Instantánea del volumen de bloques

  • Réplica de almacenamiento de archivos

  • Fuente externa de verdad para la configuración de la VPC

Gestión de cambios

La gestión de cambios incluye tareas como actualizaciones, cambios de configuración y eliminaciones.

Conceda a los usuarios y procesos las funciones y acciones de IAM con los menores privilegios necesarios para su trabajo. Para más información, consulta ¿Cómo puedo evitar el borrado accidental de servicios?

Considere la posibilidad de crear una copia de seguridad manual antes de realizar cambios en la configuración de la infraestructura.

Cómo ayuda IBM® a planificar la recuperación en caso de catástrofe

IBM® adopta medidas específicas de recuperación para IBM Cloud VPC en caso de catástrofe.

Si un único host falla inesperadamente, los servidores virtuales del host que ha fallado pueden reiniciarse automáticamente en un host sano. Para obtener más información sobre cómo IBM supervisa la infraestructura y responde a los fallos de host, consulte Políticas de recuperación de fallos de host.

Cómo se recupera IBM de los fallos de zona

Los fallos de zona pueden deberse a catástrofes naturales, problemas de infraestructura como un corte de electricidad, acciones accidentales o malintencionadas que borren información o actualizaciones de software que contengan un fallo o error. En caso de fallo de una zona, IBM trabaja para recuperar las instalaciones y los centros de datos, la red física y los dispositivos almacenamiento físico, servidores físicos y memoria, e hipervisores. Para más información, consulte Responsabilidades compartidas en el uso de productos IBM Cloud.

Cómo se recupera IBM de los fracasos regionales

En caso de que toda una región experimente un fallo, IBM vuelve a trabajar para recuperar las instalaciones y centros de datos, la red física y los dispositivos, el almacenamiento físico servidores físicos y memoria, e hipervisores. Para más información, consulte Responsabilidades compartidas en el uso de los productos de IBM Cloud y Preguntas frecuentes para la recuperación en caso de desastre.

Si IBM no puede restaurar la instancia de servicio, deberá restaurar el servicio tal y como se describe en la arquitectura de recuperación de desastres.

Cómo IBM mantiene los servicios

Cuando se realiza el mantenimiento rutinario de servidores virtuales, hosts y centros de datos, se siguen protocolos rutinarios. Para obtener más información, consulte Descripción de las operaciones de mantenimiento de nube.

Todas las actualizaciones siguen las mejores prácticas de servicio de IBM, incluidos los planes de recuperación y los procesos de reversión. El mantenimiento regular puede causar breves interrupciones, mitigadas por la lógica de reintento de disponibilidad del cliente. Los cambios se despliegan secuencialmente, región por región, y zona por zona dentro de una región. IBM revierte las actualizaciones a la primera señal de un defecto.

Los cambios complejos se activan y desactivan con banderas de función para controlar la exposición.

Los cambios que afectan a las cargas de trabajo de los clientes se detallan en las notificaciones de IBM Cloud. Para obtener más información sobre el mantenimiento planificado, los anuncios y las notas de la versión que afectan a este servicio, consulte Supervisión de notificaciones y estado.