Visión general de la alta disponibilidad y la recuperación tras desastre para IBM Cloud® Object Storage

La alta disponibilidadCapacidad de un servicio o carga de trabajo para soportar fallos y seguir proporcionando capacidad de procesamiento de acuerdo con algún nivel de servicio predefinido. (HA) es la capacidad de un servicio de permanecer operativo y accesible ante fallos inesperados.
La recuperación de desastresCapacidad de un servicio o carga de trabajo para recuperarse de incidentes graves poco frecuentes y fallos a gran escala, como la interrupción del servicio. Esto incluye un desastre físico que afecte a toda una región, la corrupción de una base de datos o la pérdida de un servicio que contribuya a una carga de trabajo. El impacto supera la capacidad del diseño de alta disponibilidad para gestionarlo. es el proceso de recuperación de la instancia de servicio a un estado de funcionamiento.

IBM Cloud Object Storage es un servicio global que permite configurar la resistencia de los datos de almacenamiento manteniendo una alta disponibilidad. Para más información, véase Acuerdo de nivel de servicio(SLA). También puede encontrar la región disponible y las ubicaciones de los centros de datos en la documentación Disponibilidad de servicios e infraestructuras por localidad.

Arquitectura de alta disponibilidad

Object Storage es un servicio global y tiene la opción de configurar la resistencia del almacenamiento. La resistencia de un bucket viene definida por el endpoint que se utiliza para crearlo, es decir, Cross Region, Regional y Single Site.

  • La resiliencia entre regiones distribuirá sus datos por varias áreas metropolitanas

  • La resiliencia regional distribuirá los datos por toda una única área metropolitana

  • La resiliencia de un único centro de datos distribuye los datos entre varios dispositivos dentro de un único centro de datos

Los buckets regionales y transregionales pueden mantener la disponibilidad durante una interrupción del sitio o de la zona sin necesidad de realizar cambios en la configuración, por lo que se recomienda utilizar estos ajustes de resiliencia del bucket de almacenamiento al configurar las cargas de trabajo para una alta disponibilidad. Los datos que se almacenan en un único sitio siguen estando distribuidos entre muchos dispositivos de almacenamiento físico, pero se encuentran dentro de un único centro de datos sin ningún tipo de soporte zonal.

Funciones de alta disponibilidad

Object Storage proporciona las siguientes funciones para ayudarle a planificar una alta disponibilidad en caso de interrupción:

Características HA para Object Storage
Característica Descripción Consideración
Resistencia del cubo de almacenamiento Posibilidad de configurar opciones de resistencia específicas para los datos de los clientes. los buckets Object Storage que se crean en un endpoint regional distribuyen los datos a través de tres o más zonas contenidas en un área metropolitana. Cualquiera de estas zonas puede sufrir una interrupción o incluso una destrucción sin que ello afecte a la disponibilidad.


Los buckets que se crean en un punto de conexión entre regiones distribuyen los datos entre tres regiones de una ubicación geográfica. Cualquiera de estas regiones puede sufrir una interrupción o incluso puede ser destruida sin que ello afecte a la disponibilidad.

Las solicitudes se dirigen al área metropolitana interregional más cercana mediante el Equilibrio de Carga Global de Servidores (GSLB).

Consulte Puntos finales y ubicaciones de almacenamiento para obtener más información.
Réplica La replicación copia los objetos recién creados y las actualizaciones de objetos de un bucket de origen a un bucket de destino y permite definir reglas para la copia automática y asíncrona de objetos. Para asegurarse de que dispone de una copia de seguridad en caso de desastre, se recomienda configurar la replicación. Más información sobre Seguimiento de eventos de replicación.

Arquitectura de recuperación en caso de catástrofe

Los buckets interregionales, regionales y de un solo sitio ofrecen distintos niveles de tolerancia frente a escenarios de catástrofe específicos. Elija el modelo de resistencia adecuado para su cubo que se ajuste a los requisitos de recuperación ante desastres de su empresa. Para muchos escenarios de desastre a nivel de centro de datos o regional, IBM planea como objetivo un tiempo de recuperación del servicio y del contenido asociado inferior a 24 horas con un RPO de 1 hora.

El cliente puede implementar otras arquitecturas opcionales para mejorar los tiempos de recuperación.

Por ejemplo, para recuperarse del improbable caso de una interrupción regional completa de COS en la que no sea posible restaurar los datos originales, podría crearse un cubo duplicado en una región alternativa. Esperar a que IBM Cloud recupere una región o servicio afectado también es una vía válida, pero recuerde que puede tardar muchas horas o más y que puede haber pérdida de datos en función del escenario de desastre.

El cubo duplicado puede configurarse para reflejar el cubo de producción, pero con referencias actualizadas a los servicios regionales. Por ejemplo, si se utiliza Key Protect, un cubo duplicado en Madrid debe hacer referencia a claves raíz almacenadas en una instancia de Key Protect en Madrid. En caso de desastre, cuando no es posible esperar a que IBM recupere completamente la región, los clientes pueden repoblar este bucket duplicado con una copia de seguridad de los datos originales en el bucket de origen. Como alternativa, los clientes pueden configurar reglas de replicación antes de cualquier interrupción para mantener los datos sincronizados entre el bucket de origen y el bucket duplicado. Para obtener el máximo nivel de resiliencia, dicho bucket duplicado debe crearse antes del hecho (antes de cualquier desastre potencial) y mantenerse sincronizado con el bucket de origen que utiliza la replicación. El uso de la función de replicación de objetos debe considerarse junto con el modelo de resiliencia de su bucket de origen y los objetivos generales de recuperación ante desastres de su empresa.

Planificar la recuperación en una región de recuperación. El bucket replicado debe alinearse con los enfoques de recuperación ante desastres de la carga de trabajo dentro de IBM Cloud. Si la catástrofe no afecta a la configuración ni a la disponibilidad del bucket de origen de producción (por ejemplo, sólo la pérdida de datos), es posible que el cliente pueda reparar los datos del bucket de origen in situ. En el caso de que sea necesaria la conmutación por error a un bucket replicado, la aplicación cliente deberá reconfigurarse para llamar al endpoint del bucket replicado de destino.

Funciones de recuperación en caso de catástrofe

IBM COS proporciona las siguientes funciones de recuperación tras desastre que pueden ser configuradas por los clientes:

Características de DR para Object Storage
Característica Descripción Consideración
Replicación de objetos La replicación copia los objetos recién creados y las actualizaciones de objetos de un bucket de origen a un bucket de destino y permite definir reglas para la copia automática y asíncrona de objetos. Para asegurarse de que dispone de una segunda copia en caso de desastre, puede configurar la replicación entre un bucket de producción y un bucket de recuperación de destino. Dependiendo de los requisitos de resistencia de su empresa, la replicación puede no ser necesaria si se utilizan buckets regionales o interregionales. Más información sobre Seguimiento de eventos de replicación.
Mantenimiento de versiones de objetos Active el versionado de objetos para mantener versiones anteriores de los objetos que puedan restaurarse en caso de corrupción o eliminación de datos. Los clientes pueden activar el versionado de objetos en los buckets y restaurar las versiones antiguas en caso de corrupción de datos. El cubo debe estar disponible para realizar la recuperación de la versión. Más información
Bloqueo de objetos El bloqueo de objetos impide la eliminación de versiones de objetos durante un periodo de conservación especificado. Activa el bloqueo de objetos para protegerlos contra borrados o sobrescrituras accidentales o no autorizadas. Asegúrese de que las versiones seguras de los objetos están disponibles para la recuperación. Más información

El cliente crea y mantiene otras opciones de recuperación en caso de catástrofe.

Características de DR del cliente para Object Storage
Característica Descripción Consideración
Copia de seguridad y restauración Utilice scripts o aplicaciones de copia de seguridad de terceros para realizar copias de seguridad de los datos de los buckets de origen en una región de recuperación. El cliente debe alojar y gestionar cualquier script o solución de copia de seguridad de terceros para realizar copias de seguridad de los datos almacenados en los buckets de COS.

Planificación de la RD

Los pasos DR deben practicarse con regularidad. A medida que elabore su plan, tenga en cuenta los siguientes escenarios de fracaso y resoluciones.

Escenarios DR para Object Storage
Anomalía Resolución
Fallo de hardware (punto único) los buckets Object Storage son resistentes a fallos de hardware puntuales dentro de una zona. No requiere configuración.
Fallo del centro de datos Los COS buckets regionales y entre regiones son resistentes a los fallos de los centros de datos individuales. El cliente no necesita configuración ni conmutación por error.

Los clientes con buckets en zonas de un solo centro de datos pueden configurar la replicación o utilizar soluciones de copia de seguridad de terceros para garantizar que haya una copia segura de los datos disponible fuera de la zona. Esperar a que IBM Cloud recupere una región o servicio afectado también es una opción válida, pero recuerde que puede llevar muchas horas o incluso más, dependiendo de la naturaleza de la interrupción del centro de datos.
Corrupción de datos Utilice el control de versiones de objetos, la replicación de objetos o soluciones de copia de seguridad de terceros para garantizar que existan versiones intactas de los objetos que puedan recuperarse en caso de corrupción de datos o eliminación accidental.
Fracaso regional Los cubos COS interregionales son resistentes a los fallos regionales. Algunos servicios regionales integrados, como Key Protect, pueden requerir pasos adicionales de conmutación por error para los buckets interregionales.

Los clientes con buckets en COS regionales o de un único centro de datos deben seguir los pasos de recuperación ante desastres indicados anteriormente en caso de fallos regionales totales. Esperar a que IBM Cloud recupere una región o servicio afectado también es una vía válida, pero recuerde que puede tardar muchas horas o más en función de la naturaleza de la interrupción regional.

Uso de IBM Cloud Key Management Service para añadir cifrado de envolvente:

Si utiliza cualquier otra integración de servicios IBM Cloud, por ejemplo IBM Cloud Key Management Service como Key Protect o Hyper Protect, para añadir cifrado de envolvente, deberá asegurarse de que se utiliza el plan de configuración adecuado para la réplica de claves. Esto es esencial cuando se utiliza una configuración interregional que garantiza la disponibilidad de una réplica de la clave en caso de interrupción del servicio. Consulte la documentación Key Protect para obtener información sobre alta disponibilidad y recuperación ante desastres.

Sus responsabilidades en HA y DR

Sus responsabilidades en HA y DR
Responsabilidad Descripción
Resiliencia Aprovisione cubos Object Storage con la opción de resiliencia, la clase de almacenamiento, la localidad de los datos y las configuraciones opcionales adecuadas para la carga de trabajo y el caso de uso específicos.
Copia de seguridad de datos Garantizar las copias de seguridad de los datos de los clientes si es necesario según los requisitos de su organización.
Red Supervise y gestione los recursos de red IBM a IBM para garantizar el acceso adecuado a los puntos finales de servicio de IBM Cloud, incluidas la capacidad y la disponibilidad.
Uso de IBM Cloud KMS para añadir cifrado de sobres Si utiliza IBM Cloud Key Protect o Hyper Protect Crypto Services para añadir cifrado de envolvente, asegúrese de revisar la documentación respectiva de alta disponibilidad y recuperación ante desastres para comprender plenamente las implicaciones. Es posible que deba utilizar una ubicación de instancia de clave que tenga una réplica de clave que pueda utilizarse en caso de conmutación por error. Asegúrese también de revisar la información correspondiente sobre licencias y planes.

Para saber más sobre la titularidad de responsabilidades entre el cliente y Object Storage, consulte [Sus responsabilidades al utilizar Object Storage (/docs/cloud-object-storage?topic=cloud-object-storage-responsibilities)].

Objetivo de tiempo de recuperación (RTO) y objetivo de punto de recuperación (RPO)

La oferta de IBM Cloud Object Storage cuenta con planes para la recuperación tanto del servicio en la nube como del contenido asociado, que se produce en cuestión de horas en caso de desastre.

Características RTO/RPO para Object Storage
Característica RTO y RPO
Recuperación en caso de fallo del hardware (punto único) RTO = 0, RPO = 0 para todos los modelos de resistencia
Recuperación tras una interrupción del centro de datos RTO = 0, RPO = 0 para los modelos de resiliencia transregional y regional
Restaurar la versión anterior del objeto RTO = segundos, RPO = cerca de 0
Recuperación a un cubo en una región separada con replicación activa RTO = minutos, el scripting puede mejorar el tiempo aún más y también considerar el tiempo para ajustar las cargas de trabajo para apuntar al cubo de recuperación, ,

RPO = cerca de 1 hora
Recuperación a un nuevo bucket en una nueva región sin replicación activa RTO = de minutos a días, tenga en cuenta el tiempo necesario para reconfigurar un nuevo bucket y ajustar las cargas de trabajo al nuevo punto final del bucket. También hay que tener en cuenta el tiempo necesario para rellenar el cubo con una copia de los datos originales. La RPO está sujeta al plan de copia de seguridad y recuperación del cliente

Gestión de cambios

La gestión de cambios incluye tareas como actualizaciones, cambios de configuración y eliminaciones. Para asegurarse de que a los usuarios se les da acceso según los requisitos de rol, por favor revise Introducción a IAM.

Se recomienda conceder a los usuarios y procesos las funciones y acciones de IAM con los menores privilegios necesarios para su trabajo. Consulte ¿Cómo puedo evitar el borrado accidental de servicios?

Cómo ayuda IBM® a garantizar la recuperación ante desastres

IBM® toma medidas específicas de recuperación en caso de desastre.

  • Recuperación de fallos de zona o regionales
    En caso de fallo de zona, IBM Cloud resolverá el corte de zona y, cuando la zona vuelva a estar en línea, el equilibrador de carga global reanudará el envío de solicitudes de API al nodo de instancia restaurado sin necesidad de que el cliente realice ninguna acción.
  • IBM® realiza pruebas anuales de diversos escenarios de desastre y perfecciona continuamente nuestra documentación de recuperación basándose en los hallazgos encontrados durante estas pruebas.
  • los clientes disponen de un soporte global 24 × 7 con IBM® Expertos en la materia que están de guardia para ayudar en caso de desastre.
    Todos los IBM® Los expertos en la materia reciben formación anual sobre continuidad del negocio y políticas y procedimientos de recuperación ante desastres para garantizar la preparación en caso de desastre.

Cómo IBM mantiene los servicios

Todas las actualizaciones siguen las mejores prácticas de servicio de IBM y cuentan con un plan de recuperación y un proceso de reversión. Las actualizaciones periódicas para nuevas funciones y el mantenimiento forman parte de las operaciones normales. Este mantenimiento puede causar ocasionalmente breves intervalos de interrupción que son gestionados por la lógica de reintento de disponibilidad del cliente. Los cambios se introducen secuencialmente, región por región y zona por zona dentro de una misma región. Las actualizaciones se echan atrás a la primera señal de un defecto.

Los cambios complejos se activan y desactivan con banderas de función para controlar la exposición.

Los cambios que afectan a las cargas de trabajo de los clientes se detallan en las notificaciones. Para obtener más información, consulte las notificaciones de seguimiento y el estado del mantenimiento planificado, los anuncios y las notas de la versión que afectan a este servicio.