Visión general de la alta disponibilidad y la recuperación tras desastre para IBM Cloud Direct Link
La alta disponibilidadCapacidad de un servicio o carga de trabajo para soportar fallos y seguir proporcionando capacidad de procesamiento de acuerdo con algún nivel de servicio predefinido. (HA) es la capacidad de un servicio de permanecer operativo y accesible ante fallos inesperados. La recuperación de desastresCapacidad de un servicio o carga de trabajo para recuperarse de incidentes graves poco frecuentes y fallos a gran escala, como la interrupción del servicio. Esto incluye un desastre físico que afecte a toda una región, la corrupción de una base de datos o la pérdida de un servicio que contribuya a una carga de trabajo. El impacto supera la capacidad del diseño de alta disponibilidad para gestionarlo. (DR) es el proceso de recuperación de la instancia de servicio a un estado de funcionamiento.
IBM Cloud® recomienda encarecidamente establecer un enlace directo secundario y diverso para evitar cortes, ya sean imprevistos o programados por mantenimiento. Una recuperación eficaz en caso de catástrofe, sobre todo si afecta a todo un centro, requiere una planificación y una preparación minuciosas.
IBM Cloud Direct Link es un servicio de alta disponibilidad diseñado para cumplir los Objetivos de Nivel de Servicio(SLO). Se compone de configuraciones zonales y regionales para adaptarse a diversas necesidades. Para comprender mejor la infraestructura subyacente, incluidas las definiciones de centros de datos, zonas y puntos de presencia ( PoPs ), consulte IBM Cloud ubicaciones de regiones y centros de datos para el despliegue de recursos. Para obtener información sobre las regiones y ubicaciones de centros de datos disponibles para Direct Link, consulte la sección Pasarela en las páginas de aprovisionamiento de Direct Link Connect o Direct Link Dedicated.
Para obtener más información sobre el enfoque de IBM Cloud para la alta disponibilidad y la recuperación ante desastres, incluidos los estándares y las mejores prácticas de toda la plataforma, consulte Cómo IBM Cloud garantiza la alta disponibilidad y la recuperación ante desastres. También puede encontrar información sobre la alta disponibilidad en el Acuerdo de Nivel de Servicio (SLA) de IBM Cloud.
Arquitectura de alta disponibilidad
Conseguir una arquitectura de alta disponibilidad (HA) con IBM Cloud Direct Link requiere algo más que añadir una segunda conexión: significa eliminar todos los puntos únicos de fallo, incluidos los relacionados con sus proveedores de conectividad. El aprovisionamiento de un segundo Direct Link desde una ubicación o ruta de red diferente es un buen comienzo, pero la verdadera resiliencia depende de algo más que la separación física.
Aquí es donde cobran importancia los conceptos de redundancia y diversidad. Redundancia significa disponer de sistemas o conexiones de reserva para que, si uno falla, otro pueda tomar el relevo. La diversidad va un paso más allá: garantiza que esas copias de seguridad sean independientes, idealmente utilizando distintos proveedores, infraestructuras o rutas físicas. Sin diversidad, los sistemas redundantes pueden seguir compartiendo un único punto de fallo.
Por ejemplo, confiar en un único proveedor para las dos conexiones Direct Link sigue introduciendo riesgos. Para garantizar la redundancia total de la ruta, debes establecer conexiones adicionales a través de diversos proveedores. Esto ayuda a mantener la conectividad con IBM Cloud incluso durante las interrupciones específicas del proveedor.
Para reforzar aún más la disponibilidad, IBM recomienda desplegar conexiones Direct Link Connect o Dedicated en varias zonas IBM Cloud. Aunque IBM proporciona la infraestructura y las herramientas necesarias para soportar diseños resistentes, depende de usted construir y mantener arquitecturas que cumplan sus requisitos específicos de disponibilidad. Esto incluye la distribución de las cargas de trabajo por regiones, la implantación de conexiones diversas y la comprobación periódica de los procedimientos de recuperación en caso de catástrofe y conmutación por error.
Usted es responsable de entender cómo se configura, personaliza y utiliza su conexión Direct Link. También es responsable de volver a crear una instancia del servicio en una nueva ubicación y de restaurar sus datos. Para obtener información sobre cómo diseñar diversidad para lograr la alta disponibilidad con Direct Link, consulte Modelos para la diversidad y la redundancia en Direct Link.
Funciones de alta disponibilidad
IBM Cloud Direct Link admite las siguientes funciones de alta disponibilidad:
| Característica | Descripción | Consideración |
|---|---|---|
| IBM Cloud Transit Gateway | Conecte varios enlaces directos a una pasarela de tránsito para un enrutamiento de red centralizado, escalable y redundante a través de VPC y on-prem. Centraliza el enrutamiento y reduce la complejidad de las implantaciones a gran escala. | Para evitar un único punto de fallo, despliegue pasarelas de tránsito redundantes en zonas o regiones separadas y conecte enlaces directos a cada una de ellas. Esté atento a los límites de configuración, como las cuotas de archivos adjuntos y la propagación de rutas. |
| Compatibilidad con el protocolo de pasarela fronteriza (BGP) | Utilice BGP para redirigir dinámicamente el tráfico en caso de fallo de un enlace directo, lo que permite una recuperación rápida y una selección automatizada de la ruta. | Debe configurar la monitorización de sesiones BGP y el ajuste de preferencias de ruta para evitar el enrutamiento asimétrico o los retrasos en la conmutación por error. |
Como cliente, puede crear y dar soporte a las siguientes otras funciones de alta disponibilidad:
| Característica | Descripción | Consideración |
|---|---|---|
| Múltiples dispositivos in situ | Instale varios dispositivos redundantes (por ejemplo, enrutadores y conmutadores) en sus instalaciones para garantizar una alta disponibilidad en la ruta de red hacia su enlace directo. | Planifique la redundancia del espacio físico, la alimentación y el cableado. Pruebe los escenarios de conmutación por error con regularidad para garantizar que la HA a nivel de dispositivo funciona como se espera. |
| Conexión de dispositivos locales a diferentes PoPs y centros de datos | Conecte dispositivos (por ejemplo, routers y cortafuegos) a diferentes puntos de presencia ( PoPs ) o centros de datos para evitar puntos únicos de fallo. | Evalúe la latencia y el ancho de banda de la red en PoPs y los centros de datos. Garantizar vías físicas diversas y coordinarse con los proveedores para evitar grupos de riesgo compartido. |
| Prependido de AS, BGP | Configurar AS prepending y enrutamiento BGP para gestionar el flujo de tráfico entre conexiones activas y pasivas. | Defina políticas de enrutamiento claras para el tráfico entrante y saliente. Supervisar que los anuncios de BGP sean correctos y ajustar las estrategias de ruta de AS según sea necesario. |
| Detección de reenvío bidirectional (BFD) | Habilite BFD para detectar rápidamente los fallos de enlace y garantizar una rápida conmutación por error, mejorando la disponibilidad. | Verificar que todos los elementos de red soportan BFD. Supervise el estado de la sesión BFD y ajuste cuidadosamente los intervalos de detección para equilibrar la sensibilidad y los falsos positivos. |
Arquitectura de recuperación en caso de catástrofe
IBM Cloud Direct Link desempeña un papel fundamental en la creación de arquitecturas resistentes y de alta disponibilidad. Para planificar la recuperación en caso de catástrofe, Direct Link ofrece una serie de funciones diseñadas para garantizar una conectividad fiable y de baja latencia durante las interrupciones.
Las organizaciones pueden elegir entre varias opciones de velocidad de puerto (de 50 Mbps a 10 Gbps) en función de sus necesidades de replicación de datos. Aunque la redundancia no está incorporada, puede configurarla mediante el aprovisionamiento de enlaces duales a través de diversos routers de conexión cruzada (XCR) y la implementación de estrategias de conmutación por error BGP adecuadas. Direct Link admite el enrutamiento local y global, lo que permite distribuir la carga de trabajo por regiones para mejorar la capacidad de recuperación. La integración con regiones multizona (MZR) y la compatibilidad con copias de seguridad y recuperación de configuraciones proporcionan una mayor protección contra fallos localizados.
La siguiente tabla resume estas características y consideraciones clave.
Funciones de recuperación en caso de catástrofe
IBM Cloud Direct Link admite las siguientes funciones de recuperación ante desastres:
| Característica | Descripción | Consideración |
|---|---|---|
| Enrutamiento local y global | Direct Link incluye enrutamiento local y global, proporcionando conectividad sin fisuras a centros de datos dentro del mismo mercado (enrutamiento local) y a través de diferentes mercados geográficos (enrutamiento global). | El enrutamiento global es necesario para compartir la carga de trabajo entre regiones y para la recuperación ante desastres en varias regiones. |
| Copia de seguridad y recuperación de configuraciones | IBM Cloud proporciona herramientas para realizar copias de seguridad de las configuraciones de Direct Link, lo que permite restaurar los servicios en caso de desastre. | Se recomienda realizar copias de seguridad periódicas y probar los procedimientos de recuperación para garantizar un rápido restablecimiento durante las interrupciones. |
| Soporte de región multizona (MZR) | Direct Link se integra con los MZR de IBM Cloud, mejorando la disponibilidad y la resistencia al distribuir las cargas de trabajo en varias zonas. | Es necesario un despliegue adecuado en varias zonas para lograr una alta disponibilidad y minimizar el impacto de los fallos específicos de cada zona. |
Como cliente, puede crear y dar soporte a las siguientes otras opciones de recuperación ante desastres:
| Característica | Descripción | Consideración |
|---|---|---|
| Scripts de copia de seguridad/restauración y datos de copia de seguridad | Crear y mantener sus propios scripts de copia de seguridad y restauración, así como almacenar de forma segura los datos de configuración y estado de la red, para agilizar la recuperación durante las interrupciones. | Asegúrese de que las copias de seguridad estén cifradas, versionadas y almacenadas en ubicaciones geográficamente diversas. Automatice los programas de copias de seguridad y valide periódicamente los procedimientos de restauración. |
| Diversas conexiones de Direct Link | Establezca diversas conexiones Direct Link en diferentes regiones o zonas para garantizar una conectividad continua durante los cortes regionales. | La implementación de diversas conexiones requiere una planificación cuidadosa de la arquitectura de red y de las configuraciones de BGP para garantizar una conmutación por error sin problemas. |
| Protección de datos | IBM ofrece soluciones sólidas para la copia de seguridad, conservación y recuperación de datos, que son fundamentales para mantener la continuidad de la actividad empresarial y respaldar los esfuerzos de recuperación en caso de catástrofe. | Pruebe periódicamente los procesos de copia de seguridad y restauración para garantizar la integridad y disponibilidad de los datos. |
Planificación de la recuperación tras desastre
Es fundamental practicar con regularidad las medidas de recuperación en caso de catástrofe para asegurarse de que está bien preparado ante interrupciones inesperadas. Cuando elabore su plan de recuperación ante desastres, tenga en cuenta los siguientes escenarios de fallo y resoluciones para IBM Cloud Direct Link.
Puede haber varias formas de recuperarse de determinados fallos, así que asegúrese de evaluar cada escenario en función de su arquitectura y requisitos específicos. A continuación se describen las situaciones de fallo más habituales, junto con las posibles medidas de recuperación:
| Anomalía | Resolución |
|---|---|
| PoP fallo | Asegúrese de que hay dos o más conexiones que no se conectan a la misma PoP. |
| Fallo del centro de datos (zona) | Asegúrese de que hay dos o más enlaces directos a través de diferentes zonas para garantizar la conmutación por error. IBM Cloud Direct Link puede redirigir el tráfico automáticamente, pero la configuración por parte del cliente mejora la resistencia. |
| error de región | Anticípese a ello disponiendo de conexiones en una región restablecida. Si el coste es prohibitivo, disponga de capacidades VPN y scripts asociados para sustituir las conexiones de enlace directo. |
| Fallo de hardware (punto único) | La arquitectura IBM Cloud Direct Link está diseñada para hacer frente a fallos de hardware de un solo punto proporcionando diversas conexiones de red. La conmutación por error se produce sin problemas, sin necesidad de configuración por parte del cliente. |
| Pérdida de paquetes en la conexión de red | Utilice herramientas de supervisión para identificar la causa raíz. Compruebe si hay picos de tráfico que superen el ancho de banda proporcionado, lo que puede desencadenar la vigilancia y la pérdida de paquetes. Inspeccione los puertos, el cableado y el hardware de red en busca de fallos. Si el problema persiste o no se puede aislar, póngase en contacto con el servicio de asistencia de IBM para que lo investiguen. |
| Se aprovisionan dos enlaces directos utilizando diferentes proveedores a la misma PoP, pero ambos están conectados al mismo dispositivo de hardware, lo que crea un único punto de fallo. | Asegúrese de la diversidad de puertos comprobando los detalles de la asignación de puertos en la consola IBM Cloud cuando solicite enlaces directos. Para los proveedores no integrados (pedidos por separado tanto en el portal de proveedores como en la consola IBM Cloud ), verifique el puerto que utiliza un enlace existente y seleccione uno diferente. Para los proveedores integrados en la API (en los que los pedidos se inician en el portal del proveedor y se reflejan en la consola IBM Cloud ), consulte nuestras instrucciones específicas para proveedores. Para los enlaces directos dedicados, compruebe si existen conexiones cruzadas en la misma PoP. |
Sus responsabilidades en HA y DR
Para obtener más información sobre la responsabilidad de utilizar Direct Link entre IBM y usted, el cliente, consulte Comprender sus responsabilidades al utilizar IBM Cloud Direct Link. Es su responsabilidad probar continuamente su plan de HA y DR.
Pueden producirse interrupciones en la conectividad de la red y breves periodos de indisponibilidad de un servicio. Es su responsabilidad asegurarse de que el código fuente de la aplicación incluye la lógica de reintento de disponibilidad del cliente para mantener la alta disponibilidad de la aplicación.
Objetivo de tiempo de restauración (RTO)
Direct Link Ofrece mecanismos para proteger sus datos y restablecer las funciones del servicio. Existen planes de continuidad de la actividad para alcanzar el objetivo de tiempo de recuperaciónEn la planificación de la recuperación en caso de catástrofe, el tiempo que tarda en restablecerse un proceso empresarial tras una catástrofe. (RTO) fijado para el servicio. La siguiente tabla resume los objetivos de Direct Link.
| Característica | RTO |
|---|---|
| Configuración de redundancia | En cuestión de minutos (normalmente menos de 5 minutos) |
| Direccionamiento | Conmutación automática en cuestión de minutos (normalmente < 2 minutos) |
| Copia de seguridad y recuperación | En función del tamaño de los datos: ~10 minutos + 1 minuto por cada 10 GB de datos restaurados |
| Región multizona | ~10 minutos + 1 minuto por cada 10 GB si es necesario restaurar los datos |
| Scripts de copia de seguridad/restauración y datos de copia de seguridad | 30 minutos - varias horas, dependiendo de la automatización y el volumen de datos |
| Diversas conexiones de Direct Link | < 5 minutos (normalmente 1-2 minutos) si BGP y la conmutación por error de enrutamiento están configurados correctamente y se prueban con regularidad |
| Protección de datos, asumiendo las herramientas proporcionadas por IBM | 10 minutos + 1 minuto por cada 10 GB de datos restaurados (igual que la recuperación de copia de seguridad estándar de IBM ) |
Gestión de cambios
La gestión de cambios incluye tareas como actualizaciones, cambios de configuración y eliminaciones.
Conceda a los usuarios y procesos las funciones y acciones de Identity and Access Management (IAM) con los menores privilegios necesarios para su trabajo. Para más información, consulta ¿Cómo puedo evitar el borrado accidental de servicios?
Las mejores prácticas para gestionar el cambio también incluyen:
- Planifique y documente los cambios manteniendo un registro de cambios para cualquier modificación que se realice en la configuración de Direct Link.
- Cree una copia de seguridad de las configuraciones críticas antes de realizar actualizaciones o cambios importantes.
- Programe la actualización o los cambios de alto impacto durante las ventanas de bajo tráfico y notifíquelo a los equipos afectados.
- Supervisa el estado y las métricas de tu conexión a Direct Link para asegurarte de que todo funciona según lo esperado.
Cómo ayuda IBM a planificar la recuperación en caso de catástrofe
IBM diseña su infraestructura pensando en la resistencia, especialmente para servicios como IBM Cloud Direct Link, fundamental para conectar las redes locales a IBM Cloud. En caso de avería:
- Los equipos de respuesta a incidentes identifican y aíslan rápidamente el fallo.
- El reencaminamiento del tráfico se realiza siempre que es posible utilizando la red troncal de IBM y las redes de los proveedores.
- La comunicación del estado del servicio se mantiene a través de la página IBM Cloud Status para mantenerle informado.
Cuando se trata de fallos zonales y regionales, IBM adopta las siguientes medidas de recuperación:
Cómo se recupera IBM de los fallos de zona
Un fallo de zona se refiere al fallo de un centro de datos o zona de disponibilidad dentro de una región. IBM mitiga el impacto de estas formas:
- Direct Link opera a través de múltiples rutas físicas de red. La diversidad de enlaces y rutas garantiza que un fallo en una zona no afecte a toda la conexión.
- IBM supervisa constantemente la salud de los extremos de Direct Link. Si una zona deja de estar disponible, el tráfico puede redirigirse a zonas sanas cuando proceda.
Si IBM no puede restaurar la instancia de servicio, deberá restaurar el servicio tal y como se describe en Arquitectura de recuperación de desastres.
Cómo se recupera IBM de los fracasos regionales
En el raro caso de un fallo regional:
- IBM le anima a diseñar cargas de trabajo en varias regiones. Direct Link se pueden suministrar conexiones a diferentes regiones de IBM Cloud, lo que ayuda a reducir el impacto de una interrupción regional.
- IBM y las asociaciones con los principales proveedores de redes de telecomunicaciones ofrecen rutas alternativas para el tráfico si una región deja de estar disponible.
- IBM respalda sus planes de recuperación ante desastres al permitir el aprovisionamiento de Direct Link en varias regiones. Se recomienda configurar diversos enlaces en regiones secundarias que puedan activarse en función de las necesidades.
Si IBM no puede restaurar la instancia de servicio, deberá restaurar el servicio tal y como se describe en la arquitectura de recuperación de desastres.
Cómo IBM mantiene los servicios
Todas las actualizaciones siguen las mejores prácticas de servicio de IBM, incluidos los planes de recuperación y los procesos de reversión. El mantenimiento regular puede causar breves interrupciones, mitigadas por la lógica de reintento de disponibilidad del cliente. Los cambios se despliegan secuencialmente, región por región, y zona por zona dentro de una región. IBM revierte las actualizaciones a la primera señal de un defecto.
IBM avisa con antelación de todas las actividades de mantenimiento previstas. Si se prevé que un cambio afectará a sus cargas de trabajo, IBM se lo comunicará mediante notificaciones oficiales. Para mantenerse al día sobre el mantenimiento, los anuncios de servicio y otras actualizaciones, consulte la página de buenas prácticas sobre el estado de la supervisión.