Comprender la alta disponibilidad
IBM Cloud implementa patrones de arquitectura para diseñar servicios IBM Cloud de alta disponibilidad (HA), ayudando a garantizar la resiliencia frente a diferentes tipos de fallos que puedan afectar a la infraestructura distribuida IBM Cloud.
¿Qué es la alta disponibilidad?
Si ejecuta cargas de trabajo empresariales en un entorno de nube, los componentes y servicios del sistema deben permanecer operativos y accesibles durante periodos prolongados sin interrupción alguna durante interrupciones planificadas o imprevistas. Este nivel de resistencia se conoce como alta disponibilidadCapacidad de un servicio o carga de trabajo para soportar fallos y seguir proporcionando capacidad de procesamiento de acuerdo con algún nivel de servicio predefinido.. La alta disponibilidad se consigue utilizando componentes y servicios redundantes del sistema y distribuyendo estos componentes en distintos entornos. IBM Cloud ofrece servicios en la nube de alta disponibilidad utilizando componentes redundantes y eliminando los puntos únicos de fallo.
A nivel de regiones multizonaUna región repartida en ubicaciones físicas de varias zonas para aumentar la tolerancia a fallos. (MZR), HA significa tener cargas de trabajo ejecutándose en múltiples zonas de disponibilidadUbicación dentro de una región en la que se ejecuta IBM Cloud Kubernetes Service. en la MZR, que proporcionan la redundancia para fallos locales.
Para la HA en la nube, es importante comprender los conceptos de alto nivel que debe abordar si está creando o ejecutando un sistema de alta disponibilidad en la nube.
Fórmula para la alta disponibilidad
Una fórmula estándar para la alta disponibilidad es MTBF/(MTBF+MTTR), donde MTBF es el tiempo medio entre fallos y MTTR es el tiempo medio de reparación. Dado que MTBF es
el tiempo en el que el sistema está activo, y MTTR es el tiempo en el que el sistema está inactivo, esta fórmula puede resumirse del siguiente modo:
- Disponibilidad = (El tiempo que el sistema está activo)/(El tiempo que el sistema está activo + El tiempo que el sistema está inactivo).
La fórmula es útil porque muestra cómo mejorar la disponibilidad. Considere un escenario en el que requiere que el servidor esté siempre disponible durante un mes de 30 días. En ese mes, digamos que el servidor se cayó una vez durante un total de 1 hora.
- Para obtener el tiempo total del mes, multiplique 30 días x 24 h/día = 720 horas
- MTBF = Tiempo total de funcionamiento / Número de fallos = 720 h / 1 = 720 h
- MTTR = Tiempo total de inactividad / Número de fallos = 1 h / 1 = 1 h
- Disponibilidad = (MTBF / (MTBF + MTTR)) x 100 = (720 / 721) x 100 = 99.86 %
Puede aumentar el MTBF, disminuir el MTTR, o ambas cosas. Esto significa que la disponibilidad puede mejorarse aumentando la fiabilidad o solucionando los problemas cuando se rompen de forma más eficiente. Ambos enfoques son habituales en los sistemas informáticos. El sistema principal, que utiliza componentes de alta fiabilidad, componentes redundantes y modularidad para permitir reparaciones más rápidas, muestra que este enfoque permite niveles significativos de disponibilidad. Para obtener más información sobre la disponibilidad de servicios específicos IBM Cloud, consulte los acuerdos de nivel de servicio(SLA).
¿Por qué necesita alta disponibilidad?
Con IBM Cloud, puede proteger sus cargas de trabajo críticas desplegándolas en una infraestructura resistente y de alta disponibilidad. Utilizando las funciones de copia de seguridad, recuperación ante desastres y alta disponibilidad, puede minimizar el tiempo de inactividad si se produce un fallo grave. Al crear infraestructuras en la nube protegidas contra puntos únicos de fallo y realizar copias de seguridad de sus datos, mantiene sus cargas de trabajo y aplicaciones altamente disponibles.
Una infraestructura resistente mantiene su solución de nube en funcionamiento, incluso si uno o más componentes de la infraestructura experimentan un problema como:
- Pérdida de energía en un centro de datos
- Fallo de hardware en uno de los centros de datos
- Fallo de la red debido a un problema del router virtual
- Mantenimiento planificado o no de un servicio
- Catástrofe natural con radio de explosión limitado
- Ataque de ransomware a una instancia de servidor virtual