Resistencia en IBM Cloud

En tecnología de la información (TI), la resiliencia se define en términos generales como la capacidad de una organización o solución para mantener los sistemas y aplicaciones esenciales y recuperarse de las interrupciones. Resiliencia en IBM Cloud se centra en la perspectiva de los clientes de IBM, sus planificadores de soluciones, arquitectos y constructores y las soluciones resilientes que crean en la plataforma IBM Cloud.

La resistencia y la disponibilidad suelen ir de la mano. Cuanto más resistente sea un servicio o una carga de trabajo, más disponible estará normalmente. Por ejemplo, suponiendo un entorno operativo idéntico, se podría considerar que una carga de trabajo que presente un 99.9 % de disponibilidad en un mes determinado tiene menos resiliencia en comparación con una carga de trabajo que presente un 99.99 % de disponibilidad. Para lograr una mayor resiliencia —y, por extensión, una mayor disponibilidad—, es necesario contar con una mayor redundancia de los componentes.

Escenario de resiliencia

Imagínese lo siguiente: Usted es un ávido ciclista que suele dar largos paseos en bicicleta por el campo. Aunque la mayoría de sus viajes transcurren sin problemas, siempre existe la posibilidad de que algo vaya mal. Por ejemplo, ¿qué pasa si pasas por encima de un objeto punzante y se te pincha una rueda? Si no vas preparado, puede que tengas que dar un largo paseo hasta casa. Pero si ya has pensado en esa posibilidad, quizá hayas montado de antemano unos neumáticos con mayor resistencia a los pinchazos.

Para ser aún más resistente, puedes llevar contigo un kit de reparación de pinchazos y una bomba de aire. Sin embargo, reparar un pinchazo en el arcén puede llevar algún tiempo. Así que decides llevarte una cámara de repuesto. Esta solución es más cara, pero aumenta la disponibilidad de tu bicicleta, ya que te permite volver a montar más rápidamente al sustituir la cámara en lugar de reparar la antigua. Siempre puedes ir un paso más allá e invertir en neumáticos sin cámara que puedan autocurar pequeños pinchazos sobre la marcha sin intervención del ciclista. Aunque suele ser más cara, esta solución ofrece una resistencia a los pinchazos mucho mayor y garantiza un menor tiempo de inactividad, siempre que no se produzca un nivel anómalo de daños.

Para estar preparado ante daños graves, quizá decidas llevarte una rueda de repuesto completa, y cosas por el estilo. Llevado al extremo, podrías decidir que necesitas ser totalmente resistente a cualquier fallo que pudiera ocurrir para evitar interrupciones en tu viaje, así que empleas la solución de pilotos profesionales y haces que te siga un coche de apoyo. El coche de apoyo puede tener un juego completo de piezas de repuesto, varias motos de repuesto y un mecánico. Aunque esta solución garantiza un tiempo de inactividad prácticamente nulo, tampoco es proporcional a los problemas con los que la mayoría de nosotros nos encontramos en un paseo en bicicleta normal. En otras palabras, llega un momento en el que la resiliencia, el tiempo de inactividad y el coste alcanzan un equilibrio y la solución se adapta a tus necesidades.

Al igual que en el caso del ciclismo, los requisitos y las capacidades de resiliencia para las cargas de trabajo de TI deben tenerse en cuenta en función del grado de importancia que tenga la aplicación o la solución para una organización, sopesándolos con el coste de la solución de resiliencia y la pérdida económica o de reputación que podría derivarse de un tiempo de inactividad.

Objetivos de nivel de servicio

Para ayudar a los clientes a diseñar resiliencia en sus cargas de trabajo, IBM Cloud publica objetivos de nivel de servicio (SLO) para cada servicio en IBM Cloud objetivos de nivel de servicio. Esto proporciona el SLO objetivo para cada servicio como objetivo de disponibilidad en una configuración de alta disponibilidad. El diseño arquitectónico subyacente de IBM Cloud y sus servicios ofrece una plataforma de alta disponibilidad para sus cargas de trabajo; no obstante, es importante que estas se implementen adecuadamente, repartidas entre varias zonas de una misma región.

Por ejemplo, el objetivo de disponibilidad para IBM Cloud VPC figura como « 99.999 %» en la sección de servicios de computación del SLO. Sin embargo, para que una carga de trabajo pueda aprovechar al máximo ese SLO, debe implementarse con alta disponibilidad en cada una de las tres zonas de una región multizona determinada. Siguiendo con el ejemplo de la VPC, para aprovechar al máximo el SLO del 99.999 % para tu carga de trabajo, necesitas como mínimo tres instancias de servidor virtual (una en cada zona) y un equilibrador de carga. Si el coste de esa configuración supera tu presupuesto, podrías implementar dos instancias de servidor virtual en dos zonas con un equilibrador de carga, aunque esto reduce la resiliencia. Si se reduce aún más a una sola instancia de servidor virtual sin equilibrador de carga, el SLO efectivo se reduce aún más.

Acuerdos del nivel de servicio

Es importante recordar que los SLO son objetivos y no garantías. En la práctica, esto significa que, aunque la arquitectura subyacente se ha diseñado con el objetivo de alcanzar una disponibilidad del 99.999 %, siguen existiendo situaciones que podrían afectar a dicha disponibilidad, por muy improbables que sean. Dado que los SLO no ofrecen garantías, tampoco constituyen un instrumento contractual.

Sin embargo, IBM Cloud reconoce que los clientes pagan por un servicio y esperan que dicho servicio esté disponible. Al igual que otros proveedores de servicios en la nube, IBM Cloud publica otra serie de cifras de disponibilidad conocidas como Acuerdos de Nivel de Servicio(SLA). Cuando utilizas un servicio de IBM Cloud, el SLA describe la disponibilidad mínima que puedes esperar de dicho servicio. Si se incumple ese mínimo, los clientes tienen derecho a recibir créditos de servicio, tal y como se establece en el SLA. El SLA también incluye condiciones que pueden especificar el modelo de implementación de una carga de trabajo y el derecho a créditos en función de cómo se haya implementado dicha carga de trabajo. Es importante que conozcas el SLA de los componentes de IBM Cloud que utilizas y cómo se puede aplicar dicho SLA en diferentes escenarios de implementación de cargas de trabajo.

responsabilidades compartidas

IBM Cloud funciona según un modelo de responsabilidad compartida, en el que, en términos generales, IBM Cloud se encarga de la resiliencia y la recuperación de la nube, mientras que los clientes se encargan de la resiliencia y la recuperación de sus cargas de trabajo. Para obtener más información, consulta « Resiliencia y responsabilidades compartidas ».

Acerca de esta guía

Esta guía ofrece una visión general de los conceptos y capacidades básicos que debes conocer para diseñar cargas de trabajo resilientes en IBM Cloud. Entre los temas tratados se incluyen la alta disponibilidad, la recuperación ante desastres, la ciberresiliencia y las garantías de « IBM Cloud » en estos ámbitos. Aquí encontrarás todo lo que necesitas para diseñar, planificar, probar y garantizar la resiliencia operativa de tus soluciones de IBM Cloud.

La guía aborda las capacidades generales de resiliencia de IBM Cloud y las mejores prácticas. Para conocer las funciones y los requisitos específicos de cada servicio, consulta la documentación correspondiente a cada uno de ellos.