Comprendre la haute disponibilité

IBM Cloud met en œuvre des modèles d'architecture pour concevoir des services IBM Cloud à haute disponibilité (HA), ce qui permet d'assurer la résilience contre différents types de défaillances susceptibles d'avoir un impact sur l'infrastructure distribuée IBM Cloud.

Qu'est-ce que la haute disponibilité ?

Si vous exécutez des charges de travail d'entreprise dans un environnement en nuage, les composants et les services du système doivent rester opérationnels et accessibles pendant de longues périodes sans aucune interruption lors de pannes planifiées ou imprévues. Ce niveau de résilience est connu sous le nom de haute disponibilitéLa capacité d'un service ou d'une charge de travail à résister aux défaillances et à continuer à fournir une capacité de traitement selon un niveau de service prédéfini.. La haute disponibilité est obtenue en utilisant des composants et des services redondants et en répartissant ces composants dans différents environnements. IBM Cloud fournit des services cloud hautement disponibles en utilisant des composants redondants et en éliminant les points de défaillance uniques.

Au niveau des régions multizonesUne région répartie sur plusieurs sites physiques dans plusieurs zones afin d'accroître la tolérance aux pannes. (MZR), HA signifie que les charges de travail s'exécutent dans plusieurs zones de disponibilitéUn emplacement dans une région dans laquelle IBM Cloud Kubernetes Service s'exécute. au sein de la MZR, qui assurent la redondance en cas de défaillance locale.

Pour l'AH dans le nuage, il est important de comprendre les concepts de haut niveau que vous devez prendre en compte si vous construisez ou exploitez un système de nuage hautement disponible.

Formule pour la haute disponibilité

Une formule standard pour la haute disponibilité est MTBF/(MTBF+MTTR), où MTBF est le temps moyen entre les défaillances et MTTR le temps moyen de réparation. Étant donné que MTBF est l'heure à laquelle le système est en service et que MTTR est l'heure à laquelle le système est en panne, cette formule peut être résumée comme suit :

  • Disponibilité = (temps de fonctionnement du système)/(temps de fonctionnement du système + temps d'arrêt du système).

La formule est utile parce qu'elle montre comment améliorer la disponibilité. Considérons un scénario dans lequel vous exigez que le serveur soit toujours disponible pendant un mois de 30 jours. Au cours de ce mois, disons que le serveur est tombé en panne une fois pour une durée totale de 1 heure.

  • Pour obtenir la durée totale du mois, multipliez 30 jours x 24 heures/jour = 720 heures
  • MTBF = Durée totale de fonctionnement / Nombre de défaillances = 720 h / 1 = 720 h
  • MTTR = Temps d'arrêt total / Nombre de défaillances = 1 heure / 1 = 1 heure
  • Disponibilité = (MTBF / (MTBF + MTTR)) x 100 = (720 / 721) x 100 = 99.86 %

Vous pouvez augmenter le MTBF, diminuer le MTTR ou les deux. Cela signifie que la disponibilité peut être améliorée en augmentant la fiabilité ou en réglant les problèmes lorsqu'ils surviennent de manière plus efficace. Ces deux approches sont courantes dans les systèmes informatiques. Le grand système, qui utilise des pièces de haute fiabilité, des pièces redondantes et de la modularité pour permettre des réparations plus rapides, montre que des niveaux significatifs de disponibilité sont possibles avec cette approche. Pour plus d'informations sur la disponibilité de certains services IBM Cloud, voir les accords de niveau de service(SLA).

Formule de disponibilité.
Formule de disponibilité résumée

Pourquoi avez-vous besoin d'une haute disponibilité?

Avec IBM Cloud, vous pouvez protéger vos charges de travail critiques en les déployant sur une infrastructure résiliente et hautement disponible. En utilisant les fonctions de sauvegarde, de reprise après sinistre et de haute disponibilité, vous pouvez minimiser les temps d'arrêt en cas de panne grave. En créant des infrastructures en nuage protégées contre les points de défaillance uniques et en sauvegardant vos données, vous assurez la haute disponibilité de vos charges de travail et de vos applications.

Une infrastructure résiliente permet à votre solution cloud de continuer à fonctionner, même si un ou plusieurs composants de l'infrastructure rencontrent un problème, par exemple :

  • Perte d'alimentation dans un centre de données
  • Défaillance matérielle dans l'un des centres de données
  • Défaillance du réseau due à un problème de routeur virtuel
  • Maintenance planifiée ou non d'un service
  • Catastrophe naturelle à rayon d'explosion limité
  • Attaque de ransomware sur une instance de serveur virtuel