Description de la haute disponibilité et de la reprise après incident pour IBM Cloud Direct Link
La haute disponibilitéLa capacité d'un service ou d'une charge de travail à résister aux défaillances et à continuer à fournir une capacité de traitement selon un niveau de service prédéfini. (HA) est la capacité d'un service à rester opérationnel et accessible en cas de défaillance inattendue. La reprise après sinistreCapacité d'un service ou d'une charge de travail à se remettre d'incidents rares, majeurs et de défaillances à grande échelle, tels que l'interruption d'un service. Il peut s'agir d'un désastre physique qui affecte une région entière, de la corruption d'une base de données ou de la perte d'un service contribuant à une charge de travail. L'impact dépasse la capacité de la conception de haute disponibilité à le gérer. (DR) est le processus de récupération de l'instance de service à un état fonctionnel.
IBM Cloud® recommande fortement de mettre en place un lien direct secondaire et diversifié pour éviter les pannes, qu'elles soient imprévues ou programmées pour des raisons de maintenance. Une reprise après sinistre efficace, en particulier pour les problèmes affectant un site entier, nécessite une planification et une préparation minutieuses.
IBM Cloud Direct Link est un service hautement disponible conçu pour répondre aux objectifs de niveau de service(SLO). Il est composé de configurations zonales et régionales pour répondre à une variété de besoins. Pour mieux comprendre l'infrastructure sous-jacente, y compris les définitions des centres de données, des zones et des points de présence ( PoPs ), voir IBM Cloud région et emplacements des centres de données pour le déploiement des ressources. Pour plus d'informations sur les régions et les centres de données disponibles pour Direct Link, voir la section Gateway sur les pages de provisionnement Direct Link Connect ou Direct Link Dedicated.
Pour en savoir plus sur l'approche de IBM Cloud en matière de haute disponibilité et de reprise après sinistre, y compris les normes et les meilleures pratiques à l'échelle de la plate-forme, voir Comment IBM Cloud garantit la haute disponibilité et la reprise après sinistre. Vous trouverez également des informations sur la haute disponibilité dans l'accord de niveau de service (SLA) de IBM Cloud.
Architecture à haute disponibilité
Pour mettre en place une architecture à haute disponibilité (HA) avec IBM Cloud Direct Link, il ne suffit pas d'ajouter une deuxième connexion : il faut éliminer tous les points de défaillance uniques, y compris ceux liés à vos fournisseurs de connectivité. La mise à disposition d'un second site Direct Link à partir d'un emplacement ou d'un chemin de réseau différent est un bon début, mais la véritable résilience ne dépend pas seulement d'une séparation physique.
C'est là que les concepts de redondance et de diversité deviennent importants. La redondance consiste à mettre en place des systèmes ou des connexions de secours, de sorte qu'en cas de défaillance de l'un d'eux, un autre puisse prendre le relais. La diversité va encore plus loin : elle garantit que ces sauvegardes sont indépendantes, idéalement en utilisant des fournisseurs, des infrastructures ou des chemins physiques différents. Sans diversité, les systèmes redondants peuvent toujours partager un seul point de défaillance.
Par exemple, le fait de s'appuyer sur un seul fournisseur pour les deux connexions Direct Link présente toujours un risque. Pour garantir une redondance totale des chemins, vous devez établir des connexions supplémentaires par l'intermédiaire de divers fournisseurs. Cela permet de maintenir la connectivité avec IBM Cloud même en cas de panne d'un fournisseur.
Pour renforcer encore la disponibilité, IBM recommande de déployer des connexions Direct Link Connect ou Dedicated sur plusieurs zones IBM Cloud. Bien que IBM fournisse l'infrastructure et les outils nécessaires pour prendre en charge les conceptions résilientes, c'est à vous qu'il incombe de construire et de maintenir des architectures qui répondent à leurs exigences spécifiques en matière de disponibilité. Il s'agit notamment de répartir les charges de travail entre les régions, de mettre en œuvre diverses connexions et de tester régulièrement les procédures de reprise après sinistre et de basculement.
Il vous incombe de comprendre comment votre connexion Direct Link est configurée, personnalisée et utilisée. Vous êtes également responsable de la recréation d'une instance du service dans un nouvel emplacement et de la restauration de vos données. Pour plus d'informations sur la conception de la diversité pour obtenir la haute disponibilité avec Direct Link, voir Modèles de diversité et de redondance dans Direct Link.
Fonctionnalités de haute disponibilité
IBM Cloud Direct Link prend en charge les fonctions de haute disponibilité suivantes :
| Fonction | Description | Élément à prendre en compte |
|---|---|---|
| IBM Cloud Transit Gateway | Attachez plusieurs liens directs à une passerelle de transit pour un routage réseau centralisé, évolutif et redondant à travers les VPC et sur site. Centralisation du routage, réduction de la complexité dans les déploiements à grande échelle. | Pour éviter un point de défaillance unique, déployez des passerelles de transit redondantes dans des zones ou des régions distinctes et connectez des liens directs à chacune d'entre elles. Veillez aux limites de configuration, telles que les quotas de pièces jointes et la propagation des itinéraires. |
| Prise en charge du protocole BGP (Border Gateway Protocol) | Utiliser BGP pour réacheminer dynamiquement le trafic en cas de défaillance d'un lien direct, ce qui permet une récupération rapide et une sélection automatisée du chemin. | Doit configurer la surveillance des sessions BGP et l'ajustement des préférences d'itinéraires pour éviter le routage asymétrique ou les retards de basculement. |
En tant que client, vous pouvez créer et prendre en charge les autres fonctions de haute disponibilité suivantes :
| Fonction | Description | Élément à prendre en compte |
|---|---|---|
| Plusieurs appareils sur site | Installez plusieurs dispositifs redondants (par exemple, des routeurs et des commutateurs) sur place pour garantir une haute disponibilité sur le chemin du réseau jusqu'à votre lien direct. | Prévoir la redondance de l'espace physique, de l'alimentation électrique et du câblage. Testez régulièrement les scénarios de basculement pour vous assurer que l'HA au niveau des appareils fonctionne comme prévu. |
| Connexion des appareils sur site à différents PoPs et centres de données | Connecter les dispositifs (par exemple, les routeurs et les pare-feu) à différents points de présence ( PoPs ) ou centres de données afin d'éviter les points de défaillance uniques. | Évaluer la latence du réseau et la bande passante entre PoPs et les centres de données. Assurer la diversité des parcours physiques et se coordonner avec les prestataires pour éviter les groupes à risques partagés. |
| Préfixation AS, BGP | Configurer le prépaiement AS et le routage BGP pour gérer le flux de trafic entre les connexions actives et passives. | Définir des politiques de routage claires pour le trafic entrant et sortant. Contrôler les annonces BGP pour s'assurer qu'elles sont correctes et ajuster les stratégies de chemin d'accès de l'AS si nécessaire. |
| Détection de réacheminement bidirectionnel (BFD) | Activer BFD pour détecter rapidement les défaillances de liaison et assurer un basculement rapide, améliorant ainsi la disponibilité. | Vérifiez que tous les éléments du réseau supportent BFD. Surveillez l'état de la session BFD et réglez soigneusement les intervalles de détection afin d'équilibrer la sensibilité et les faux positifs. |
Architecture de reprise après sinistre
IBM Cloud Direct Link joue un rôle essentiel dans la mise en place d'architectures résilientes et à haute disponibilité. Pour la planification de la reprise après sinistre, Direct Link offre une gamme de fonctions conçues pour assurer une connectivité fiable et à faible latence pendant les interruptions.
Les entreprises peuvent choisir parmi plusieurs options de vitesse de port (50 Mbps à 10 Gbps) en fonction de leurs besoins en matière de réplication de données. Bien que la redondance ne soit pas intégrée, vous pouvez la configurer en prévoyant des liens doubles à travers divers routeurs de connexion croisée (XCR) et en mettant en œuvre des stratégies de basculement BGP appropriées. Direct Link prend en charge le routage local et global, ce qui permet de répartir la charge de travail entre les régions afin d'améliorer la résilience. L'intégration avec les régions multizones (MZR) et la prise en charge de la sauvegarde et de la récupération de la configuration offrent une protection supplémentaire contre les défaillances localisées.
Le tableau suivant présente ces caractéristiques et les principales considérations à prendre en compte.
Fonctionnalités de reprise après sinistre
IBM Cloud Direct Link prend en charge les fonctions de reprise après sinistre suivantes :
| Fonction | Description | Élément à prendre en compte |
|---|---|---|
| Routage local et global | Direct Link comprend à la fois le routage local et le routage global, offrant une connectivité transparente aux centres de données au sein d'un même marché (routage local) et à travers différents marchés géographiques (routage global). | Le routage global est nécessaire pour le partage interrégional de la charge de travail et la reprise après sinistre dans plusieurs régions. |
| Sauvegarde et restauration des configurations | IBM Cloud fournit des outils pour sauvegarder les configurations de Direct Link, ce qui vous permet de restaurer les services en cas de sinistre. | Il est recommandé de procéder à des sauvegardes régulières et de tester les procédures de récupération afin de garantir une restauration rapide en cas de panne. |
| Prise en charge de MZR (Multi-Zone Region) | Direct Link s'intègre aux MZR de IBM Cloud et améliore la disponibilité et la résilience en répartissant les charges de travail sur plusieurs zones. | Un déploiement adéquat sur plusieurs zones est nécessaire pour obtenir une haute disponibilité et minimiser l'impact des défaillances spécifiques à une zone. |
En tant que client, vous pouvez créer et prendre en charge les autres options de reprise après sinistre suivantes :
| Fonction | Description | Élément à prendre en compte |
|---|---|---|
| Scripts de sauvegarde/restauration et données de sauvegarde | Créer et maintenir leurs propres scripts de sauvegarde et de restauration, ainsi que stocker en toute sécurité les données de configuration et d'état du réseau, afin d'accélérer la reprise en cas de panne. | Veiller à ce que les sauvegardes soient cryptées, versionnées et stockées dans des lieux géographiquement différents. Automatiser les programmes de sauvegarde et valider périodiquement les procédures de restauration. |
| Connexions diverses à l' Direct Link | Établir diverses connexions Direct Link dans différentes régions ou zones pour assurer une connectivité continue pendant les pannes régionales. | La mise en œuvre de diverses connexions nécessite une planification minutieuse de l'architecture du réseau et des configurations BGP afin de garantir un basculement transparent. |
| Protection des données | IBM fournit des solutions robustes pour la sauvegarde, la conservation et la récupération des données, qui sont essentielles pour maintenir la continuité des activités et soutenir les efforts de reprise après sinistre. | Tester régulièrement les processus de sauvegarde et de restauration pour garantir l'intégrité et la disponibilité des données. |
Planification de la reprise après incident
Il est essentiel de s'entraîner régulièrement à la reprise après sinistre afin d'être bien préparé à des perturbations inattendues. Lors de l'élaboration de votre plan de reprise après sinistre, envisagez les scénarios de défaillance et les solutions suivantes pour IBM Cloud Direct Link.
Il peut y avoir plusieurs façons de récupérer après certaines défaillances. Veillez donc à évaluer chaque scénario en fonction de votre architecture et de vos besoins spécifiques. Voici les scénarios de défaillance les plus courants, ainsi que les mesures de récupération possibles :
| Echec | Résolution |
|---|---|
| PoP défaillance | Veillez à ce que deux ou plusieurs connexions ne soient pas reliées au même site PoP. |
| Défaillance du centre de données (zone) | Veillez à ce qu'il y ait au moins deux liens directs entre les différentes zones pour assurer le basculement. IBM Cloud Direct Link peuvent réacheminer le trafic automatiquement, mais la configuration côté client améliore la résilience. |
| défaillance de région | Anticipez cela en ayant des connexions dans une région restaurée. Si le coût est prohibitif, il faut mettre en place des capacités VPN et des scripts associés pour remplacer les connexions directes. |
| Défaillance du matériel (point unique) | L'architecture IBM Cloud Direct Link est conçue pour gérer les défaillances matérielles ponctuelles en fournissant diverses connexions réseau. Le basculement se fait de manière transparente, sans qu'aucune configuration du client ne soit nécessaire. |
| Perte de paquets de la connexion réseau | Utiliser des outils de surveillance pour identifier la cause première. Vérifier les pics de trafic qui dépassent la bande passante fournie, ce qui peut déclencher des contrôles et des suppressions de paquets. Inspecter les ports, le câblage et le matériel du réseau pour détecter les défauts. Si le problème persiste ou ne peut être isolé, adressez-vous au service d'assistance IBM pour un examen plus approfondi. |
| Deux liaisons directes sont fournies par des fournisseurs différents au même site PoP,, mais elles sont toutes deux connectées au même dispositif matériel, ce qui crée un point de défaillance unique. | Assurez-vous de la diversité des ports en vérifiant les détails de l'affectation des ports dans la console IBM Cloud lorsque vous commandez des liaisons directes. Pour les fournisseurs non intégrés (commandés séparément dans le portail des fournisseurs et dans la console IBM Cloud ), vérifiez le port utilisé par un lien existant et sélectionnez-en un autre. Pour les fournisseurs intégrés à l'API (où les commandes sont initiées dans le portail du fournisseur et reflétées dans la console IBM Cloud ), consultez nos instructions spécifiques au fournisseur. Pour les liaisons directes dédiées, vérifiez s'il existe des liaisons transversales sur le même site PoP. |
Vos responsabilités en matière d'HA et de DR
Pour plus d'informations sur la responsabilité de l'utilisation de Direct Link entre IBM et vous, le client, voir Comprendre vos responsabilités lors de l'utilisation de IBM Cloud Direct Link. Il est de votre responsabilité de tester en permanence votre plan d'HA et de DR.
Des interruptions de la connectivité du réseau et de courtes périodes d'indisponibilité d'un service peuvent se produire. Il est de votre responsabilité de vous assurer que le code source de l'application inclut une logique de relance de la disponibilité du client afin de maintenir la haute disponibilité de l'application.
Objectif de temps de reprise (RTO)
Direct Link fournit des mécanismes permettant de protéger vos données et de restaurer les fonctions du service. Des plans de continuité des activités sont en place pour atteindre l'objectif de temps de rétablissementDans le cadre de la planification de la reprise après sinistre, le temps nécessaire à la restauration d'un processus d'entreprise après un sinistre. (RTO) visé pour le service. Le tableau suivant présente les cibles pour Direct Link.
| Fonction | RTO |
|---|---|
| Configuration de la redondance | En quelques minutes (généralement moins de 5 minutes) |
| Routage | Basculement automatique en quelques minutes (généralement < 2 minutes) |
| Sauvegarde et récupération | En fonction de la taille des données : ~10 minutes + 1 minute par 10 Go de données restaurées |
| Région à zones multiples | ~10 minutes + 1 minute par 10 GB si une restauration des données est nécessaire |
| Scripts de sauvegarde/restauration et données de sauvegarde | 30 minutes - plusieurs heures, en fonction de l'automatisation et du volume de données |
| Connexions diverses à l' Direct Link | < 5 minutes (généralement 1 à 2 minutes) si BGP et le basculement de routage sont correctement configurés et régulièrement testés |
| Protection des données, avec les outils fournis par IBM | 10 minutes + 1 minute par tranche de 10 Go de données restaurées (identique à la restauration de sauvegarde standard sur IBM ) |
Gestion des modifications
La gestion des changements comprend des tâches telles que les mises à niveau, les modifications de configuration et les suppressions.
Accorder aux utilisateurs et aux processus les rôles et les actions Identity and Access Management (IAM) avec le minimum de privilèges requis pour leur travail. Pour plus d'informations, voir Comment empêcher la suppression accidentelle de services?
Les meilleures pratiques de gestion du changement comprennent également :
- Planifiez et documentez les changements en tenant un journal des changements pour toutes les modifications apportées à votre configuration Direct Link.
- Créez une sauvegarde des configurations critiques avant d'effectuer une mise à niveau ou des changements majeurs.
- Programmer les mises à niveau ou les changements à fort impact pendant les périodes de faible trafic et en informer les équipes concernées.
- Surveillez la santé et les paramètres de votre connexion Direct Link pour vous assurer que tout fonctionne comme prévu.
Comment IBM soutient la planification de la reprise après sinistre
IBM conçoit son infrastructure en gardant à l'esprit la résilience, en particulier pour des services tels que IBM Cloud Direct Link, qui est essentiel pour connecter les réseaux sur site à IBM Cloud. En cas de défaillance :
- Les équipes de réponse aux incidents identifient et isolent rapidement la défaillance.
- Le reroutage du trafic est effectué, dans la mesure du possible, en utilisant la dorsale de IBM et les réseaux des fournisseurs.
- La communication sur l'état des services est maintenue sur la page IBM Cloud Status afin de vous tenir informé.
En cas de défaillance d'une zone ou d'une région, IBM prend les mesures de récupération suivantes :
Comment IBM récupère les défaillances de zones
Une défaillance de zone désigne la défaillance d'un centre de données ou d'une zone de disponibilité au sein d'une région. IBM atténue l'impact de cette manière :
- Direct Link fonctionne sur plusieurs chemins physiques du réseau. La diversité des liens et des chemins permet d'éviter qu'une défaillance dans une zone n'affecte l'ensemble de la connexion.
- IBM surveille en permanence l'état de santé des points d'extrémité Direct Link. Si une zone devient indisponible, le trafic peut être réacheminé vers des zones saines, le cas échéant.
Si IBM ne peut pas restaurer l'instance de service, vous devez restaurer le service comme décrit dans l'architecture de reprise après sinistre.
Comment IBM se remet des échecs régionaux
Dans le cas rare d'une défaillance régionale :
- IBM vous encourage à architecturer les charges de travail dans plusieurs régions. Direct Link peuvent être fournies à différentes régions IBM Cloud, ce qui permet de réduire l'impact d'une panne régionale.
- IBM l'ossature mondiale de l'entreprise et ses partenariats avec les principaux fournisseurs de réseaux de télécommunications offrent des itinéraires alternatifs pour le trafic si une région devient indisponible.
- IBM prend en charge vos plans de reprise après sinistre en permettant le provisionnement de Direct Link dans plusieurs régions. Il est recommandé de configurer divers liens dans les régions secondaires qui peuvent être activés en cas de besoin.
Si IBM ne peut pas restaurer l'instance de service, vous devez restaurer le service comme décrit dans l'architecture de reprise après sinistre.
Comment IBM maintient les services
Toutes les mises à niveau suivent les meilleures pratiques du service IBM, y compris les plans de reprise et les processus de retour en arrière. La maintenance régulière peut entraîner de brèves interruptions, atténuées par la logique de relance de la disponibilité du client. Les modifications sont déployées de manière séquentielle, région par région, et zone par zone à l'intérieur d'une région. IBM annule les mises à jour au premier signe de défaut.
IBM fournit un préavis pour toutes les activités de maintenance planifiées. Si un changement est susceptible d'affecter votre charge de travail, IBM vous en informera par le biais de notifications officielles. Pour vous tenir au courant de la maintenance, des annonces de service et d'autres mises à jour, consultez la page des meilleures pratiques en matière de surveillance de l'état.