Meilleures pratiques en matière de résilience

Suivez les meilleures pratiques de résilience sur IBM Cloud pour vous assurer que vos charges de travail sont hautement disponibles et que vous pouvez vous remettre d'un désastre.

Avoir un plan

Traverser une crise est stressant et les catastrophes ne font pas exception à la règle. Lors d'un sinistre, il est probable que vous essayiez de redémarrer les services critiques de l'entreprise et que vous soyez sous pression pour le faire rapidement, ce qui peut conduire à des erreurs. Dans le cas improbable d'une catastrophe, le fait de disposer d'un plan clairement défini aide votre entreprise à se rétablir de manière prévisible, ce qui contribue à atténuer le stress et à réduire les erreurs. Pour plus d'informations sur la création d'un plan de reprise après sinistre, voir Planification de la reprise après sinistre.

Déterminer les priorités

Lorsque vous élaborez un plan de reprise après sinistre, assurez-vous que votre organisation l'approuve, le comprend et peut le financer. Lorsque vous obtenez l'adhésion d'un plus grand nombre de parties prenantes, vous pouvez définir les priorités de l'entreprise en cas de catastrophe. De cette manière, le plan est à la fois complet et proportionné aux attentes de l'entreprise. Examinez régulièrement le plan avec votre organisation afin de prendre en compte les changements de priorités et mettez le plan à jour si nécessaire.

Répartir la capacité entre les zones

Le déploiement de charges de travail sur plusieurs zones de disponibilité au sein d'une même région améliore la disponibilité, mais il convient de veiller à éviter les déséquilibres entre les zones, en particulier lorsque vous utilisez des IBM Cloud® Virtual Servers for Virtual Private Cloud (VSI). Veillez à répartir vos charges de travail entre plusieurs zones afin qu'elles continuent de fonctionner en cas de défaillance d'une zone. Assurez-vous également que les zones restantes disposent d'une capacité suffisante pour prendre en charge l'intégralité de la charge de travail. Lorsque vous effectuez un déploiement sur trois zones, prévoyez environ 17 % de capacité VSI supplémentaire par zone afin de compenser la perte de capacité de 33 % qui survient lors d’une panne de zone.

Comprendre ce qui est considéré comme une catastrophe

Pour mettre en œuvre le plan de reprise après sinistre, vous devez être sûr que ce que vous vivez est un sinistre. Expliquez clairement dans le plan ce qui est considéré comme une catastrophe, sinon vous risquez de recevoir de fausses alertes ou de rester inactif lorsqu'une catastrophe se produit. Définir plusieurs scénarios différents qui constituent une catastrophe, comment l'entreprise peut y réagir et à quelle vitesse. Il faut également tenir compte de l'ampleur de l'impact. Si l'un des composants d'une charge de travail subit un sinistre, la réaction est-elle différente d'une situation où tout tombe en panne ?

La communication est essentielle

En cas de catastrophe, une communication efficace entre les équipes est importante. Dans votre plan, indiquez clairement quelles personnes peuvent appeler en cas de catastrophe. Définir comment ils communiquent avec l'organisation et les personnes qui doivent mettre en œuvre le plan de reprise après sinistre. Indiquer clairement les canaux de communication, tels que le téléphone ou le courrier électronique, afin de s'assurer que les messages importants ne sont pas manqués. Pensez à des canaux de communication de secours au cas où les canaux principaux seraient affectés. Le plan peut également prescrire certaines réunions qui doivent avoir lieu pour faire le point sur la situation.

Testez votre plan

Réagir à une catastrophe réelle n'est pas le moment idéal pour tester votre plan pour la première fois. Testez régulièrement votre plan pour vous assurer qu'il fonctionne et que vous comprenez le temps qu'il faudra pour le mettre en œuvre. Lorsque d'autres personnes sont impliquées, tester votre plan leur permet de mieux comprendre leur rôle. Après le test, veillez à intégrer dans le plan les leçons tirées de l'expérience. Pour plus d'informations sur le test de votre plan de reprise d'activité, voir Test de reprise d'activité.

Comprendre ses responsabilités

Chaque service IBM Cloud dispose d'une matrice des rôles et des responsabilités qui définit les responsabilités de IBM®, les responsabilités des clients et les responsabilités partagées, y compris les responsabilités liées à la sauvegarde, à la récupération et aux sinistres. Assurez-vous de bien comprendre les responsabilités de chacun des services que vous utilisez, car elles déterminent les actions à entreprendre pour récupérer avec succès vos instances de service et vous aider à planifier.

Tenir compte des exigences en matière de résilience et de résidence des données

La résilience des données fait référence à la capacité d'accéder aux données, de les conserver ou de les récupérer rapidement en cas de défaillance ou de catastrophe. Il est lié aux concepts de haute disponibilité, de reprise après sinistre et de cyber-résilience. Pour plus d'informations sur la résilience des données, consultez le IBM Well-Architected Framework.

Un autre aspect important à prendre en compte est la résidence des données et toute restriction ou exigence concernant l'emplacement physique de vos données, non seulement pour les environnements de production, mais aussi pour la sauvegarde et la récupération.

Comprendre la résidence des données dans IBM Cloud

IBM Cloud le réseau mondial d'implantations d'EMC vous offre la flexibilité de choisir l'endroit où vous souhaitez exécuter vos charges de travail. Consultez la politique de déploiement des services de IBM Cloud pour savoir quand et comment demander qu'un service soit disponible dans une région donnée.

Lorsque vous fournissez une instance d'un service régional et zonal, vous sélectionnez une région pour déployer l'instance conformément à vos exigences géographiques. IBM Cloud permet de garantir que le contenu fourni par vous et votre charge de travail, tel que défini dans le contrat de services en nuage, est stocké et traité localement dans l'emplacement de la région sélectionnée. Pour une liste complète des lieux où les services IBM Cloud sont disponibles, voir Disponibilité des services et des infrastructures par lieu.

les services IBM Cloud permettent d'enregistrer des sauvegardes cryptées du contenu du client dans le lieu où se trouve le service régional ou zonal, en vue d'une récupération en cas de corruption des données ou de sinistre majeur dans un centre de données.

En ce qui concerne les métadonnées du client, y compris les informations relatives aux contacts commerciaux et à l'utilisation du compte (telles que définies dans l'accord de service IBM Cloud ), IBM Cloud les stocke et les traite là où se trouvent les plans de contrôle des services régionaux et globaux.

Pour une liste complète des attributs de données que chaque service IBM Cloud traite et stocke, voir la bibliothèque de référence de l'API et du SDK.

Toutes les données en transit sont cryptées. Seuls TLS 1.2 et 1.3 sont pris en charge dans IBM Cloud afin d'éviter un retour à une version vulnérable du protocole. TLS 1.1 et moins sont explicitement désactivés.

Les processus et procédures relatifs au traitement des données privées IBM Cloud sont documentés dans le IBM Cloud Data Processing Addendum (DPA). Le présent accord de traitement des données (DPA) et ses annexes s’appliquent au traitement des données à caractère personnel effectué par IBM Cloud pour le compte du client (données à caractère personnel du client). Le traitement des Données Personnelles est soumis au Règlement général sur la protection des données 2016/679 (GDPR). Il est également soumis à toute autre législation en matière de protection des données mentionnée dans la section Législations en matière de protection des données afin de fournir des services (les Services) conformément au contrat conclu entre le client et IBM Cloud. Le IBM Cloud Est disponible à l'adresse suivante : Data Processing Addendum.

En plus du DPA, les services en nuage fournissent des pièces du DPA qui peuvent être trouvées sur le IBM Cloud Termes.

Intégrez les fonctions HA et DR à vos charges de travail

Lorsque vous concevez des charges de travail déployées dans le nuage, pensez à la haute disponibilité et à la reprise après sinistre dans le cadre de la phase de collecte des besoins. En comprenant dès le début du processus de conception quelles doivent être les qualités de résilience de la charge de travail, vous pouvez prendre des décisions qui influencent l'architecture et facilitent la reprise. Par exemple, si vous connaissez l'objectif de temps de récupération d'une charge de travail, vous pouvez décider comment déployer une charge de travail pour atteindre cet objectif en utilisant les caractéristiques des services disponibles. De même, si vous comprenez l'objectif du point de récupération, vous pouvez prendre de meilleures décisions concernant les données, la manière de les sauvegarder ou de les répliquer. Le fait d'intégrer cet aspect à un stade précoce permet également à l'entreprise de mieux comprendre les coûts de fonctionnement liés à la charge de travail.

Réfléchissez à la manière dont vous pouvez développer un code d'application pour faciliter le passage à un site de reprise après sinistre. Par exemple, évitez de coder en dur des chaînes de connexion ou d'autres configurations susceptibles d'être modifiées à la suite d'une connexion à d'autres ressources.

Choisir les bons outils

Pensez à IBM Cloud comme à une boîte à outils avec un ensemble d'outils ou de services que vous pouvez utiliser pour déployer et exécuter des charges de travail. Pour utiliser correctement un outil, vous devez comprendre ce qu'il peut faire et ce qu'il ne peut pas faire, et choisir le bon outil. Si vous essayez d'utiliser un outil pour un travail pour lequel il n'a pas été conçu, un problème peut survenir. Lorsque vous élaborez votre plan de résilience, vous devez comprendre le plus précisément possible les services utilisés par votre charge de travail, leurs capacités et leurs limites. Si une marque de service n'est pas en mesure d'atteindre vos objectifs de RTO ou de RPO, envisagez d'autres services ou outils qui pourraient vous aider à combler l'écart. Demandez-vous également si les objectifs que vous avez fixés sont réalistes ou si vous n'introduisez pas une complexité et des coûts excessifs dans votre solution pour un gain mineur.

Effectuez des sauvegardes avant de procéder à des modifications

L'exploitation de systèmes informatiques n'est jamais sans risque, et l'introduction de changements dans votre environnement de travail est un moment où le risque augmente. Disposer d'un plan de validation des changements et d'un plan de sauvegarde pour gérer les changements apportés à votre environnement. L'une des premières étapes de tout plan de mise en œuvre du changement consiste à effectuer des sauvegardes des données et des configurations. Si un problème survient pendant ou peu après la publication, vous pouvez récupérer vos sauvegardes.

Créer des images personnalisées

Créer une image personnalisée à partir d'un volume de démarrage et l'utiliser comme image dorée, avec des applications et des configurations préinstallées, pour réduire le temps de provisionnement des instances IBM Cloud® Virtual Servers for Virtual Private Cloud dans le site DR. Le volume de démarrage doit être attaché à une instance de serveur virtuel (VSI) arrêtée pour créer l'image personnalisée.

Utilisez des noms d'hôte pour les sous-réseaux

Utilisez les noms d'hôtes et les DNS au lieu des adresses IP pour minimiser les changements nécessaires au redéploiement d'une application sur le site DR, en particulier avec les instances VPC, y compris les VSI. Les sous-réseaux sont spécifiques à une zone et ne s'étendent pas d'une zone à l'autre. De nouvelles adresses IP sont attribuées aux nouvelles instances de service, ce qui peut perturber les configurations existantes, telles que les règles de sécurité ou les fichiers de configuration des applications.

Configurer les services de gestion des clés pour la reprise après sinistre

Pour Key Protect, configurez le service sur le site principal avec un basculement dans la région DR pour permettre le réacheminement automatique des demandes de Key Protect en cas de panne du service régional. Créer des scripts pour mettre à jour les paramètres du point de terminaison privé virtuel (VPE) afin d'accéder au service Key Protect, en particulier l'adresse IP ( Internet Protocol ), dans le cadre des procédures de reprise après sinistre.

Pour HPCS, configurez une unité cryptographique de basculement dans la région DR. Initialiser et configurer les unités cryptographiques de basculement de la même manière que les unités cryptographiques opérationnelles avant le sinistre, afin qu'elles soient disponibles en cas de panne régionale

Investir dans l'observabilité

L'observabilité comprend des outils tels que IBM Cloud Logs et IBM Cloud Monitoring qui vous permettent de savoir ce qui se passe dans le système et, en cas de panne ou de dégradation des services, d'identifier, d'atténuer et de remédier rapidement à la cause première. Cela est particulièrement nécessaire pour les systèmes distribués complexes où les défaillances sont inévitables et où il est très difficile de suivre ou de corréler les dépendances entre les composants. En outre, le service Activity Tracker Event Routing vous permet d'auditer les événements et d'enregistrer et de surveiller les modifications apportées au système tout en offrant une visibilité sur le trafic IP entrant et sortant des interfaces réseau au sein du VPC Flow Logs for VPC fournit une visibilité sur le trafic IP entrant et sortant des interfaces réseau au sein du VPC et vous permet de résoudre les problèmes de réseau et de connectivité, qui sont autrement difficiles à observer.

Les applications résilientes conçues pour l'informatique en nuage et les processus qui les soutiennent doivent exploiter efficacement ces capacités. Par exemple, les applications devraient présenter des mesures de l'état de santé de leurs composants et de leurs sous-systèmes. Tous les services IBM Cloud prennent en charge la collecte des mesures de la plateforme et exposent des mesures détaillées qui sont documentées individuellement, comme ceci pour le répartiteur de charge. Les applications et les tableaux de bord conçus pour les soutenir devraient exploiter ces mesures pour améliorer l'efficacité opérationnelle.

IBM Cloud Logs offre des fonctionnalités avancées pour enrichir, interroger et alerter sur les logs générés par les applications tout en gérant le volume de logs et son coût. Différents types d' alertes permettent d'obtenir des capacités plus sophistiquées pour surveiller efficacement les systèmes.

Restez informé des notifications de IBM Cloud

En cas de catastrophe affectant un service ou une région de IBM Cloud, vous recevez des notifications de IBM Cloud dans votre compte ou par courrier électronique. Inscrivez-vous pour recevoir des notifications sur votre compte en consultant Voir les notifications. Vous pouvez également consulter la page IBM Cloud La page d' aperçu de l'état.