Pourquoi les pods sysdig-agent se trouvent-ils dans CrashLoopBackOff sur un cluster RHCOS privé?
Cloud privé virtuel Nœuds de travail RHCOS Réservé aux particuliers
Si votre cluster utilise des nœuds de travail RHCOS et aucun accès Internet sortant, les pods sysdig-agent dans l'espace de noms ibm-observe peuvent entrer dans CrashLoopBackOff ou ne pas démarrer.
Vos pods sysdig-agent sont dans CrashLoopBackOff ou ne démarrent pas dans l'espace de noms ibm-observe sur un cluster privé qui utilise des nœuds de travail RHCOS.
Il se peut que les pods sysdig-agent redémarrent de façon répétée et ne parviennent pas à se rétablir après l'installation ou la configuration de l'intégration Sysdig. Lorsque vous vérifiez les journaux de pods, vous voyez des erreurs
similaires à celles qui suivent :
oc -n ibm-observe logs <sysdig-agent-pod> --previous
Exemple de sortie :
* Kernel headers not found in /host/lib/modules/5.14.0-427.105.1.el9_4.x86_64/build, continuing anyway
* Loading kernel probe
Error! Your kernel headers for kernel 5.14.0-427.105.1.el9_4.x86_64 cannot be found at /lib/modules/5.14.0-427.105.1.el9_4.x86_64/build or /lib/modules/5.14.0-427.105.1.el9_4.x86_64/source.
* Trying to download precompiled module from https://download.sysdig.com/stable/sysdig-probe-binaries/...
Download of sysdigcloud-probe for version 14.3.2 failed.
curl: (28) Failed to connect to download.sysdig.com port 443: Connection timed out
Cannot load the probe
Sur les nœuds de travail RHCOS, l'agent de surveillance ne peut pas s'appuyer sur les en-têtes du noyau local car RHCOS ne les inclut pas. Dans ce scénario, l'agent Sysdig tente de joindre sysdig.com pour récupérer un pilote précompilé.
Dans les clusters privés uniquement, ou les clusters sans accès Internet sortant, ce processus échoue et les pods agents peuvent entrer sur le site CrashLoopBackOff.
Si le pilote eBPF n'est pas activé, c'est une cause potentielle du problème. Suivez les étapes suivantes pour diagnostiquer et résoudre le problème.
eBPF est désormais activé par défaut pour les nouveaux déploiements de Sysdig. Toutefois, si vous rencontrez des problèmes sur un cluster existant avec des travailleurs RHCOS dans un environnement privé, vérifiez si eBPF est activé et activez-le si nécessaire.
Vérifiez la configuration de votre agent Sysdig et activez le pilote eBPF si nécessaire.
-
Vérifiez si le pilote eBPF est activé sur votre cluster.
oc -n ibm-observe get daemonset/sysdig-agent -o jsonpath='{.spec.template.spec.containers[0].env[?(@.name=="SYSDIG_AGENT_DRIVER")].value}'- Si la sortie indique
universal_ebpf, eBPF est déjà activé. Les étapes ci-dessous ne sont pas nécessaires, et les suivre ne causera aucun dommage mais ne résoudra pas votre problème. Il se peut que vous deviez rechercher d'autres causes potentielles. - Si la sortie est vide ou affiche une valeur autre que
universal_ebpf, passez à l'étape suivante pour activer eBPF.
- Si la sortie indique
-
Réglez le pilote de l'agent Sysdig sur
universal_ebpf.oc -n ibm-observe set env daemonset/sysdig-agent SYSDIG_AGENT_DRIVER=universal_ebpf -
Redémarrer les pods
sysdig-agent.oc delete pods -l app=sysdig-agent -n ibm-observe -
Vérifier que les pods de remplacement sont créés et revenir à l'état
Running.oc get pods -l app=sysdig-agent -n ibm-observe
Pour plus d'informations sur la surveillance des limitations des nœuds de travail RHCOS, voir Surveillance de l'état des clusters.