sysdig-agent 파드가 프라이빗 전용 RHCOS 클러스터( CrashLoopBackOff )에 있는 이유는 무엇인가요?
가상 프라이빗 클라우드 RHCOS 워커 노드 비공개 전용
클러스터에서 RHCOS 워커 노드를 사용하고 아웃바운드 인터넷 액세스가 없는 경우, ibm-observe 네임스페이스의 sysdig-agent 파드는 CrashLoopBackOff 로 들어가거나 시작하지 못할 수 있습니다.
sysdig-agent 파드가 CrashLoopBackOff 에 있거나 RHCOS 워커 노드를 사용하는 프라이빗 전용 클러스터의 ibm-observe 네임스페이스에서 시작하지 못했습니다.
Sysdig 통합을 설치하거나 구성한 후 sysdig-agent 파드가 반복적으로 다시 시작되고 정상 상태가 되지 않는 것을 볼 수 있습니다. 파드 로그를 확인하면 다음과 유사한 오류가 표시됩니다:
oc -n ibm-observe logs <sysdig-agent-pod> --previous
출력 예:
* Kernel headers not found in /host/lib/modules/5.14.0-427.105.1.el9_4.x86_64/build, continuing anyway
* Loading kernel probe
Error! Your kernel headers for kernel 5.14.0-427.105.1.el9_4.x86_64 cannot be found at /lib/modules/5.14.0-427.105.1.el9_4.x86_64/build or /lib/modules/5.14.0-427.105.1.el9_4.x86_64/source.
* Trying to download precompiled module from https://download.sysdig.com/stable/sysdig-probe-binaries/...
Download of sysdigcloud-probe for version 14.3.2 failed.
curl: (28) Failed to connect to download.sysdig.com port 443: Connection timed out
Cannot load the probe
RHCOS 워커 노드에서 모니터링 에이전트는 로컬 커널 헤더를 포함하지 않기 때문에 로컬 커널 헤더에 의존할 수 없습니다. 이 시나리오에서 Sysdig 에이전트는 미리 컴파일된 드라이버를 검색하기 위해 sysdig.com 에 접속을 시도합니다. 프라이빗 전용 클러스터 또는 아웃바운드 인터넷 액세스가 없는 클러스터에서는 이 프로세스가 실패하고 에이전트 파드가 CrashLoopBackOff 으로 들어갈 수 있습니다.
eBPF 드라이버가 활성화되어 있지 않은 경우, 이것이 문제의 잠재적 원인일 수 있습니다. 다음 단계에 따라 문제를 진단하고 해결하세요.
eBPF 이제 새 Sysdig 배포에 기본적으로 활성화됩니다. 그러나 비공개 전용 환경의 RHCOS 작업자가 있는 기존 클러스터에서 문제가 발생하는 경우 eBPF 이 활성화되어 있는지 확인하고 필요한 경우 활성화하세요.
Sysdig 에이전트 구성을 확인하고 필요한 경우 eBPF 드라이버를 활성화합니다.
-
현재 클러스터에서 eBPF 드라이버가 활성화되어 있는지 확인합니다.
oc -n ibm-observe get daemonset/sysdig-agent -o jsonpath='{.spec.template.spec.containers[0].env[?(@.name=="SYSDIG_AGENT_DRIVER")].value}'- 출력에
universal_ebpf이 표시되면 eBPF 이 이미 활성화된 것입니다. 아래 단계는 필수는 아니며, 이 단계를 따른다고 해서 문제가 해결되지는 않습니다. 다른 잠재적 원인을 조사해야 할 수도 있습니다. - 출력이 비어 있거나
universal_ebpf이외의 값이 표시되면 다음 단계로 계속 진행하여 eBPF 을 활성화합니다.
- 출력에
-
Sysdig 에이전트 드라이버를
universal_ebpf로 설정합니다.oc -n ibm-observe set env daemonset/sysdig-agent SYSDIG_AGENT_DRIVER=universal_ebpf -
sysdig-agent파드를 다시 시작합니다.oc delete pods -l app=sysdig-agent -n ibm-observe -
대체 파드가 생성되었는지 확인하고
Running상태로 돌아갑니다.oc get pods -l app=sysdig-agent -n ibm-observe
RHCOS 워커 노드에 대한 모니터링 제한에 대한 자세한 내용은 클러스터 상태 모니터링을 참조하세요.