错误信息故障排除参考
本参考资料列出了 Red Hat OpenShift on IBM Cloud 中所有故障排除主题中已记录的错误消息和错误代码。 条目按组件分类,并附有指向完整故障排除主题的链接。
集群与主节点
| 错误消息 | 故障排除主题 |
|---|---|
Cannot complete cluster master operations because the cluster has a broken webhook application. |
为什么集群主节点操作会因 Webhook 故障而失败? |
Cannot complete cluster master upgrade because the Upgradeable status condition is set to False. |
为什么我会看到“Cannot complete cluster master upgrade”这条消息? |
The master is approaching its allotted memory resource limit (93%). |
为什么我的集群主节点状态显示其资源即将达到上限? |
etcd database size is approaching the maximum |
为什么会出现“etcd database size is approaching the maximum”错误? |
The 'configuration' field is not a valid Kubernetes PodSecurityConfiguration setting. |
为什么会出现“PodSecurityConfiguration 无效”的错误提示? |
No VPC is available. Create a VPC. |
VPC:为什么我在控制台创建集群时没有可用的 VPC? |
Your cluster can't pull images from the 'icr.io' domains because an IAM access policy could not be created. |
为什么集群在创建过程中无法从 IBM Cloud Container Registry 拉取镜像? |
Image security enforcement update canceled. CAE008: can't enable Portieris image security enforcement because the cluster already has a conflicting image admission controller installed. |
为什么我的 Portieris 集群映像安全强制策略的安装被取消了? |
incorrect account for worker, Worker deploy failed due to network communications failing, Unable to connect to the IBM Cloud account. |
为什么我无法创建或删除集群或工作节点? |
Unable to create cluster. The 'vpc-gen2' infrastructure operation failed with the message: the provided token is not authorized to view the specified subnet |
为什么在创建 VPC 集群时会出现“infrastructure operation failed”错误? |
No resources found., connection timed out, dial tcp: connect: connection timed out |
调试集群中的常见 CLI 问题 |
Encrypted storage cannot be configured. Review the customer root key configuration for the worker pool. |
为什么我无法创建具有加密工作节点的 VPC 集群? |
Pending security group creation |
当我创建一个 VPC 集群时,我的工作节点会卡在 Pending security group creation |
Infrastructure instance status is 'failed': Can't start instance because provisioning failed. |
添加自定义 DNS 解析器后,为什么会出现 DNS 故障? |
Could not store the cloud object storage bucket and IAM service key. |
为什么我在创建集群时会出现有关云对象存储桶的错误? |
Could not find user. |
为什么我在尝试访问 Web 控制台时会看到“Could not find user”错误? |
No resources found. |
登录到我的集群后,为什么会看到“未找到资源”的提示? |
VPN server configuration update failed. |
为什么集群主节点会返回VPN服务器错误? |
oc get clusterversion 的输出显示版本未更新 |
为什么 OpenShift 显示集群版本已过时? |
| 在默认安全模式下,图像流未填充到集群中 | 为什么在默认安全模式的集群中,图像流无法加载? |
sysdig-agent 仅限私有访问的 RHCOS 集群中 CrashLoopBackOff 中的 Pod |
为什么位于 CrashLoopBackOff 上的 sysdig-agent Pod 会出现在一个仅限私有访问的 RHCOS 集群中? |
工作程序节点
| 错误消息 | 故障排除主题 |
|---|---|
The worker node instance ID changed. Reload the worker node if bare metal hardware was serviced. |
经典问题:为什么裸机实例 ID 与工作节点记录不一致? |
The dedicated hosts for the zone 'eu-de-2' are not ready. |
VPC:为什么无法在专用主机上创建工作节点? |
SoftLayerAPIError(SoftLayer_Exception_Public): Could not obtain network VLAN with id #123456. |
经典问题:为什么无法添加 VLAN ID 无效的工作节点? |
Registration failed – The plan containers.kubernetes.vpc.gen2.roks is not available in <region>. |
为什么我在尝试配置或重新加载工作节点时会看到 Registration failed 错误? |
A VSI with this profile will put user over quota. |
由于配额限制,VPC 工作节点无法进行配置 |
warning: Container container-00 is unable to start due to an error: Back-off pulling image "registry.redhat.io/rhel8/support-tools" |
创建了一个 4.15 集群后,我的应用程序无法正常运行了 |
网络健康检查(NHC)错误
在 ibmcloud oc cluster health issues 命令的输出中出现了以下错误代码。
| 错误代码 | 严重性 | 描述 | 故障排除主题 |
|---|---|---|---|
NHC001 |
警告 | Tigera 操作员报告称,Calico 已处于“进行中”状态超过一小时。 | 为什么“网络状态”显示 NHC001 错误? |
NHC003 |
警告 | 集群中的某些工作节点无法连接到容器镜像仓库以下载镜像。 | 为什么“网络状态”显示 NHC003 错误? |
NHC004 |
警告 | 集群中的某些工作节点无法解析 VPE 网关的主机名。 | 为什么“网络状态”显示 NHC004 错误? |
NHC005 |
警告 | Tigera 运营商报告称,Calico 处于“性能下降”状态。 | 为什么“网络状态”显示 NHC005 错误? |
NHC006 |
警告 | 从某些工作节点无法访问一个或多个 DNS 解析器。 | 为什么“网络状态”显示 NHC006 错误? |
NHC007 |
警告 | 从某些工作节点无法访问一个或多个 DNS 解析器。 | 为什么“网络状态”显示 NHC007 错误? |
NHC009 |
错误 | IAM 令牌交换请求失败。 | 为什么“网络状态”显示 NHC009 错误? |
NHC010 |
错误 | 超出了安全组规则相关的配额。 | 为什么“网络状态”显示 NHC010 错误? |
NHC011 |
错误 | 超过了与安全组相关的配额。 | 为什么“网络状态”显示 NHC011 错误? |
输入状态错误(ERR 和 ESS 代码)
在 ibmcloud oc ingress status-report get 命令的输出中出现了以下错误代码。 IBM Cloud Kubernetes Service 和 Red Hat OpenShift on IBM Cloud 这两个页面中都出现了相同的代码。
| 错误代码 | 错误消息 | 故障排除主题 |
|---|---|---|
ERRDSIA |
该子域注册的地址有误。 | Ingress 错误:ERRDSIA |
ERRDRISS |
该子域名存在 DNS 解析问题。 | Ingress 错误:ERRDRISS |
ERRDSAISS |
该子域名的外部提供商存在授权问题。 | 输入错误:ERRDSAISS |
ERRDSISS |
该子域名存在 TLS 相关的问题。 | 输入错误:ERRDSISS |
ERRSAM |
缺少负载均衡服务的地址。 | 输入错误:ERRSAM |
ESSDNE |
该密钥在集群中不存在,或者位于错误的命名空间中。 | Ingress 错误:ESSDNE |
ESSEC |
TLS 的证书已过期或即将过期。 | 输入错误:ESSEC |
ESSEF |
“Opaque”秘密字段已过期或即将过期。 | 输入错误:ESSEF |
ESSSMG |
找不到该秘密群组。 | 输入错误:ESSSMG |
ESSSMI |
无法访问 Secrets Manager 实例。 | 输入错误:ESSSMI |
ESSSMINF |
未找到 Secrets Manager 实例。 | 输入错误:ESSSMINF |
ESSVC |
CRN 与同一域下的默认密钥不匹配。 | 输入错误:ESSVC |
ESSWS |
该秘密状态显示了一条警告。 | 输入错误:ESSWS |
ERRESNF |
缺少外部服务。 | 输入错误:ERRESNF |
ERRIODEG |
Ingress 操作员处于降级状态。 | 输入错误:ERRIODEG |
ERRIONF |
集群中缺少 Ingress 操作员。 | 输入错误:ERRIONF |
ERRRNA |
一条或多条路径未被接受。 | 输入错误:ERRRNA |
ERRSAMO |
缺少负载均衡服务的地址。 | Ingress 错误:ERRSAMO |
ERRSEIPM |
该服务缺少一个或多个工作节点 IP 地址。 | Ingress 错误:ERRSEIPM |
XXX.us-south.containers.appdomain.cloud: dial tcp: ... can't marshal DNS message |
为什么 DNS 操作员会显示“RouteHealthDegraded”或“can't marshal DNS message”错误? |
负载均衡器
| 错误消息 | 故障排除主题 |
|---|---|
The VPC load balancer that routes requests to this Kubernetes LoadBalancer service is offline. |
VPC 集群:为什么我的应用无法通过负载均衡器连接? |
The subnet with ID(s) '<subnet_id>' has insufficient available ipv4 addresses. |
VPC 集群:为什么 Kubernetes LoadBalancer 服务会出现“无 IP 地址”的错误? |
The load balancer was created in zone <zone>. This setting cannot be changed. |
VPC 集群:我的 VPC NLB 出现区域错误且无法更新 |
Warning CreatingCloudLoadBalancerFailed ... Failed ensuring LoadBalancer: FindLoadBalancer failed ... 401 Unauthorized ... BXNIM0430E |
为什么在创建 VPC 集群时会出现“SyncLoadBalancerFailed”错误? |
| 在创建或更新负载均衡器时发生的安全组协议不匹配事件 | VPC 集群:创建或更新时发生安全组协议错误 LoadBalancer |
CAE003: Unable to determine the ingress IP address for the network load balancer. |
经典集群:为什么主节点的状态中会显示一个用于 NLB 错误的入站 IP 地址? |
| VPC 负载均衡器的健康状态显示,N 个实例中仅有 2 个通过检查 | VPC 集群:为什么会看到 VPC 负载均衡器的健康状态显示为“故障”? |
Error on cloud load balancer ... Service and associated VPC load balancer do not match ... hostname.invalid |
为什么我的“私有路径”NLB中会出现 hostname.invalid 错误? |
| Ingress 子域名的 DNS 问题 | 为什么我的 Ingress 子域名出现了 DNS 问题? |
应用程序和服务
| 错误消息 | 故障排除主题 |
|---|---|
Failed to create pod sandbox: rpc error: ... failed to request 1 IPv4 addresses. IPAM allocated only 0 |
为什么我的容器无法启动? |
ImagePullBackOff 或图片获取授权错误 |
为什么无法通过 ImagePullBackOff 从注册表中获取镜像,或者出现授权错误? |
pull QPS exceeded 图像提取过程中的错误 |
为什么 Pod 在拉取镜像时会出现“pull QPS exceeded”错误? |
Error: failed to download "<helm_repo>/<chart_name>" |
Helm Chart 安装故障排除:更新配置值 |
This service doesn't support creation of keys |
解决 IBM Cloud 集群中的服务绑定错误 |
Pod 仍处于“Pending”状态 |
为什么 Pod 会一直处于待处理状态? |
| Pod 反复无法重启或被意外移除 | 为什么 Pod 会反复无法重启或被意外移除? |
error: build error: After retrying 2 times, Pull image still failed due to error: unauthorized: authentication required |
为什么我的构建会因镜像拉取认证问题而报错? |
received unexpected HTTP status: 504 Gateway Time-out |
为什么向内部注册表写入数据会超时? |
error: build error: Failed to push image: error copying layers and metadata |
为什么我的 Pod 因安全上下文约束(SCC)而出现“权限被拒绝”的错误,导致无法构建? |
dial tcp 161.26.0.28:443: connect: network is unreachable |
为什么我无法从 VPC 网络外部将镜像推送到内部注册表? |
Pod 处于“CrashLoopBackOff”状态 |
为什么我的 Pod 处于“CrashLoopBackOff”状态? |
oc debug 出现错误,错误信息为 container is unable to start error |
为什么执行 oc debug 命令时会出现 container is unable to start error 错误? |
The entitlement 'ocp_entitled' was not found. |
为什么在创建工作器池时会出现许可证或授权错误? |
Error: Unable to find a match: kernel-headers-VERSION kernel-devel-VERSION |
为什么我的 NVIDIA 显卡驱动在RHEL 9工作节点上安装失败? |
Failed to get StorageCluster","error":"no matches for kind "StorageCluster" in version "ocs.openshift.io/v1" |
为什么 openshift-storage 命名空间中没有列出任何Pod? |
位于 openshift-marketplace 命名空间中的Pod ImagePullBackOff |
位于 openshift-marketplace 命名空间中的Pod位于 ImagePullBackOff |
failed to set feature gates 工作节点升级时出现错误 |
在升级工作节点时,为什么会出现“failed to set feature gates”错误? |
机密集装箱排程失败:Insufficient kata.peerpods.io/vm |
如何对机密容器进行故障排除? |
权限与凭据
| 错误消息 | 故障排除主题 |
|---|---|
User doesn't have permissions to create or manage Storage |
管理存储和创建 PVC 需要哪些权限? |
默认安全 (SBD)
| 错误消息 | 故障排除主题 |
|---|---|
warning: Container container-00 is unable to start due to an error: Back-off pulling image "registry.redhat.io/rhel8/support-tools" |
创建了一个 4.15 集群后,我的应用程序无法正常运行了 |
Pending security group creation |
当我创建一个 VPC 集群时,我的工作节点会卡在 Pending security group creation |
Infrastructure instance status is 'failed': Can't start instance because provisioning failed. |
添加自定义 DNS 解析器后,为什么会出现 DNS 故障? |
| 更新至该版本后,Nodeport 应用无法正常运行 4.15 | 在将集群版本更新至 4.15 或更高版本后修复 NodePort 应用 |
| 在创建版本 4.15 集群后,VPC 中的其他集群出现故障 | 在创建了一个 4.15 版本的集群后,我VPC中其他集群中运行的应用程序出现了故障 |
| VSI 无法访问 VPE 网关 | 为什么我的 VSI 无法访问 VPE 网关? |
File Storage
| 错误消息 | 故障排除主题 |
|---|---|
MountVolume.SetUp failed for volume ... mount.nfs: access denied by server while mounting |
经典问题:为何在将卷挂载到工作节点时被拒绝访问服务器? |
write-permission 或 NFS 挂载路径上出现的非root用户所有权错误 |
当 NFS 文件存储挂载路径的所有者为非root用户时,为什么我的应用会失败? |
| 应用 NFS 文件存储权限时出现组ID错误 | 为什么我的应用在获取 NFS 文件存储权限时会出现组ID错误? |
| 非root用户无法授予对持久化存储的访问权限 | 为什么我无法为非root用户授予对持久存储的访问权限? |
| 工作节点的文件系统已更改为只读模式 | 为什么将工作节点的文件系统改为只读模式? |
| PVC 仍处于待处理状态(文件存储) | 为什么我的文件存储 PVC 一直处于“待处理”状态? |
MetadataServiceNotEnabled |
为什么访问 File Storage for VPC 时会出现“MetadataServiceNotEnabled”错误? |
MountingTargetFailed 或 rpc error: code = DeadlineExceeded desc = context deadline exceeded |
为什么访问 File Storage for VPC 时会出现“MountingTargetFailed”错误? |
SubnetFindFailed 或参阅 rpc error: code = FailedPrecondition 了解 PVC 的创建方法 |
为什么 File Storage for VPC 的PVC生成会失败? |
UnresponsiveMountHelperContainerUtility |
为什么访问 File Storage for VPC 时会出现“UnresponsiveMountHelperContainerUtility”错误? |
shares_snapshot_operation_not_allowed |
为什么我无法创建 File Storage for VPC 快照? |
shares_snapshot_not_found 关于PVC修复 |
为什么我无法将 File Storage for VPC 快照还原到PVC上? |
| 无法删除 VPC( File Storage )快照 | 为什么我无法删除我的 File Storage for VPC 快照? |
'rfs' profile is not accessible 或 stunnel manager is not initialized |
File Storage 区域传输加密问题的故障排除 |
VPC File Storage PVC 仍保留在 Pending 中,且容量数值经过四舍五入 |
使用容量舍入时,为什么我的PVC一直处于“待处理”状态? |
| VPC File Storage 部署权限错误 | 为什么我的 File Storage for VPC 部署会因权限错误而失败? |
在挂载 VPC 时,App pod 卡在 Container creating 状态 File Storage |
为什么我的 App Pod 在尝试挂载 File Storage for VPC 时卡在“Container creating”状态? |
File Storage Critical 状态下的插件 |
为什么“File Storage for VPC”插件显示为“Critical”状态? |
Block Storage
| 错误消息 | 故障排除主题 |
|---|---|
failed to mount the volume as "ext4", it already contains xfs. Mount error: mount failed: exit status 32 |
为什么将现有块存储挂载到 Pod 时会因文件系统不匹配而失败? |
Volume not attached |
为什么在尝试扩展 Block Storage for VPC 卷时会出现“Volume not attached”错误? |
| 将块存储更改为只读 | 为什么块存储会变为只读模式? |
Message: 50% throttling of CPU in namespace kube-system for container ibmcloud-block-storage-driver-container |
为什么块存储插件 Helm 的图表会显示CPU限速警告? |
| PVC块状存储仍处于待处理状态 | 为什么我的块存储 PVC 一直处于“待处理”状态? |
| 应用程序无法访问或向 PVC 写入数据(阻塞) | 为什么我的应用程序无法访问或写入 PVC? |
Labels: ibm.io/pv-connectivity-status: limited |
为什么我的 Block Storage 持久卷显示连接状态为“limited”? |
| Block Storage API 密钥重置导致配置失败 | Block Storage for VPC 重置 API 密钥后,PVC 创建失败 |
UNEXPECTED INCONSISTENCY; RUN fsck MANUALLY. |
为什么挂载 Block Storage for Classic 时会出现文件系统检查错误而失败? |
| 无法删除块存储卷的快照 | 为什么我无法删除我的 Block Storage for VPC 卷快照资源? |
| 块存储快照创建失败 | 为什么我无法创建 Block Storage for VPC 快照? |
| 删除簇后,块存储设备上仍会显示费用 | 为什么在删除集群后,我仍然看到块存储设备的费用? |
Object Storage
| 错误消息 | 故障排除主题 |
|---|---|
pvc:...:can't access bucket <bucket_name>: NotFound: Not Found |
为什么我的PVC无法访问现有的存储桶? |
Error: symlink ... helm-ibmc: file exists |
为什么安装对象存储 Helm 插件会失败? |
d--------- 1 root root 0 Jan 1 1970 <file_name> (非root用户无法访问文件) |
解决非root用户访问文件时的问题,位于 IBM Cloud |
EPERM: operation not permitted |
为什么我的应用 pod 会出现“Operation not permitted”错误而失败? |
chown: changing ownership of '<volume_mount_path>': Input/output error |
为什么无法更改挂载路径的所有者? |
Error: rendered manifest contains a resource that already exists. ... existing_kind: storageClass |
为什么安装 IBM Cloud Object Storage 插件会失败? |
Bad value for ibm.io/object-store-endpoint ... scheme is missing. |
为什么我在创建 PVC 时会看到错误的 s3fs 或 IAM API 端点? |
SignatureDoesNotMatch: The request signature we calculated does not match the signature you provided. |
为什么我在创建 PVC 时会看到“凭据错误”或“访问被拒绝”的提示? |
| Object Storage PVC 仍处于待处理状态 | 为什么我的PVC一直处于待处理状态? |
can't get credentials: can't get secret tsecret-key: secrets "secret-key" not found |
为什么由于找不到 Kubernetes 密钥,导致PVC或Pod的创建失败? |
Transport endpoint is not connected. |
为什么传输端点未连接? |
Error mounting volume: s3fs mount failed: s3fs: error while loading shared libraries: libfuse.so.2 |
为什么在使用 IBM Cloud Object Storage 插件时会出现卷挂载错误? |
| 使用 COS 集群附加组件时出现“传输端点未连接”错误 | 为什么在使用 IBM Cloud Object Storage 集群附加组件时会出现“传输端点未连接”的错误? |
Portworx 存储器
| 错误消息 | 故障排除主题 |
|---|---|
kp.Error: ... msg='Unauthorized: The user does not have access to the specified resource' |
为什么在 KMS 端点无效时加密会失败? |
Red Hat OpenShift on IBM Cloud 数据基础(ODF)
| 错误消息 | 故障排除主题 |
|---|---|
Failed to get StorageCluster","error":"no matches for kind "StorageCluster" in version "ocs.openshift.io/v1" |
为什么 openshift-storage 命名空间中没有列出任何Pod? |
ODF 舱体卡在 Pending |
为什么 OpenShift 数据基础架构的Pod会卡在 Pending 这个步骤? |
ODF 存储集群卡在 Progressing |
为什么我的 OpenShift Data Foundation存储集群的状态一直停留在“Progressing”? |
ceph-cluster-controller: failed to reconcile ... must be no more than 63 characters |
为什么我的 OpenShift Data Foundation存储集群的状态一直停留在“Failed to reconcile”? |
OpenShift 虚拟化
| 错误消息 | 故障排除主题 |
|---|---|
| OpenShift 虚拟化操作员安装失败 | 为什么 OpenShift 虚拟化操作员的安装会失败? |
| HyperConverged 资源部署失败 | 为什么 HyperConverged 资源的部署会失败? |
| VM 磁盘配置失败 | 为什么 VM 磁盘无法完成配置? |
PVCs仍处于 Pending 状态 |
为什么在 OpenShift 虚拟化中,持久卷请求会一直保留在 Pending 中? |
| OpenShift 虚拟化环境中的ODF安装失败 | 为什么在 OpenShift 虚拟化环境中安装 OpenShift 数据基础时会失败? |
| 虚拟机无法启动 | 为什么虚拟机无法启动? |
| 实时迁移失败 | 为什么虚拟机的在线迁移会失败? |
| 虚拟机无法访问网络 | 为什么虚拟机无法访问网络? |
| VNI连接失败 | 为什么 VNI 连接会失败? |
| Localnet 用户自定义网络无法正常工作 | 为什么“localnet”用户定义的网络无法正常工作? |
| 附加了 VNI 的虚拟机无法通信 | 为什么连接了 VNI 的虚拟机无法通信? |
| 虚拟机性能不佳 | 为什么虚拟机的性能较差? |
| 实时迁移速度较慢 | 为什么实时迁移速度很慢? |