安装 Red Hat OpenShift 人工智能插件

按照以下步骤将 OpenShift 人工智能插件安装到现有集群中。

想在新集群上部署 AI OpenShift 操作员吗? 尝试 在 IBM Cloud 可部署架构上使用 OpenShift 人工智能。

最低需求

在设置附加组件之前,请查看以下注意事项。

  • 查看 支持的群集附加组件版本,确定要在群集中安装的附加组件版本。
  • 您的群集必须至少有 2 个工作节点。 每个工作节点必须至少有 8vCPU 和 32GB 内存。
  • 您的工作节点必须使用 RHCOS 操作系统。
  • 您必须允许群集的出站流量,才能安装所需的操作员。

受支持的版本

查看支持的 OpenShift AI 附加组件版本和相应的 OpenShift AI 和版本。Red Hat OpenShift on IBM Cloud 版本。

支持的人工智能插件版本以及 Red Hat OpenShift 人工智能和 Red Hat OpenShift on IBM Cloud.
OpenShift 人工智能附加版 Red Hat OpenShift AI版本 支持的群集版本
420 3.4.2 420,421
419 3.4.0 4.19, 4.20, 4.21
418 2.25.6 4.18, 4.19
417 2.25.6 4.17, 4.18
416 2.25.6 4.16, 4.17

不支持从 418 版升级到 419 版。 只允许新安装 419 版本。 如需了解更多信息,请参阅 《关于 OpenShift AI 插件》

注意事项

  • 要使用 OpenShift AI 提供的所有功能,建议至少使用 1 个 GPU。
  • 您的集群可以混合使用 GPU 节点和非 GPU 节点。 不过,如果使用这种配置,请确保将应用程序部署在 GPU 节点上,以充分利用其资源。
  • 从 OpenShift AI Operator 的 2.19.0 版本开始,KServe 可选择高级模式或标准模式。 默认情况下,当您使用 OpenShift AI 并使用 IBM Cloud 附加组件安装 KServe 时,它是以标准模式安装的。 如果要使用高级模式,则必须在安装插件后完成 可选步骤

准备工作

安装附加组件前,请完成以下步骤。

  1. 请登录您的账户。 如果适用,请将相应的资源组设定为目标。 设置集群的上下文。

  2. 可选:如果还没有,请 创建一个 VPC Public Gateway

  3. 如果要在 OpenShift AI 附加组件中使用 OpenShift Pipelines、Node Feature Discovery 或 NVIDIA GPU 操作员,则必须在群集上启用 OperatorHub 并禁用出站流量保护。 如果您不想使用这些操作符,请跳过此步骤。

    1. 启用集群上的 OperatorHub。
    oc patch operatorhub cluster --type json -p '[{"op": "add", "path": "/spec/disableAllDefaultSources", "value": false}]'
    
    1. 禁用出站流量保护。

    禁用出站流量保护后,所有外部网络连接均被允许。 更多信息,请参阅 《VPC集群中的出站流量管理 》。

    ibmcloud oc vpc outbound-traffic-protection disable --cluster CLUSTER
    

先决条件

安装附加组件前,请完成以下步骤。

  1. 请登录您的账户。 如果适用,请将相应的资源组设定为目标。 设置集群的上下文。

  2. 可选:如果还没有,请 创建一个 VPC Public Gateway

  3. 如果要在 OpenShift AI 附加组件中使用 OpenShift Pipelines、Node Feature Discovery 或 NVIDIA GPU 操作员,则必须在群集上启用 OperatorHub 并禁用出站流量保护。 如果您不想使用这些操作符,请跳过此步骤。

    1. 启用集群上的 OperatorHub。
    oc patch operatorhub cluster --type json -p '[{"op": "add", "path": "/spec/disableAllDefaultSources", "value": false}]'
    
    1. 禁用出站流量保护。

    禁用出站流量保护后,所有外部网络连接均被允许。 更多信息,请参阅 《VPC集群中的出站流量管理 》。

    1. 在控制台中,导航至 群集页面并单击相关群集。
    2. 在群集的“概览”页面,找到“网络”部分,选择“已禁用出站流量保护”选项。

第一步:选择定制选项

您可以在安装附加组件时指定不同的选项来增强 Red Hat OpenShift 人工智能项目,例如用于构建可移植机器学习工作流的数据管道或用于管理和扩展资源的工具。 您还可以自定义升级策略和删除策略。 有关每个可用选项的说明,请参阅 OpenShift AI 自定义选项。 如果您在安装附加组件时未选择特定选项,则将应用默认值。 这些选项由 Red Hat OpenShift AI 平台管理。

在 CLI 中,运行命令列出所有选项。 在用户界面中,这些选项都列在安装过程中的“功能”部分。

ibmcloud oc cluster addon options --addon openshift-ai

步骤 2:审查推荐的其他操作员

您也可以选择安装其他推荐用于某些 OpenShift 人工智能功能的操作员。 如果您的仪表盘上还没有这些功能,您可以选择将其添加到附加安装中。 或者,您可以随时通过 OperatorHub 或按照操作员特定的安装步骤进行安装。 要使用这些操作符,您必须 禁用集群的出站流量保护

您负责管理这些操作员,包括但不限于更新、监控、恢复和重新安装。

建议使用以下运算符。

其中一些运营商可能会提供额外的定制选项,您可以在安装附加组件时选择指定这些选项。 查看 推荐运营商提供的定制服务 列表。

第三步:在CLI中安装附加组件

运行命令安装 Red Hat OpenShift 人工智能插件。 请通过 --parameter PARAM=VALUE 格式指定 定制内容。 例如,要添加数据科学管道选项,请发送电子邮件至 --parameter oaiDataSciencePipelines=Managed

要在使用 CLI 安装附加组件时包含推荐的运营商,请在运行安装命令时指定以下选项。

  • OpenShift 管道:--parameter pipelineEnabled=true
  • Node 发现功能:--parameter nfdEnabled=true
  • NVIDIA GPU运算:--parameter nvidiaEnabled=true

有关可用版本的列表,请参阅 支持的版本

安装命令。

ibmcloud oc cluster addon enable openshift-ai --cluster CLUSTER [-f] [--param PARAM] [-q] [--version VERSION]

示例命令用于安装插件,并启用自动次要更新和补丁更新、CodeFlare, 和 KServe。

ibmcloud oc cluster addon enable openshift-ai --cluster CLUSTER --param oaiInstallPlanApproval=Automatic --param oaiCodeflare=Managed --param oaiKserve=Managed

第 2 步:查看推荐的其他操作员

您也可以选择安装其他推荐用于某些 OpenShift 人工智能功能的操作员。 如果您的仪表盘上还没有这些功能,您可以选择将其添加到附加安装中。 或者,您可以随时通过 OperatorHub 或按照操作员特定的安装步骤进行安装。 要使用这些操作符,您必须 禁用集群的出站流量保护

您负责管理这些操作员,包括但不限于更新、监控、恢复和重新安装。

建议使用以下运算符。

其中一些运营商可能会提供额外的定制选项,您可以在安装附加组件时选择指定这些选项。 查看 推荐运营商提供的定制服务 列表。

第 3 步:在用户界面中安装附加组件

使用用户界面安装 Red Hat OpenShift 人工智能插件。

  1. 导航至 仪表板页面,点击相关仪表板。

  2. 在集群详情页面上,找到附加组件部分。 找到 Red Hat OpenShift 人工智能选项并点击安装

  3. “功能”部分,查看可用附加自定义选项的描述,并启用您希望随安装一起提供的选项。

  4. “其他推荐运营商”部分,点击展开每个运营商,然后选择您想要包含的自定义选项。 建议对某些 Red Hat OpenShift 人工智能功能进行额外的操作和自定义。 您可以选择稍后通过 OperatorHub 或按照操作员特定的安装步骤来安装这些选装件。

    您负责管理这些操作员,包括但不限于更新、监控、恢复和重新安装。

  5. 单击安装

第 4 步:访问 OpenShift AI 面板

安装 OpenShift AI 附加组件后,您可以访问 OpenShift AI 面板。

  1. 在集群概览页面中,单击 “OpenShift”Web 控制台
  2. 应用程序启动器 应用程序 启动器,选择 Red Hat OpenShift AI 面板选项。
  3. 如果出现提示,请单击 Log in with OpenShift

可选:在高级模式下设置 KServe

如果要在高级模式下使用 KServe,必须完成以下步骤。

  1. 从 OperatorHub 安装 OpenShift Serverless Operator。
  2. 从 OperatorHub 安装 OpenShift Service Mesh Operator。
  3. 在数据科学群集初始化 CR 中将服务网格管理状态设置为 Managed
    serviceMesh:
        controlPlane:
            metricsCollection: Istio
            name: data-science-smcp
            namespace: istio-system
        managementState: Managed
    
  4. 在数据科学集群自定义资源中将 KServe 服务管理状态设置为 Managed
    kserve:
        managementState: Managed
        serving:
          managementState: Managed
          name: knative-serving
    

OpenShift 人工智能定制选项

查看 OpenShift 人工智能插件的定制选项。 这些运营商由 Red Hat OpenShift AI 平台管理。

在通过命令行界面安装 AI 附加 OpenShift 组件时,若需包含某个选项,请在运行时使用 -option ibmcloud oc cluster addon enable openshift-ai`` --parameter PARAM=VALUE 格式添加该选项。 例如,要安装带有数据科学管道选项的附加组件,请指定 --parameter oaiDataSciencePipelines=Managed

在通过用户界面安装 AI 附加 OpenShift 组件 时,若需包含某个选项,请在系统提示时点击启用该选项。 这些选项包含在“功能”部分。

OpenShift AI附加定制选项和CLI参数。
定制 CLI 参数 描述 缺省值
OpenShift AI 平台次要版本和补丁更新的审批政策 oaiInstallPlanApproval 自动或手动应用次要更新和补丁更新。 AutomaticManual Automatic
OpenShift 人工智能删除政策 oaiDeletePolicy 如果卸载附加组件,请保留或删除附加组件安装的任何操作员或组件。 RetainDelete Retain
开放数据中心仪表板 oaiDashboard 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
ueue oaiKueue 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
CodeFlare oaiCodeflare 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
ModelMesh 服务 oaiModelmeshserving 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
工作台 oaiWorkbenches 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
数据科学流程 oaiDataSciencePipelines 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
KServe oaiKserve 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)
oaiRay 启用或禁用该组件。 如果启用,则由 OpenShift 人工智能平台管理。 Managed 使 能够禁用
Removed
Managed (已启用)

推荐的其他操作程序

查看 推荐的运营商 以及在安装过程中可以包含的可选自定义项。 您负责管理这些操作员,包括但不限于更新、监控、恢复和重新安装。

在通过命令行界面安装 OpenShift AI插件 时,若需包含针对操作员的自定义设置,请在运行 ibmcloud oc cluster addon enable openshift-ai 时使用以下 --parameter PARAM=VALUE 格式添加该选项: 例如,要为 NVIDIA 操作符包含 GPUDirect Storage NVIDIA 自定义设置,请指定 --parameter nvidiaGpuDirectStorageEnabled=true

在通过用户界面安装AI OpenShift 插件 时,若需为操作员添加自定义设置,请在系统提示时点击启用该选项。 请注意,存在其他具有默认设置 NVIDIA 的操作符,这些设置仅可通过命令行界面(CLI)或编辑配置文件进行修改 ClusterPolicy。

OpenShift 为其他操作员提供人工智能附加定制选项。 这些设置可在安装过程中通过 CLI 或用户界面进行更改。
定制 CLI 参数 描述 缺省设置
Node 功能发现删除政策 nfdDeletePolicy 如果删除了 OpenShift AI插件,请保留或删除运算符。 Retain (默认)或 Delete Retain
NVIDIA GPU 操作员删除政策 nvidiaDeletePolicy 如果删除了 OpenShift AI插件,请保留或删除运算符。 Retain (默认)或 Delete Retain
NVIDIA CUDA 安装后测试 nvidiaCudaTest 启用 NVIDIA CUDA测试。 true (已启用,默认值)
false (已禁用)
false (残障人士)
管道运营商删除政策 pipelineDeletePolicy 如果删除了 OpenShift AI插件,请保留或删除运算符。 Retain (默认)或 Delete

以下 NVIDIA GPU 运算符适用于默认设置。 只有使用 CLI 安装附加组件时,才能在安装过程中更改这些设置。 安装完成后,您可以在用户界面或 CLI 中通过编辑 ClusterPolicy.

OpenShift 为其他操作员提供人工智能附加定制选项。 这些设置只能在安装过程中通过 CLI 更改。
定制 CLI 参数 描述 CLI 值 用户界面默认设置
NVIDIA 沙盒工作负载 nvidiaSandboxWorkloads 启用沙箱工作负载所需的附加操作数管理。 true (已启用,默认)
false (已禁用)
Enabled
NVIDIA vGPU 经理 nvidiaVgpuManagerEnabled 启用 NVIDIA vGPU 经理。 true (已启用,默认值)
false (已禁用)
Enabled
NVIDIA GPUDirect存储 nvidiaGpuDirectStorageEnabled 启用GPUDirect存储。 true (已启用,默认值)
false (已禁用)
Enabled
NVIDIA Node 状态导出器 nvidiaNodeStatusExporterEnabled 启用“Node”状态导出功能。 true (已启用,默认值)
false (已禁用)
Enabled
NVIDIA 虚拟函数 I/O 管理器 nvidiaVfioManagerEnabled 启用 VFIO Manager 进行配置,以部署 VFIO-PCI。 true (已启用,默认值)
false (已禁用)
Enabled
NVIDIA 沙箱设备插件 nvidiaSandboxDevicePluginEnabled 启用 NVIDIA 沙盒设备插件。 true (已启用,默认值)
false (已禁用)
Enabled
英伟达多实例 GPU 管理器 nvidiaMigManagerEnabled 启用 NVIDIA 多实例 GPU 管理器。 true (已启用,默认值)
false (已禁用)
Enabled
NVIDIA 数据中心 GPU 管理器主机引擎部署 nvidiaDcgmEnabled 将 NVIDIA Data Center GPU Manager Hostengine 作为单独的 pod 进行部署。 true (已启用,默认值)
false (已禁用)
Enabled
NVIDIA vGPU 设备管理器 nvidiaVgpuDeviceManagerEnabled 启用 NVIDIA vGPU 设备管理器。 true (已启用,默认值)
false (已禁用)
Enabled

后续步骤?