版本说明 watsonx.data

使用这些发行说明可了解按日期分组的 IBM® watsonx.data 最新更新。

有关 watsonx.data as a Service on IBM Cloud 与 gen AI 体验的新内容,请参阅 watsonx.data as a Service on IBM Cloud 与 gen AI 体验的发布说明

有关 watsonx.data on-prem 的新功能,请参阅 watsonx.data 的发布说明

有关本地 watsonx.data Premium 部署版本的新功能,请 阅本地部署高级版的发布说明。

技术预览功能:我们还提供技术预览部分,其中包括目前正在预览的功能。 这些功能尚未普遍提供,在发布前可能会有所更改。 要查看技术预览项目的发布说明,请参阅 技术预览

2025年12月10日 - 版本 2.3

实例配置增强功能

本次版本更新 watsonx.data 引入了以下增强功能:

您现在可以在以下新区域创建启用了虚拟私有端点(VPE)的 watsonx.data 实例:达拉斯(us-south)、华盛顿特区(us-east)和法兰克福(eu-de)。 要在配置过程中启用VPE,请在CLI命令中添加 "vpe_required":"true" 参数。 有关如何配置启用 虚拟 私有端点 (VPE) 的实例的信息,请参阅配置启用虚拟私有端点 (VPE) 的实例。

数据源和存储增强

watsonx.data 这一版本引入了以下数据源和存储增强功能:

  • 现在,您可以将 IBM Knowledge Catalog 治理策略应用于数据源。MongoDB 更多信息,请参阅 连接到 IBM Knowledge Catalog(IKC)

  • 您现在可以使用 ServicePrincipal 身份验证将 Azure 数据 Gen2 湖存储关联到 Presto (C++)。

  • 现在,您可以将多个冰山类型的目录关联到单个对象存储桶或容器。 每个目录必须在存储设备上配置一个唯一且不重叠的基础路径,以确保数据隔离的有效性。

    例如:

    • Catalog1 可能与...相关 s3a://mybucket/foo/bar
    • Catalog2 可能与...相关 s3a://mybucket/lorem/ipsum

    此项增强功能使数据在同一存储空间内更易于逻辑分离,并可在多个目录间重复利用,从而提升灵活性与组织性。 此行为适用于所有新的精简版计划实例,这些实例现已设置为账户范围。 有关更多信息,请参阅 《向单个存储添加多个 Apache Iceberg 目录》

    此功能仅适用于 watsonx.data 精简版实例。 此前,每个对象存储桶或容器只能关联到单一目录。

发动机和服务改进

此版本的 watsonx.data 引入了以下引擎和服务增强功能:

  • Prestissimo在写入 Apache Iceberg 表格时的性能表现现已优于其他 Java 实现方案。 以下功能可用:

    • 分区表支持——Prestissimo可向分区Iceberg表写入数据,并通过批量评估高效应用分区转换。 它支持标识符、时间转换(年、月、日、时)、桶和截断操作,并生成符合Iceberg规范的分区目录路径。
    • 数据文件统计收集——在写入操作期间,Prestissimo会收集并向Iceberg清单文件报告关键数据文件统计信息,包括记录计数、文件大小及分区详情。
    • 排序表写入支持——Prestissimo支持将排序的Iceberg表写入存储,从而为受益于排序数据的工作负载提供优化的查询性能。
  • 企业版无服务器Spark,支持灵活容量配置

    按需容量

    • 在企业 watsonx.data 版方案中,Spark引擎支持无服务器模式,同时仍可灵活地根据需求分配专用容量。
    • 在无服务器平台上运行Spark作业,无需为每个Spark引擎配置专用节点。
    • 无服务器Spark环境提供共享节点池,最大资源配额为8个 vCPUs 节点,内存为32 GB。

    此行为适用于所有新 watsonx.data 实例,这些实例现已属于账户范围。

    专用容量

    • 对于需要更高容量的工作负载,您可以配置具有可定制内存配置的专用节点。 有关无服务器和按需容量的更多详细信息,请参阅《管理 Spark 容量》。
    • Spark引擎创建流程现已简化,仅需关注核心细节——引擎名称、Spark版本、主存储桶及关联目录——同时将容量预留任务移至引擎详情页的新增“容量管理”标签页。 本次更新移除了创建流程中的容量配置环节,使引擎设置更快、更简洁。
    • 创建引擎后,您可在“容量”选项卡下管理虚拟机规格、配置节点池并设置按需回退阈值。

    此行为适用于所有新 watsonx.data 实例,这些实例现已属于账户范围。

    企业版计划的最大资源配额为256个 vCPUs 实例和1024 GB内存。 要提高此限制,您必须联系 IBM 支持团队。

    有关无服务器和按需容量的更多详细信息,请参阅《 管理 Spark 容量 》。

精简版实例的账户级组件持久化

现在,您可以独立于单个实例保留账户级组件(如目录、数据库、存储桶及其元数据属性)。 当实例被删除时,这些组件仍可从同一账户和区域内的任何其他实例访问。 此行为适用于所有新的精简版计划实例,这些实例现已设置为账户范围。

在精简计划实例中跨冰山目录重复使用模式名称

此前,当使用三部分名称(<catalog>.<schema>.<table>)引用表时,模式名称必须在单个 watsonx.data 实例内的所有目录中保持唯一。 此限制阻止了在不同目录中创建同名模式。 对于冰山目录,此限制已被解除。 现在,您可以在多个Iceberg目录中重复使用模式名称。 例如:

  • myiceberg_catalog1.abcschema.mytable
  • myiceberg_catalog2.abcschema.mytable

此行为适用于所有新的精简版计划实例,这些实例现已设置为账户范围。

模式名称在其他目录类型( Hive 如Delta和Hudi)中仍需保持唯一性。

加强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • 管理员可以创建基于上下文的限制策略,并定义可信IP地址。 您现在可以配置受信任的IP地址,为指定用户启用对 watsonx.data (UI和API)的安全访问。 此功能通过确保仅允许来自批准IP地址的流量访问用户界面和API,从而增加了额外的保护层。 任何试图从定义范围外的IP地址 watsonx.data 访问的行为都将被阻止。 有关更多信息,请参阅 《使用基于IP的控制措施保障用户界面访问安全》

  • 一款全新的轻量级CPG现已作为可下载插件推出,可与任何策略引擎(例如Ranger Apache、IBM Knowledge Catalog Collibra等)实现无缝集成。 有关更多信息,请参阅 通用策略网关(CPG)连接器

账单改进

watsonx.data 这一版本对计费功能进行了以下改进:

  • 组件 watsonx.data 的计量现已在运行时级别运行,捕获与引擎关联的每个运行时的开始、停止和暂停事件。 它能清晰地展示引擎的消耗情况和资源使用状况。 对于引擎如 Presto,这仍是一对一映射,而 Spark 引入了多种运行时子类型(例如内核、HistoryServer, 应用程序),每种类型都会单独追踪其活跃时段和非活跃时段。 用户界面将通过显示运行时级别的活动栏和事件历史记录链接来反映这些变更,这些链接针对每个运行时进行范围限定,从而确保清晰度和精确性。 有关更多信息,请参阅 计量与使用体验。 此行为适用于所有新 watsonx.data 实例,这些实例现已属于账户范围。
精简版计划增强功能:

本次版本更新为精简版计划 watsonx.data 引入了以下增强功能:

通过移除对多种使用场景的支持,现已简化了轻量级 watsonx.data 方案的配置流程。 所有新实例均采用默认 Generative AI 用例进行配置。 数据工程和 Power BI 用例已弃用且不再可用。 命令行界面(CLI)配置方法现仅支持默认 Generative AI 使用场景,确保提供一致且简化的操作体验。

OpenTelemetry 增强

本次版本更新为( Java )引擎 watsonx.data 引入了以下增强 Presto 的可观测性和监控功能。

  • 您现在可以集成 Presto ( Java ) OpenTelemetry 引擎来监控查询执行和系统性能。 OpenTelemetry 支持捕获遥测数据(如跟踪信息和指标),这些数据可通过Instana、等工具进行 PrometheusGrafana 可视化分析。 更多信息,请参见 OpenTelemetry

  • 全新的 Grafana Instana和仪表板——您现在可以使用Instana Grafana 和仪表板监控性能,并全面掌握系统健康状况与运行表现。 有关更多详细信息,请参阅 支持仪表板

查询优化器增强功能

本次版本更新为查询优化watsonx.data 器引入了以下增强功能。

  • 查询优化器的默认查询重写超时现已支持配置。 从版本开始,您可以通过更新属性使用 2.3 PATCH API optplus.query-timeout-seconds 更改此超时值。 有关详细信息,请参阅 《 更新查询优化器的查询重写超时设置 》。

  • 支持在轻量级实例的查询Hive 优化器中注册和 watsonx.data 冰山元数据存储。

    查询优化器支持 Hive 和 Iceberg 目录的不同元存储类型。

    用户现在可以注册:

    • Hive 使用 watsonx-data-hive 元存储类型的目录。
    • 使用 iceberg-rest 元存储类型的冰山目录。

    这一增强功能可实现更细粒度的控制,并与不断发展的元存储架构兼容。 注册操作采用更新后的语法和属性,通过 REGISTER_EXT_METASTORE 过程完成。

    从本次发布开始,企业版将继续支持统一 watsonx-data 元数据存储类型的旧版功能,而精简版实例将不再提供该功能。 有关详细信息,请参阅 手动同步查询优化器和元存储

节省开销优先于 HTTP 协议支持(适用于 watsonx.data 精简方案)

元数据服务(MDS)现已 watsonx.data 通过HTTPS HTTP 协议运行Thrift服务,取代了之前的二进制协议。 此变更影响服务端点和连接配置。

主要变更:

  • MDS Thrift协议(thrift://)已更改为Thrift Over HTTP (https://)。
  • 所有通过 HTTPS 向 MDS Thrift 服务发起的 HTTP Thrift API 调用都必须使用 account_id SSL 加密。
  • 调用涉及Iceberg目录的API时,必须包含 catalog query参数。

对于Spark和内部引擎 Presto,这些更新将自动应用于 watsonx.data 新建和迁移的目录。 对于Spark、Db2 等外部引擎,用户必须手动更新连接设置以反映 Netezza 新的协议、端口和查询参数。

多租户元数据服务(MDS)增强功能

本次版本更新为MDS watsonx.data 引入了以下增强功能:

  • AccountId 现在要求所有直接调用MDS REST服务(包括Iceberg Catalog和Unity Catalog)都必须使用此参数。 未包含此标头的请求将失败。
  • 冰山操作的终点现已从 更新 /mds/iceberg/api/v1/iceberg

有关更多信息,请参阅 API 文档

CPDCTL CLI增强功能

本版 watsonx.data 对 IBM Cloud Pak for Data 命令行界面 ( IBM cpdctl) 进行了以下改进:

  • CPDCTL 中的,engine, ingestion, component, bucketservice 命令已启用向后兼容性。

从 CPDCTL 版本 1.8.85 开始,这些命令现可连接至早于版本的发布 watsonx.data 版本,确保跨环境的 2.2.1 集成与兼容性更顺畅。

  • 在命令 bucket 下新增的 wx-data bucket list-objects 选项会列出存储桶中添加的对象 watsonx.data。 有关在 bucket 中执行命令 watsonx.data 相关 bucket 操作的详细信息,请参阅 bucket。

  • 现已提供一个隐藏标志作为临时解决方案 --en-apikey ,用于处理 --api-key 标志在和 `sparkjob create` tablemaint 命令中验证失败的边界情况。 有关 更多信息,请参阅 cpdctl wx-data 命令用法和示例的附加信息。

基于通用人工智能的聊天界面 watsonx.data

现在您可以通过由生成式人工智能驱动的聊天界面与助手对话,watsonx.data 向其咨询相关问题 IBM® watsonx.data。 该助手根据其对 IBM 产品文档的了解,为您 watsonx.data 解答相关问题。 它有助于更轻松、更快速地探索和了解产品。 要启用该功能并开始使用,请参阅 watsonx.data 助手 - genAI 智能聊天界面

检索服务

本次版本更新 watsonx.data 引入了以下检索服务增强功能:

  • 您现在可以在控制 watsonx.data 台中为检索服务在实例级别配置 gpt-oss-120b AI 模型。 有关为检索服务配置 AI 模型的信息,请参阅《 为检索服务配置 AI 模型 》。
增强摄取

本次版本更新 watsonx.data 引入了以下数据摄取增强功能:

  • 在摄入界面的目标面板中新增了一个切换按钮,用于控制摄入的Iceberg格式表的删除模式,默认模式为写时复制(COW)。 切换至读取时合并模式可在数据摄取过程中启用行级删除功能。
不推荐的功能

以下功能在本版本中已弃用:

  • 用于用户身份验证 ibmlhtoken 的用户名 ibmlhapikey 和已被宣布从版本起弃 2.2.0 用,并标记为将被移除。 现在,该 2.3.0 支持已被完全移除。

要进行身份验证,您必须使用新格式:

ibmlhapikey_<username>

ibmlhtoken_<username>

有关更多信息,请参阅 《访问管理与治理》 watsonx.data

技术预览功能

对于此版本,技术预览版功能中还提供了其他更新和增强功能。 要查看此版本的技术预览更新,请参阅 技术预览 2.3

2025 年 11 月 13 日 - 版本 2.2.2 新功能 1 ( NF1 )

NF12.2.2watsonx.data 该版本将分阶段在不同地理区域发布,并非所有地区均可使用。 若需了解该 NF12.2.2 版本是否在您所在地区提供,请联系 IBM 支持团队。

技术预览功能
对于此版本,技术预览版功能中还提供了其他更新和增强功能。 要查看此版本的技术预览更新,请参阅 技术预览 2.2.2 NF1。
不推荐的功能
通过用户界面创建 watsonx.data Lite 实例时,高性能 BI数据工程用例已被弃用。 您仍然可以使用 CLI 在这些用例中创建 watsonx.data Lite 实例。 不过,这些用例将在 2.3.1 版本中从 CLI 中移除。

2025 年 10 月 31 日 - 版本 2.2.2

发动机和服务改进

此版本的 watsonx.data 引入了以下引擎和服务增强功能:

  • Milvus 中的 watsonx.data 现在支持以下外部存储类型,用于存储矢量数据、索引文件和二进制日志:Google Cloud Storage (GCS)、Azure Data Lake Storage (ADLS) Gen1 和 S3-compatible 存储类型。
  • Milvus 缩放功能现在对入门级 T 恤尺寸无效。 您不能再将 Milvus Starter T 恤的尺寸缩放到任何其他尺寸。 也不允许从更大的配置缩回到 Starter。
数据源和存储增强

watsonx.data 这一版本引入了以下数据源和存储增强功能:

  • 现在,您可以将 IBM Knowledge Catalog 治理策略应用到数据源,Teradata。 更多信息,请参阅 连接到 IBM Knowledge Catalog(IKC)
  • 现在,您可以创建处于活动状态的存储,而无需将其与目录关联。 这一改进消除了手动激活的需要。
  • 现在,您可以在拓扑视图中启用和禁用已启用 ACL 的存储上的 ACL 功能。 有关更多信息,请参阅 在启用 ACL 的存储上禁用或启用 ACL
  • 现在,您可以使用 GlusterFS, 这种可扩展的分布式文件系统作为 MinIO 的受支持存储后端。 有关更多信息,请参阅 使用 MinIO 设置 GlusterFS 复制存储
  • 现在,您可以使用自定义 S3 存储选项,在 watsonx.data 中配置任何与 S3 兼容的对象存储。 更多信息,请参阅 自定义 S3 存储
  • 您现在可以更新 Azure Data Lake Storage (ADLS) 和 Google Cloud Storage 的凭据。
  • 现在,您可以选择在实例控制台数据库或数据平台内的默认目录中保存以下数据源的连接详情:
    • IBM Db2
    • IBM Netezza
    • MySQL
    • Oracle
    • PostgreSQL
    • Snowflake
    • SQL Server
Delta Lake 目录现可使用 Spark 访问控制扩展功能

现在,您可以将 Delta Lake 目录与 Spark 访问控制扩展一起使用,从而增强 Spark 应用程序提交过程中的安全性。 该功能带来了额外的授权,确保只有授权用户才能通过 Spark 作业访问和操作 watsonx.data 目录。 有关详细信息,请参阅 使用 Spark 访问控制扩展增强 Spark 应用程序的提交

定制 Spark 应用程序有效载荷

在 watsonx.data 中提交 Spark 应用程序时,可以自定义应用程序有效载荷,使其包含以下功能:

  • 闲置密钥:确保即使在客户端与服务器通信失败的情况下,也只处理一次提交的应用程序。
  • 最大运行时间控制:定义 Spark 应用程序的最长执行时间。 如果未指定超时时间,作业将继续运行直至完成,无论耗时长短。

更多信息,请参阅 自定义 Spark 应用程序提交参数

共同政策网关(CPG)

通用策略网关 (CPG) 配置现在是可选的。 您可以创建 watsonx.data 实例,而无需自动配置 CPG,除非明确要求使用策略引擎。 有了这项功能,CPG 配置现在完全是可选和可逆的。 如果需要 Ranger 或 IKC 等客户策略引擎,可以稍后再配置 CPG。 有关更多信息,请参阅 启用或禁用常用策略网关引擎

CPDCTL CLI增强功能

本版 watsonx.data 对 IBM Cloud Pak for Data 命令行界面 ( IBM cpdctl) 进行了以下改进:

  • 使用新的 access-control 命令组管理 watsonx.data 实例中资源的访问策略,包括查看、更新和撤销用户和组的访问权限。 更多信息,请参阅 访问控制
数据管理器增强功能

用户现在可以创建带有自定义路径的模式,以更细粒度的方式查看和同步数据。 有了这项新功能,用户可以只同步特定目录(例如 /test1 或 /test1/schema1 ),以检索该路径下的表,而不是同步整个目录。 这种有针对性的同步功能提高了数据管理的性能和精度。

集成增强功能

IBM watsonx.data 现在通过与 Manta 集成,支持 Presto 的列级世系跟踪。 有了这一增强功能,用户现在可以探索详细的列依赖关系、关系和元数据变化,从而更深入地了解数据流并提高整个管道的可追溯性。

不推荐的功能

IBM 客户端软件包已被弃用,ibm-lh-client 软件包的安装和支持将从 watsonx.data 的 2.3.0 版本开始。 客户端软件包中的实用程序和命令由 IBM CPDCTL CLI 取代。 我们鼓励用户迁移并探索 CPDCTL。 有关如何使用 IBM CPDCTL CLI 的更多信息,请参阅 IBM cpdctl

使用以下可用工具实现客户端软件包的同等功能:

  • python-run / - 使用标准 环境开发和运行 Spark 脚本。dev-sandbox Python
  • presto-run / CLI - 使用官方 Presto Presto CLI 对 运行 SQL 查询。watsonx.data
  • cert-mgmt- 使用 JVM keytool 管理 证书。HTTPS

2025 年 9 月 23 日 - 版本 2.2.1 新增功能 (NFI)

NFI 版本的 watsonx.data 即 2.2.1 服务在 IBM Cloud 平台上的发布说明,包含生成式人工智能体验,详见 IBMwatsonx.data 即服务版本 2.2.1 新增功能介绍(NFI)

增强元数据服务
watsonx.data 中的元数据服务 (MDS) 现在支持通过 Iceberg 和 Unity REST 应用程序接口发布代用证书。 通过请求临时凭证,外部元数据消费者现在可以安全地访问对象存储中的数据,而无需管理长期访问密钥。

自动发行的凭据支持功能仅适用于存储服务 watsonx.data,例如 Amazon S3 Google Google Cloud Storage Cloud Storage (GCS) 和 Azure Azure Data Lake Storage (ADLS)。 要为 Amazon S3 存储启用托管凭证支持,元数据消费者在将 S3 组件注册到时,需要指定角色ARN(Amazon watsonx.data 资源名称)字段。 有关更多详细信息,请参阅 添加 Amazon S3 存储

2025 年 9 月 11 日 - 版本 2.2.1

发动机和服务改进

本版 watsonx.data 引入了以下引擎和服务增强功能:

  • 推出 watsonx.data API 的 v3 版本。 您可以继续使用 v2 版本,直到 watsonx.data 2.3 版本。 请参见 API 文档(v3 )。
  • 现在,您可以将 watsonx.data Spark 引擎的 Spark 运行时设置为 Spark 4.0,这样就可以在 Spark 4.0 上运行 Spark 应用程序。 有关支持的 Spark 版本的详细信息,请参阅 支持的 Spark 版本
  • watsonx.data 中的 Milvus 服务现已升级到 2.5.12 版本。
  • 现在,您可以在 watsonx.data 中使用开源的 Milvus 备份工具来备份和恢复 Milvus 中的数据。
  • watsonx.data 中的 Gluten 加速 Spark 引擎现在可以运行使用 Spark 版本 3.5 的应用程序。 有关支持的 Spark 版本的详细信息,请参阅 支持的 Spark 版本
  • 现在,您可以在 watsonx.data 中使用 Milvus 的矢量传输服务 (VTS),跨系统迁移或管理矢量数据。 更多详情,请参阅 使用矢量传输服务
查询优化器增强功能

现在,您可以通过优化器仪表板监控查询性能的改进。 优化器正在积极管理相关目录的查询计划,并提高 Presto (C++) 引擎的性能。 更多详情,请参阅 从优化器仪表板管理统计更新

加强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • watsonx.data 中 Milvus 服务的权限管理现在包括以下全局权限:

    • DescribeDatabase- 提供指定数据库的详细信息。

    • AlterDatabase- 修改现有数据库的属性。

有关在 Milvus 中管理用户访问权限的详细信息,请参阅 watsonx.data 中的预定义角色和权限

CPDCTL CLI增强功能

本版 watsonx.data 对 IBM Cloud Pak for Data 命令行界面 ( IBM cpdctl) 进行了以下改进:

  • 从 CPDCTL 1.8.25 版本开始,兼容性仅限于 watsonx.data 2.2.1 及以上版本。 这一变更是由于 v2 API 支持已被弃用,这是 v3 API 重大升级的一部分。 对于 CPDCTL 旧版本的用户,请参阅 CPDCTL 发行存档

    由于 API 规范的更新,某些命令可能已经更改。 使用 --help 选项 查看并适应最新的命令语法。

  • 从 watsonx.data 版本 2.2.1 开始,您可以通过 cpdctl 使用 HashiCorp Vault,以实现安全的机密管理和简化的自动化工作流。

  • service 命令 wx-data service generate-engine-dump 下的一个新选项允许您在 watsonx.data 中为 Presto 工作者和协调者节点生成转储。 有关 service 命令的详细信息,请参阅 watsonx.data 中与 可维护性 相关的操作。

  • 使用新的 component 命令可检索 watsonx.data 中各种组件的配置详情和状态。 有关 component 命令的详情,请参阅 wx-data 命令和用法,该命令用于获取 watsonx.data 中各种组件的配置详情。

  • 从 CPDCTL 版本 1.8.5 开始,用户不再需要将 instance ID 设置为环境变量。 此方法已弃用,将在未来的版本中移除。 取而代之的是直接使用 profile 命令设置 instance ID。 有关将 instance ID 设置为环境变量的详情,请参阅 配置命令和用法

数据源和存储增强

现在,您可以从数据平台导入以下数据源的目录和项目:

  • IBM Db2
  • IBM Netezza
  • MySQL
  • Oracle
  • PostgreSQL
  • Snowflake
  • SQL Server
丰富数据的语义自动化

watsonx.data 现在支持语义搜索功能,允许用户使用自然语言查询数据,使数据探索更加直观和高效。 有关语义搜索功能的详细信息,请参阅 watsonx.data 中执行语义搜索

公众预览增强功能

现在可从配置用户界面访问公开预览功能。 现在,您可以从“配置”用户界面轻松访问和管理 watsonx.data 公共预览版功能。 公开预览中的功能会以预览标签突出显示,便于识别。 您可以启用或禁用这些功能来探索其功能。 每个公开预览功能都包含一个指向其详细文档的链接,以便您了解更多相关信息。 有关公开预览版功能的更多详情,请参阅 watsonx.data (公开预览版)中的新 功能。

不推荐的功能

以下功能在本版本中已弃用:

  • watsonx.data API 版本 v2 现已废弃

watsonx.data 从版本 2.2.1 开始,API 版本 v2 已完全从 watsonx.data 开发人员版中删除。 在 2.3 版本中,它将从 watsonx.data 软件版本中完全删除。 您必须迁移到最新支持的 API 版本 ( v3 ),以确保持续的兼容性和对新功能的访问。

  • 在 watsonx.data 中注册外部 Spark 引擎的选项在本版本中已被弃用,并将在 2.3 版本中移除。watsonx.data 已包含可直接配置和使用的内置 Spark 引擎,包括 Gluten 加速 Spark 引擎(配置 Gluten 加速 Spark 引擎)和本地 watsonx.data Spark 引擎 (配置 Spark 引擎 )。

2025 年 8 月 05 日 - 版本 2.2.0 新功能 1 ( NF1 )

支持 BLOB 和 CLOB 数据类型

watsonx.data 中的 BLOB 和 CLOB 数据类型支持现已更新,以与 SQL 标准保持一致,Presto 作为联合查询引擎遵循 SQL 标准。

阅读支持: 可以从基于 JDBC 的联合系统中读取 BLOB 和 CLOB。 读取时,它们的映射关系如下:

  • 将 BLOB 转换为 VARBINARY
  • 将 CLOB 转换为 VARCHAR

写作支持: 还支持写入 BLOB 和 CLOB 数据,处理方式如下:

  • VARBINARY 表示二进制数据
  • 用于字符数据的 VARCHAR

创建表格支持: 创建新表时,不能使用 BLOB 或 CLOB 作为列类型。 在这种情况下,只支持 VARBINARY 和 VARCHAR。

发动机版本升级

Presto ( Java ) 和 Presto (C++) 引擎现已升级至 0.294 版本。

连接至 watsonx BI

现在,您可以将 watsonx.data 与 IBM watsonx BI 连接起来,直接访问不同数据源中的数据,使数据科学家和数据分析师更容易使用数据。 有关连接 watsonx BI 的信息,请参阅 与 watsonx BI 集成

精简计划增强

本版 watsonx.data 引入了以下精简版计划增强功能:

  • Lite 计划的无服务器 Spark 引擎:watsonx.data Lite 计划实例中的 Spark 引擎采用无服务器模式运行。 现在,您可以在服务器较少的平台上运行 Spark 作业,无需为每个 Spark 引擎配备专用节点。 无服务器 Spark 允许的最大资源配额限制为 8 vCPU×32 GB,用户可以访问共享节点池。 Spark 运行时间安排在数据平面的任何可用节点上,而不是专用节点上。 有关如何配置 Lite 计划实例并在其中创建 Spark 引擎的信息,请参阅 为 Lite 计划配置无服务器 Spark 引擎

  • Presto ( Java ) 引擎引入了新的精简版配置,为实验和早期开发目的提供了单节点部署设置。 Lite Presto ( Java ) 引擎仅适用于 watsonx.data Lite 计划实例。 更多信息,请参阅 配置 Presto(Java)引擎

增强摄取

本版 watsonx.data 包括以下摄入增强功能:

现在已接受.txt 文件格式的数据输入。 这一增强功能提高了灵活性,允许用户无缝上传纯文本文件以及现有的支持格式。

服务增强功能

现在,您可以使用两个设置来配置查询超时最大查询执行时间查询客户端超时。 有关更多信息,请参阅 watsonx.data 中的管理用户设置:会话超时、查询超时和登录消息设置

2025 年 7 月 11 日

watsonx.data 的新版本于 2025 年 7 月 11 日发布,并做了如下修改:

新区域可用性
watsonx.data AWS 上,现已在孟买地区提供。

2025 年 7 月 7 日 - 2.2.0 Hotfix 1 版本

2.2 热修复版 watsonx.data 于 2025 年 7 月 7 日发布。 此版本包括安全更新和修复。

2025 年 6 月 11 日 - 版本 2.2.0

发动机和服务改进

本版 watsonx.data 引入了以下引擎和服务增强功能:

  • 引入了新的 API 版本,可使用代理主机路由连接到 Milvus 服务。 更多信息,请参阅 连接到 Milvus 服务
  • 对于 Presto (C++)引擎,现在可通过区域配置启用 Hive 和 Iceberg 目录。 更多信息,请参阅 配置 Presto(C++)引擎
  • 新的 Gluten 加速 Spark 引擎:现在,您可以配置 Gluten 加速 Spark 引擎,并利用 Spark SQL 框架的高可扩展性和本地库的高性能来运行复杂的分析工作负载。 有关使用新的 Gluten 加速 Spark 引擎的信息,请参阅 使用 Gluten 加速 Spark 引擎
  • 使用 Spark 作业转换冰山表数据,运行更快的工作区查询:为了加快冰山表的读取速度,现在可以使用 Spark 作业将冰山表数据从“读取时合并(MOR)”格式转换为“写入时复制(COW)”格式。 更多信息,请参阅 提交 Spark 作业 MoR 至 CoW 转换
  • 您可以使用 Spark API 功能来配置可列出的应用程序限制以及用于筛选 Spark 应用程序的筛选条件。
CPDCTL CLI增强功能

本版 watsonx.data 对 IBM Cloud Pak for Data 命令行界面 ( IBM cpdctl) 进行了以下改进:

  • 您可以使用 tablemaint 命令在 watsonx.data 中执行不同的冰山表格维护操作。

  • 您可以使用 wx-data service 命令执行各种与服务性相关的操作,如列出表、检索启用 QHMM 的数据桶列表,以及监控与 QHMM 相关的统计数据和查询。

更多信息,请参阅 IBM cpdctl

集成增强功能

watsonx.data 这一版本增强了与其他服务的集成:

  • 新的交付方式:在 watsonx.data

使用支持的数据源的数据产品现在可以通过 watsonx.data 中的“作为表交付”方法交付到 watsonx.data 表的实例中。 这种方法允许拥有适当权限的用户创建新表或追加到现有表中。 如需了解更多信息,请参阅 与 Data Product Hub 集成

  • 新的交付方式:在 watsonx.data

现在,您可以使用 watsonx.data 中的访问交付方法,订阅从 watsonx.data 实例创建的数据产品。 这种方法可让消费者通过 Data Product Hub 直接访问 watsonx.data 资源。 交付后,消费者将看到有关如何访问 watsonx.data 实例以及他们可以访问的特定资源的详细信息。 如需了解更多信息,请参阅 与 Data Product Hub 集成

  • 现在,您可以通过以下方式连接到 Spark 查询服务器,并执行查询来分析数据。

    • 使用 DBeaver ( JDBC 客户端)
    • 使用 Java ( JDBC 客户端) 代码
    • 使用 Python ( PyHive JDBC 客户端)

    更多信息,请参阅 使用 Spark JDBC 驱动程序连接 Spark 查询服务器

账单改进

watsonx.data 这一版本对计费功能进行了以下改进:

  • 账单粒度:用户现在可以逐项查看账单,从而提高账单的精细度和透明度
  • 计费准确性:现在将按每分钟跟踪用户计费使用情况,取代以前的高水位法
查询历史监控和管理 (QHMM) 增强功能

本版 watsonx.data 引入了以下 QHMM 增强功能:

从快速启动向导设置中移除查询监控页面,并与配置水桶页面合并。 现在,您可以直接从快速启动向导中更新的“配置存储桶”页面启用、禁用和配置 QHMM 存储详情。 有关更新的快速启动向导设置的信息,请参阅 快速启动

数据源和存储增强

watsonx.data 这一版本包括以下存储增强功能:

现在,您可以通过新技术局域网管理器 (NTLM) 身份验证和 Microsoft Entra 身份验证使用 SQL Server。 NTLM 是一种基于 Windows 的“挑战-响应”身份验证方法。 更多信息,请参见 SQL Server.

现在,您可以创建以下默认处于活动状态的存储:

  • IBM Cloud Object Storage
  • Amazon S3
  • IBM Storage Ceph
  • MinIO
  • Google Cloud Storage
  • Azure Data Lake Storage
  • Apache Ozone
加强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • 您可以使用导出功能下载现有的资源策略,并将其导入到另一个所需的环境中。 这可确保一致性,有助于顺利迁移。 有关如何使用导入导出功能的信息,请参阅 管理用户访问
  • 目录管理员或属于具有管理员角色的组的用户现在可以删除他们对目录的访问权限。 有关如何删除组件用户的更多信息,请参阅 管理用户访问
  • 非管理员用户只有只读权限,现在可以查看“配置”部分中的“驱动程序管理器”页面。 这样,他们就可以查看活动司机列表及其详细信息,而无需咨询管理员。 更多信息,请参阅 驱动程序管理器
审计和跟踪功能增强

本版 watsonx.data 引入了以下审计和跟踪增强功能:

现在,可跟踪事件列表包括与 MDS Thrift 服务器和 MDS Rest 服务器相关的详细活动,可深入了解应用程序和用户如何与这些关键组件进行交互。 有关信息,请参阅 MDS Thrift 服务器事件MDS Rest 服务器事件

不推荐的功能

以下功能在本版本中已弃用:

  • 使用 REST 主机的 Milvus API(带有 /api/v1 前缀的 API)从 watsonx.data v2.2 起已被弃用。

  • Azure 数据湖存储 (ADLS) 现已弃用,并将在即将发布的版本中移除。Gen1 您必须过渡到 ADLS Gen2,因为 ADLS Gen1 不可用。

  • 使用 ibmlhapikey 和 ibmlhtoken 作为用户名的用户身份验证方法现已过时,将在今后的版本中删除。 您可以使用 ibmlhapikey_<username>ibmlhtoken_<username> 代替。 更多信息,请参阅 watsonx.data 中的访问管理和治理

2025 年 4 月 10 日 - 2.1.2 Hotfix 1 版本

发动机和服务改进

本版 watsonx.data 引入了以下服务增强功能:

推出 Tiny Milvus,这是 Milvus 向量数据库的轻量级单节点部署,专为实验和早期开发而量身定制。

Tiny Milvus 提供 Milvus 的核心体验,专为在 watsonx.ai 平台上使用而设计。 它是基于矢量的人工智能探索的切入点,所需资源最少,有助于确保有效的数据管理和分析。 它有别于 watsonx.data 中的其他 Milvus 配置,后者支持更广泛的可扩展性和企业级功能。

Tiny Milvus 支持多达 10K 载体,适合在没有繁重基础设施的情况下进行快速试验和早期实验。 它并非用于生产工作负载。

有关使用 Tiny Milvus 的更多信息,请参阅 设置 watsonx.data Milvus 矢量存储

2025 年 4 月 04 日 - 版本 2.1.2

数据源和存储增强

watsonx.data 这一版本包括以下存储增强功能:

现在您可以连接到 IBM Db2 for i 数据源。 有关 IBM Db2 for i 的信息,请参见 IBM Db2 for i.

连接性增强

watsonx.data 这一版本包括以下连接性增强功能:

现在,您可以使用虚拟专用端点安全、私密地连接到 watsonx.data 实例。 有关在 watsonx.data 中配置网络端点的信息,请参阅 设置虚拟专用端点

集成增强功能

watsonx.data 的此次发布引入了以下与其他服务的增强集成:

  • 现在,当您与 watsonx.data 集成时,可以为 Presto (C++) 引擎定义 IBM Knowledge Catalog 治理策略。 有关连接 IBM Knowledge Catalog (IKC) 的信息,请参阅 连接 IBM Knowledge Catalog(IKC )。
  • 现在,您可以根据 ODBC 驱动程序选择(Simba 或 CData),为目标 Presto 引擎导出配置文件,以便更轻松地与 watsonx.data 建立连接。 这一改进使您无需使用 PowerBI 手动配置 Presto 引擎的详细信息。 有关使用配置文件连接 Presto 的更多信息,请参阅 使用配置文件连接 Presto
  • 与 Data Product Hub 集成:您可以将 watsonx.data 与 DPH 集成,将 SQL 表和查询打包成针对特定用例定制的数据产品。 有关详细信息,请参阅 与 Data Product Hub 集成
增强摄取

本版 watsonx.data 包括以下摄入增强功能:

使用外部 Spark 引擎的摄取作业现在可在 watsonx.data 中提供日志。 这一增强功能可让用户直接在 watsonx.data 的云平台( SaaS 实例)上有效识别作业执行情况并排除故障。 有关摄取程序的详细信息,请参阅“通过网络控制台使用 Spark 摄入数据”。

发动机和服务改进

本版 watsonx.data 引入了以下引擎和服务增强功能:

现在,您可以使用 Azure Data Lake Storage Gen2,AccessKey Authmode with Spark engine,在提交 Spark 应用程序的同时存储数据。 有关 Azure Data Lake Storage Gen2 的信息,请参阅 Azure Data Lake Storage

查询工作区增强功能

本版 watsonx.data 引入了以下查询工作区增强功能:

现在您可以选择取消一个或多个正在运行的查询。 此外,在取消或成功完成查询后,还可以从工作表中删除查询,使工作区更加井然有序。 更多信息,请参阅 运行 SQL 查询

加强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • 管理员现在可以为 IBM Db2 和 IBM Netezza 配置访问权限。 他们可以为 watsonx.data 用户分配查看、编辑和管理 IBM Netezza 和 IBM Db2 引擎的角色。 有关资源级权限的信息,请参阅 (Db2 和 Netezza )。
  • 在创建和查看自己的模式时,管理员现在可以授予或撤销用户或角色的特定权限。 有关数据策略规则的信息,请参阅 管理数据策略规则
  • 之前被弃用的 DAS 代理流现已移除,在 watsonx.data 中不再可用。
查询历史监控和管理 (QHMM) 增强功能

本版 watsonx.data 引入了以下 QHMM 增强功能:

  • 现在,当您在 watsonx.data 中配置查询监控时,可以选择与 QHMM 目录相关联的 Presto 引擎。 有关配置 QHMM 的信息,请参阅 配置查询监控
  • 现在,您可以使用迁移脚本在 watsonx.data 中将 QHMM 数据从源数据桶传输到目标数据桶。 有关使用迁移脚本的更多信息,请参阅 QHMM Shell 脚本用法
CPDCTL CLI增强功能

本版 watsonx.data 对 IBM Cloud Pak for Data 命令行界面 ( IBM cpdctl) 进行了以下改进:

  • 从 2.1.2 版本开始,默认情况下可使用 wx-data 命令,这样就可以在 watsonx.data 中执行摄取、管理引擎等操作。
  • 您可以使用 wx-data engine createwx-data engine delete 命令配置和删除 watsonx.data 中的所有可用引擎。
  • 您可以使用 sparkjob 命令提交、列出和获取 Spark 应用程序的详细信息。
  • INSTANCE_ID 替换为。WX_DATA_INSTANCE_ID

更多信息,请参阅 IBM cpdctl

2025年2月28日 - 版本 2.1.1

新区域可用性

watsonx.data 现在多伦多地区提供精简版和企业版套餐。 要了解配置,请参阅 配置 watsonx.data 精简版计划配置 watsonx.data 企业版计划

数据源和存储增强

watsonx.data 的此次发布包括以下存储增强功能:

  • 现在,您可以测试以下数据源和存储的连接:

    • Apache Phoenix
    • IBM Data Virtualization Manager
    • BigQuery
    • Google Cloud Storage
  • 现在,您可以使用 注册表加载表元数据 API,在对象存储上注册并加载预先存在的Hudi和Delta表。

增强摄取

在完成数据提取工作后,您现在可以直接从 “数据提取历史”页面访问提取的数据,从而简化工作流程并节省时间。

集成增强功能

watsonx.data 的此次发布引入了以下与其他服务的增强集成:

  • “连接信息” 页面现在包括:
    • Presto DBT集成的配置详情。 您可以从本页复制DBT集成所需的 Presto 配置详细信息。
    • 可选择导出TDS文件,其中包含 Tableau 集成所需的 Presto 发动机配置详情。

有关详细信息,请参阅 获取连接信息

发动机和服务改进

此版本的 watsonx.data 引入了以下引擎和服务增强功能:

  • 现在,您可以在Spark引擎详情页面的 “应用程序”选项卡中创建Spark应用程序。 更多信息,请参阅 从控制台提交Spark应用程序
  • 现在,您可以使用 Spark 版本,3.5.4,在 watsonx.data 中运行应用程序。 watsonx.data、Apache Spark 3.4.4 和 Apache Spark 3.5.4 是支持的版本。
  • Milvus 允许以下操作:
    • 现在,您可以在 Milvus 中根据多个向量列进行混合 GroupBy 搜索,并在运行搜索查询时自定义组大小。 更多信息,请参阅 将 watsonx Assistant 连接到 watsonx.data Milvus 进行自定义搜索
    • Milvus 现在支持自定义大小,容量为30亿个向量,最多1,024个维度。
    • Milvus 现在可以在预先定义的T恤尺寸(小号、中号和大号)或自定义尺寸之间进行放大或缩小。 更多信息,请参阅 添加 Milvus 服务
  • 从 watsonx.data 2.1.1 版本开始,Milvus 2.5.0 版本得到支持。 更多信息,请参阅 Milvus
加强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • watsonx.data 中的访问管理服务(AMS)现在可以对来自 Presto 的请求使用JSON Web Token(JWT)认证,确保安全高效的访问控制。 更多信息,请参阅 通过 Presto CLI(远程)连接到 Presto 引擎
  • 现在,您可以将用户和角色批量分配给基础设施组件,每批20个。 有关更多信息,请参阅管理用户访问权
  • 现在,您可以使用 Apache Ranger Hadoop SQL策略来管理Spark引擎的数据。 当Spark引擎访问 Hadoop 集群中的数据时,您可以定义Ranger策略。 启用Ranger策略可确保可靠的数据安全性和管理。 使用 Ranger 策略,您可以配置表授权( L3 )、行级过滤和数据列掩码。 更多信息,请参阅 启用 Apache Ranger资源策略
CPDCTL CLI增强功能

IBM CPDCTL CLI 现在用于配置和管理 watsonx.data 中的不同操作。 使用 CPDCTL 命令行界面,您可以管理配置设置、运行采集任务、管理引擎、数据源和存储。 目前使用以下两个插件来执行这些操作:

  • config- 配置 watsonx.data 服务环境和用户。

  • wx-data- 在 watsonx.data 中执行其他操作,例如,引擎的摄取和管理等。 如需了解更多信息,请发送电子邮件至 IBM cpdctl

    watsonx.data 开发者版现已在 CPDCTL 版本 v1.6.104IBM 及更高版本中启用。

不推荐的功能

以下功能在本版本中已弃用:

  • 数据访问服务(DAS)代理功能现已弃用,并将在未来版本中移除。 您不能使用数据访问服务(DAS)代理功能访问对象存储( S3、ADLS和ABS)。 如果您在使用DAS代理流时遇到任何问题,请联系 IBM 支持。 如需了解DAS功能的概述,请参阅 数据访问服务(DAS )。

  • IBM 客户端包现已弃用,将在未来版本中移除。 客户端软件包中的实用程序和命令替换为 IBM CPDCTL CLI。 有关如何使用 IBM CPDCTL CLI 的更多信息,请参阅 IBM cpdctl

2025年2月4日 - 版本 2.1.0 补丁 2

精简计划增强
IBM® watsonx.data 悉尼地区现已推出精简版套餐。 有关在悉尼地区配置精简版计划实例的更多信息,请参阅 配置精简版计划

2025年1月10日 - 版本 2.1.0 补丁 1

企业计划提升
如果您使用 IBM Cloud 在悉尼地区配置企业计划实例,则必须使用计划名称 lakehouse-enterprise-mcsp。 更多信息,请参阅 通过CLI提供实例

2024 年 12 月 13 日 - 版本 2.1.0

数据源和存储增强

该版本包括以下新数据源和存储增强功能:

  • 现在您可以连接到 Apache Phoenix 数据源。 更多信息,请参阅 Apache Phoenix

  • 如果使用 MySQL 数据源,现在可以在“配置”页面的“驱动程序管理器”部分管理驱动程序。 每个驱动程序都要经过一系列验证步骤。 您不能再测试 MySQL 连接。 有关详细信息,请参阅 MySQL

当您升级到版本 2.1.0 时,任何现有的 MySQL 目录将不再与引擎关联。 这意味着您需要重新建立目录 MySQL 与引擎之间的连接。

  • 测试连接功能现在可用于 Arrow Flight service 支持的以下数据源:

    • Apache Derby
    • Salesforce
    • Greenplum
    • MariaDB
  • 现在,您可以测试 Azure Data Lake Storage (ADLS) 和 IBM Data Virtualization Manager for z/OS 数据源的连接。

集成增强功能

watsonx.data的这一版本引入了以下新的或增强的与其他服务的集成:

  • 现在您可以从“配置”页面启用 Databand 连接。 更多信息,请参阅 使用 Databand 监控 Spark 应用程序的运行

  • 现在,您可以从 watsonx.data 实例 > 配置 > 连接信息 页面获取 Presto 连接信息,进行以下集成:

    • 商业智能工具
    • DataBuildTool (dbt)
  • 从 watsonx.data 版本 2.1 开始,您只能与以下一种策略引擎集成:

    • Apache Ranger
    • IBM Knowledge Catalog (IKC)

更多信息,请参阅 连接信息

  • 现在,您可以将 IBM Manta Data Lineage 与 watsonx.data 集成,通过 Manta UI 从 Spark 捕捉并发布作业、运行和数据集事件。 有关详细信息,请参阅 IBM Manta Data Lineage

  • 现在,您可以通过 Presto 的 dbt 适配器使用所有 Presto 数据类型。 在 dbt_project.yml 中指定数据类型为 column_types。 更多信息,请参阅 安装和使用 dbt- watsonx-presto

发动机和服务改进

此版本的 watsonx.data 引入了以下引擎和服务增强功能:

使用 ibm-lh 实用程序查询历史信息

使用 ibm-lh 实用程序可以获得以下查询历史信息:

  • 基本查询信息
  • 查询失败的基本错误信息。
  • 查询统计信息。
  • 查询内存信息。
  • 查询垃圾回收信息。
  • 最高查询时间。
  • 查询的内存使用详情。
  • 连接两个表后的信息。
  • 包含表格所有列的信息。
  • 查询中的错误信息。
  • 所有错误代码的计数。
  • 所有故障信息的计数。
  • 所有故障类型的计数。

更多信息,请参阅 使用 ibm-lh 实用程序检索 QHMM 日志

加强摄入

此版本的 watsonx.data 引入了以下摄取增强功能:

  • 目标表预览:在提交摄取任务之前,用户现在可以预览目标表模式并编辑列标题和数据类型。 这样可以进行验证,确保数据被输入到正确的表结构中。 更多信息,请参阅 通过网络控制台使用 Spark 接收数据

  • Java 的表创建摄取:数据管理器现在包含一个选项,可使用导航到本地摄取的Java摄取流程创建表格,根据文件大小和其他因素提供灵活性和控制。 更多信息,请参见 创建表格通过网络控制台使用 Spark 接收数据

  • 增强源存储支持

    • Azure 数据湖存储 (ADLS):现已支持直接从 ADLS 采集数据。
    • Google Cloud Storage (GCS):现已支持直接从 GCS 采集数据。
  • 临时存储:用户现在可以选择外部存储桶作为本地摄取的暂存区。 如果未指定存储空间,watsonx.data 可以推断并选择一个合适的存储桶。 更多信息,请参阅 通过网络控制台使用 Spark 接收数据

元数据服务(MDS)简介

从 2.1 版开始,watsonx.data 将使用元数据服务(MDS)而非 Hive 元存储(HMS)。 MDS 与现代开放式目录 API、Unity Catalog API 和 Apache Iceberg REST Catalog API 兼容,可实现更广泛的工具集成并提高灵活性。 这种新架构性能相当,同时还能通过现有的 Thrift 或 HMS 接口继续支持 Spark 和 Presto 客户端。 更多信息,请参阅 元数据服务(MDS)概述

建议先在测试环境中使用 MDS,然后再在生产环境中使用。

不推荐的功能

以下功能在本版本中被弃用:

  • 通过事件监听器在 watsonx.data 中捕获 DDL 变更的 REST API 功能将从 watsonx.data 发布版本 2.1 开始弃用。

2024 年 11 月 13 日 -2.0.4版修复程序

精简版计划改进

此热修复版本包括以下精简版计划增强功能:

  • 精简版计划现在包括一个与Presto引擎相关联的专用只读样本IBMCOS 存储,以支持查询样本和基准数据。

  • 现在,您可以使用 tpcds 示例工作表来处理高性能用例,使用 Gosales 示例工作表来处理数据工程和GenAI用例。

  • 查询优化器现在已为高性能 BI 用例自动启用。

2024 年 10 月 29 日 - 版本2.0.4

发动机和服务改进

该版本包括以下引擎和服务增强功能:

  • PrestoJava) 和Presto(C++) Worker 的 "task.max-drivers-per-task 属性默认值现在根据vCPUs 数量设置。

  • 您可以在查询监控页面的查询历史记录监控和管理 (QHMM) 中启用文件剪枝功能。 您还可以配置 QHMM 存储桶的最大大小和阈值百分比。 当文件上传或清理调度程序运行(默认每 24 小时一次)期间达到阈值时,旧数据将被删除。 更多信息,请参阅 配置查询监控

  • 查询历史记录监控和管理 (QHMM) 不再将诊断数据存储在默认的IBM管理试用桶(wxd-system)中。要存储诊断数据,现在必须使用 QHMM 支持的存储类型。 有关使用自有存储的更多信息,请参阅 配置查询监控

  • 现在,您可以通过检查 JSON 文件中的 "wxdQueryOptimized 参数来验证查询优化状态。 更多信息,请参阅 从Presto(C++)CLI 或查询工作区运行查询

增强数据源

该版本包括以下数据源和存储增强功能:

  • 测试连接功能现在可用于以下数据源:

    • Apache Pinot
    • Cassandra
    • Prometheus
  • 新数据源 SAP HANA 现在可用。 您可以使用“配置”页面下的“驱动程序管理器”来管理 SAP HANA 数据源的驱动程序。 每个驱动程序都要经过一系列验证。

Lite 套餐

为提高可用性,精简版计划用户现在可以隐藏系统目录(cmx 和系统)。 使用Presto(C++) 引擎的精简版计划实例包括作为基准目录的 "tpch,而使用PrestoJava) 引擎的实例包括作为基准目录的 "tpch 和 "tpcds

不推荐的功能

以下功能在本版本中已弃用:

  • 通过事件监听器捕获watsonx.data中 DDL 变更的 REST API 功能在此版本中被弃用,并将随2.1版发布从watsonx.data中移除。

  • 已不再支持Apache Spark 3.3运行时。 您必须升级到 Spark3.4。 要更新Apache Spark版本,请参阅 编辑 Spark 引擎详细信息

2024 年 9 月 25 日 - 版本 2.0.3

数据源和存储增强

该版本包括以下新数据源和存储增强功能:

  • 现在,您可以为 Milvus 启用 Azure Data Lake Storage Gen1 Blob 和 Google Cloud Storage。 有关详细信息,请参阅 ADLS Gen1 BlobGoogle Cloud Storage

  • 您可以为引擎创建或添加新的数据源,而无需为其附加目录。 目录可在稍后阶段附加到数据源。

  • 现在,您可以使用 Apache Ozone 存储 Presto ( Java ) 引擎。 更多信息,请参见 Apache Ozone.

  • 现在,您可以配置 Apache Kafka 数据源使用加盐挑战响应身份验证机制 (SCRAM) 身份验证机制。 您可以上传自签名证书。 有关详细信息,请参阅 Apache Kafka

集成增强功能

watsonx.data的这一版本引入了以下新的或增强的与其他服务的集成:

  • 现在,您可以将 watsonx.data 与 Spark 引擎的数据构建工具 (dbt) 集成,以便在 watsonx.data 中进行就地数据转换。 有关详细信息,请参阅 关于 dbt 集成

  • 您可以将 watsonx.data 与 Databand 整合。 这种集成可以提供超越 Spark UI 和 Spark History 的洞察力,从而增强监控功能。 有关详细信息,请参阅 使用 Databand 监控 Spark 应用程序的运行

  • 您可以将watsonx.data与以下Business Intelligence(BI)可视化工具集成,以访问连接的数据源,并构建引人注目的交互式数据可视化:

    • Tableau
    • Looker
    • 多摩
    • Qlik
    • PowerBI

    有关详细信息,请参阅 关于 BI 可视化工具

发动机和服务改进

此版本的 watsonx.data 引入了以下引擎和服务增强功能:

  • 查询优化器支持冰山表格。 有关详细信息,请参阅 查询优化器

  • 现在,您可以使用数据构建工具 (dbt-watsonx-presto) 适配器为 Presto (Java) 引擎构建、测试和记录数据模型。 有关详细信息,请参阅 dbt-watsonx-presto

  • Presto (C++) 引擎新增了一个自定义属性(file-column-names-read-as-lower-case),以避免列名中的大小写字母不匹配。 有关详细信息,请参阅 Presto(C++) 的目录属性。

加强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • 现在,您可以添加用户和用户组来定义数据策略规则。 有关详细信息,请参阅 数据政策

  • 管理员现在可以选择 TPCDS 和 TPCH 目录来创建访问控制策略。 选择 "是使用这些目录定义规则的唯一允许操作。 要定义数据策略,请参阅 数据策略

  • 管理员现在可以在创建资源组后编辑资源组配置。 有关更多信息,请参阅 配置 Presto 资源组

IBM Knowledge Catalog数据源治理政策

现在,您可以将 IBM Knowledge Catalog 治理策略应用到 Presto 中的以下数据源:

  • Oracle
  • PostgreSQL
  • MySQL
  • SQL Server
  • Db2
加强摄入

watsonx.data的这一版本包括对摄取工作流程的以下改进:

Lite 套餐

您可以根据以下三种使用情况配置精简版计划实例。 从列表中选择一个用例继续:

  • 生成式人工智能:您可以使用此选项探索生成式人工智能用例。 配置的实例包括 Presto、Milvus 和 Spark。
  • 高性能商业智能:您可以使用该选项探索商业智能可视化功能。 配置的实例包括 Presto (C++) 和 Spark。
  • 数据工程工作负载:您可以使用数据工程工作负载来探索各种工作负载驱动的用例。 配置的实例包括 Presto (Java) 和 Spark。

有关详细信息,请参阅 精简版计划

2024 年 8 月 27 日 - 版本 2.0.2

数据源和存储增强

该版本包括以下新数据源和存储增强功能:

  • 内容感知存储(CAS)现在称为数据访问服务(DAS)。

  • Apache Hive 已升级到 4.0.0 版本。

  • 现在,您可以从 Storage details 页面查看 DAS 端点。 有关详细信息,请参阅 探索存储对象

集成增强功能

watsonx.data的这一版本引入了以下新的或增强的与其他服务的集成:

  • 现在,您可以在 watsonx.data 平台内的 SQL 视图中使用 IBM Knowledge Catalog的治理功能。 有关详细信息,请参阅 与 IBM Knowledge Catalog(IKC) 集成。

  • IBM watsonx.data 现在支持 Apache Ranger 策略,以便使用 Presto (C++) 引擎管理数据。 有关详细信息,请参阅For more information, see Apache护林员政策

增强发动机和服务

此版本的 watsonx.data 引入了以下引擎和服务增强功能:

  • 实例管理员现在可以在 Presto 中配置资源组。 有关详细信息,请参阅 资源组

  • 现在,您可以使用应用程序接口来执行查询和检索结果。 有关详细信息,请参阅 API

  • 现在,您可以通过 API 自定义配置或更改 Presto (Java) 的日志级别。 更多信息,请参阅 API

  • 现在,您可以使用 Iceberg Spark Analyze 程序生成“不同值个数”(NDV)列统计数据,以增强 Spark 基于成本的优化器(CBO),从而改进查询规划。

  • 现在,您可以使用自定义数据源选项连接到Presto(Java)引擎的黑洞和本地文件连接器。 有关详细信息,请参阅 自定义数据源

  • 现在,您可以为 Presto 引擎和 Milvus 服务生成 JSON 代码段。 您可以将其复制/粘贴到 watsonx.data 中。IBM Cloud Pak for Data 和 watsonx 中的 Presto 和 Milvus 连接器用户界面,以简化连接创建。 有关详细信息,请参阅 获取连接信息

增强访问管理

watsonx.data 的这一版本引入了以下访问管理增强功能:

  • 现在,您可以控制对 Presto (C++) 引擎的访问。 有关更多信息,请参阅 Engine(Presto(Java)或 Presto(C++))

  • 现在,您可以批量授予用户和用户组组件访问权限。 有关更多信息,请参阅管理用户访问权

  • 现在,您可以在 Presto 中获得包含 DEBUG 信息的系统访问控制 (SAC) 插件日志。 有关详细信息,请参阅 API 自定义

加强摄入

此版本的 watsonx.data 引入了以下摄取增强功能:

2024 年 8 月 01 日 - 版本 2.0.1

数据源

  • 现在,您可以使用 IBM API 密钥作为身份验证机制,连接到 Db2 数据源。 有关详细信息,请参阅 IBM Db2
  • Presto (C++) 引擎现在可以与 数据源关联。Arrow Flight service 支持只读操作。 支持以下 Arrow Flight service 数据源:
    • Salesforce
    • MariaDB
    • Greenplum
    • Apache Derby

更多信息,请参见 Arrow Flight service.

  • 以下新数据库适用于 Presto (Java) 引擎:

集成

  • 在将 IBM Knowledge Catalog与 IBM watsonx.data 集成时,您可以为表中的单个行配置数据保护规则,允许用户访问表中行的子集。 有关更多信息,请参阅 过滤行

  • 现在,您可以为 Presto (Java) 引擎应用以下 Apache Ranger 策略:

    • 行级过滤:用户可以访问表中的行子集。 有关更多信息,请参阅 添加行级筛选策略
    • 列屏蔽:限制用户查看屏蔽值,而不是显示敏感数据。 有关更多信息,请参阅 添加列屏蔽策略
  • 您现在可以将 IBM watsonx.data 与内部部署的 IBM DataStage 集成。 您可以使用 DataStage 服务从 IBM watsonx.data 加载和读取数据。 有关详细信息,请参阅 与 DataStage

认证和授权

  • Spark 访问控制扩展允许额外的授权,从而提高了提交申请时的安全性。 如果在 spark 配置中启用扩展,则只允许授权用户通过 Spark 作业访问和操作 IBM watsonx.data 目录。 有关详细信息,请参阅 使用 Spark 访问控制扩展增强 Spark 应用程序的提交

  • IBM watsonx.data 现在支持 Azure Data Lake Storage 和 Azure Blob Storage 的对象存储代理和签名。 有关详细信息,请参阅 使用 DAS 代理访问 ADLS 和 ABS 兼容存储桶

  • 现在为 Teradata 和 Db2 数据源提供轻量级目录访问协议 (LDAP)。 用户需要在服务器级别设置该配置。 对于 Teradata,请在用户界面中明确选择身份验证机制类型为 LDAP。 有关详细信息,请参见 Teradata

DAS代理用于访问ADLS和ABS存储桶以及LDAP增强功能,在版本中处于技术 2.0.1 预览阶段。

  • Milvus 现在支持用户分区级隔离。 管理员可授权用户在分区上执行特定操作。 更多信息,请参阅 服务( Milvus )

存储器

  • 现在,您可以在 IBM watsonx.data 中的 Presto (Java) 引擎中添加以下存储:
    • Azure 数据湖存储 Gen2
    • Azure 数据湖存储 Gen1 Blob

有关详细信息,请参阅 Azure Data Lake Storage Gen2Azure Data Lake Storage Gen1 Blob

  • 您可以修改用户注册的存储桶的访问密钥和秘密密钥。 此功能不适用于默认存储桶、ADLS 或 Google Cloud Storage。 只有当新凭证成功通过测试连接时,才能使用此功能。

引擎

  • 现在,您可以对 MongoDB 数据源使用 ALTER TABLE ADD、DROP 和 RENAME 列语句。
  • 现在,您可以配置 Presto 如何处理不支持的数据类型。 有关更多信息,请参阅 ignore-unsupported-datatypes

目录

  • 现在可以通过用户界面在基础架构管理器页面的“管理关联”下将目录批量关联到引擎或解除关联。

应用程序接口定制和属性

基础架构管理器

  • 您可以在基础设施管理器页面上使用搜索功能搜索以下值:
    • 数据库名称
    • 注册主机名
    • 由用户名创建
  • 现在您可以使用铃铛图标下通知部分的“请勿打扰”切换开关来启用或禁用弹出式通知。
  • 您可以在“配置”页面的“连接信息”磁贴下找到连接信息。 这些信息可以复制并下载到 JSON 片段中。

查询工作区

  • 从新的下拉列表中选择所需的目录和模式,就可以通过 SQL 查询工作区对模式下的所有表运行查询,而无需指定路径 <catalog>.<schema>。 有关更多信息,请参阅 运行 SQL 查询

watsonx.data 定价方案

  • 现在,您可以在达到 2000 个资源单位的账户上限之前删除现有的精简版计划实例,然后创建一个新实例,并消耗账户中可用的剩余资源单位。 有关详细信息,请参阅 watsonx.data 简化计划

2024 年 7 月 3 日 - 版本2.0.0

数据源的新数据类型

以下新数据类型现在可用于某些数据源。 您可以在数据管理器页面下的添加列选项。

  • BLOB

    • Db2
    • Teradata
    • Oracle
    • MySQL
    • SingleStore
  • CLOB

    • Db2
    • Teradata
    • Oracle
  • BINARY

    • SQL Server
    • MySQL

由于不支持数字数据类型watsonx.data,您可以使用十进制数据类型作为数字数据类型的等效替代Netezza数据源。

现在,您可以在查询工作区中使用 BLOB 和 CLOB 数据类型和 SELECT 语句来构建和运行针对数据的查询,以Oracle和SingleStore数据源。

您现在可以使用 BLOB 和 CLOB 数据类型MySQL和PostgreSQL数据源等同于 LONGTEXT、BYTEA 和 TEXT,因为这些数据类型与Presto(Java )。 这些数据类型映射到 CLOB 和 BLOBPresto(Java ) 如果数据源中存在具有 LONGTEXT、TEXT 和 BYTEA 数据类型的表。

  • MySQL (CLOB 相当于 LONGTEXT)
  • PostgreSQL (CLOB 相当于 TEXT)
  • PostgreSQL (BLOB 相当于 BYTEA)
  • Netezza(十进制相当于数字)
  • Oracle(BLOB 和 CLOB 与 SELECT 语句)
  • SingleStore(BLOB 和 CLOB 与 SELECT 语句)

数据源 Db2 的新操作

您可以对 BLOB 和 CLOB 数据类型执行以下操作Db2数据源:

  • 插入
  • 创建
  • 加拿大癌症援助协会
  • ALTER
  • 放置

基于 Arrow Flight service 新数据源

现在,您可以通过 Arrow Flight service 使用以下数据源:

  • Greenplum
  • Salesforce
  • MariaDB
  • Apache Derby

更多信息,请参见 Arrow Flight service.

新数据源

您现在可以使用以下数据源:

  • Cassandra
  • BigQuery
  • ClickHouse
  • Apache Pinot

有关详细信息,请参阅For more information, see 添加数据库目录对

检索摄取历史记录的命令

现在,您可以使用 ibm-lh get-status 检索提交的所有提取作业的状态--all-jobsCLI 命令。 您可以检索所有已提交的摄取作业的状态。 您将获得有权访问的历史记录。 有关详细信息,请参阅For more information, see ibm-lh 工具支持的选项和参数

(IKC) IBM Knowledge Catalog 授权 S2S 的附加角色

除了数据访问之外,IBM Knowledge CatalogS2S授权需要元数据访问和控制台 API 访问来集成watsonx.data。 为IKC服务访问配置创建了以下新角色:

  • 查看者
  • Metastore 查看器

Apache 护林员政策

IBMwatsonx.data现在支持ApacheRanger 政策允许整合Presto引擎。 有关详细信息,请参阅For more information, see Apache护林员政策

版本升级

  • Presto(Java ) 引擎现已升级至版本0.286。
  • Milvus 服务现已升级到 2.4.0 版本。 重要特征包括:
    • 更好的性能(低内存利用率)
    • 支持稀疏数据
    • 内置 SPLADE 引擎,用于稀疏向量嵌入
    • 大肠杆菌M3混合(密集+稀疏)搜索

Hive Metastore (HMS) 访问 watsonx.data

您现在可以获取以下元数据信息Hive通过使用 REST API 来获取 Metastore 信息,而不是从引擎详细信息中获取信息。 外部实体使用 HMS 详细信息来集成watsonx.data。 您必须具有管理员、Metastore 管理员或 Metastore 查看者角色才能运行 API。

用于数据丰富的语义自动化

数据丰富的语义自动化利用生成式人工智能IBM Knowledge Catalog更深入地了解您的数据,并通过自动丰富来增强数据,使其具有分析价值。 语义层集成仅供精简版计划用户使用,为期 30 天。 有关详细信息,请参阅For more information, see 语义自动化用于数据丰富watsonx.data

查询优化器可提高查询性能

您现在可以使用查询优化器来提高由Presto(C++)引擎。 如果查询优化器确定优化可行,则查询将进行重写;否则,本机引擎优化优先。 有关详细信息,请参阅For more information, see 查询优化器概述

引擎 Presto 的新名称 watsonx.data

Presto重命名为Presto(Java )。

新引擎( Presto C++)在 watsonx.data

您可以配置Presto(C++)引擎(版本0.286 ) 在watsonx.data在数据源上运行 SQL 查询并获取查询的数据。 有关详细信息,请参阅For more information, seePresto(C++)概述。

使用代理访问 S3 兼容 S3 存储桶

外部应用程序和查询引擎可以访问S3和S3兼容存储桶由watsonx.data通过S3代理人。 有关详细信息,请参阅For more information, see 使用S3代理访问S3和S3兼容存储桶

混合大小写功能标志,用于 Presto ( Java ) 引擎

混合大小写功能标志,允许在区分大小写和不区分大小写的行为之间切换Presto(Java ) 可用。 该标志默认设置为 OFF,可以在部署期间设置为 ONwatsonx.data。 有关详细信息,请参阅 Presto(Java)混合大小写支持概述

新型存储类型 Google Cloud Storage

您现在可以使用新的存储类型Google Cloud Storage。 有关详细信息,请参阅For more information, see 添加存储目录对

2024 年 5 月 31 日-V 1.1.5

在 watsonx.data 精简版计划中提供 Spark 引擎

现在,您可以在 watsonx.data Lite 套餐实例中添加小型 Spark 引擎 (单节点)。 有关详细信息,请参阅 watsonx.data 简化计划

与 Spark 实验室相关的更新

  • 从 Spark 实验室使用 Jupyter Notebook

: 现在,您可以在 Spark 实验室中从 VS Code Marketplace 安装 Jupyter 扩展,并使用 Jupyter 笔记本工作。 有关更多信息,请参阅 创建 Jupyter 笔记本

  • 从 Spark 实验室访问 Spark Spark UI

现在,您可以从 Spark labs 访问 Spark 用户界面(UI),监控 Spark 应用程序运行的各个方面。 有关详细信息,请参阅 从 Spark 实验室访问 Spark UI

为 IBM Cloud 实例配置新区域

现在,您可以在悉尼区域供应 IBM Cloud 实例。

2024 年 4 月 30 日-V 1.1.4

新版本的 watsonx.data 已于 2024 年 4 月发布。

此发行版包含以下功能和更新:

Kerberos 连接 HDFS 的身份验证

现在,您可以对安全 Apache Hadoop Distributed File System (HDFS) 连接启用 Kerberos 认证。 有关更多信息,请参阅 HDFS

新数据源

现在提供了以下新数据源:

  • Oracle
  • Amazon Redshift
  • Informix
  • Prometheus

有关更多信息,请参阅 数据源

测试 SSL 连接

现在,您可以测试 MongoDB 和 SingleStore 数据源的 SSL 连接。

上传数据源 Apache Kafka 的描述文件

Apache Kafka 数据源将数据存储为生产者和使用者必须解释的字节消息。 要查询此数据,使用者必须首先将其映射到列中。 现在,您可以上载将原始数据转换为表格式的主题描述文件。 每个文件都必须是包含表定义的 JSON 文件。 要从 UI 上载这些 JSON 文件,请转至您注册的 Apache Kafka 数据库的概述页面,然后选择 添加主题 选项。 有关更多信息,请参阅 Apache Kafka

许可证方案 watsonx.data

IBM® watsonx.data 现在提供以下许可计划。

  • Lite 套餐
  • 企业套餐

有关不同许可证套餐的更多信息,请参阅 IBM® watsonx.data 定价套餐

Presto ( Java )引擎版本升级

这Presto(Java ) 引擎现已升级至版本0.285.1。

暂停或继续 Milvus

您现在可以暂停或恢复 Milvus 服务。 暂停服务可避免产生费用。

Spark 现在可用作本机引擎

除了注册外部 Spark 引擎外,您现在还可以在 IBM watsonx.data 实例上供应本机 Spark 引擎。 通过本机 Spark 引擎,您可以使用 watsonx.data UI 和 REST API 端点来完全管理 Spark 引擎配置,管理对 Spark 引擎的访问以及查看应用程序。 有关更多信息,请参阅 供应本机 Spark 引擎

使用本机 Spark Engine 采集数据

现在,您可以使用本机 Spark 引擎提交采集作业。 更多信息,请参阅 使用不同的表格格式

2024 年 3 月 27 日-V 1.1.3

新版于2024 watsonx.data 年3月发布。

此发行版包含以下功能和更新:

某些数据源的新数据类型

现在,可以将 BINARY 数据类型与“查询”工作空间中的 SELECT 语句配合使用,以针对以下数据源构建和运行针对数据的查询:

  • Elasticsearch
  • SQL Server
  • MySQL

新数据类型:BLOB和CLOB可用于 MySQL, PostgreSQL, Snowflake、SQL Server 和 Db2 数据源。 只能将这些数据类型与“查询”工作空间中的 SELECT 语句配合使用,以针对数据构建和运行查询。

使用 Iceberg 数据源的 DELETE FROM 功能删除数据

现在,您可以使用 DELETE FROM 功能从 Iceberg 数据源中的表中删除数据。

您可以使用“写入时复制”方式或“读取时合并”方式 (缺省值) 为新表指定表属性删除方式。

针对 Iceberg 数据源的 ALTER VIEW 语句

现在,可以在“查询”工作空间中使用以下 SQL 语句来针对 ALTER VIEW 的数据构建和运行查询:

ALTER VIEW 名称 RENAME TO new_name

为 Netezza Performance Server 数据源上传 SSL 证书

现在,您可以在 Netezza Performance Server 数据源中浏览和上载 SSL 证书以用于 SSL 连接。 SSL 证书的有效文件格式为 .pem,.crt 和 .cer。 您可以使用基础结构管理器中的“添加数据库/目录”对选项来上载 SSL 证书。

查询数据来自 Db2 和 Watson Query

现在,您可以从 Watson Query 实例查询在 Db2 和虚拟化表中创建的昵称。

SSL连接用于 Data Virtualization Manager for z/OSIBM 数据源

现在,您可以通过使用“添加数据库”用户界面来保护数据库连接并对其进行加密,从而为 IBM Data Virtualization Manager for z/OS 数据源启用 SSL 连接。 选择“验证证书”以验证主机返回的 SSL 证书是否可信。 您可以选择在 SSL 证书中提供主机名。

使用目录中的 Apache Hudi 数据

现在,您可以连接并使用 Apache Hudi 目录中的数据。

添加 Milvus 为服务 watsonx.data

现在,您可以在 watsonx.data 中将 Milvus 作为一项服务提供,它具有以下功能:

  • 供应不同的存储变体,例如入门模板,中型和大型节点。

  • 为 Milvus 用户分配管理员或用户角色:现在可为 Milvus 用户提供用户访问策略。 使用访问控制用户界面,可以为 Milvus 用户分配管理员或用户角色,还可以授予、撤销或更新权限。

  • 为 Milvus 配置对象存储来存储数据。 您可以添加或配置自定义水桶,并指定用户名、密码、区域和水桶 URL。

更多信息,请参阅 Milvus

使用 ibm-lh 摄入工具批量装入数据

现在,您可以使用 ibm-lh 摄入工具,通过使用 ibm-lh-client 软件包,以非交互方式 (从 ibm-lh-tools 容器外部) 运行批处理摄入过程。 有关更多信息,请参阅 ibm-lh 命令和用法

在 Web 控制台中使用批量采集来创建模式

现在,如果先前未创建模式,那么可以在 Web 控制台中使用批量采集过程来创建模式。

在 Apache Iceberg 表中使用时间旅行查询

现在,您可以在 Apache Iceberg 表快照中使用分支和标记运行以下时间旅行查询:

-SELECT *FROM <table name> FOR VERSION AS OF 'historical-tag'

-SELECT *FROM <table name> FOR VERSION AS OF "test-branch"

无需凭据访问 Cloud Object Storage 现在,您可以通过使用数据访问服务(DAS)端点,在没有凭据的情况下访问您的 Cloud Object Storage 存储桶。

2024 年 2 月 28 日-V 1.1.2

新版于2024 watsonx.data 年2月发布。

此发行版包含以下功能和更新:

数据源的 SSL 连接

现在,您可以通过使用 添加数据库 用户界面来保护数据库连接并对其进行加密,从而为以下数据源启用 SSL 连接:

  • Db2

  • PostgreSQL

有关更多信息,请参阅 添加数据库

安全摄入作业历史记录

现在,用户只能查看自己的摄入作业历史记录。 管理员可以查看所有用户的摄入作业历史记录。

SQL 增强功能

现在,您可以在“查询”工作空间中使用以下 SQL 语句来针对数据构建和运行查询:

  • Apache Iceberg 数据源
    • CREATE VIEW
    • DROP VIEW
  • MongoDB 数据源
    • 删除

数据源 Teradata 新增数据类型BLOB和CLOB

新的数据类型 BLOB 和 CLOB 可用于 Teradata 数据源。 只能将这些数据类型与“查询”工作空间中的 SELECT 语句配合使用,以针对数据构建和运行查询。

在数据采集期间创建新表

先前,您必须在 watsonx.data 中具有用于采集数据的目标表。 现在,您可以使用 数据管理器中的数据采集,直接从源数据文件 (以拼法或 CSV 格式提供) 创建新表。 您可以使用以下摄入方法来创建表:

  • 使用 Iceberg 复制装入器来采集数据。

  • 使用 Spark 采集数据。

对列执行 ALTER TABLE 操作

通过 Iceberg 数据源,现在可以对以下数据类型转换的列执行 ALTER TABLE 操作:

  • int 到 bigint

  • 浮动到双精度

  • decimal (num1,dec_decimal) 到 decimal (num2,dec_decimal),其中 num2>num1。

通过使用已排序的文件提高查询性能

通过 Apache Iceberg 数据源,可以生成排序文件,从而减少查询结果的延迟,提高 Presto ( Java ) 的性能。 在每个文件的写入过程中,将对 Iceberg 表中的数据进行排序。

您可以使用 sorted_by 表属性来配置对数据进行排序的顺序。 创建表时,请指定排序所涉及的一个或多个列的数组。 要禁用此功能,请将会话属性 sorted_writing_enabled 设置为 false。

2024 年 1 月 31 日-V 1.1.1

新版于2024 watsonx.data 年1月发布。

此发行版包含以下功能和更新:

Data Virtualization Manager for z/OS®IBM 连接器

现在,您可以使用新的 IBM Data Virtualization Manager for z/OS® 连接器来读写 IBM Z®,而无需移动,复制或变换数据。 有关更多信息,请参阅 连接到 IBM Data Virtualization Manager(DVM)数据源

Teradata 连接器已启用多 ALTER TABLE 语句功能

Teradata 连接器现在支持 ALTER TABLE RENAME TOALTER TABLE DROP COLUMNALTER TABLE RENAME COLUMN column_name TO new_column_name 语句。

支持时间旅行查询

冰山连接器Presto(Java ) 现在支持时间旅行查询。

属性 format_version 现在显示当前版本

现在,在创建 Iceberg 表时,属性 format_version 显示正确的值 (当前版本)。

2023 年 11 月 29 日-V 1.1.0

watsonx.data 的新版本已于 2023 年 11 月发布。

此发行版包含以下功能和更新:

Presto ( Java ) 区分大小写的行为

这Presto(Java ) 行为从不区分大小写更改为区分大小写。 现在,您可以像在数据库中一样以原始案例格式提供对象名称。 有关详细信息,请参阅For more information, see 区分大小写的搜索配置Presto(Java )

回滚功能

您可以使用回滚功能来回滚或前滚到 Iceberg 表的任何快照。

捕获数据定义语言 (DDL) 更改

现在,您可以使用事件监听器在 watsonx.data 中捕获和跟踪 DDL 更改。

使用 Spark 采集数据

现在,您可以使用由 Apache Spark 支持的 IBM Analytics Engine 在 watsonx.data 中运行摄取作业。

有关更多信息,请参阅 使用 Spark 采集数据

与 Db2 和 集成 Netezza Performance Server

现在,您可以在 watsonx.data 控制台中注册 Db2 或 Netezza Performance Server 引擎。

有关更多信息,请参阅 注册引擎

新增连接器

现在,您可以在 watsonx.data 中使用连接器来建立与以下类型的数据库的连接:

  • Teradata
  • Delta Lake
  • Elasticsearch
  • SingleStoreDB
  • Snowflake

有关更多信息,请参阅 添加数据库

AWS Spark的EMR

现在,您可以从 Amazon Web Services Elastic MapReduce (AWS EMR) 运行 Spark 应用程序,以实现 watsonx.data Spark 用例:

  • 数据摄取
  • 数据查询
  • 表维护

有关更多信息,请参阅 使用 AWS EMR for Spark 用例

7 2023 年 7 月-V 1.0.0

watsonx.data 是一种新的开放式体系结构,用于组合数据仓库和数据湖模型的元素。 watsonx.data 上提供的一流功能和优化使其成为下一代数据分析和自动化的最佳选择。 在第一个发行版 (watsonx.data 1.0.0) 中,支持以下功能部件:

  • 创建、缩放、暂停、恢复和删除Presto(Java ) 查询引擎
  • 将目录与引擎关联和取消关联
  • 浏览目录对象
  • 添加和删除数据库/目录对
  • 更新数据库凭证
  • 添加和删除存储区/目录对
  • 浏览存储区对象
  • 装入数据
  • 探索数据
  • 查询数据
  • 查询历史记录