从 watsonx.data 合并和查询数据

了解如何从 NPSaaS 和数据湖表中查询和合并数据。

准备工作

在示例中,使用的是 2021 年 1 月和 2022 年 1 月公开的黄色出租车“纽约出租车之旅记录数据 和”{: external}。 要遵循此示例,请确保数据位于可访问的S3存储桶中,并且表已加载到watsonx.data中的HiveMetastore 服务器 (HMS) 的ApacheIceberg 表中。

对数据湖数据库中的表运行跨数据库查询。

  • 要确定乘客最多的年份,请运行:

    示例:

    LOCALDB.ADMIN(ADMIN)=> select ( select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED) as "passengers 2022",( select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021) as "passengers 2021";
    

    输出:

    passengers 2022 | passengers 2021
    
    -----------------+-----------------
    
            3324167 |         1794615
    
    (1 row)
    
  • 要比较 2021 年凌晨 1:00 到 2022 年下午 6:00 之间的乘客数量,请运行:

    示例:

    LOCALDB.ADMIN(ADMIN)=> select(select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2022", (select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021 where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2021";
    

    输出:

    overnight passengers 2022 | overnight passengers 2021
    
    ---------------------------+---------------------------
    
                       163058 |                     33469
    
    (1 row)