從 watsonx.data 合併及查詢資料

瞭解如何從 NPSaaS 及資料湖表格查詢及合併資料。

開始之前

在範例中,使用了 2021 年 1 月和 2022 年黃色計程車的公開 紐約計程車行程記錄資料。 若要遵循此範例,請確保資料位於可存取的S3儲存桶中,watsonx.data該表已載入至Hive Metastore 伺服器 (HMS) 中的Apache Iceberg 表中。

使用資料湖資料庫中的表格執行跨資料庫查詢。

  • 若要識別哪一年的乘客最多,請執行下列動作:

    範例:

    LOCALDB.ADMIN(ADMIN)=> select ( select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED) as "passengers 2022",( select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021) as "passengers 2021";
    

    輸出:

    passengers 2022 | passengers 2021
    
    -----------------+-----------------
    
            3324167 |         1794615
    
    (1 row)
    
  • 若要比較 2021 年和 2022 年早上 1:00 至下午 6:00 的乘客人數,請執行:

    範例:

    LOCALDB.ADMIN(ADMIN)=> select(select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2022", (select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021 where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2021";
    

    輸出:

    overnight passengers 2022 | overnight passengers 2021
    
    ---------------------------+---------------------------
    
                       163058 |                     33469
    
    (1 row)