從 watsonx.data 合併及查詢資料
瞭解如何從 NPSaaS 及資料湖表格查詢及合併資料。
開始之前
在範例中,使用了 2021 年 1 月和 2022 年黃色計程車的公開 紐約計程車行程記錄資料。 若要遵循此範例,請確保資料位於可存取的S3儲存桶中,watsonx.data該表已載入至Hive Metastore 伺服器 (HMS) 中的Apache Iceberg 表中。
使用資料湖資料庫中的表格執行跨資料庫查詢。
-
若要識別哪一年的乘客最多,請執行下列動作:
範例:
LOCALDB.ADMIN(ADMIN)=> select ( select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED) as "passengers 2022",( select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021) as "passengers 2021";輸出:
passengers 2022 | passengers 2021 -----------------+----------------- 3324167 | 1794615 (1 row) -
若要比較 2021 年和 2022 年早上 1:00 至下午 6:00 的乘客人數,請執行:
範例:
LOCALDB.ADMIN(ADMIN)=> select(select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2022", (select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021 where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2021";輸出:
overnight passengers 2022 | overnight passengers 2021 ---------------------------+--------------------------- 163058 | 33469 (1 row)