Daten aus watsonx.data zusammenführen und abfragen
Hier erfahren Sie, wie Sie Daten aus einer NPSaaS und einer Data-Lake-Tabelle abfragen und zusammenführen.
Vorbereitende Schritte
In den Beispielen wird der öffentlich verfügbare " New Yorker Taxifahrt Datensatzdaten " {: external} für gelbe Taxis im Januar 2021 und 2022 verwendet. Um diesem Beispiel zu folgen, stellen Sie sicher, dass sich die Daten in einem zugänglichen S3 befinden und die Tabelle in watsonx.data in eine Apache Iceberg-Tabelle im Hive Metastore Server (HMS) geladen wurde.
Führen Sie eine datenbankübergreifende Abfrage mit der Tabelle in der Data-Lake-Datenbank aus.
-
Um festzustellen, welches Jahr die meisten Passagiere hatte, führen Sie:
Beispiel:
LOCALDB.ADMIN(ADMIN)=> select ( select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED) as "passengers 2022",( select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021) as "passengers 2021";Ausgabe:
passengers 2022 | passengers 2021 -----------------+----------------- 3324167 | 1794615 (1 row) -
Um zu vergleichen, wie viele Passagiere zwischen 1:00 Uhr und 18:00 Uhr in 2021 und 2022 gereist sind, gehen Sie wie folgt vor:
Beispiel:
LOCALDB.ADMIN(ADMIN)=> select(select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2022", (select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021 where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2021";Ausgabe:
overnight passengers 2022 | overnight passengers 2021 ---------------------------+--------------------------- 163058 | 33469 (1 row)