watsonx.data 데이터 병합 및 쿼리하기
NPSaaS 데이터 레이크 테이블에서 데이터를 쿼리하고 병합하는 방법을 알아보세요.
시작하기 전에
이 예에서는 2021년 1월과 2022년 1월의 노란색 택시에 대한 공개적으로 사용 가능한 뉴욕 택시 운행 기록 데이터 ' {: external} '을 사용했습니다. 이 예제를 따르려면 데이터가 액세스 가능한 S3 버킷에 있고 테이블이 watsonx.data Hive Metastore 서버(HMS)의 Apache Iceberg 테이블로 로드되었는지 확인합니다.
데이터 레이크 데이터베이스의 테이블을 사용하여 교차 데이터베이스 쿼리를 실행합니다.
-
이용자가 가장 많았던 연도를 확인하려면 실행하세요:
예:
LOCALDB.ADMIN(ADMIN)=> select ( select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED) as "passengers 2022",( select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021) as "passengers 2021";출력:
passengers 2022 | passengers 2021 -----------------+----------------- 3324167 | 1794615 (1 row) -
2021년과 2022년 오전 1시부터 오후 6시 사이에 얼마나 많은 승객이 여행했는지 비교하려면 실행하세요:
예:
LOCALDB.ADMIN(ADMIN)=> select(select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2022", (select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021 where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2021";출력:
overnight passengers 2022 | overnight passengers 2021 ---------------------------+--------------------------- 163058 | 33469 (1 row)