watsonx.data 데이터 병합 및 쿼리하기

NPSaaS 데이터 레이크 테이블에서 데이터를 쿼리하고 병합하는 방법을 알아보세요.

시작하기 전에

이 예에서는 2021년 1월과 2022년 1월의 노란색 택시에 대한 공개적으로 사용 가능한 뉴욕 택시 운행 기록 데이터 ' {: external} '을 사용했습니다. 이 예제를 따르려면 데이터가 액세스 가능한 S3 버킷에 있고 테이블이 watsonx.data Hive Metastore 서버(HMS)의 Apache Iceberg 테이블로 로드되었는지 확인합니다.

데이터 레이크 데이터베이스의 테이블을 사용하여 교차 데이터베이스 쿼리를 실행합니다.

  • 이용자가 가장 많았던 연도를 확인하려면 실행하세요:

    예:

    LOCALDB.ADMIN(ADMIN)=> select ( select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED) as "passengers 2022",( select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021) as "passengers 2021";
    

    출력:

    passengers 2022 | passengers 2021
    
    -----------------+-----------------
    
            3324167 |         1794615
    
    (1 row)
    
  • 2021년과 2022년 오전 1시부터 오후 6시 사이에 얼마나 많은 승객이 여행했는지 비교하려면 실행하세요:

    예:

    LOCALDB.ADMIN(ADMIN)=> select(select sum(PASSENGER_COUNT) from YELLOW_TAXI_JANUARY_2022_LOADED where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2022", (select sum(PASSENGER_COUNT) from MYLAKE.TAXIDATA.YELLOW_TAXI_JANUARY_2021 where TPEP_PICKUP_DATETIME::time > '1:00am' and TPEP_PICKUP_DATETIME::time < '6:00am') as "overnight passengers 2021";
    

    출력:

    overnight passengers 2022 | overnight passengers 2021
    
    ---------------------------+---------------------------
    
                       163058 |                     33469
    
    (1 row)