IBM cpdctl을 사용하여 스파크 테이블 유지 관리

에 적용됩니다: 스파크 엔진

IBM Cloud Pak for Data 명령줄 인터페이스( IBM cpdctl)를 통해 Spark 애플리케이션을 제출하여 Iceberg 테이블 유지 관리 작업을 수행할 수 있습니다. IBM cpdctl에서 제공되는 tablemaint 유틸리티를 사용하면 스파크 애플리케이션의 세부 정보를 제출하고, 나열하고, 확인할 수 있습니다.

시작하기 전에

  • watsonx.data 인스턴스를 프로비저닝합니다.
  • IBM cpdctl을 다운로드하여 설치합니다. 자세한 내용은 IBM cpdctl 설치를 참조하세요.
  • IBM cpdctl에서 watsonx.data 환경을 구성합니다. 자세한 내용은 IBM cpdctl 구성을 참조하세요.

테이블 유지 관리

테이블 유지 관리 유틸리티에서 사용할 수 있는 리소스를 사용하여 다음과 같은 테이블 유지 관리 작업을 수행할 수 있습니다.

  • 스냅샷 관리

    • 롤백_투_스냅샷 - 특정 스냅샷 ID로 테이블을 롤백합니다.
    • 롤백_투_타임스탬프 - 특정 날짜 및 시간의 스냅샷으로 테이블을 롤백합니다.
    • set_current_snapshot - 테이블의 현재 스냅샷 ID를 설정합니다.
    • 체리픽_스냅샷 - 스냅샷에서 현재 테이블 상태로의 변경 사항을 체리픽합니다.
  • 메타데이터 관리

    • 만료_스냅샷 - 더 이상 필요하지 않은 이전 스냅샷과 해당 파일을 제거합니다.
    • remove_orphan_files - Iceberg 테이블의 메타데이터 파일에서 참조되지 않는 파일을 제거하는 데 사용됩니다.
    • 재작성_데이터_파일 - 작은 파일을 큰 파일로 결합하여 메타데이터 오버헤드와 런타임 파일 열기 비용을 줄입니다.
    • 재작성_매니페스트 - 스캔 계획을 최적화하기 위해 테이블에 대한 매니페스트를 다시 작성합니다.
  • 테이블 마이그레이션

    • register_table - 존재하지만 해당 카탈로그 식별자가 없는 metadata.json 파일에 대한 카탈로그 항목을 만듭니다.

자세한 내용은 wx-data 명령 사용 방법 --help (-h) 섹션을 참조하세요.