데이터 수집 정보

데이터 수집은 데이터를 가져와서 IBM® watsonx.data로 로드하는 프로세스입니다. watsonx.data의 사용자 인터페이스(UI)에서 데이터 수집 모듈을 데이터 관리자 페이지에서 사용하여 안전하고 쉽게 데이터를 로드할 수 있습니다. 또는 파일에서 테이블 만들기 옵션을 사용하여 로컬 또는 원격 데이터 파일을 수집하여 테이블을 만들 수도 있습니다.

데이터 파일을 watsonx.data에 수집하면 조회가 실행될 때 테이블 스키마가 생성되고 추론됩니다. 수집할 파일은 동일한 형식 유형과 동일한 스키마를 사용해야 합니다. watsonx.data는 수집되는 소스 파일을 기반으로 스키마를 자동으로 검색합니다.

다음은 데이터 수집의 몇 가지 요구 사항 또는 동작입니다:

  • 스키마 전개는 지원되지 않습니다.
  • 대상 테이블은 아이스버그 형식의 테이블이어야 합니다.
  • IBM Storage Ceph, IBM Cloud Object Storage(COS), AWS S3, MinIO 객체 스토리지가 지원됩니다.
  • 오브젝트 스토리지에 대한 pathStyleAccess 특성은 지원되지 않습니다.
  • .txt,.csv, Parquet, JSON, ORC, Avro. 파일 형식이 소스 데이터 파일로 지원됩니다.
  • 로컬 수집의 경우 파일 누적 크기의 최대 제한은 500MB 이내여야 합니다.
  • 2MB를 초과하는 파일은 미리 볼 수 없지만 성공적으로 수집됩니다.
  • 복잡한 중첩 개체 및 배열이 포함된 JSON 파일은 UI에서 미리 볼 수 없습니다.
  • 복잡한 JSON 파일은 있는 그대로 수집되어 배열이 테이블 항목으로 생성됩니다. 최적의 데이터 시각화 및 분석에는 권장되지 않습니다.
  • JSON 파일 내의 키는 올바른 구문 분석 및 해석을 위해 따옴표로 묶어야 합니다.

CLI를 통해 데이터 로드 또는 수집

watsonx.data 의 수집 작업은 ibm-lh 도구를 사용하여 실행할 수 있습니다. CLI를 통해 수집 작업을 실행하려면 도구를 ibm-lh-client 에서 가져와 로컬 시스템에 설치해야 합니다. ibm-lh-client 패키지를 설치하고 수집을 위해 ibm-lh 도구를 사용하기 위한 자세한 정보 및 지시사항은 ibm-lh-client 설치ibm-lh 명령행 유틸리티 설정을 참조하십시오.

ibm-lh-client 의 IBM 클라이언트 패키지는 이제 더 이상 사용되지 않으며 향후 릴리스에서 제거될 예정입니다. Ibm-lh 도구는 IBM CPDCTL CLI에서 ./cpdctl wx-data ingestion 지원으로 대체됩니다. IBM CPDCTL CLI 사용 방법에 대한 자세한 내용은 IBM cpdctl을 참조하세요.

Ibm-lh 도구 및 ./cpdctl wx-data ingestion 명령은 다음 기능을 지원합니다:

  • 소스 파일 또는 대상 테이블을 기반으로 하는 스키마의 자동 감지.

  • CSV 파일의 고급 테이블 구성 옵션:

    • 구분 기호
    • 헤더
    • 파일 인코딩
    • 행 분리문자
    • 이스케이프 문자
  • 단일 파일, 여러 파일 또는 단일 폴더(하위 폴더 없음)의 S3 및 로컬 Parquet 파일 수집.

  • 단일 파일, 여러 파일 또는 단일 폴더(하위 폴더 없음)의 S3 및 로컬 CSV 파일 수집.