문서를 분할하여 쿼리 결과를 더 간결하게 만들기

검색 기능이 쿼리 결과에서 보다 간결한 정보를 찾을 수 있도록 문서를 분할하세요.

문서 분할의 이점에 대한 자세한 내용은 IBM의 새로운 문서 분할 기능 사용 블로그 게시물 IBM Watson Discovery에서 확인하세요.

사용자가 학습한 스마트 문서 이해 모델이 적용된 문서만 분할할 수 있습니다.

문서를 분할하면 원본 문서가 여러 개의 세그먼트로 나뉩니다. 각 세그먼트에는 보다 균일한 정보 집합이 포함되어 있습니다. 문서의 콘텐츠를 세분화된 그룹으로 분할하면 데이터를 더욱 세분화된 수준에서 보강하고 색인을 생성할 수 있습니다.

문서 분할 방식을 제어하려면 페이지 나누기 마커로 사용할 subtitle 또는 question 와 같은 필드를 지정합니다. 페이지 나누기 옵션은 사용자가 학습한 SDU(스마트 문서 이해) 모델을 문서에 적용할 때 생성되는 필드로 채워집니다. 자세한 내용은 스마트 문서 이해 사용하기 를 참조하세요. 사전 학습된 스마트 문서 이해 모델에 의해 생성된 필드로는 문서를 분할할 수 없습니다.

문서가 재처리되면 처음부터 끝까지 평가됩니다. 페이지 나누기 마커 필드가 발생할 때마다 원본 문서가 분할되고 새 세그먼트가 만들어집니다. 원본 문서가 여러 세그먼트로 분할될 때까지 각 마커 필드에서 분할이 계속됩니다.

시작하기 전에 페이지 나누기 마커로 사용할 필드를 결정합니다.

  • 기본적으로 인덱싱되는 모든 필드를 사용할 수 있습니다. 선택 사항을 확인하려면 색인할 필드 목록을 확인하세요. Type 값이 있는 필드는 인덱스에 저장됩니다.
  • 문서당 세그먼트의 수는 1,000으로 제한됩니다. 세그먼트 번호 999 가 생성된 후 나머지 문서 콘텐츠는 세그먼트 1,000 에 저장됩니다.
  • PDF 및 Microsoft Word 문서에서 메타데이터와 사용자 지정 메타데이터가 추출되어 각 세그먼트와 함께 색인에 포함됩니다.

각 제품 항목에 대한 설명 및 사양 섹션이 있는 카탈로그와 같이 반복되는 섹션이 포함된 문서에는 주의하세요. 문서를 너무 세분화된 수준으로 분할하면 사양 세부 정보가 있는 섹션과 같은 하위 섹션이 해당 섹션이 속한 제품에서 분리될 수 있습니다.

컬렉션의 문서를 분할하려면 다음 단계를 완료하세요:

  1. 탐색 패널에서 컬렉션 관리를 클릭한 다음 클릭하여 컬렉션을 엽니다.

  2. 필드 관리 페이지를 엽니다.

    식별된 필드 목록이 표시됩니다.

  3. 문서를 분할하여 쿼리 결과를 개선하세요 섹션에서 문서 분할을 클릭합니다.

  4. 필드 선택 드롭다운에서 페이지 나누기 마커로 사용할 필드를 선택합니다.

    선택할 수 있는 목록에는 식별된 모든 필드의 하위 집합이 포함되어 있습니다.

  5. 변경사항 적용 및 재처리를 클릭하십시오.

활동 페이지에서 분할 과정의 상태를 확인할 수 있습니다.

메타데이터 필드에는 상위 문서 ID가 포함됩니다. 원본 문서의 각 결과 세그먼트에는 서로 다른 정보가 포함될 수 있습니다. 예를 들어 부제목 필드를 기준으로 문서를 분할하는 경우 첫 번째 세그먼트에는 제목 필드만 포함될 수 있습니다. 다음 세그먼트에는 자막과 텍스트 필드가 포함될 수 있습니다. 세 번째에는 자막 필드, 텍스트 필드 및 바닥글 필드가 포함될 수 있습니다.

분할된 문서 업데이트하기

분할된 문서가 변경되어 다시 업로드하려는 경우 개발자와 협력하여 API를 사용하여 문서를 교체하세요. 개발자는 문서 업데이트 메서드를 사용하여 원본 상위 문서를 대체할 수 있습니다. 더 자세한 정보를 원하시면, API 참조를 참고하세요. 요청과 함께 전송해야 하는 {document_id} 경로 변수를 제공하려면 문서 세그먼트 중 하나의 parent_document_id 필드 내용을 복사합니다.

원본 문서를 바꾸면 업데이트된 버전의 문서가 원본보다 총 세그먼트 수가 적은 경우를 제외하고 모든 세그먼트가 덮어씌워집니다. 이러한 오래된 세그먼트는 인덱스에 남아 있습니다.

색인에서 문서 세그먼트 삭제하기

데이터 관리 페이지에서 컬렉션의 문서를 삭제할 수 있습니다. 단일 문서에서 생성된 모든 문서 세그먼트를 찾으려면 metadata.parent_document_id 필드 값이 동일한 문서를 확인합니다. 자세한 내용은 쿼리 결과에서 콘텐츠 제외하기 를 참조하세요.

IBM Cloud Pak for Data IBM Cloud Pak for Data 릴리스 이전 4.6.5

데이터 관리 페이지는 4.6.5 릴리스부터 설치된 배포에서 사용할 수 있습니다. 이전 릴리스에서는 개발자가 API를 사용하여 문서 세그먼트를 삭제할 수 있었습니다. 자세한 내용은 문서 삭제 API를 참조하세요.