문서를 분할하여 쿼리 결과를 더 간결하게 만들기
검색 기능이 쿼리 결과에서 보다 간결한 정보를 찾을 수 있도록 문서를 분할하세요.
문서 분할의 이점에 대한 자세한 내용은 IBM의 새로운 문서 분할 기능 사용 블로그 게시물 IBM Watson Discovery에서 확인하세요.
사용자가 학습한 스마트 문서 이해 모델이 적용된 문서만 분할할 수 있습니다.
문서를 분할하면 원본 문서가 여러 개의 세그먼트로 나뉩니다. 각 세그먼트에는 보다 균일한 정보 집합이 포함되어 있습니다. 문서의 콘텐츠를 세분화된 그룹으로 분할하면 데이터를 더욱 세분화된 수준에서 보강하고 색인을 생성할 수 있습니다.
문서 분할 방식을 제어하려면 페이지 나누기 마커로 사용할 subtitle 또는 question 와 같은 필드를 지정합니다. 페이지 나누기 옵션은 사용자가 학습한 SDU(스마트 문서 이해) 모델을 문서에 적용할 때 생성되는 필드로 채워집니다. 자세한 내용은 스마트 문서 이해 사용하기 를 참조하세요. 사전 학습된 스마트 문서 이해 모델에 의해 생성된 필드로는 문서를 분할할 수 없습니다.
문서가 재처리되면 처음부터 끝까지 평가됩니다. 페이지 나누기 마커 필드가 발생할 때마다 원본 문서가 분할되고 새 세그먼트가 만들어집니다. 원본 문서가 여러 세그먼트로 분할될 때까지 각 마커 필드에서 분할이 계속됩니다.
시작하기 전에 페이지 나누기 마커로 사용할 필드를 결정합니다.
- 기본적으로 인덱싱되는 모든 필드를 사용할 수 있습니다. 선택 사항을 확인하려면 색인할 필드 목록을 확인하세요. Type 값이 있는 필드는 인덱스에 저장됩니다.
- 문서당 세그먼트의 수는
1,000으로 제한됩니다. 세그먼트 번호999가 생성된 후 나머지 문서 콘텐츠는 세그먼트1,000에 저장됩니다. - PDF 및 Microsoft Word 문서에서 메타데이터와 사용자 지정 메타데이터가 추출되어 각 세그먼트와 함께 색인에 포함됩니다.
각 제품 항목에 대한 설명 및 사양 섹션이 있는 카탈로그와 같이 반복되는 섹션이 포함된 문서에는 주의하세요. 문서를 너무 세분화된 수준으로 분할하면 사양 세부 정보가 있는 섹션과 같은 하위 섹션이 해당 섹션이 속한 제품에서 분리될 수 있습니다.
컬렉션의 문서를 분할하려면 다음 단계를 완료하세요:
-
탐색 패널에서 컬렉션 관리를 클릭한 다음 클릭하여 컬렉션을 엽니다.
-
필드 관리 페이지를 엽니다.
식별된 필드 목록이 표시됩니다.
-
문서를 분할하여 쿼리 결과를 개선하세요 섹션에서 문서 분할을 클릭합니다.
-
필드 선택 드롭다운에서 페이지 나누기 마커로 사용할 필드를 선택합니다.
선택할 수 있는 목록에는 식별된 모든 필드의 하위 집합이 포함되어 있습니다.
-
변경사항 적용 및 재처리를 클릭하십시오.
활동 페이지에서 분할 과정의 상태를 확인할 수 있습니다.
메타데이터 필드에는 상위 문서 ID가 포함됩니다. 원본 문서의 각 결과 세그먼트에는 서로 다른 정보가 포함될 수 있습니다. 예를 들어 부제목 필드를 기준으로 문서를 분할하는 경우 첫 번째 세그먼트에는 제목 필드만 포함될 수 있습니다. 다음 세그먼트에는 자막과 텍스트 필드가 포함될 수 있습니다. 세 번째에는 자막 필드, 텍스트 필드 및 바닥글 필드가 포함될 수 있습니다.
분할된 문서 업데이트하기
분할된 문서가 변경되어 다시 업로드하려는 경우 개발자와 협력하여 API를 사용하여 문서를 교체하세요. 개발자는 문서 업데이트 메서드를 사용하여 원본 상위 문서를 대체할 수 있습니다. 더 자세한 정보를 원하시면, API 참조를 참고하세요. 요청과 함께 전송해야 하는
{document_id} 경로 변수를 제공하려면 문서 세그먼트 중 하나의 parent_document_id 필드 내용을 복사합니다.
원본 문서를 바꾸면 업데이트된 버전의 문서가 원본보다 총 세그먼트 수가 적은 경우를 제외하고 모든 세그먼트가 덮어씌워집니다. 이러한 오래된 세그먼트는 인덱스에 남아 있습니다.
색인에서 문서 세그먼트 삭제하기
데이터 관리 페이지에서 컬렉션의 문서를 삭제할 수 있습니다. 단일 문서에서 생성된 모든 문서 세그먼트를 찾으려면 metadata.parent_document_id 필드 값이 동일한 문서를 확인합니다. 자세한 내용은 쿼리 결과에서 콘텐츠 제외하기 를 참조하세요.
IBM Cloud Pak for Data IBM Cloud Pak for Data 릴리스 이전 4.6.5
데이터 관리 페이지는 4.6.5 릴리스부터 설치된 배포에서 사용할 수 있습니다. 이전 릴리스에서는 개발자가 API를 사용하여 문서 세그먼트를 삭제할 수 있었습니다. 자세한 내용은 문서 삭제 API를 참조하세요.