分割文件以使查詢結果更簡潔
請分割文件,以便搜尋功能可以在查詢結果中找到更簡要的資訊來傳回。
如需分割文件的好處的相關資訊,請閱讀 Medium.com上的 Using IBM Watson Discovery's New Document Segmentation Feature 部落格文章。
您只能分割已套用使用者訓練的「智慧型文件理解」模型的文件。
當您分割文件時,原始文件會分成區段。 每一個區段都包含一組更一致的資訊。 透過將文件中的內容分割成分段群組,您可以在更精細的層次強化及檢索資料。
若要控制文件的分割方式,您可以指定欄位 (例如 subtitle 或 question) 以用作分頁標記。 分頁選項會移入當您將使用者訓練的「智慧型文件理解 (SDU)」模型套用至文件時所建立的欄位。 如需相關資訊,請參閱 使用智慧型文件理解。 您無法使用預先訓練的「智慧型文件理解」模型所產生的欄位來分割文件。
重新處理文件時,會從開始到結束評估文件。 每當出現分頁標記欄位時,即會分割原始文件,並建立新的區段。 分割會在每一個標記欄位繼續進行,直到原始文件分成多個區段為止。
開始之前,請決定要使用哪一個欄位作為分頁標記。
- 您可以使用依預設已編製索引的任何欄位。 若要查看您的選項,請檢查 要索引的欄位 清單。 具有 類型 值的欄位會儲存在索引中。
- 每份文件的區段數限制為
1,000。 建立區段號碼999之後,任何剩餘文件內容都會儲存在區段1,000中。 - PDF 和 Microsoft Word 文件中的 meta 資料以及任何自訂 meta 資料都會隨每一個區段一起擷取並包含在索引中。
請小心包含重複區段的文件,例如具有每一個產品項目的說明及規格區段的型錄。 如果您以太精細的層次分割文件,則子區段 (例如具有規格詳細資料的區段) 可以與它所屬的產品取消關聯。
若要分割集合中的文件,請完成下列步驟:
-
從導覽畫面中按一下 管理集合,然後按一下以開啟集合。
-
開啟 管理欄位 頁面。
即會顯示已識別欄位的清單。
-
在「透過分割文件改善查詢結果」部分,按一下「分割文件」。
-
從 選取欄位 下拉清單中選擇您要用作分頁標記的欄位。
您可以從中選擇的清單包括所有已識別欄位的子集。
-
按一下套用變更並重新處理。
您可以從「活動」頁面中檢查分割程序的狀態。
meta 資料欄位包括母項文件 ID。 原始文件的每一個結果區段都可以包含不同的資訊。 例如,如果您根據子標題欄位分割文件,則第一個區段可能只包含標題欄位。 下一個區段可能包含子標題和文字欄位。 第三個可能包含子標題欄位、文字欄位及標底欄位。
更新已分割的文件
如果已分割的文件變更,且您想要重新上傳文件,請與開發人員合作,以使用 API 來取代文件。 開發人員可以使用 更新文件 方法來取代原始母項文件。 如需詳細資訊,請參閱 API 參考資料。 若要提供必須隨要求一起傳送的 {document_id} 路徑變數,請複製文件其中一個區段的
parent_document_id 欄位內容。
當您取代原始文件時,除非文件更新版本的區段總數少於原始版本,否則會改寫所有區段。 那些較舊的區段會保留在索引中。
從索引中刪除文件區段
您可以從 管理資料 頁面中刪除集合中的文件。 若要尋找從單一文件產生的所有文件區段,請檢查是否有文件具有相同的 metadata.parent_document_id 欄位值。 如需相關資訊,請參閱 從查詢結果排除內容。
IBM Cloud Pak for Data IBM Cloud Pak for Data before the 4.6.5 release
從 4.6.5 版開始,已安裝的部署中提供「管理資料」頁面。 在舊版中,開發人員可以使用 API 來刪除文件區段。 如需相關資訊,請參閱 刪除文件 API。