分割文件以使查詢結果更簡潔

請分割文件,以便搜尋功能可以在查詢結果中找到更簡要的資訊來傳回。

如需分割文件的好處的相關資訊,請閱讀 Medium.com上的 Using IBM Watson Discovery's New Document Segmentation Feature 部落格文章。

您只能分割已套用使用者訓練的「智慧型文件理解」模型的文件。

當您分割文件時,原始文件會分成區段。 每一個區段都包含一組更一致的資訊。 透過將文件中的內容分割成分段群組,您可以在更精細的層次強化及檢索資料。

若要控制文件的分割方式,您可以指定欄位 (例如 subtitlequestion) 以用作分頁標記。 分頁選項會移入當您將使用者訓練的「智慧型文件理解 (SDU)」模型套用至文件時所建立的欄位。 如需相關資訊,請參閱 使用智慧型文件理解。 您無法使用預先訓練的「智慧型文件理解」模型所產生的欄位來分割文件。

重新處理文件時,會從開始到結束評估文件。 每當出現分頁標記欄位時,即會分割原始文件,並建立新的區段。 分割會在每一個標記欄位繼續進行,直到原始文件分成多個區段為止。

開始之前,請決定要使用哪一個欄位作為分頁標記。

  • 您可以使用依預設已編製索引的任何欄位。 若要查看您的選項,請檢查 要索引的欄位 清單。 具有 類型 值的欄位會儲存在索引中。
  • 每份文件的區段數限制為 1,000。 建立區段號碼 999 之後,任何剩餘文件內容都會儲存在區段 1,000 中。
  • PDF 和 Microsoft Word 文件中的 meta 資料以及任何自訂 meta 資料都會隨每一個區段一起擷取並包含在索引中。

請小心包含重複區段的文件,例如具有每一個產品項目的說明及規格區段的型錄。 如果您以太精細的層次分割文件,則子區段 (例如具有規格詳細資料的區段) 可以與它所屬的產品取消關聯。

若要分割集合中的文件,請完成下列步驟:

  1. 從導覽畫面中按一下 管理集合,然後按一下以開啟集合。

  2. 開啟 管理欄位 頁面。

    即會顯示已識別欄位的清單。

  3. 在「透過分割文件改善查詢結果」部分,按一下「分割文件」。

  4. 選取欄位 下拉清單中選擇您要用作分頁標記的欄位。

    您可以從中選擇的清單包括所有已識別欄位的子集。

  5. 按一下套用變更並重新處理

您可以從「活動」頁面中檢查分割程序的狀態。

meta 資料欄位包括母項文件 ID。 原始文件的每一個結果區段都可以包含不同的資訊。 例如,如果您根據子標題欄位分割文件,則第一個區段可能只包含標題欄位。 下一個區段可能包含子標題和文字欄位。 第三個可能包含子標題欄位、文字欄位及標底欄位。

更新已分割的文件

如果已分割的文件變更,且您想要重新上傳文件,請與開發人員合作,以使用 API 來取代文件。 開發人員可以使用 更新文件 方法來取代原始母項文件。 如需詳細資訊,請參閱 API 參考資料。 若要提供必須隨要求一起傳送的 {document_id} 路徑變數,請複製文件其中一個區段的 parent_document_id 欄位內容。

當您取代原始文件時,除非文件更新版本的區段總數少於原始版本,否則會改寫所有區段。 那些較舊的區段會保留在索引中。

從索引中刪除文件區段

您可以從 管理資料 頁面中刪除集合中的文件。 若要尋找從單一文件產生的所有文件區段,請檢查是否有文件具有相同的 metadata.parent_document_id 欄位值。 如需相關資訊,請參閱 從查詢結果排除內容

IBM Cloud Pak for Data IBM Cloud Pak for Data before the 4.6.5 release

從 4.6.5 版開始,已安裝的部署中提供「管理資料」頁面。 在舊版中,開發人員可以使用 API 來刪除文件區段。 如需相關資訊,請參閱 刪除文件 API