套用預先訓練的 SDU 模型

套用預先建置的「智慧型文件理解 (SDU)」模型,它可以擷取文字並經過訓練以識別文件中的表格、清單及區段。

如果您的文件包含具有您要擷取之有價值資訊的表格,請使用預先訓練模型。 模型也可以保留表格、清單及區段的巢狀結構中固有的意義。 使用預先訓練模型可加快從文件結構擷取資訊的程序。

如果您想要自訂如何使用文件結構來從文件推斷意義,或者您想要使用 SDU 模型所產生的欄位來分割文件,請改為建立使用者訓練模型。 如需相關資訊,請參閱 定義使用者訓練的 SDU 模型

預先訓練模型會自動套用至 合約的文件擷取 專案。 專案會套用已知道如何辨識對合約重要的術語和概念的模型,而不是您在文件中註釋與合約相關的內容。

準備文件

您只能將預先訓練的 SDU 模型套用至下列檔案類型:

  • 影像檔 (PNG、TIFF、JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

如需 Discovery 支援的檔案類型完整清單,請參閱 支援的檔案類型

Smart Document Understanding 工具會使用光學字元辨識 (OCR),從它所分析之檔案中的影像擷取文字。 映像檔必須符合 OCR 支援的最低品質需求。 如需相關資訊,請參閱 光學字元辨識

工具無法讀取具有下列性質的文件; 請在開始之前從集合中移除它們:

  • 看起來有文字覆蓋其他文字的文件會被視為雙重覆蓋,無法註釋。
  • 無法註釋在單一頁面上包含多個文字直欄的文件。

當您套用智慧型文件理解模型時,由於在文件上套用 AI 模型所需的資源,您的收藏集的轉換時間可能會增加。

套用預先訓練的模型

若要將預先訓練的「智慧型文件理解」模型套用至集合,請完成下列步驟:

  1. 從導覽畫面開啟 管理集合 頁面。

  2. 選取您要套用模型的集合。

  3. 開啟「識別欄位」頁面。

  4. 選擇 預先訓練模型

    依預設會使用 僅文字擷取 選項。 使用此模型,會在 text 欄位中檢索在來源文件中辨識到的任何文字。

  5. 按一下 提交,然後按一下 套用變更並重新處理

瞭解輸出

如果 SDU 模型在文件中尋找並處理結構 (例如表格),則它會將結構表示法儲存在名為 enriched_{field} 的欄位中,其中 {field} 是儲存結構的欄位。

下列摘錄顯示預先訓練 SDU 模型所處理文件的 enriched_html 欄位中表格的 JSON 表示法。

顯示 JSON Snippet,其中包含 enriched_html 欄位,以及包含 section_title、row_headers、table_headers、location 等區段的表格物件。
JSON表表示

如果您想要從已處理的結構擷取文字,您可以使用 location 欄位來尋找索引值,以識別字串開始及結束的位置。

如需索引表格結構的相關資訊,請參閱 瞭解表格

對問題進行疑難排解

如果您在使用「智慧型文件理解」工具時遇到問題,請遵循下列暫行解決方法。

資源不足,無法處理文件

錯誤
當您將預先訓練模型套用至集合時,文件處理未順利完成,並會顯示 Insufficient resources to process document 訊息。
原因
顯示此錯誤是因為在建置機器學習模型之處理程序的剖析、結構識別或組合階段期間發生記憶體不足錯誤。 當集合中有一或多個文件太大或有太多複雜表格可供工具處理時,資源不足。
解決方案
在將預先訓練的模型套用至集合之前,請檢閱集合中的大型文件或具有許多表格的文件,並將它們分成較小的文件。 確切限制會根據文件的複雜性而有所不同。 通常,分割長度超過 400 頁的文件,並避免在單一文件中包含超過 20 個複式表格。