套用預先訓練的 SDU 模型
套用預先建置的「智慧型文件理解 (SDU)」模型,它可以擷取文字並經過訓練以識別文件中的表格、清單及區段。
如果您的文件包含具有您要擷取之有價值資訊的表格,請使用預先訓練模型。 模型也可以保留表格、清單及區段的巢狀結構中固有的意義。 使用預先訓練模型可加快從文件結構擷取資訊的程序。
如果您想要自訂如何使用文件結構來從文件推斷意義,或者您想要使用 SDU 模型所產生的欄位來分割文件,請改為建立使用者訓練模型。 如需相關資訊,請參閱 定義使用者訓練的 SDU 模型。
預先訓練模型會自動套用至 合約的文件擷取 專案。 專案會套用已知道如何辨識對合約重要的術語和概念的模型,而不是您在文件中註釋與合約相關的內容。
準備文件
您只能將預先訓練的 SDU 模型套用至下列檔案類型:
- 影像檔 (PNG、TIFF、JPG)
- Microsoft PowerPoint
- Microsoft Word
如需 Discovery 支援的檔案類型完整清單,請參閱 支援的檔案類型。
Smart Document Understanding 工具會使用光學字元辨識 (OCR),從它所分析之檔案中的影像擷取文字。 映像檔必須符合 OCR 支援的最低品質需求。 如需相關資訊,請參閱 光學字元辨識。
工具無法讀取具有下列性質的文件; 請在開始之前從集合中移除它們:
- 看起來有文字覆蓋其他文字的文件會被視為雙重覆蓋,無法註釋。
- 無法註釋在單一頁面上包含多個文字直欄的文件。
當您套用智慧型文件理解模型時,由於在文件上套用 AI 模型所需的資源,您的收藏集的轉換時間可能會增加。
套用預先訓練的模型
若要將預先訓練的「智慧型文件理解」模型套用至集合,請完成下列步驟:
-
從導覽畫面開啟 管理集合 頁面。
-
選取您要套用模型的集合。
-
開啟「識別欄位」頁面。
-
選擇 預先訓練模型
依預設會使用 僅文字擷取 選項。 使用此模型,會在
text欄位中檢索在來源文件中辨識到的任何文字。 -
按一下 提交,然後按一下 套用變更並重新處理。
瞭解輸出
如果 SDU 模型在文件中尋找並處理結構 (例如表格),則它會將結構表示法儲存在名為 enriched_{field} 的欄位中,其中 {field} 是儲存結構的欄位。
下列摘錄顯示預先訓練 SDU 模型所處理文件的 enriched_html 欄位中表格的 JSON 表示法。
如果您想要從已處理的結構擷取文字,您可以使用 location 欄位來尋找索引值,以識別字串開始及結束的位置。
如需索引表格結構的相關資訊,請參閱 瞭解表格。
對問題進行疑難排解
如果您在使用「智慧型文件理解」工具時遇到問題,請遵循下列暫行解決方法。
資源不足,無法處理文件
- 錯誤
- 當您將預先訓練模型套用至集合時,文件處理未順利完成,並會顯示
Insufficient resources to process document訊息。 - 原因
- 顯示此錯誤是因為在建置機器學習模型之處理程序的剖析、結構識別或組合階段期間發生記憶體不足錯誤。 當集合中有一或多個文件太大或有太多複雜表格可供工具處理時,資源不足。
- 解決方案
- 在將預先訓練的模型套用至集合之前,請檢閱集合中的大型文件或具有許多表格的文件,並將它們分成較小的文件。 確切限制會根據文件的複雜性而有所不同。 通常,分割長度超過 400 頁的文件,並避免在單一文件中包含超過 20 個複式表格。