定義使用者訓練的 SDU 模型

建立「智慧型文件理解 (SDU)」模型,以根據文件結構來學習文件內容。

使用「智慧型文件理解」工具將自訂欄位新增至集合,以便您可以執行下列動作:

  • 文件特定區段的目標預先建置或自訂強化。
  • 將大型文件分成較小的文件。

如需決定 SDU 是否可以協助您使用案例的說明,請閱讀 何時使用智慧型文件理解

如果從表格中擷取資訊對您的使用案例而言很重要,請考慮使用預先訓練的模型。 如需建立預先訓練的 SDU 模型的相關資訊,請參閱 套用預先訓練的 SDU 模型

何時使用智慧型文件理解

「智慧型文件理解 (SDU)」工具更適用於部分專案類型。

  • 文件擷取 專案搭配使用時,此工具最有用。 使用此工具,可將您的文件分成較小且更可耗用的資訊區塊。 當您協助 Discovery 檢索文件中的正確資訊集時,您可以改善應用程式可以找到並傳回的答案。

    例如,您的文件可能包含標題為 H4 的小節中顯示的提示。 如果您想要分別從這些提示中擷取資訊,您可以新增名為 tips 的欄位,並教導模型辨識它。 將模型套用至集合之後,您只能將強化套用至 tips 欄位。 稍後,您可以將搜尋限制為僅從 tips 欄位傳回內容。

    或者您有包含子區段的額外大型文件。 您可以教導 SDU 模型辨識這些子區段,然後將大型文件分割成多個較小且易於管理的文件,從其中一個子區段開始。

  • 準備集合以在 交談式搜尋 專案中使用的最佳方式是識別離散問答配對。 您可以使用 SDU 工具來尋找並標註它們。 如果您將專案配置成在回答欄位中包含回答,則必須更新 watsonx Assistant 中的搜尋配置,以從自訂回答欄位取得回應內文。

  • 預先訓練的 SDU 模型會自動套用至 合約的文件擷取 專案。 預先訓練的 SDU 模型知道如何辨識對合約重要的術語和概念。 因此,您無法將使用者訓練的 SDU 模型套用至此專案類型,但也不需要。

  • SCU 工具很少與 內容採礦 專案搭配使用。

您只能使用 SDU 工具來註釋下列檔案類型:

  • 影像檔 (PNG、TIFF、JPG)
  • Microsoft PowerPoint
  • Microsoft Word
  • PDF

如需 Discovery 支援的檔案類型完整清單,請參閱 支援的檔案類型

Smart Document Understanding 工具會使用光學字元辨識 (OCR),從它所分析之檔案中的影像擷取文字。 映像檔必須符合 OCR 支援的最低品質需求。 如需相關資訊,請參閱 光學字元辨識

工具無法讀取具有下列性質的文件; 請在開始之前從集合中移除它們:

  • 看起來有文字覆蓋其他文字的文件會被視為雙重覆蓋,無法註釋。
  • 無法註釋在單一頁面上包含多個文字直欄的文件。

當您建立自訂的智慧型文件理解模型時,由於需要資源將 AI 模型套用至文件,因此您的收藏集的轉換時間可能會增加。

從代表性文件開始

文件有各種形狀和大小。 您的集合可能混合了不同的文件結構。 當單一集合中的文件具有類似樣式性質時,「智慧型文件理解」運作最佳。 例如,文件對標題和標頭使用一致的字型大小和顏色,且文件中的表格具有類似的佈置。 若要為集合建立最佳模型,請採取下列必要步驟:

  1. 檢閱文件以尋找樣式和佈置型樣,然後根據文件的樣式將文件分成群組。

    例如,如果您的資料包含遵循四種不同格式化樣式的文件,請將文件分成四個個別集合,每一種樣式一個集合。 將具有統一佈置和樣式的文件新增至每一個集合。 每個集合的良好目標大小是 40 個文件。

  2. 使用 SDU 工具來註釋此代表文件集,並訓練 Watson 來辨識資料中的自訂內容。

  3. 將自訂 SDU 模型套用至完整集合。 如需相關資訊,請參閱 重複使用 SDU 模型

建立模型

若要將使用者訓練的「智慧型文件理解」模型套用至集合,請完成下列步驟:

  1. 從導覽畫面開啟 管理集合 頁面。

  2. 如果您的專案有多個集合,請選取含有您要註釋之文件的集合。

  3. 開啟「識別欄位」頁面。

  4. 選擇 使用者訓練模型

    依預設會使用 僅文字擷取 選項。 使用此模型,會在 text 欄位中檢索在來源文件中辨識到的任何文字。

  5. 按一下 提交,然後按一下 套用變更並重新處理

文件子集可供您註釋。 清單中會顯示 20-50 個文件的集合。 可用的文件數因數個因素而有所不同,包括集合中的整體文件數,以及其中有多少文件是支援的檔案類型。

如果任何用來訓練 SDU 模型的訓練文件在 Discovery 中經過版面或結構變更,先前的註解就不再有效。 若要更新 SDU 模型,您必須在擷取更新的文件後,再次為其加上註解。 否則,之前的註解會錯誤地與文字內容對應,使用者介面中相對應的註解頁面也會變得混亂。

標註影片

下列視訊顯示如何選取標籤,然後將它套用至文件中文字的表示法。

在影片中,使用者按一下 title 欄位標籤,然後按一下代表「目錄」頁面標題的文字區塊,將文字標示為標題。 接下來,使用者按一下 table_of_contents 欄位標籤,並選取目錄文字區塊來標示它。 然後,使用者按一下 footer 欄位標籤,並按一下代表頁面標底的文字區塊。 標示文字之後,使用者按一下 提交頁面 按鈕。

標示文件

開始之前,請先瞭解您計劃要註釋之文件的結構。 是否有您要「探索」根據回答傳回的子標題區段? 如果是的話,請識別所有子標題。 稍後,您可以將文件分割成個別子文件,每一個子文件都以子標題開始。 如需相關資訊,請參閱 何時使用智慧型文件理解

若要標示文件,請完成下列步驟:

  1. 檢閱文件預覽。

    原始文件的視圖會隨文件的表示法一起顯示,其中文字會取代為區塊。

    區塊是 text 欄位標籤的所有顏色,因為所有現行文字都被視為標準文字,將在 text 欄位中編製索引。

    標籤區塊,代表特定類型的資訊,例如標題或頁面標底,以及其他欄位標籤。 例如,當您將標題欄位標籤套用至原本會檢索為文字的文件標題時,您會定義更精確的文件內容表示法。

    使用標籤來識別文件結構不同部分的程序稱為 註釋 文件。

  2. 檢閱可用來註釋文件的欄位標籤。 它們會顯示在 欄位標籤 畫面中。

    如需欄位及其說明的清單,請參閱 預設欄位標籤 表格。

  3. 若要建立自訂欄位標籤,請按一下 建立新的項目

    • 請指定不含空格的欄位標籤。 例如,complex_task 是有效的欄位標籤。

      請避免在對 Discovery具有特殊意義的名稱中使用欄位標籤名稱或包含字元,例如 # 記號或句點 (.)。 如需相關資訊,請參閱 如何處理欄位

    • 如果您想要變更用來代表欄位的顏色,請反覆地按一下顏色區塊 具有兩個箭頭且指向圓圈的方形顏色區塊,直到以您要使用的顏色顯示為止。

      您稍後無法變更欄位標籤顏色。

    • 按一下建立

  4. 首先,按一下欄位標籤以啟動它。

  5. 接下來,按一下代表您要標示為欄位類型之內容的區塊。

    區塊會變更為欄位標籤的顏色。 您已順利標示欄位!

  6. 重複此程序,以註釋文件中的更多欄位。

    不必擔心。 您不需要為每個頁面加上標籤。 當您套用標籤並提交頁面時,Watson 會從您註釋的內容中學習,並開始預測註釋。

    請遵循下列準則:

    • 如果某個區段沒有特殊的內容,請將它標示為 text,依預設會套用它。
    • 標籤不能跨越多個頁面。
    • 請勿以不同方式處理粗體斜體或有底線的文字。 根據上下文來進行標示,而不要根據樣式。
    • 在所有文件上使用一致的標籤。
    • 從多頁文件的第一頁工作到最後一頁。
    • 若要移除單一註釋,請選擇另一個標籤 (例如 text),並將它套用至項目以改寫前一個註釋。
    • 若要移除您新增至整個頁面的註釋,請按一下工具列中的 清除變更 圖示。
    • 若要註釋表格,請按一下表格開頭的文字,然後拖曳以選取整個表格中的文字。
    • 當您標示一個以上表格時,會自動針對整個集合啟用 Table Understanding 強化。 如需相關資訊,請參閱 瞭解表格
    • 來源文件中的影像不會呈現在預覽中。 如果啟用「光學字元辨識 (OCR)」,則會擷取影像或圖表中的任何文字,並在預覽中呈現。
    • 請勿標示空格。
  7. 當您要標示的所有項目都已標示時,請提交頁面。 按一下 提交頁面

    繼續註釋文件,直到 Watson 可以正確且一致地將不同類型的內容對映至適合您的欄位。

  8. 在教導 Watson 識別欄位之後,請按一下 套用變更並重新處理

您使用 SDU 工具定義的自訂欄位會檢索為根層次欄位。

下一步

當您建置使用者訓練模型時,您可以變更文件中儲存資訊的位置。 接下來,變更搜尋結果的配置方式。 依預設,會從段落或文字欄位擷取搜尋結果。 您可能有更好的欄位可用來作為結果主體的來源。 如需相關資訊,請參閱 變更結果內容

如果虛擬助理正在使用您的專案,請更新搜尋技能配置,以從不同欄位取回回答內文。 如需相關資訊,請參閱 配置搜尋

您可以將強化 (自訂或預先建置的強化) 套用至 SDU 模型所產生的新根欄位。

如果您想要傳回含有搜尋結果的較短文字 Snippet,則可以根據您定義的其中一個新欄位 (例如章節或區段) 來分割文件。

可用的欄位

下列欄位可讓您使用「智慧型文件理解」工具來套用至文件。

這些欄位是任意的。 如果您想要的話,可以將 image 欄位套用至文件中的每個標題。 不過,如果欄位名稱不符合內容,則可能很難知道稍後要搜尋哪個欄位來尋找您需要的資訊。 預設集是用來協助您開始使用的代表欄位類型。 只有 texttable 欄位具有特殊顯著性。 請勿使用它們來識別文字及表格以外的任何項目。

預設欄位標籤
欄位 定義
answer 在一問一答的對答中(常見於常見問答集),問題的答案。
author 作者姓名。
footer 使用此標籤表示出現在頁尾的有關文件的元資訊(如頁碼或參考資料)。
header 使用此標籤表示在頁面開頭出現的有關文件的元資訊。
question 在一問一答的對話中(通常在 FAQ 中),問題。
subtitle 文件的次要標題。
table_of_contents 在文件目錄中的清單上使用此標籤。
text 依預設,文件中的每一個文字區塊都會標示為文字。 僅將不同的標籤套用至具有特殊意義的文字區塊。
title 文件的主標題。
table 使用此標籤可對文件中的表格進行註釋。
image 影像不會顯示在文件預覽中。 如果您啟用 OCR,則影像或圖表中的文字會改為顯示在預覽中。 如果您要防止將部分影像中的文字併入搜尋結果中,請將影像文字標記為影像。 您可以稍後從索引中排除影像欄位。

重複使用 SDU 模型

使用 SDU 工具定義模型之後,您可以將它儲存並在其他集合中重複使用,方法是將它從一個集合匯出並將它匯入至另一個集合。

匯入新模型會改寫集合中的現有模型。 如果已訓練現有模型 (例如透過自訂欄位標籤和註釋),則匯入新模型會影響集合,並可能導致資料流失。

若要重複使用模型,請完成下列步驟:

  1. 匯出要重複使用的模型。 從 SDU 工具列功能表中,選取 匯出模型

    匯入和匯出選單
    匯入和匯出選單

  2. 建立您要在其中重複使用模型的集合。 首先僅將一個文件新增至集合。

  3. 從 SDU 工具列匯入模型。 所匯出模型的副檔名為 .sdumodel

  4. 將其餘文件新增至集合。 開啟「管理集合」頁面的 活動 標籤,然後按一下 上傳資料 以將更多檔案新增至集合。

依現狀使用匯入的模型。 不要再建立任何註釋。 如果您在匯入 .sdumodel 檔案之後進行註釋,則會改寫匯入的模型。

智慧型文件理解限制

您可以根據「智慧型文件理解」模型建立的自訂欄位數目取決於 Discovery 計劃類型。

自訂欄位限制
方案 每個 SDU 模型的自訂欄位
Cloud Pak for Data 無限制
進階 100
企業 100
加號 (包括試用) 40

您可以為每個集合註釋以訓練 SDU 模型的文件數上限取決於 Discovery 計劃類型。

訓練集限制
方案 每個集合的文件數
Cloud Pak for Data 40
進階 40
企業 40
加號 (包括試用) 40

管理欄位

管理欄位標籤包含多個選項:

識別要索引的欄位
如需相關資訊,請參閱 從查詢結果排除內容
透過分割文件改善查詢結果
如需相關資訊,請參閱 分割文件使查詢結果更簡潔
日期格式設定
如需相關資訊,請參閱 日期格式設定

若要存取「管理欄位」頁面,請按一下導覽面板上的「管理收藏集」圖示,然後開啟一個收藏集。 按一下管理欄位標籤。 如需集合的相關資訊,請參閱 建立集合