定義自訂實體

透過建立實體擷取程式,教導 Discovery 重要的術語。

實體擷取程式 是一種機器學習模型,可辨識並標記您指出對商業需要或使用案例而言很重要的術語。 當您建立實體擷取程式時,您可以決定要尋找及擷取之資訊的內容及範圍。 您的擷取程式可以擷取下列任何項目:

  • 代表物件的術語,例如來自烹飪秘訣的蔬菜名稱,或來自事故報告的汽車製造商及模型
  • 物件的屬性,例如顏色和數量
  • 簡短詞組,例如 107 deaths in Francerevenue of $343M

實體類型 是一種事物類型。 若要建立實體擷取程式,您可以定義一組您所關心的 實體類型。 然後,您可以透過尋找代表您要擷取之資訊類型的術語或詞組,來註釋您自己的文件集合,並將它們標示為實體範例。

在定義實體類型和標籤實體範例之後,您可以產生機器學習模型。 模型會根據如何在句子中參照您標示為範例的術語或詞組,來瞭解您所關心的資訊。 模型會從訓練資料中參照實體範例所使用的環境定義和語言中學習。

在充分訓練機器學習模型以辨識實體類型之後,您可以將模型發佈為強化,並將強化套用至新文件。 自訂實體擷取程式強化會辨識並標記相同及類似術語的新提及項目,作為您所關心實體類型的出現項目。

如需如何使用實體擷取程式將網域自訂作業新增至 AI 應用程式的相關資訊,請參閱 實體擷取程式特性 Watson Discovery v2 部落格文章。

Discovery 也有內建 實體 強化,可直接套用至您的集合。 它不需要任何訓練即可辨識一般已知的專有名詞。 如需 Watson NLP 實體強化的相關資訊,請參閱 實體

您已在 Knowledge Studio中建置實體類型系統? 您可以使用與機器學習模型相關聯的語料庫作為實體擷取程式訓練資料的起點。 如需相關資訊,請參閱 匯入語料庫

如需實體擷取程式可搭配使用之語言的相關資訊,請參閱 語言支援

實體擷取程式概觀影片

此視訊提供如何定義自訂實體類型的概觀,然後使用它們從資料中擷取感興趣的術語。

若要讀取影片的文字記錄,請在 YouTube.com 開啟影片,然後按一下其他動作 圖示,然後選擇開啟文字記錄

範例

如果您熟悉內建「實體」強化,則知道強化可以辨識符合一般性種類的術語,例如 PersonLocation。 使用實體擷取程式,您可以控制哪些項目構成有意義的術語或詞組。

下列影像顯示可辨識 family members 實體類型提及項目的強化可能從文字中擷取的術語。 此範例說明如何預測家庭成員提及項目及其他實體提及項目 (由內建實體強化所辨識) 兩者。

顯示來自 Pride and Prejudice with family member (女兒、姐妹、母親) 提及及實體 (Mr. Bennett,Mr. Bingley,Netherfield,Longbourn) 提及標籤的摘錄。
標記實體範例

此摘錄來自 Jane Austen 所著 Pride and Predidea 的第 3 章。

開始之前

尋找或建立含有文件的集合,這些文件具有您要「探索」瞭解之實體類型的各種範例。 若要教導擷取程式,您必須標示實體類型的範例。 如果您的集合包含有效範例,則只能標示範例。 嘗試尋找具有許多不同術語的文件,這些術語可作為您要定義之每個實體類型的範例。

新增實體擷取程式

若要新增實體萃取器,請完成下列步驟:

  1. 開啟您要建立實體萃取器的專案。

    專案必須至少具有一個集合,其中包含代表您網域資料的文件。

  2. 從「改善及自訂」頁面的「改善工具」畫面中,展開 Tach 網域概念,然後按一下 擷取實體

  3. 按一下新建

    如果您要從 IBM Watson® Knowledge Studio 語料庫建立基於實體類型系統的實體擷取程式,請按一下箭頭,然後選擇 匯入 Knowledge Studio 語料庫。 如需後續步驟,請參閱 匯入 Knowledge Studio 語料庫

  4. 新增擷取程式名稱及選擇性地新增說明。

    此名稱用作模型名稱,並用作發佈模型時所建立強化的名稱。 該名稱會在「強化」頁面中顯示為強化名稱,您及其他人可以在其中將它套用至集合。 它也會在文件的 JSON 表示法中顯示為模型名稱,其中會找到自訂實體。 名稱會以您指定的大小寫和間距來儲存。

  5. 選擇具有網域資料代表文件的集合。

  6. 從文件中選擇要在文件視圖中顯示的欄位,您將在其中標示集合中的文件。

    • 文件標題 會顯示在頁面標頭中作為文件名稱。 選擇每個文件具有唯一值的欄位,例如儲存在 extracted_metadata.filename 欄位中的檔名。
    • 文件內文 是您標示實體範例的位置。 選擇包含大量文件內容的欄位,例如 text 欄位。

    顯示 PP3.docx 是文件標題,而主文字畫面顯示內文欄位。
    標籤文件頁

  7. 按一下建立

您選取的集合中的文件會顯示在 標註文件 視圖中。 您將在集合中標示您要「探索」從這個文件及其他文件辨識的實體類型的出現項目。

如果頁面主體中未顯示任何文字,請透過建立新的實體擷取程式來重新開始。 此時,當您選取 文件內文 欄位的值時,請務必從包含文字的已處理文件中選擇一個欄位。

定義實體類型

完成下列步驟來定義實體類型:

  1. 按一下 新增實體類型

  2. 新增實體類型名稱及選用說明。

    請使用適用於您資料的命名慣例。 內建 Entities 強化使用起始大寫而不使用空格,例如 EmailAddress。 若要區分您的實體與其他強化所擷取的實體,您可能想要使用不同的慣例。

  3. 選用項目: 在您要標示為此實體類型範例的文件中,挑選用於強調顯示文字的顏色。

    您可以按一下 標籤顏色 選用區中的顏色,然後按一下 更新顏色 圖示以按 Tab 鍵從一個顏色移至下一個顏色。 若要使用自訂顏色,請指定其十六進位顏色代碼 (#fff0f7)。

  4. 按一下建立

  5. 重複此處理程序,以新增您要擷取程式辨識的所有實體類型。

    如果您不確定要為實體類型新增哪些項目,則最好先檢閱集合中的文件。 透過檢閱內容,您可以瞭解哪些術語具有重要意義,並尋找將此類術語分組的邏輯方法。

標示顯著項

標籤文件 視圖中,從集合中尋找文件中的顯著性術語,並將它們加上標籤以指出其實體類型。

在開始標示文件之前,請決定是否要保持啟用大量標示。 大量標籤功能是加快文件標籤處理程序的好方法。 啟用時,您所標示的每一個術語都會在文件中出現的任何地方自動加上標籤。 否則,您必須逐一標示該術語的每一個出現項目。

如果您決定不要大量標籤範例,請將 大量標籤實體範例 切換參數設為 關閉。 如需相關資訊,請參閱 大量標註範例

標註提示

開始之前,請先檢閱下列提示:

  • 您標示的文件集合必須包含一組具代表性的文件。 文件必須具有您要實體擷取程式辨識之實體類型的許多不同範例。 如果您在開始建立實體擷取程式時選取的集合不符合需求,請立即停止並重新開始使用不同的文件集合。
  • 定義彼此明顯不同的實體類型。
  • 針對每一個實體類型至少標註 40 個範例。
  • 標示實體類型的每一個有效範例。 請勿跳過任何出現項目。 若要加速處理程序,請使用大量標籤功能。

標示實體範例

標示文件中代表您所定義實體類型範例的術語。 當您完成一個文件時,請將文件狀態從 進行中 切換至 完成,然後移至下一個文件。

若要標示實體範例,請完成下列步驟:

  1. 檢閱文件的文字。 尋找要標示的實體範例。

    下表顯示一些範例。

    實體類型和範例
    實體類型 要在文件中標示的範例
    顏色 白色、綠色、紫色
    汽車 敞篷車,SUV,轎車
    AUTO_MODEL 探險家、思域、索倫託
    自動製造商 福特、本田、起亞
    clothing 襯衫、襯衫、鞋
    儀器 債券,股票,ETF,munis

    如果尚未建立您要識別的實體類型,請新增實體類型。 從「實體類型」畫面中,按一下 建立新的項目。 如需新增實體類型的相關資訊,請參閱 定義實體類型

  2. 首先,從 實體類型 畫面中按一下實體類型。

  3. 在文件內文中,選取代表實體範例的單字或詞組。

    即會選取術語,並將顏色標籤套用至該術語。 實體類型名稱的前兩個字元會在標籤界限內以大寫上標顯示。 2 個字元的 ID 和標籤顏色都可協助您將範例與它所代表的實體類型相關聯。

    顯示將標籤套用至句子中的字組「妻子」。
    標籤應用於實體範例

    範例文字也會新增至 實體類型 畫面。 如果您按一下箭頭以檢視詳細資料,則可以看到已列出範例。 範例文字會以小寫形式儲存,而不論原始文字中使用的大小寫為何。

  4. 如果已啟用大量標示,則會顯示通知,以顯示在現行文件中找到並標示術語的出現次數。

  5. 如果您要標示集合中所有文件的術語出現處,請按一下 套用至所有文件

    當您啟用此選項時,會在集合中的所有文件 (包括您已檢閱並標示為完成的文件) 中標示該術語的出現項目。

    系統會要求您確認動作,因為它無法復原。 如果您不想要在每次選擇將大量標籤套用至所有文件時都必須確認該動作,請選取 不要再次要求確認。 按一下執行

    顯示大量標示確認對話框。
    批次標籤配置確認

    如需相關資訊,請參閱 大量標註範例

  6. 捲動文件,以標示您要擷取程式辨識之每一個實體類型的每一個有效範例。

    您可以搜尋要標示為實體範例的詞彙。 如需相關資訊,請參閱 使用關鍵字搜尋範例

    機器學習模型會從您不標示的術語中學習與您所執行的術語一樣多。

    如果您遺漏標註有效範例,則模型會瞭解在該環境定義中使用術語時,它不是實體類型的有效提及項目。 在某些情況下,省略是適當的。 例如,部分術語在不同環境定義中具有不同的意義。 在錯誤的環境定義中使用術語時,您不想要標示該術語。 不過,如果在正確的環境定義中使用該術語,且您未標示它,則會教導模型忽略它。 當訓練資料不一致時,您可以降低模型的有效性。

    在標示許多範例之後,會顯示實體範例建議。 您可以接受或拒絕實體範例建議。

    顯示所顯示的提示,以詢問您是否要接受建議。
    決定是否接受建議

    接受範例建議是加速標籤處理程序的另一種方式。 如需相關資訊,請參閱 實體範例建議。 接受建議之後,您可以大量標示術語。

  7. 如果您犯錯誤並標示錯誤單字,或大量標示處理程序未正確標示單字,則您可以刪除標籤。

    將滑鼠移至含標籤的單字上,直到顯示 刪除此範例 選項,然後按一下該單字。 您可以選擇只刪除此提及項目或文件中的所有提及項目。 做出選擇,然後按一下 刪除

  8. 在標示現行文件中的所有實體範例之後,請將文件狀態從 進行中 變更為 完成

    即會顯示集合中的另一個文件。

  9. 集合中每一個文件中實體類型的標籤範例。

    在標籤處理程序期間,您隨時可以按一下 儲存實體擷取程式,以儲存您的工作。

  10. 如果現行文件集中沒有足夠的範例,您可以新增更多文件。

    從「文件清單」畫面中,按一下 新增文件。 僅當集合中有更多文件可用時,此選項才可用。 您最多可以新增 20 個文件。 如果已啟用所有文件的大量標籤,則標籤會自動套用至新增的文件。

  11. 在集合中任意數目的文件中標示範例之後,請按一下 儲存實體擷取程式,然後開啟 訓練擷取程式 頁面。

大量標註範例

對於大部分實體範例,啟用大量標籤功能很有用。 如果術語在不同環境定義中具有多個意義,則您可能想要跳過它。 在這種情況下,請個別評估每一個出現項目。 請記住,如果您啟用大量標籤功能,則可以檢查自動新增之標籤的正確性,並在檢閱文件時必要時進行更正。

啟用大量標籤功能之後,會顯示一則通知,指出在現行文件中找到實體範例的出現次數。 從現行頁面中,標籤工具無法存取其他文件,以報告集合中其他文件中存在的出現次數。 不過,提及項目計數會顯示在 實體類型 畫面中。 當您第一次開啟其他文件時,您可以檢查提及項目計數,以查看自動標示的提及項目數目。

大量標籤特性是否遺漏出現項目?

如果詞彙出現在已標示該詞彙的相同詞組中,則不會標示該詞彙的出現項目。 例如,在下列句子中針對術語的第二次出現開啟大量標籤功能時,術語 husband 的第一次出現不會標示。

當大量標籤功能未提供標籤給重疊出現項目時顯示。
重疊標籤的處理

實體範例建議

在您標示足夠的範例之後,會顯示建議的實體類型範例。 系統會從您標示的範例類型中學習,並套用它所學習的內容,以識別潛在的新範例。 例如,在您將 redorangeyellowgreenblue 標示為 color 實體類型的範例之後,建議範例 畫面可能會顯示 indigoviolet 作為建議您標示的範例。 在您標示實體類型的許多範例之前,不會顯示建議。

下列範例顯示針對家庭成員提及項目所提出的建議。

顯示系列成員實體的建議。
實體範例建議

您可能注意到您選擇要大量標註的術語未加上標籤,而是顯示為建議。 在下列情況下會跳過術語:

  • 術語可能出現在文件不同區段中的不同名詞詞組中。 例如,術語 father 可能出現在名詞詞組 the kindest *father*to her *father* 中。 當單字包含在具有形容詞的名詞詞組中時,意義會變更。 因此,有時會建議此類術語,而不是自動標示。
  • 單字可能是其本身的有效範例,並作為多單字提及項目的一部分。 For example, a mention of IBM might refer to the company International Business Machines, Corp. or might be used as part of a product name, such as IBM Cloud Pak for Data. 不過,單字或詞組只能是一個範例的一部分。 範例標籤不能彼此重疊。 因此,您必須選擇哪個範例建議最精確。 In this example, where the term IBM is used as part of a product name, it is more accurate to label the full phrase as an example of the Product entity type.
  • 服務可能會辨識術語是多個實體類型的可能範例。 例如,單字 top 可能表示 最佳 或可能表示 襯衫

若要進一步調查建議,請按一下它以查看文件內環境定義中的單字。 查看環境定義中的術語可協助您決定出現項目是否為您要標示的有效實體範例。

匯出實體擷取程式的標示資料

您可以從 Discovery匯出實體擷取程式的標示資料。 您可以使用匯出的標籤資料,在 Watson Studio 及「自然語言處理程序 (NLP)」之類的服務上訓練或建置大型語言模型 (LLM)。

若要匯出已標籤的資料,請完成下列步驟:

  1. 從「改善及自訂」頁面的「改善工具」畫面中,展開 Tach 網域概念,然後按一下 擷取實體

  2. 對於您要從中匯出含標籤的資料的實體擷取程式,請按一下 動作 圖示,然後選取 下載含標籤的資料

    下載含標籤資料的壓縮檔。 壓縮檔包含下列 JSON 檔案。

    • labeled_data.json: 包含文字和標籤。 資料格式基於 Watson Natural Language Processing 中實體擷取的輸入資料格式。 如需相關資訊,請參閱 輸入資料格式
    • metadata.json: 包含工作區及含標籤資料的 meta 資料。

匯入 Knowledge Studio 語料庫

對於已安裝的部署,已隨 4.6.2 版新增匯入功能。

您可以匯入已在 IBM Watson® Knowledge Studio 中註釋的文件語料庫,以用作 Discovery中實體擷取程式的訓練資料。

Knowledge Studio 中定義的實體類型在 Discovery中顯示為新的實體類型。 自訂實體擷取程式模型時,您可以繼續註釋匯入的文件。

不會代表來自 Knowledge Studio 機器學習模型的實體子類型和關係,也不會代表與模型相關聯的任何自訂字典。

您必須先從 Knowledge Studio 將文件集匯出為 .zip 檔,然後才能匯入語料庫。 請遵循適當的步驟,以根據 Knowledge Studio 部署類型來匯出:

雖然您必須同時下載文件集和類型系統,才能將註釋包含在您上傳至另一個 Knowledge Studio 工作區的文件中,但在此使用案例中並不如此。 您只將文件集匯入至 Discovery。 在 Discovery中重建文件中的任何註釋。 不需要 Knowledge Studio 類型系統。

若要匯入 Knowledge Studio 語料庫,請完成下列步驟:

  1. 開啟您要匯入語料庫的專案。

  2. 從「改善及自訂」頁面的「改善工具」畫面中,展開 Tach 網域概念,然後按一下 擷取實體

  3. 按一下與 新建 按鈕相關聯的箭頭。然後按一下 匯入 Knowledge Studio 語料庫

  4. 新增擷取程式名稱及選擇性地新增說明。

    此名稱用作模型名稱,並用作發佈模型時所建立強化的名稱。 該名稱會在「強化」頁面中顯示為強化名稱,您及其他人可以在其中將它套用至集合。 它也會在文件的 JSON 表示法中顯示為模型名稱,其中會找到自訂實體。 名稱會以您指定的大小寫和間距來儲存。

  5. 按一下 上傳,然後瀏覽以尋找並選取您從 Knowledge Studio匯出的 .zip 檔。 按一下建立

    您上傳的註釋文件會與實體擷取程式工作區一起儲存,而不是作為專案中的新集合。 您可以繼續註釋文件。

給 Discovery 一些時間來匯入並處理機器學習模型語料庫。 建立實體擷取程式之後,擷取程式會開啟至 標籤文件 頁面。

訓練擷取程式

在標示文件之後,請檢閱將用來訓練實體擷取程式模型的訓練資料。

若要訓練擷取程式,請完成下列步驟:

  1. 決定是否要套用進階選項。 大部分模型不需要變更這些選項。

    檢閱並完成 頁面提供下列自訂作業:

    • 包括訓練集中未由人員檢閱的文件。

      通常,只有人員標示、檢閱及明確標示完成的文件才可以成為要併入訓練集的候選項。 不過,如果您想要讓未標示為完成的文件併入訓練集中,您可以這麼做。

    • 變更包含訓練資料之文件集中包含的文件比例。

      集合中的文件會隨機分割成下列集合:

      • 訓練集: 您所標示及用來訓練實體擷取程式機器學習模型的文件。 訓練集的目標是教導機器學習模型正確的標籤。
      • 測試集: 用來測試訓練模型的文件。 執行測試之後,您可以檢閱結果,密切分析模型發生錯誤的區域,並尋找改善模型效能的方法。
      • 盲目集: 在完成數次測試和改善反覆運算之後,保留並用來定期測試模型的文件。 盲區集中的文件是故意被打飛的。 當您使用測試集中的文件來測試模型並分析結果時,您會熟悉基礎測試文件。 因為測試文件是用來反覆改善模型的,所以它們可以開始間接影響模型的訓練。 這就是為什麼盲集文件如此重要的原因。 盲目集可讓您定期產生模型的無偏誤評估。

      預設分割會套用通常用於機器學習訓練的比例 (70 %-23 %-7%)。

  2. 按一下 訓練擷取程式

當您訓練擷取程式時,Discovery 會使用訓練集的文件來建置機器學習模型。 產生模型之後,它會自動對測試集中的文件執行測試。 即會顯示測試結果,供您檢閱。

疑難排解訓練問題

瞭解可能的錯誤訊息以及如何處理它們。

訓練資料太大

您的訓練資料包含大型文字文件,或處理資料所需的許多實體類型及資源大於服務實例可用的資源。 即使您的工作區未超出所記載的實體擷取程式限制,也可能會發生此錯誤。 要解決這個問題,您可以嘗試以下其中一種方法:

  • 移除一或多個實體類型,以減少訓練資料的大小。
  • 從訓練資料中移除額外的大型文件。 例如,如果其中一個標示的文件特別大,請將其狀態從 已完成 變更為 進行中,以從訓練資料中省略該文件。
  • 減少訓練集中包含的文件數。 訓練資料的預設分割比例 (70 %-23 %-7%) 使用訓練集中 70% 的文件。 您可以將訓練集中使用的文件百分比變更為較小的數字。 例如,您可以將分割比例變更為 60 %-33 %-7%。
  • IBM Cloud Pak for DataIBM Software Hub 透過擴充服務 pod 來增加已部署服務實例的容量。

評估擷取程式

若要檢閱您所建立之實體擷取程式模型的測試執行中的度量值,請按一下 評估擷取程式 標籤。

下表說明可用的評估指標。

度量值詳細資料
度量 說明
混淆矩陣 提供已註釋文件集之詳細數字分析的表格。 使用它來比較機器學習模型所標示的實體類型提及項目與訓練資料中所標示的實體類型提及項目。
F1 評分 測量是否達到查準率與查全率之間的最佳平衡。 F1 分數可以解譯為查準率與查全率值的加權平均。 F1 分數的最佳值為 1,最差值為 0。 如果模型沒有足夠的訓練資料可從中學習,則整體評分較低。
精準度 測量有多少整體擷取的提及項目分類為正確的實體類型。 誤判是指不應擷取實體,但已擷取 (預測 = 正、實際 = 負)。 誤判通常表示低精準度。
查全率 測量應擷取實體類型提及項目的頻率。 誤否定是指應該擷取實體類型,但未擷取 (預測 = 負數,實際 = 正數)。 誤否定通常表示低查全率。
  1. 檢閱所提供關於擷取程式模型測試執行的度量值,以判定是否需要更多訓練。

  2. 按一下 檢閱測試集中的訓練結果,以更詳細地探索測試結果。

    測試集中的文件會以一個畫面中顯示的預測標籤和另一個畫面中顯示的基準來顯示。

    • 預測標籤是實體擷取程式識別並標示為實體類型的範例。
    • 基準 包含人員所標示或由人員大量標示及檢閱的範例。 基準中的標籤被視為正確的標籤。

    模型的效能會根據預測標籤與基準的相符程度來分級。

改善擷取程式

下表顯示一般問題的建議修正程式。

改善動作
問題 補救問題的動作
整體評分低 您的訓練集中可能沒有足夠的文件具有含標籤的範例。 在更多文件中標示更多範例。
低查全率 使用擷取程式遺漏的實體類型新範例來標示更多文件。
低查準率 尋找經常混淆的實體類型。 尋找並標示每一個實體類型的更多範例,以協助實體擷取程式區分實體類型。

將文件新增至訓練資料

若要新增更多文件,請完成下列步驟:

  1. 開啟 標註文件 標籤。

  2. 從「文件清單」畫面中,選擇 新增文件

    如果沒有其他文件可從現行集合新增至實體擷取程式,則會停用此按鈕。 若要將更多文件新增至集合,請跳至集合的「活動」頁面,然後按一下 上傳資料 磚以瀏覽並新增更多檔案。

您無法從集合中選擇要在 文件清單 中顯示的文件以進行標註。 如果您想要標示特定類型的文件,請考量將代表文件新增至可用來建立實體擷取程式的集合。

可以包含在訓練資料中的文件數有限制。 如果您的訓練資料包括具有已標示區段的組合,以及其他未標示區段的組合,則系統可能會從未標示的句子中取樣部分範例。 子取樣有助於平衡用於訓練的正面及負面範例數目。 平衡訓練集中的範例可改善訓練效能。

將實體擷取程式發佈為強化

當您認為實體擷取程式已備妥時,請發佈實體擷取程式。 你怎麼知道它準備好了? 在您進行改良的數個測試執行之後,如果評分未變更,則模型已備妥。 您可以在發佈模型之後返回以更新並重新訓練模型。

  1. 評估擷取程式 頁面中,按一下 發佈擷取程式
  2. 按一下套用至資料
  3. 選擇集合,然後選取您要套用實體擷取程式強化的文件欄位。
  4. 按一下套用

匯出實體擷取程式

對於已安裝的部署,隨 4.6.2 版新增了匯出功能。

您在一個專案中建立並部署的實體擷取程式模型可作為強化,可套用至相同服務實例中任何專案的集合。

如果您想要在另一個服務實例的專案中使用實體擷取程式模型,則可以匯出實體擷取程式。 若要在其他位置使用它,請遵循 使用匯入的 ML 模型來尋找自訂項目 中的步驟來建立機器學習模型。 您無法繼續編輯匯入至另一個專案的實體擷取程式。

您要匯出的實體擷取程式必須經過完整訓練。

若要匯出實體擷取程式,請完成下列步驟:

  1. 使用您要匯出的實體擷取程式開啟專案。

  2. 從「改善及自訂」頁面的「改善工具」畫面中,展開 Tach 網域概念,然後按一下 擷取實體

  3. 實體擷取程式 清單中,尋找您要匯出的實體擷取程式。

  4. 按一下擷取程式的 動作 圖示,然後選擇 下載模型 以將模型儲存至系統。

    除非已訓練模型,否則無法使用 下載模型 選項。

實體擷取程式模型儲存為 .ent 檔案。 您可以將它作為機器學習模型匯入至另一個服務實例中的專案,然後將它套用至集合。 如需匯入模型的相關資訊,請參閱 使用匯入的 ML 模型來尋找自訂項目

套用實體擷取程式強化

發佈擷取程式時,您可以指定要套用擷取程式的欄位。 如果您稍後決定將強化套用至不同的或多個欄位,則可以遵循下列步驟來執行此動作。

  1. 從導覽畫面中,按一下 管理集合
  2. 按一下以開啟您要套用強化的集合。
  3. 按一下 強化
  4. 在清單中尋找實體擷取程式名稱,然後選擇要套用強化的欄位。
  5. 按一下套用變更並重新處理

如需如何從集合中移除實體擷取程式強化的相關資訊,請參閱 管理強化

實體擷取程式輸出

當強化辨識文件中的其中一個自訂實體時,會將項目新增至文件 JSON 表示法的 enriched_text.entities 區段。 該區段包含自訂模型可辨識的實體,以及內建實體強化可辨識的實體。 內建強化使用 Watson NLP 服務來識別屬於它所稱 Natural Language Understanding 類型系統的實體。 如需內建實體強化的相關資訊,請參閱 實體

下列 JSON 輸出由名為 literature 的自訂模型產生,可辨識系列成員提及項目。

顯示具有自訂實體提及項目之文件的 JSON 輸出。
自訂實體提及的 JSON 表示

監視一段時間內的效能

您可以隨時重新訓練實體擷取程式模型。 每次訓練模型時,請檢閱效能指標評分,以判定您最近的變更是增加還是減少模型的評分。

  1. 如果要比較一項測試執行與另一項測試執行,請按一下 檢視評分歷程

    歷程視圖會顯示最後 5 個訓練執行。

    若要保留評分資訊超過最近 5 個訓練執行的時間,您可以以逗點區隔值格式匯出度量值,並在個別應用程式中追蹤評分。 按一下表狀表示法圖示 表狀表示法圖示,然後按一下 下載為 CSV

如果後續訓練執行導致較低的評分,請不要發佈該版本的模型。

刪除實體擷取程式

您可以刪除未使用的實體擷取程式,這表示從實體擷取程式發佈的強化不會套用至集合。

例如,如果您達到方案容許的擷取程式數目上限,則可能想要刪除實體擷取程式。

請記住,限制是根據服務實例而非專案來定義。 如果您無法建立新的實體擷取程式,但現行專案中沒有擷取程式數目上限,請檢查相同服務實例中的其他專案。 可能有實體擷取程式未在其他可刪除的專案中使用。

  1. 從您要從使用實體擷取程式的任何集合中刪除的實體擷取程式中,移除已發佈的實體擷取程式強化。

    如需相關資訊,請參閱 刪除強化

  2. 從「改善及自訂」頁面的「改善工具」畫面中,展開 Tach 網域概念,然後按一下 擷取實體

  3. 尋找您要刪除的實體擷取程式,按一下 動作 圖示,然後選取 刪除

實體擷取程式限制

您可以為每個服務實例建立的實體擷取程式數目取決於 Discovery 方案類型。

實體擷取程式計劃限制
方案 每個服務實例的實體擷取程式[1] 每個擷取程式的實體類型數上限 訓練資料中的文件數上限
Cloud Pak for Data 無限制 18 1,000 家
進階 10 18 1,000 家
企業 10 18 1,000 家
加號 (包括試用) 3 12 200

  1. 此數字反映服務實例 (包括來自所匯入實體擷取程式模型) 的已發佈實體擷取程式強化數目,不論它們是否套用至集合。 ↩︎