此文件適用於 IBM Watson® Knowledge Studio on IBM Cloud®。 若要查看舊版 Knowledge Studio on IBM Marketplace 的文件,請按一下此鏈結。
引導註釋
藉由預先註釋工作區中的文件,來簡化註釋人員的工作。 預先註釋程式是 Knowledge Studio 字典、以規則為基礎的模型或機器學習模型,您可以執行它們,以自動尋找並註釋提及項目。
預先註釋可讓註釋人員的工作更輕鬆,因為它涵蓋直接明確的註釋,並開始進行註釋文件的工作。
用於預先註釋文件的方法絕不會限制您可以使用產生模型的方式。 例如,只因為您使用 Natural Language Understanding 服務來預先註釋文件,並不表示您必須將建置的最終機器學習模型部署至 Natural Language Understanding 服務。
預先註釋方法
以下是可用的預先註釋程式:
-
Natural Language Understanding
您可以使用預先註釋程式,自動在文件中尋找實體提及項目。 如果您的來源文件具有一般的知識主題,則此預先註釋程式是您適用的良好選擇。 例如,如果您是使用專注於特定領域(例如專利法研究)的高度特殊化文件,則字典預先註釋程式或以規則為基礎的模型可能是更適當的選擇。
-
字典
使用您提供的詞彙字典,並建立與實體類型的關聯,以在文件中尋找實體類型的提及項目。 此選項最適用於具有獨特或特殊化術語的領域,因為這個預先註釋程式不會分析以機器學習預先註釋程式執行方式使用詞彙的上下文;它反而會根據有顯著差別的詞彙,以具有可判讀的意義,而不論其使用詞彙的上下文。 例如,將石棉 辨識為礦物實體類型,比判定為壓扁 實體類型更為容易,而此實體類型可能是蔬菜、運動或壓碎某個東西的動詞意義。
字典預先註釋程式不會辨識實體子類型。 註釋人員可以使用預先註釋的文件執行註釋作業,為每個預先註釋的提及項目指定實體子類型。
-
機器學習
使用機器學習模型來自動註釋文件。 只有在您已使用 Knowledge Studio 建立機器學習模型時,此選項才可供使用。 如果您新增文件集,則可以執行之前建立的機器學習註釋程式,以預先註釋新文件。 如果新的文件集與原本用來訓練機器學習註釋程式的文件類似,則這可能是進行預先註釋的最佳選擇。
-
規則
使用以規則為基礎的模型來自動註釋文件。 只有在您已使用 Knowledge Studio 建立以規則為基礎的模型時,此選項才可供使用。 如果您的文件包含可以從中衍生意義的一般記號型樣,則此模型可能是良好的選項。 它可以納入字典預先註釋程式(如果啟用它的話)的部分函數,方法為識別其也會在文件中尋找之字典詞彙的類別類型。
或者,您也可以上傳已註釋的文件,並使用它們來開始訓練機器學習模型。 您不能對上傳的已註釋文件執行預先註釋程式,否則現有註釋將從文件中除去,並僅取代為預先註釋程式所產生的註釋。
執行多個預先註釋程式
Knowledge Studio 可讓您一次執行多個預先註釋程式。 首先,您需要準備要使用的預先註釋方法。 如需相關資訊,請參閱下列各節:
配置預先註釋程式順序
使用多個預先註釋程式時,會針對結果儲存第一個對文字段進行的註釋,即使其他預先註釋程式稍後依序嘗試對相同文字段進行註釋也是一樣。 這不適用於人工註釋,而且不論預先註釋順序為何都會予以保留。
例如,請考慮範例文字 IBM Watson。 如果第一個順序的字典將 IBM 標示為 Organization 實體類型,則第二個順序的機器學習模型無法將 IBM Watson 註釋為 Software Brand 實體類型,因為這會置換對 IBM 進行的較舊註釋。
您可以在機器學習模型 > 預先註釋頁面的順序直欄中檢視預先註釋程式的現行順序。 若要變更順序,請完成下列步驟。
- 按一下訂單設定。
- 按一下上移和下移箭頭** 按鈕,以在順序之前或之後移動預先註釋方法。
- 按一下儲存。
- 再次檢查預先註釋頁面上的順序直欄,以確定它符合您要的順序。
執行預先註釋程式
- 在準備好預先註釋方法而且您已配置預先註釋程式的順序之後,請按一下執行預先註釋程式。
- 選取您要使用的預先註釋程式,然後按下一步。
- 如果您要在執行預先註釋程式之前消除預先註釋程式所進行的現有註釋,則請選取清除先前的預先註釋結果。 即使選取此項目,還是會保留人工註釋。
- 選取您要預先註釋的文件集。
- 按一下執行。
以 Natural Language Understanding 預先註釋文件
您可以使用 Natural Language Understanding 服務,來預先註釋您新增至語料庫的文件。
開始之前
判斷 Natural Language Understanding 預先註釋程式是否可能為您的使用案例新增值。 請檢閱支援的 Natural Language Understanding 服務實體類型及子類型清單,以判斷它們與類型系統中的類型之間是否有自然重疊。 若有的話,請繼續執行此程序。 若沒有,請選擇不同的預先註釋程式來使用。
關於此作業
Natural Language Understanding 是透過自然語言處理程序提供文字分析的服務。 當您使用 Natural Language Understanding 預先註釋程式時,它會呼叫 Natural Language Understanding 服務來尋找及註釋文件中的實體。
您必須指定您要服務尋找的實體類型,方法為將 Natural Language Understanding 實體類型對映至已新增至 Knowledge Studio 類型系統的 Knowledge Studio 實體類型。 只會尋找並註釋您所對映的實體類型提及項目。
程序
若要使用 Natural Language Understanding 服務來預先註釋文件,請完成下列步驟:
-
以 Knowledge Studio 管理者身分登入,並選取您的工作區。
-
移至機器學習模型 > 預先註釋頁面。
-
按一下 Natural Language Understanding 列中的溢位功能表按鈕,然後按一下對映實體類型。
- Natural Language Understanding 實體類型的下拉清單會預先移入 Natural Language Understanding 服務所辨識的實體類型。
- 您必須至少對映一個實體類型。
- 您無法將 Natural Language Understanding 實體類型對映至 Knowledge Studio 實體角色,只能對映至 Knowledge Studio 實體類型。
- 您可以將多個 Natural Language Understanding 實體類型對映至單一 Knowledge Studio 實體類型,或其他方式。 例如,允許下列對映:
表 1. 實體類型的範例映射 | Watson Knowledge Studio 實體類型 | Natural Language Understanding 實體類型 | | --- | --- | | ENGINEER
SCIENTIST | Person | 工程師 | 城市
國家 -
在對映您要套用的所有實體類型之後,請移至機器學習模型 > 預先註釋頁面。 按一下執行預先註釋程式。
-
選取 Natural Language Understanding,然後按下一步。
除非您至少對映一個實體類型,否則 Natural Language Understanding 註釋程式無法使用。
-
執行預先註解器時,請選擇抹除先前的預先註解結果。 即使選取此項目,還是會保留人工註釋。
-
選取您想要預先註釋的每一個文件集的勾選框。
如果您是第一次執行此預先註釋程式,請先驗證預先註釋程式可以如預期找到對映實體提及項目。 建立一個文件集,其中包含代表性文件,或來自每一個不同資料來源的文件。
-
按一下執行。
如果您是執行預先註釋程式的驗證檢查,請開啟已註釋文件,並檢閱已新增的註釋。 請確定已建立足夠的正確註釋數目。 如果註釋正確,則您可以在更多及更大的文件集上重新執行註釋程式。 如果註釋不正確,請考慮將不同的 Natural Language Understanding 實體類型對映至您的類型。 如果類型未自然重疊,則 Natural Language Understanding 預先註釋程式不是供您使用的最佳預先註釋程式。
預先註釋會套用至個別文件,而不會顧慮文件可能隸屬的各種文件集。 在已選取文件集與未選取文件集之間重疊的文件,在這兩個文件集中將為已預先註釋。
結果
由 Natural Language Understanding 服務預先註釋之文件所產生的基準,無法直接在 Knowledge Studio 之外使用。 您可以下載基準(以不可讀取的格式表示),以將它從某個 Knowledge Studio 工作區移至另一個工作區。 您可以繼續開發基準,並用它來建置機器學習模型或以規則為基礎的模型,然後部署此模型,以在 Knowledge Studio 之外的服務中使用。
使用 Natural Language Understanding 預先註釋的文件在下載時會遮蔽為無法讀取的格式。 但是,那些文件中的所有註釋都會被遮蔽,包括由註釋人員新增至文件的註釋。
相關資訊:
以字典預先註釋文件
若要協助註釋人員開始使用其註釋作業,您可以建立字典,並使用它來預先註釋您新增至語料庫的文件。
關於此作業
當註釋人員開始使用已預先註釋的文件時,實體類型可能已根據字典項目標示一些提及項目。 註釋人員可以變更或移除預先註釋的實體類型,並將實體類型指派給未註釋的提及項目。 由字典進行的預先註釋不會註釋關係及互相參照。 關係及互相參照必須由註釋人員註釋。
此作業顯示如何建立可編輯的字典。 如果您要使用唯讀字典來上傳及預先註釋文件,請按一下建立字典按鈕旁邊的功能表圖示,然後選取上傳字典。
程序
若要建立可編輯字典並對文件進行預先註釋,請遵循下列步驟:
-
以 Knowledge Studio 管理者身分登入,並選取您的工作區。
-
選取資產 > 字典頁面。
-
按一下建立字典,輸入名稱,然後按一下儲存。
-
從實體類型清單中,選取要與字典相關聯的實體類型。
您也可以從機器學習模型 > 預先註釋頁面建立實體類型與字典的關聯。 按一下頁面之「字典」列中的溢位功能表按鈕,然後按一下對映實體類型。
-
新增字典的項目,或上傳包含字典詞彙的檔案。
-
移至機器學習模型 > 預先註釋頁面。
-
按一下執行預先註釋程式。
-
選取字典,然後按下一步。
-
如果您要在執行預先註釋程式之前消除預先註釋程式所進行的現有註釋,則請選取清除先前的預先註釋結果。 即使選取此項目,還是會保留人工註釋。
-
選取您想要預先註釋的每一個文件集的勾選框,然後按一下執行。
預先註釋會套用至個別文件,而不會顧慮文件可能隸屬的各種文件集或註釋集。 在已選取文件集與未選取文件集之間重疊的文件,在這兩個文件集中將為已預先註釋。
相關資訊:
以機器學習模型預先註釋文件
您可以使用現有機器學習模型,來預先註釋您新增至語料庫的文件。
關於此作業
在註釋 10 到 30 個文件之後,可根據資料進行機器學習模型訓練。 請不要在正式作業中使用這類訓練最少的模型。 不過,您可以使用此模型來對文件預先註釋,以協助加速後續文件的人工註釋。 例如,如果您在訓練機器學習模型之後將文件新增至語料庫,則可以使用此模型來預先註釋新的文件集。 絕不在人員註釋的相同文件上執行預先註釋程式。 預先註釋程式會移除人工註釋。
程序
若要使用現有機器學習模型來預先註釋文件,請執行下列動作:
-
以 Knowledge Studio 管理者身分登入,並選取您的工作區。
-
移至機器學習模型 > 預先註釋頁面。
-
按一下執行預先註釋程式。
-
選取機器學習模型,然後按下一步。
-
如果您要在執行預先註釋程式之前消除預先註釋程式所進行的現有註釋,則請選取清除先前的預先註釋結果。 即使選取此項目,還是會保留人工註釋。
-
選取您想要預先註釋的每一個文件集的勾選框,然後按一下執行。
預先註釋會套用至個別文件,而不會顧慮文件可能隸屬的各種文件集或註釋集。 在已選取文件集與未選取文件集之間重疊的文件,在這兩個文件集中將為已預先註釋。
使用以規則為基礎的模型預先註釋文件
規則編輯將於 2025 年 6 月 30 日結束。 如需詳細資訊,請參閱 發行說明。
您可以使用現有以規則為基礎的模型,來預先註釋您新增至語料庫的文件。
程序
若要使用以規則為基礎的模型來預先註釋文件,請完成下列步驟:
-
以 Knowledge Studio 管理者身分登入,並選取您的工作區。
-
移至機器學習模型 > 預先註釋頁面。
-
按一下頁面之「以規則為基礎的模型」列中的溢位功能表按鈕,然後按一下對映實體類型和類別,將您已在 Knowledge Studio 類型系統中定義的實體類型,對映至一個以上以規則為基礎的模型類別。
您也可以選取以規則為基礎的模型 > 版本 > 以規則為基礎的模型標籤,來開啟對映頁面。
-
針對您要對映的每一個實體類型,按一下編輯。
- 類別名稱直欄的下拉清單會預先移入與以規則為基礎的模型相關聯的類別。
- 您必須至少將一個實體類型對映至類別。
-
在機器學習模型 > 預先註釋頁面上,按一下執行預先註釋程式。
除非您至少將一個實體類型對映至類別,否則「以規則為基礎的模型」選項無法使用。
-
如果您要在執行預先註釋程式之前消除預先註釋程式所進行的現有註釋,則請選取清除先前的預先註釋結果。 即使選取此項目,還是會保留人工註釋。
-
選取您要預先註釋的文件集或註釋集。
-
按一下執行。
預先註釋會套用至個別文件,而不會顧慮文件可能隸屬的各種文件集。 在已選取文件集與未選取文件集之間重疊的文件,在這兩個文件集中將顯示為已預先註釋。
上傳預先註釋的文件
您可以透過 Unstructured Information Management Architecture (UIMA) 分析引擎上傳預先註釋的文件,以快速開始訓練模型。
預先註釋的文件必須位於「UIMA 共用分析結構 (UIMA CAS XMI)」的 XMI 序列化表單中。 您上傳的 .zip 檔必須包括 UIMA TypeSystem 描述子檔案,以及將 UIMA 類型對映至 Knowledge Studio 類型系統中實體類型的檔案。
UIMA CAS XMI 是 Apache UIMA 的標準格式。 提供的準則可讓您以正確格式從 IBM Watson Explorer 中的已分析集合建立檔案。 如果您使用另一個 Apache UIMA 實作,請根據您的目的來調整這些準則。 不論您如何建立 XMI 檔案,每個人建立類型系統對映檔及 .zip 檔的需求都相同。
如果您將匯入的文件指派給註釋人員,則在基準編輯器中會預先註釋文件,而且可能已註釋一些提及項目。 因此,註釋人員有更多時間可以專注在將註釋準則套用至未標示的提及項目。 或者,您也可以略過人工註釋步驟,並使用預先註釋的文件來立即開始訓練及評估機器學習模型。
從 Watson Explorer Content Analytics 匯出已分析的文件
您可以匯出已在 IBM Watson Explorer Content Analytics 中搜索及分析的文件,並將分析的文件當作 XMI 檔上傳至 Knowledge Studio 工作區。
程序
若要從 Watson Explorer Content Analytics 集合中取得已分析的文件,請遵循下列步驟:
-
在 Web 瀏覽器中開啟 Content Analytics 管理主控台。
-
在「集合」視圖上,展開您要從中匯出文件的集合。 在「剖析及索引」窗格中,確保剖析及索引程序正在執行中,然後按一下匯出已分析文件內容及 meta 資料的箭頭圖示。
-
在已分析的文件匯出選項區域中,選取將文件匯出為 XML 檔、選取將 CAS 啟用為 XMI 格式匯出勾選框、指定要寫入已匯出資料的輸出路徑,然後按一下確定。
-
停止並重新啟動集合的剖析及索引服務,然後執行下列其中一個步驟:
- 如果集合已在文件快取中包含您要用於訓練機器學習模型的索引文件,請重新啟動完整索引建置。
- 如果集合未包含您要用於訓練機器學習模型的索引文件,請上傳文件、至少配置一個搜索器來搜索文件,然後啟動搜索器。
-
在匯出區域中,檢查匯出要求的狀態。 進度會指出匯出的文件數量。
-
移至您在配置匯出選項時指定的輸出資料夾。 當文件匯出為 XML 檔時,輸出資料夾名稱是根據匯出發生時的時間戳記。 輸出資料夾包含 XMI 檔 (
*.xmi) 及 UIMA TypeSystem 描述子檔案 (exported_typesystem.xml)。
下一步
您必須定義 UIMA 類型與 Knowledge Studio 實體類型之間的對映。 您也必須建立 .zip 檔,其中包含將已分析資料上傳至 Knowledge Studio 工作區所需的所有檔案。
相關資訊:
從 Content Analytics Studio 匯出已分析的集合
您可以從 WatsonExplorer Content Analytics Studio 匯出已分析文件的集合,並將分析的文件當作 XMI 檔上傳至 Knowledge Studio 專案。
程序
若要從 Content Analytics Studio 集合中取得已分析的文件,請遵循下列步驟:
- 啟動 Content Analytics Studio,並開啟 Studio 專案。
- 在包含您要用於訓練機器學習模型之文件的資料夾上按一下滑鼠右鍵,並選取分析集合。
- 選取 UIMA 管線配置檔。
- 移至「集合分析」視圖,然後按一下「集合分析」視圖中的儲存圖示。 指定要寫入所儲存結果的資料夾,並指定檔名。
- 開啟您指定的資料夾。 所儲存檔案的副檔名為
.annotations。 - 將
.annotations檔複製到本端檔案系統,然後將副檔名從.annotations重新命名為.zip。 - 擷取 .zip 檔中的所有檔案。 擷取的內容包括 XMI 檔 (
*.xmi)、UIMA TypeSystem 描述子檔案 (TypeSystem.xml) 及其他檔案。
下一步
您必須定義 UIMA 類型與 Knowledge Studio 實體類型之間的對映。 您也必須建立 .zip 檔,其中包含將已分析資料上傳至 Knowledge Studio 工作區所需的所有檔案。
對映 UIMA 類型與實體類型
在將 XMI 檔上傳至 Knowledge Studio 工作區之前,您必須定義 UIMA 類型與 Knowledge Studio 實體類型之間的對映。
開始之前
Knowledge Studio 工作區中的類型系統必須包括您要與 UIMA 類型相對映的實體類型。
程序
若要將 UIMA 類型對映至 Knowledge Studio 實體類型,請遵循下列步驟:
-
在包含 UIMA TypeSystem 描述子檔案的資料夾中建立一個名為
cas2di.tsv的檔案,例如exported_typesystem.xml或TypeSystem.xml。 -
使用文字編輯器開啟
cas2di.tsv檔案。 檔案中的每一行都會指定單一對映。 對映的格式視您要對映之註釋程式的註釋而定:-
您可以使用基本格式來建立對映:
UIMA_Type_Name[TAB]WKS_Entity_Type下列範例定義使用 Watson Explorer Content Analytics 中「具名實體識別」註釋程式所產生的 UIMA 類型與 Knowledge Studio 類型系統中所定義實體類型之間的對映:
com.ibm.langware.Organization ORGANIZATION com.ibm.langware.Person PERSON com.ibm.langware.Location LOCATION另一個範例定義在 WatsonExplorer Content Analytics Studio 中已建立之自訂註釋程式所產生的 UIMA 類型與 Knowledge Studio 實體類型之間的對映:
com.ibm.Person PERSON com.ibm.Date DATE -
在 Watson Explorer Content Analytics 中,您可以根據在「型樣配對器」註釋程式或「字典查閱」註釋程式中使用的資料類型來建立對映。 在文字分析規則檔 (
*.pat) 中,以種類屬性來代表資料類型。 若要定義對映,請使用下列語法:com.ibm.takmi.nlp.annotation_type.ContiguousContext:category={FACET_PATH}[TAB]{WKS_ENTITY_TYPE}下列適用於「型樣配對器」及「字典查閱」註釋程式的範例,會定義種類 $.mykeyword.product 與 Knowledge Studio 實體類型 PRODUCT 之間的對映:
com.ibm.takmi.nlp.annotation_type.ContiguousContext:category=$.mykeyword.product PRODUCT
-
下一步
您必須建立 .zip 檔,其中包含將已分析資料上傳至 Knowledge Studio 工作區所需的所有檔案。
相關資訊:
將 UIMA CAS XMI 檔上傳至工作區
若要使用您所下載的已註釋文件來訓練模型,您必須建立 .zip 檔,其中包含上傳 XMI 檔所需的所有檔案,然後將 .zip 檔上傳至 Knowledge Studio 工作區。
開始之前
在上傳 .zip 檔之前,請確保 Knowledge Studio 工作區中的類型系統包括您已與 UIMA 類型相對映的實體類型。
UIMA 分析引擎容許跨句子的註釋。 在 Knowledge Studio 中,註釋必須存在於單一句子的界限內。 如果您上傳的 XMI 檔包括跨句子的註釋,則那些註釋不會出現在基準編輯器中。
程序
若要將預先註釋的文件上傳至 Knowledge Studio 工作區,請遵循下列步驟:
-
建立 .zip 檔,其中包含 Knowledge Studio 所需的所有檔案。
-
選取包含 XMI 檔、UIMA 類型系統描述子檔案及
cas2di.tsv檔案的資料夾,或選取資料夾中的所有檔案。 -
建立包括所有檔案的 .zip 檔。 確定
cas2di.tsv及 UIMA 類型系統描述子檔案儲存在 .zip 檔的根目錄中。 這些檔案不能儲存在 .zip 檔內的子資料夾中,否則 Knowledge Studio 無法讀取它們,而且不會匯入任何內容。在 Windows 中,您可以按一下滑鼠右鍵選取傳送到>壓縮的 (zipped) 資料夾。
-
-
將 .zip 檔上傳至 Knowledge Studio 工作區。
- 以 Knowledge Studio 管理者或專案經理身分登入,開啟您要新增文件的工作區,然後開啟資產 > 文件頁面。
- 按一下上傳文件集。
- 拖曳您建立的 .zip 檔,或按一下來尋找並選取檔案。
- 選取勾選框,以指出 .zip 檔包含 UIMA CAS XMI 檔。
- 按一下上傳。