建立自訂註解程式
您可以建立字典、正規表示式或機器學習註解程式,以產生可協助您分析資料的新資料類型。
開始之前,請備妥下列資料。
| 註解程式類型 | 說明 | 日期 |
|---|---|---|
| 字典 | 將資料類型指派給符合您定義或上傳之字典項目的術語。 | 您可以選擇性地上傳字典術語的檔案。 |
| 機器學習 | 將資料類型指派給您上傳的機器學習模型所辨識的提及項目。 | 需要機器學習模型的壓縮檔。 |
| 一般表示式 | 將資料類型指派給符合您定義或上傳之 Java 正規表示式型樣的文字。 | 您可以選擇性地上傳包含正規表示式型樣的 JSON 檔案。 |
若要建立自訂註解器,請完成下列步驟:
-
從集合的分析視圖中,按一下瀏覽途徑中的 集合 鏈結,以開啟「內容採礦」應用程式的 為分析解決方案建立集合 頁面。
-
若要建立註解程式,請按一下 集合,然後從清單中選取 自訂註解程式。
收藏選單 -
按一下 建立自訂註解程式。
-
為您的註解程式命名,然後選擇性地新增說明。
-
選擇註解程式類型,然後按 下一步。
-
遵循螢幕上的指示。
如需如何配置每一個註解程式類型的相關資訊,請參閱下列其中一節:
字典配置
您可以透過上傳現有字典來匯入現有字典,也可以透過一次新增一個術語來建立字典。
如果您計劃匯入字典,則必須在 CSV 檔案中定義字典術語。 在個別行中指定每一個術語及其同義字。 請使用下列語法來指定每一個術語:
{term},{synonym},{synonym},...
若要新增字典,請完成下列步驟:
-
執行下列其中一項作業:
-
若要匯入字典術語,請執行下列動作:
- 按一下 匯入,然後瀏覽並找出含有字典術語的檔案。
- 按一下匯入。
-
若要定義字典術語,請執行下列動作:
- 按一下新增。
- 按一下 單字清單,以新增字典術語。
- 按一下 新增,然後在 基本單字 欄位中新增術語,並在 其他單字 欄位中新增您要為術語定義的任何同義字。 用逗號分隔多個同義字。 按一下確定。
- 重複前一個步驟,以新增更多字典術語。
- 完成新增字典術語之後,請按一下 基本設定。
-
-
為字典命名。
-
如果您計劃使用名詞以外的詞性來定義術語,請指定詞性。
如果選擇的語言是中文、日文、韓文或希伯來文,則只能指定名詞對於詞性。
-
決定您要如何處理案例。
當忽略大小寫時,術語
Sat、SAT和sat都會標示為出現Sat字典術語。當您取消選取 不區分大小寫 勾選框以建立區分大小寫的字典時,會使用具有大寫相符項之術語的表面形式。 針對術語新增的註釋與撰寫的術語完全相同,並針對術語的變化 (其中字母是大寫)。
例如,字典中的
sat項目會導致在文字中出現sat、Sat或SAT提及項目的註釋。 對於字典中的Sat項目,會針對出現的Sat和SAT新增註釋,但不會針對sat新增註釋。 -
識別要用於此字典的資料類型名稱。
您為註解程式指定的資料類型名稱是從集合搜尋視圖顯示的資料類型名稱。
您可以透過在資料類型名稱中包括句點 (.) 來建立階層式資料類型。 例如,您可以建立一個具有資料類型路徑
Food.Vegetables的字典,以及其他具有資料類型路徑Food.Fruits及Food.Proteins的字典。 新增更多具有更多期間的資料類型群組。 例如,您可以新增Food.Proteins.Nuts及Food.Proteins.Meats,以進一步分類蛋白質。
加上字典 -
如果您想要在使用者對根資料類型進行過濾時包括針對子資料類型傳回的文件,請選取 提昇單字。
例如,您可以針對
Food.Fruits和Food.Proteins啟用 提升單字,但不啟用Food.Vegetables。 因此,當使用者按一下 Food 資料類型時,傳回的文件包括提及 Fruits 和 Meats 字典中所含術語的文件,例如 apples 和 beef。
字典豐富應用 不過,使用者必須明確按一下 Food> Vegetables 資料類型,以取得在 Vegetables 字典中提及要傳回的術語 (例如 lettuce) 的文件。
子麵 -
重複先前的步驟,以新增更多字典。
-
按一下儲存。
從自訂註解程式頁面中,您可以查看在其他專案中建立的字典,包括非內容採礦專案。 來自其他專案類型的字典會將強化名稱顯示為註解程式名稱。 已停用 不區分大小寫 和 提升單字 設定,並將字典命名為 custom dict。
字典限制
| 方案 | 每個服務實例的字典數目 | 每個字典的基本字數 | 可以為其產生建議的術語數目 |
|---|---|---|---|
| Cloud Pak for Data | 無限制 | 無限制 | 1,000 家 |
| 進階 | 200 | 10,000 | 1,000 家 |
| 企業 | 200 | 10,000 | 1,000 家 |
總計包括您在此「內容採礦」專案中以及在相同服務實例的其他專案中建立的強化。
機器學習配置
您可以匯入現有的機器學習模型。
若要使用 Discovery 來建立模型,請參閱 實體擷取程式。
若要匯入模型,請完成下列步驟:
-
按一下 選取檔案,然後瀏覽並找出機器學習模型檔。
-
在 資料類型路徑 欄位中,指定要用於模型的根資料類型名稱。
您為註解程式指定的資料類型名稱是從集合搜尋視圖顯示的資料類型名稱。
-
按一下儲存。
機器學習模型限制
| 方案 | 每個服務實例的 mL 模型 |
|---|---|
| Cloud Pak for Data | 無限制 |
| 進階 | 10 |
| 企業 | 10 |
總計包括您在此「內容採礦」專案中以及在相同服務實例的其他專案中建立的強化。
正規表示式配置
您可以透過在 JSON 檔案中上傳現有型樣來匯入現有型樣,也可以新增型樣。
若要新增圖案,請完成下列步驟:
-
將正規表示式型樣新增至 新建型樣 欄位,然後按一下 新增。
-
指定型樣的名稱,然後識別要用於此型樣的資料類型名稱。
您為註解程式指定的資料類型名稱是從集合搜尋視圖顯示的資料類型名稱。
-
選用: 指定資料類型值。 您可以從表格中說明的選項指定值。
正規表示式資料類型值選項 資料類型值 說明 $0依現狀顯示相符文字。 $n如果正規表示式型樣包含群組,則您可以指定群組號碼,以僅從型樣群組傳回相符文字。 例如,如果正規表示式由 3 個定義美國電話號碼型樣的群組 (例如 (\d{3})-(\d{3})-(\d{4})) 組成,且您只想傳回電話號碼的區域碼部分,則可以指定$1。 如果相符文字為212-555-1234,則資料類型值會顯示為212。 僅將群組指定為您知道將傳回相符項之型樣的資料類型值。{prefix-text}:$0在資料類型名稱前面新增寫在程式中的文字。 如果您想要區分此正規表示式所產生的資料類型與以其他方式產生但類似的資料類型,則可能想要使用此選項。 例如, MyRegex:$0會產生名為MyRegex:212-555-1234的資料類型。 -
按一下儲存。
若要匯入樣式,請完成下列步驟:
-
定義您要在 JSON 檔案中新增的型樣。
型樣定義必須使用下列語法:
[ { "name": "US Phone number", "description": "US mobile phone number", "pattern": "(\\d{3})-(\\d{3})-(\\d{4})", "facetPath": ".regex.usphonenumber", "facetValue": "$0" } ]請牢記以下注意事項:
- 即使您計劃只定義一個型樣,也必須在陣列中定義型樣。
- 以反斜線跳出任何反斜線 (
\) 字元。 - 如需資料類型值選項的相關資訊,請參閱 正規表示式資料類型值選項 表格。
-
按一下 匯入,然後選擇在其中定義型樣的 JSON 檔案。
-
按一下儲存。
正規表示式限制
| 方案 | 每個服務實例的正規表示式強化 | 每個服務實例的正規表示式型樣 |
|---|---|---|
| Cloud Pak for Data | 無限制 | 無限制 |
| 進階 | 100 | 50 |
| 企業 | 100 | 50 |
總計包括您在此「內容採礦」專案中以及在相同服務實例的其他專案中建立的強化。
套用註解程式
建立註解程式之後,您必須將它套用至集合。
-
從「內容採礦」應用程式的 為分析解決方案建立自訂註解程式 頁面中,按一下 自訂註解程式,然後從清單中選取 集合。
-
在集合的磚中,按一下 選項 圖示,然後選擇 編輯集合。
-
按一下 Enrichment 索引標籤,然後選擇您建立的註解器。
您可能需要捲動頁面才能找到。
-
按一下 儲存,然後確認動作。
提供索引重建時間。
使用資料類型過濾文件
-
按一下集合磚,以在資料分析頁面中開啟集合。
-
執行下列其中一項作業:
-
您的自訂資料類型會列在 資料類型 視圖中。 反覆地捲動並按一下 載入更多,直到顯示您的資料類型為止。
-
提交空搜尋以傳回所有文件。 在 資料類型分析 窗格中,選取您建立的資料類型。
-
若要更快速存取自訂資料類型,請將它們新增至自訂視圖。 選取 自訂 作為視圖,然後按一下 編輯。 選取一或多個要新增至視圖的資料類型,然後按一下 儲存。
收藏選單
-