使用匯入的 ML 模型來尋找自訂項目
使用使用規則或環境定義來辨識及標記實體的自訂 Machine Learning 模型。
新增您使用 IBM 工具建立的 Machine Learning 模型,這些工具可用來定義您自己的類型系統。
您可以新增的模型類型視您的部署而定:
-
IBM Cloud Pak for DataIBM Software Hub 您可以新增使用 Studio 模型,或使用託管於 或 的 的實例所建立的模型。Watson Explorer Content Analytics IBM Cloud Pak® for Data IBM Cloud IBM Watson® Knowledge Studio 從 4.6.2 版本開始,您也可以新增自訂的實體萃取器模型,這些模型是在 Discovery 的另一個實例中建立,並從該實例匯出。
-
IBM Cloud 您可以新增僅在 IBM Cloud 中管理的 IBM Watson® Knowledge Studio 實例所建立的模型。
若要在 IBM Cloud Pak for Data上使用以 Knowledge Studio 建置的 Knowledge Studio 模型,請將基準移轉至 Knowledge Studio 實例,然後重新訓練模型。
支援下列類型的機型:
- 在 Knowledge Studio 中所建立的規則型模型,用於根據定義的規則在文件中尋找實體。 (檔案格式: .pear)
- 在 Knowledge Studio 中建立的機器學習模型,能夠理解語言的細微差異、意義以及您所在行業特有的關係(檔案格式:.zip)
- 在 Discovery中建立並匯出的自訂實體擷取程式。 (檔案格式: .ent)
- 在 Discovery中建立及匯出的句子分類器。 (檔案格式: .sc)
- IBM Cloud Pak for DataIBM Software Hub 在 Studio 中建立的自訂 UIMA 文字分析模型。Watson Explorer Content Analytics (檔案格式: .pear)
從已安裝的部署中,已使用 4.6.2 版本新增匯入實體擷取程式模型的支援。
探索無法識別 Knowledge Studio 模型所定義的實體子類型。
若要新增 Machine Learning 型號,請完成下列步驟:
-
建立模型,並從您用來建立它的工具中匯出它。
如需相關資訊,請參閱下列文件:
-
Knowledge Studio for IBM Cloud Pak® for Data
-
Knowledge Studio for IBM Cloud
-
Watson Explorer Content Analytics Studio
您必須從 Watson Explorer Content Analytics Studio 將模型匯出為 UIMA PEAR 檔案。 如需相關資訊,請參閱: 建立自訂 PEAR 檔案以與詞彙分析串流搭配使用。
-
-
從「改善工具」畫面的 變更網域概念 區段中,然後按一下 匯入機器學習模型。
-
指定模型的名稱,然後選擇用來定義模型的語言。
-
按一下 上傳,以瀏覽並找出您先前匯出的檔案。
-
按一下建立。
-
選擇您要從模型套用強化的集合和欄位,然後按一下 套用。
如果模型太大而無法從產品使用者介面上傳,您可以使用 API 的 建立強化 方法來匯入檔案。
規則型模型範例
舉例來說,當機器學習模型被應用為一個欄位的豐富化時,它會抽取該欄位中在 Knowledge Studio 基於規則的模型中指定的所有實體類型。 如果模型辨識實體類型 (例如 person、surname 及 job title ),則會在您的文件中辨識它們並加上標籤。
在輸出中,由 entities 陣列內 enriched_{field_name} 陣列中的 Machine Learning 強化所擷取的資訊。 在此範例中,選取用於強化的欄位為 text。
{
"enriched_text": [
{
"entities": [
{
"path": ".wksrule.entities.PERSON",
"text": "George Washington",
"type": "PERSON"
},
{
"path": ".wksrule.entities.GIVENNAME",
"text": "George",
"type": "GIVENNAME"
},
{
"path": ".wksrule.entities.SURNAME",
"text": "Washington",
"type": "SURNAME"
},
{
"path": ".wksrule.entities.POSITION",
"text": "politician",
"type": "POSITION"
},
{
"path": ".wksrule.entities.POSITION",
"text": "soldier",
"type": "POSITION"
},
{
"path": ".wksrule.entities.JOBTITLE",
"text": "President of the United States",
"type": "JOBTITLE"
}
],
"text": [
"George Washington (February 22, 1732‚ December 14, 1799) was an American politician and soldier who served as the first President of the United States from 1789 to 1797 and was one of the Founding Fathers of the United States."
]
}
]
}
因此,如果有人 使用 API 提交 Discovery 查詢語言查詢以尋找 enriched_{field_name}.entities.type:jobtitle 強化的出現項目,則會傳回討論人員工作職稱的任何段落。
機器學習模型範例
在此範例中,機器學習模型會擷取實體類型 (例如 person、oranization 和 date) 以及實體之間關係的相關資訊。 當這個 ML 模型被應用為豐富領域時,它會使用機器學習來了解文件中提到的語言細節、意義和關係。
在輸出中,由 entities 及 relations 陣列內 enriched_{field_name} 陣列中的 Machine Learning 強化所擷取的資訊。 在此範例中,選取用於強化的欄位為 text。
{
"enriched_text": [
{
"entities": [
{
"count": 1,
"text": "Democratic Party",
"type": "ORGANIZATION"
},
{
"count": 1,
"text": "March 15, 1767",
"type": "DATE"
},
{
"count": 1,
"text": "President",
"type": "POSITION"
},
{
"count": 1,
"text": "Andrew Jackson",
"type": "PERSON"
}
],
"relations": [
{
"sentence": "Andrew Jackson (March 15, 1767‚ June 8, 1845) was an American soldier and statesman who served as the seventh President of the United States from 1829 to 1837 and was the founder of the Democratic Party."
}
]
}
]
}
機器學習模型限制
您可以為每個服務實例建立的 Machine Learning (ML) 模型數目取決於您的 Discovery 計劃類型。
| 方案 | 每個服務實例的 mL 模型 |
|---|---|
| Cloud Pak for Data | 無限制 |
| 進階 | 10 |
| 企業 | 10 |
| 加號 (包括試用) | 3 |
對於每一個 Knowledge Studio 機器學習模型,可以偵測到的實體數目上限為 50。
進階規則模型
新增進階規則模型,以將從 IBM Watson® Knowledge Studio 的「進階規則」編輯器建立及匯出的文字擷取模型套用至集合。
您的模型必須使用適當的 Knowledge Studio 部署來建立:
-
IBM Cloud Pak for DataIBM Software Hub 您可以新增從下列地方建立和匯出的模型:
- IBM Watson® Knowledge Studio,使用早於 4.5 版的 IBM Cloud Pak® for Data 部署來建置。
- IBM Watson® Knowledge Studio,在 IBM Cloud 上管理
- 由開放程式碼資料與 AI 技術中心貢獻者建置的 NLP 編輯器
-
IBM Cloud 您可以新增僅在 IBM Cloud 上管理的 IBM Watson® Knowledge Studio 實例所建立的模型。
從 Knowledge Studio 移除
已結束支援使用 Knowledge Studio 中的測試版「進階規則編輯器」來建置模型。 在支援結束日期之前從 Knowledge Studio 匯出的任何規則模型都可以繼續在 Discovery中使用。
支援結束日期會根據部署類型而有所不同:
- IBM Cloud 2022 年 6 月 30 日
- IBM Cloud Pak for Data IBM Cloud Pak for Data release 4.5.1 on 3 August 2022.
IBM Cloud 除了使用 Knowledge Studio「進階規則編輯器」所產生的模型之外,您還可以透過新增型樣強化 來定義規則。
新增現有模型
若要新增進階規則模型,請完成下列步驟:
-
建立模型並匯出包含模型資源的 ZIP 檔。
如需如何匯出模型的相關資訊,請參閱模型來源的指示:
-
從「改善工具」畫面的 變更網域概念 區段中,選擇 進階規則模型。
-
按一下上傳。
-
指定模型的名稱,然後選擇用來定義模型的語言。
-
指定結果欄位的名稱,這是索引中將儲存此強化輸出的欄位。
-
按一下 上傳,以瀏覽並找出您先前匯出的 ZIP 檔。
-
按一下建立。
-
選擇您要從模型套用強化的集合和欄位,然後按一下 套用。
進階規則的輸出格式
Knowledge Studio 使用「註釋查詢語言 (AQL)」來定義進階規則模型中的規則。 每一個模型都由一或多個視圖定義。 每一個視圖都是包含多個資料記錄的關聯式資料結構。 每一筆記錄都是由視圖綱目所定義之直欄中的值所組成。 為了協助代表這些模型 (它們是自訂模型,因此具有各種綱目),會使用統一 JSON 輸出綱目。
- 每一個 JSON 物件都代表「註釋查詢語言 (AQL)」視圖。
- JSON 物件中的名稱/值配對代表視圖中屬性的名稱和值。
- AQL 視圖中的值組以 JSON 物件陣列表示,視圖中每一個值組都有一個物件。
下表說明如何以 JSON 語法來代表 AQL 資料類型。
| AQL 資料類型 | JSON 語法 | JSON 範例 |
|---|---|---|
| Integer | 數目 | 5 |
| 浮點數 | 數目 | 4.13 |
| 布林 | 布林值 | true |
| 文字 | 字串 | "some string" |
| 跨距 | 格式為 {"text": String, "location": {"begin": Integer, "end": Integer}} 的物件 |
{ "text": "Jane", location": {"begin": 5, "end": 9} } |
| 特殊案例: 空值 | 空值 | null |
| 整數清單 | 數值陣列 | [ 1, 2, 3, 4, 5] |
| 浮點數清單 | 數值陣列 | [ 4.13, 4.5 ] |
| 布林清單 | 布林值陣列 | [ true, true, false] |
| 文字清單 | 字串值陣列 | [ "some string", "another string" ] |
| Span 清單 | 物件陣列,格式為 {"text":String, "location": {"begin": Integer, "end": Integer}} |
[{ "text":"Jane", "location": {"begin": 5, "end": 9} }, { "text":"...", "location": {"begin": 15, "end": 40} }] |
| 特殊案例: 空清單 | 具有 0 個元素的陣列 | [ ] |
進階規則模型限制
您可以為每個服務實例定義的進階規則模型數目取決於 Discovery 計劃類型。
| 方案 | 每個服務實例的進階規則模型 |
|---|---|
| Cloud Pak for Data | 無限制 |
| 進階 | 3 |
| 企業 | 3 |
| 加號 (包括試用) | 1 |