使用內建 Watson NLP 來尋找一般術語
將預先建置的強化新增至您的文件,藉此善用榮獲獎項的 Watson Natural Language Processing (NLP) 功能。
使用 Watson NLP,您可以識別並標記集合中有意義的資訊,以便您可以瞭解其意義並做出更明智的決策。
下列 Watson NLP 強化可用:
Discovery提供下列其他預先訓練的強化:
Watson NLP 強化
例如,下列畫面擷取會顯示已新增至 Discovery 集合的「美國獨立宣言」文字稿,其中已啟用「實體」及「關鍵字」強化。 強化所辨識的提及項目會在文件文字中強調顯示。
部分 NLP 強化會自動套用至專案。 如果您使用這些專案類型之一,則不需要自行套用它們。
每個專案類型的預設強化
部分預先建置的強化會根據專案類型自動套用至專案中的集合。 下表顯示套用至每一種專案類型的預設強化。
| 強化 | 文件擷取 | 合約的文件擷取 | 交談式搜尋 | 內容採礦 |
|---|---|---|---|---|
| 合約 | ||||
| 實體 | ||||
| 關鍵字 | ||||
| 詞性 | ||||
| 文件觀感 | ||||
| Table Understanding |
如需下列預先建置強化的相關資訊,請參閱下列主題:
如需如何建立自訂強化的相關資訊,請參閱 新增網域特定資源。
如需如何充分利用強化的相關資訊,請閱讀 強化文件可讓搜尋更有效 部落格文章。
如需如何使用 API 套用強化的相關資訊,請參閱 使用 API 套用強化。
新增強化
若要新增 NLP 增強功能,請完成下列步驟:
-
開啟專案,並移至 管理集合 頁面。
-
按一下以開啟您要強化的集合。
-
開啟 Enrichments(豐富 )索引標籤。
-
捲動以尋找您要套用至文件的 NLP 強化。
同時列出內建強化和自訂強化。 內建強化的類型值為
System。 -
選擇一或多個要套用強化的欄位。
您可以將強化套用至
text和html欄位,以及從上傳的 JSON 或 CSV 檔案或從「智慧型文件理解 (SDU)」工具新增的自訂欄位。 -
按一下套用變更並重新處理。
您啟用的強化會以隨機順序套用至文件。 如需如何移除強化的相關資訊,請參閱 管理強化。
實體
識別實體。 實體 是通常代表適當名詞的術語,例如在資料收集中提及的人員、城市及組織。Discovery 可以辨識屬於 Watson Natural Language Processing (NLP) 服務所定義實體類型系統的實體。
如果您想要能夠識別對企業重要的不常見術語,您可以訓練自己的模型來辨識自訂實體。 如需相關資訊,請參閱 實體擷取程式。
「探索」所使用的 Watson NLP 實體擷取程式服務稱為 NLU 類型系統。 該名稱源自 Watson Natural Language Understanding (NLU) 服務除了 Watson Discovery 服務之外還使用該類型系統的事實。 不過,它是「探索」直接使用之類型系統的 Watson NLP 實作,而不是 Watson NLU 實作。 因此,這兩個實作可能會產生不同的結果。 若要取得服務可辨識之實體類型的一般構想,請參閱 實體。
下列畫面擷取顯示「實體」強化會辨識術語 政府系統 及 英國國王 (等等),並將它們標記為實體提及項目。
從文件的 JSON 視圖中,您可以看到實體提及項目的基礎 JSON 結構。
例如,如果您想要搜尋「組織」實體類型,則可以將所有 JSON 內容複製到文字編輯器,並搜尋 Organization。 從 JSON 樹狀結構視圖的根目錄中按一下 複製 圖示。
範例
輸入
"IBM is an American multinational technology company headquartered in Armonk."
回應
在 JSON 輸出中:
text= 字串。 實體文字type= 字串。 實體類型,例如Organization、Location、Person、Number。mentions= 陣列。 實體提及項目和位置model_name= 字串。 對於自訂模型,此欄位包含使用者提供的模型名稱。 否則,此欄位包含模型的預設名稱,例如watson_knowledge_studio,dictionary,character_pattern,或natural_language_understanding
{
"entities": [
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.8317045,
"location": {
"end": 3,
"begin": 0
},
"text": "IBM"
}
],
"text": "IBM",
"type": "Organization"
},
{
"model_name": "natural_language_understanding",
"mentions": [
{
"confidence": 0.6114863,
"location": {
"end": 75,
"begin": 69
},
"text": "Armonk"
}
],
"text": "Armonk",
"type": "Location"
}
]
}
關鍵字
傳回內容中的重要關鍵字。
例如,下列畫面擷取會顯示「關鍵字」強化所辨識的「美國獨立宣言」中的強調顯示術語。
從文件的 JSON 視圖中,您可以看到 Declaration 關鍵字提及項目的基礎 JSON 結構。
範例
輸入
"Watson Discovery is an award-winning AI search technology."
回應
在 JSON 輸出中:
text= 關鍵字文字mentions= 實體提及項和位置
{
"keywords": [
{
"mentions": [
{
"location": {
"end": 157,
"begin": 141
},
"text": "Watson Discovery"
}
],
"text": "Watson Discovery",
"relevance": 0.503613
},
{
"mentions": [
{
"location": {
"end": 177,
"begin": 164
},
"text": "award-winning"
}
],
"text": "award-winning",
"relevance": 0.728722
},
{
"mentions": [
{
"location": {
"end": 198,
"begin": 181
},
"text": "search technology"
}
],
"text": "search technology",
"relevance": 0.779356
}
]
}
關鍵字限制
Keywords 強化最多可以識別 50 個關鍵字,每個文件各有一個或多個提及項目。
詞性
辨識及標記詞性,包括名詞、動詞、形容詞、副詞、連結、形容詞及數字。