使用內建 Watson NLP 來尋找一般術語

將預先建置的強化新增至您的文件,藉此善用榮獲獎項的 Watson Natural Language Processing (NLP) 功能。

使用 Watson NLP,您可以識別並標記集合中有意義的資訊,以便您可以瞭解其意義並做出更明智的決策。

下列 Watson NLP 強化可用:

  • 實體: 辨識適當的名詞,例如內容中提及的人員、城市及組織。
  • 關鍵字: 辨識內容中的重要術語。
  • 詞性: 識別內容中的詞性 (例如,名詞和動詞)。
  • 觀感: 瞭解內容的整體觀感。

Discovery提供下列其他預先訓練的強化:

Watson NLP 強化

例如,下列畫面擷取會顯示已新增至 Discovery 集合的「美國獨立宣言」文字稿,其中已啟用「實體」及「關鍵字」強化。 強化所辨識的提及項目會在文件文字中強調顯示。

顯示美國獨立宣言的摘錄,並強調顯示數個術語。
摘錄自美國《獨立宣言》,其中突出顯示的條款

部分 NLP 強化會自動套用至專案。 如果您使用這些專案類型之一,則不需要自行套用它們。

每個專案類型的預設強化

部分預先建置的強化會根據專案類型自動套用至專案中的集合。 下表顯示套用至每一種專案類型的預設強化。

每個專案類型的預設強化
此表格具有列和欄標頭。 列標頭會識別專案類型。 直欄標頭會識別不同的強化。 若要瞭解依預設套用至專案類型的強化,請跳至說明強化的列,並尋找您感興趣之專案類型的直欄。
強化 文件擷取 合約的文件擷取 交談式搜尋 內容採礦
合約 勾號圖示
實體 勾號圖示 勾號圖示
關鍵字
詞性 勾號圖示
文件觀感
Table Understanding 勾號圖示

如需下列預先建置強化的相關資訊,請參閱下列主題:

如需如何建立自訂強化的相關資訊,請參閱 新增網域特定資源

如需如何充分利用強化的相關資訊,請閱讀 強化文件可讓搜尋更有效 部落格文章。

如需如何使用 API 套用強化的相關資訊,請參閱 使用 API 套用強化

新增強化

若要新增 NLP 增強功能,請完成下列步驟:

  1. 開啟專案,並移至 管理集合 頁面。

  2. 按一下以開啟您要強化的集合。

  3. 開啟 Enrichments(豐富 )索引標籤。

  4. 捲動以尋找您要套用至文件的 NLP 強化。

    同時列出內建強化和自訂強化。 內建強化的類型值為 System

  5. 選擇一或多個要套用強化的欄位。

    您可以將強化套用至 texthtml 欄位,以及從上傳的 JSON 或 CSV 檔案或從「智慧型文件理解 (SDU)」工具新增的自訂欄位。

  6. 按一下套用變更並重新處理

您啟用的強化會以隨機順序套用至文件。 如需如何移除強化的相關資訊,請參閱 管理強化

實體

識別實體。 實體 是通常代表適當名詞的術語,例如在資料收集中提及的人員、城市及組織。Discovery 可以辨識屬於 Watson Natural Language Processing (NLP) 服務所定義實體類型系統的實體。

如果您想要能夠識別對企業重要的不常見術語,您可以訓練自己的模型來辨識自訂實體。 如需相關資訊,請參閱 實體擷取程式

「探索」所使用的 Watson NLP 實體擷取程式服務稱為 NLU 類型系統。 該名稱源自 Watson Natural Language Understanding (NLU) 服務除了 Watson Discovery 服務之外還使用該類型系統的事實。 不過,它是「探索」直接使用之類型系統的 Watson NLP 實作,而不是 Watson NLU 實作。 因此,這兩個實作可能會產生不同的結果。 若要取得服務可辨識之實體類型的一般構想,請參閱 實體

下列畫面擷取顯示「實體」強化會辨識術語 政府系統英國國王 (等等),並將它們標記為實體提及項目。

顯示宣告,並強調指出政府和大不列顛國王的術語。
突出顯示了公認的實體、政府和英國國王

從文件的 JSON 視圖中,您可以看到實體提及項目的基礎 JSON 結構。

顯示文件中標識的政府系統和大不列顛國王實體的 JSON 視圖
所提及實體的 JSON 表示形式

例如,如果您想要搜尋「組織」實體類型,則可以將所有 JSON 內容複製到文字編輯器,並搜尋 Organization。 從 JSON 樹狀結構視圖的根目錄中按一下 複製 圖示。

範例

輸入

"IBM is an American multinational technology company headquartered in Armonk."

回應

在 JSON 輸出中:

  • text = 字串。 實體文字
  • type = 字串。 實體類型,例如 OrganizationLocationPersonNumber
  • mentions = 陣列。 實體提及項目和位置
  • model_name = 字串。 對於自訂模型,此欄位包含使用者提供的模型名稱。 否則,此欄位包含模型的預設名稱,例如 watson_knowledge_studio, dictionary, character_pattern,或 natural_language_understanding
{
  "entities": [
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.8317045,
          "location": {
            "end": 3,
            "begin": 0
          },
          "text": "IBM"
        }
      ],
      "text": "IBM",
      "type": "Organization"
    },
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.6114863,
          "location": {
            "end": 75,
            "begin": 69
          },
        "text": "Armonk"
        }
      ],
      "text": "Armonk",
      "type": "Location"
    }
  ]
}

關鍵字

傳回內容中的重要關鍵字。

例如,下列畫面擷取會顯示「關鍵字」強化所辨識的「美國獨立宣言」中的強調顯示術語。

顯示文件文字中識別的關鍵字
關鍵字豐富識別的術語

從文件的 JSON 視圖中,您可以看到 Declaration 關鍵字提及項目的基礎 JSON 結構。

顯示文件中標識的關鍵字的 JSON 視圖
關鍵字豐富提及的 JSON 表示

範例

輸入

"Watson Discovery is an award-winning AI search technology."

回應

在 JSON 輸出中:

  • text = 關鍵字文字
  • mentions = 實體提及項和位置
{
  "keywords": [
    {
      "mentions": [
        {
          "location": {
            "end": 157,
            "begin": 141
          },
          "text": "Watson Discovery"
        }
      ],
      "text": "Watson Discovery",
      "relevance": 0.503613
    },
    {
      "mentions": [
        {
          "location": {
           "end": 177,
            "begin": 164
          },
          "text": "award-winning"
        }
      ],
      "text": "award-winning",
      "relevance": 0.728722
    },
    {
      "mentions": [
        {
          "location": {
            "end": 198,
            "begin": 181
          },
          "text": "search technology"
        }
      ],
      "text": "search technology",
      "relevance": 0.779356
    }
  ]
}

關鍵字限制

Keywords 強化最多可以識別 50 個關鍵字,每個文件各有一個或多個提及項目。

詞性

辨識及標記詞性,包括名詞、動詞、形容詞、副詞、連結、形容詞及數字。