識別要忽略的單字

若要在搜尋期間忽略無意義的詞彙,請新增自訂停止字組清單。 停止字組是在識別內容的語意意義時沒有用的字組。

在英文中,theisand 是停止字組的範例。

您定義的停止字組會從查詢中過濾掉,並改善自然語言查詢結果的相關性。

例如,公司有三層服務。 其中一個集合中的文件僅與一個層級 (Silver 層級) 相關。 您可能想要將 "silver" 新增至停止字組清單,因為在所有文件都與 Silver 服務層級相關的情況下,該術語無助於區分一個文件與另一個文件的重要性。 當客戶在查詢字串中提及「銀級」時,會忽略它。 查詢中較重要的其他術語會改為用來搜尋資料。 或者文件集合只包含車禍報告。 您可能想要將 "car" 新增至停止字組清單,以防止查詢中的 car 提及項目將雜訊新增至搜尋。

Discovery 會自動套用許多受支援語言的預設停止字組清單。 這些停止字組會在檢索時及查詢時套用。 檢索內容並從查詢中過濾掉預先定義的停止字組時,會忽略這些停止字組。 不過,您定義的停止字組只會在查詢時使用。 您的清單不會取代預設清單; 它會擴增預設清單。 您可以新增停止字組,但無法移除停止字組。

自訂停止字組清單範例:

{
  "stopwords": [
    "a", "an", "the", "ibm", "what", "how", "when", "can", "should", ...
  ]
}

預設停止字組清單

您可以從 Watson Developer Cloud GitHub 儲存庫存取英文的預設停止字組清單。

對於下列語言,Discovery 會使用 Apache Lucene 所定義的預設停止字組清單。 如需清單中包含哪些單字的相關資訊,請參閱 Lucene 參考文件:

這些預設停止字組以 TXT 格式記載,但如果您想要擴增清單並提交它以供 Discovery使用,則必須提交 JSON 檔案。 若要查看停止字組清單檔語法的範例,請參閱自訂英文停止字組清單檔。

對於其餘支援的語言,不會使用預設停止字組。 您可以指定要在查詢時針對這些語言使用的停止字組清單。 吸收資料時不會使用您提交的清單。

您可能想要在查詢時套用的停止字組清單範例包括:

如需 Discovery支援的語言清單,請參閱 支援的語言

定義查詢時間停止字組

若要定義停止詞,請完成下列步驟:

  1. 建立停止字組檔案。 檔案必須是副檔名為 json 的 JSON 檔案。

    請遵循下列準則:

    • 以小寫形式指定停止字組。
    • 一般而言,請將停止字組清單保留在 200 總計字組下。 大小限制是一百萬個字元。 不過,如果您指定太多詞彙,可能會對搜尋精確度產生負面影響。

    您可以使用預設英文停止字組清單檔 custom_stopwords_en.json作為建置英文自訂停止字組清單的起點。

  2. 從導覽窗格中,開啟 改善及自訂 頁面。

  3. 從「改善」工具窗格中展開 改善相關性

  4. 按一下 停止字組,然後按一下集合的 上傳停止字組

    每個集合只能上傳一個停止字組清單。 您上傳的停止字組清單會擴增集合的預設停止字組清單; 它不會取代預設清單。

  5. 按一下完成

若要停用自訂停止字組檔案並回復為使用預設停止字組,請刪除自訂停止字組檔案。