識別要忽略的單字
若要在搜尋期間忽略無意義的詞彙,請新增自訂停止字組清單。 停止字組是在識別內容的語意意義時沒有用的字組。
在英文中,the、is 和 and 是停止字組的範例。
您定義的停止字組會從查詢中過濾掉,並改善自然語言查詢結果的相關性。
例如,公司有三層服務。 其中一個集合中的文件僅與一個層級 (Silver 層級) 相關。 您可能想要將 "silver" 新增至停止字組清單,因為在所有文件都與 Silver 服務層級相關的情況下,該術語無助於區分一個文件與另一個文件的重要性。 當客戶在查詢字串中提及「銀級」時,會忽略它。 查詢中較重要的其他術語會改為用來搜尋資料。 或者文件集合只包含車禍報告。 您可能想要將 "car" 新增至停止字組清單,以防止查詢中的
car 提及項目將雜訊新增至搜尋。
Discovery 會自動套用許多受支援語言的預設停止字組清單。 這些停止字組會在檢索時及查詢時套用。 檢索內容並從查詢中過濾掉預先定義的停止字組時,會忽略這些停止字組。 不過,您定義的停止字組只會在查詢時使用。 您的清單不會取代預設清單; 它會擴增預設清單。 您可以新增停止字組,但無法移除停止字組。
自訂停止字組清單範例:
{
"stopwords": [
"a", "an", "the", "ibm", "what", "how", "when", "can", "should", ...
]
}
預設停止字組清單
您可以從 Watson Developer Cloud GitHub 儲存庫存取英文的預設停止字組清單。
對於下列語言,Discovery 會使用 Apache Lucene 所定義的預設停止字組清單。 如需清單中包含哪些單字的相關資訊,請參閱 Lucene 參考文件:
- 阿拉伯文: stopwords_ar.txt
- 捷克文: stopwords_cs.txt
- 丹麥文: stopwords_da.txt
- 荷蘭文: stopwords_nl.txt
- 芬蘭文: stopwords_fi.txt
- 法文: stopwords_fr.txt
- 德文: stopwords_de.txt
- 北印度文: stopwords_hi.txt
- 義大利文: stopwords_it.txt
- 挪威文 (兩者都支援的用語): stopwords_no.txt
- 葡萄牙文: stopwords_pt.txt
- 羅馬尼亞文: stopwords_ro.txt
- 俄文: stopwords_ru.txt
- 西班牙文: stopwords_es.txt
- 瑞典文: stopwords_sv.txt
- 土耳其文: stopwords_tr.txt
這些預設停止字組以 TXT 格式記載,但如果您想要擴增清單並提交它以供 Discovery使用,則必須提交 JSON 檔案。 若要查看停止字組清單檔語法的範例,請參閱自訂英文停止字組清單檔。
對於其餘支援的語言,不會使用預設停止字組。 您可以指定要在查詢時針對這些語言使用的停止字組清單。 吸收資料時不會使用您提交的清單。
您可能想要在查詢時套用的停止字組清單範例包括:
如需 Discovery支援的語言清單,請參閱 支援的語言。
定義查詢時間停止字組
若要定義停止詞,請完成下列步驟:
-
建立停止字組檔案。 檔案必須是副檔名為
json的 JSON 檔案。請遵循下列準則:
- 以小寫形式指定停止字組。
- 一般而言,請將停止字組清單保留在
200總計字組下。 大小限制是一百萬個字元。 不過,如果您指定太多詞彙,可能會對搜尋精確度產生負面影響。
您可以使用預設英文停止字組清單檔 custom_stopwords_en.json作為建置英文自訂停止字組清單的起點。
-
從導覽窗格中,開啟 改善及自訂 頁面。
-
從「改善」工具窗格中展開 改善相關性。
-
按一下 停止字組,然後按一下集合的 上傳停止字組。
每個集合只能上傳一個停止字組清單。 您上傳的停止字組清單會擴增集合的預設停止字組清單; 它不會取代預設清單。
-
按一下完成。
若要停用自訂停止字組檔案並回復為使用預設停止字組,請刪除自訂停止字組檔案。