句子分類
IBM Cloud
句子分類是測試版特性,僅適用於受管理部署。 此外,此特性僅適用於英文文件。
使用句子分類來分類文件中具有重大商業利益的句子。
句子分類使用根據使用者定義的句子類別來分類句子的機器學習模型。 您可以在文件中標示範例句子,以定義句子類別。 為了加速標註處理程序,系統會自動在背景中準備建議模型,並為您提供更多句子標註建議。
開始之前
尋找或建立一個集合,其中的文件具有您想要 Discovery 瞭解的各種句子範例。 若要教導句子分類器,您必須標示句子類別的範例。 如果您的集合包含有效的範例,則只能標示範例。 嘗試尋找具有許多不同句子的文件,這些句子可作為您要定義之每個句子類別的範例。
新增句子分類器
若要新增句子分類器,請完成下列步驟:
-
開啟您要建立句子分類器的專案。
專案必須至少具有一個集合,其中包含代表您要分類之資料的文件。
-
從「改善及自訂」頁面的「改善工具」畫面中,展開 變更網域概念,然後按一下 傳送分類器。
-
按一下新建。
-
新增句子分類器名稱及選擇性地新增說明。
此名稱用作模型名稱,並用作您發佈模型時所建立強化的名稱。 該名稱在 強化 頁面中顯示為強化名稱,您及其他人可以在其中將它套用至集合。 它也會在找到句子類別之文件的 JSON 表示法中顯示為模型名稱。 名稱會以您指定的大小寫和間距來儲存。
-
選擇具有代表您要分類之資料的文件的集合。
-
從文件中選擇要在文件視圖中顯示的欄位,您將在其中標示集合中的文件。
- 文件標題 會顯示在頁面標頭中作為文件名稱。 選擇每個文件具有唯一值的欄位,例如儲存在
extracted_metadata.filename欄位中的檔名。 - 文件內文 是您在內容中標示句子範例的位置。 選擇包含大量文件內容的欄位,例如
text欄位。
- 文件標題 會顯示在頁面標頭中作為文件名稱。 選擇每個文件具有唯一值的欄位,例如儲存在
-
按一下建立。
您選取的集合中的文件會顯示在 標註文件 視圖中。 您將標示您要 Discovery 從集合中此文件及其他文件辨識的句子類別。
如果頁面內文中未顯示任何文字,請立即透過建立新的句子分類器來重新開始。 此時,當您選取 文件內文 欄位的值時,請務必從已處理的文件中選擇包含文字的欄位。
定義句子類別
完成下列步驟來定義句子類別:
-
按一下 新增句子類別。
-
新增句子類別名稱及選用說明。
-
選用項目: 挑選要用於文件中句子類別的顏色。
您可以按一下 標籤顏色 選用區中的顏色,然後按一下 更新顏色 圖示以按 Tab 鍵從一個顏色移至下一個顏色。 若要使用自訂顏色,請指定其十六進位顏色代碼 (#fff0f7)。
-
按一下建立。
-
重複此處理程序,以新增您要分類器分類的所有句子類別。
如果您不確定要為句子類別新增什麼,則最好先檢閱集合中的文件。 透過檢閱內容,您可以瞭解哪些句子具有重要意義,並尋找將此類句子分類的邏輯方法。
標註句子
從 標籤文件 視圖中,從集合中尋找文件中的句子,並將它們加上標籤以指出其句子類別。 在您標註時,句子分類器會自動在背景中訓練模型,以呈現標註建議。
標註建議可加快標註文件的程序。 標籤建議可讓您輕鬆找到相關範例,並在環境定義中加以檢查,而不是瀏覽文件並花費時間閱讀文字。
您可以用下列方式標示句子:
與實體擷取程式不同,對於句子分類器,沒有文件狀態的概念,例如 未啟動、進行中及 完成。 如果是實體擷取程式,您可以將文件標示為 完成,以指出它們用於訓練。 在句子分類器的案例中,只會使用含標籤的句子進行訓練,且會忽略每一個文件中未含標籤的資料。
| 配件 | 用於訓練的項目 |
|---|---|
| 實體擷取程式 | 所有標示為「完成」的文件 |
| 句子分類器 | 所有含標籤的句子 (不使用不含標籤的句子) |
手動標示
若要手動標籤,請完成下列步驟:
-
閱讀「標註文件」頁面中顯示的文件,以尋找要標註的適當句子範例。
-
選取句子範例,然後按一下 編輯標籤 圖示。
-
從清單中選取句子類別,將範例句子標示為正標籤。
若要將範例句子標示為負數標籤,請在清單中選取句子類別時按 Shift。
如果您找不到適當的句子範例,請從 文件清單中選取不同的文件。
標記句子範例 -
重複步驟,在集合的其他文件中將範例句子標示為正數或負數。
在標註時,按一下 儲存句子分類器 以儲存您的工作。 如果您從「標籤文件」頁面移至另一個頁面,系統會自動儲存您的工作。
使用快速鍵來快速標註作業。 按按鍵 1 至 5,對應清單中顯示的句子類別,將範例句子標示為正標籤。 同樣地,請按按鍵 6 至 0 以新增負標籤。 您可以按 Delete 鍵或 Backspace 鍵,以從選取的句子中移除標籤。
在文件中尋找標籤
使用搜尋功能,您可以在文件中找到句子範例,並輕鬆地將它們加上標籤。 您也可以使用搜尋來尋找含標籤的範例和未含標籤的範例,並更正任何含標籤的不一致。
若要尋找範例並在文件中標示它們,請完成下列步驟:
-
在「標籤文件」視圖上,按一下 尋找 圖示。
-
在 尋找 欄位中,指定要在文件中搜尋的文字。
當您輸入文字時,會顯示文件中的搜尋結果。
如果要瀏覽搜尋結果,您可以按一下 下一個結果 和 上一個結果 圖示。 若要為結果中未標示的範例選擇標籤,請按一下 編輯標籤 圖示,然後從清單中選取句子類別。 您也可以按一下 編輯標籤 圖示並選取 移除標籤,從結果中已標示的範例移除標籤。
搜尋結果 -
若要過濾搜尋結果,請按一下 顯示過濾器選項 圖示。
下表說明過濾器選項。
尋找中的過濾選項 選項 說明 全部 尋找文件中符合文字的所有範例。 含標籤的文字 在文件中尋找符合文字的現有含標籤範例。 未標示的文字 在文件中尋找符合文字的未標示範例。 符合大小寫 尋找同時符合文字及其大小寫的範例。 完整單字 尋找符合文字單字界限的範例。 例如,如果您在文字中指定 installing,則當選取此選項時,uninstalling 不相符。 - 重複步驟,以標記集合其他文件中的範例句子。
智慧型標籤
智慧型標籤特性使用作用中學習技術來建議您可以標註的句子範例。 智慧型標註可加快標註處理程序,但您必須先針對每個句子類別至少標註 20 個範例,以便系統可以建置建議模型。
要使用智慧標籤,請完成下列步驟:
-
針對至少一個句子類別,至少標示 20 個正範例。
系統會在背景中自動開始準備建議模型。
備妥建議模型的版本之後,系統會提供接下來要標示哪些句子的建議。 標示建議有助於最完善句子分類器模型。
-
按一下 使用智慧型標籤。
智慧標籤 即會顯示智慧型標籤窗格。 在此窗格中,您可以標示特定句子類別的句子。
-
從建議的 範例中選取範例,然後按一下 是,將範例句子標示為正標籤。 您可以按一下 否,將範例句子標示為負數標籤。
智慧標籤面板 -
重複前一個步驟來標示其他建議範例。
若要重新整理清單中建議的範例,請按一下 重新整理建議。 清單會以新的建議重新整理,而現有的標示範例不會顯示在清單中。
-
標示句子之後,請按一下 完成。
如果現行文件集中沒有足夠的句子範例,您可以新增更多文件。 僅當集合中有更多文件時,此選項才可用。 如需相關資訊,請參閱 將文件新增至訓練資料。
-
在集合中任意數目的文件中標示範例之後,請按一下 儲存句子分類器,然後訓練分類器。 如需相關資訊,請參閱 訓練分類器。
智慧型標籤提示
請記住下列智慧型標籤提示:
-
使用快速鍵來快速標註作業。 您可以按左移鍵來選擇「是」,或按右移鍵來選擇「否」。 選擇「是」或「否」相當於指定句子類別的正或負標籤。
-
若要將範例句子標示為正標籤,請按按鍵 1 至 5,對應於清單中顯示的句子類別。 同樣地,請按按鍵 6 至 0 以新增負標籤。 您可以按 Delete 鍵或 Backspace 鍵,以從選取的句子中移除標籤。
-
如果範例與現行句子類別無關,請將範例標示為負數,而不是將它保留為未標示。 未標示的資料會被忽略,且不會用於訓練,因此指定負標籤對於改善分類模型非常重要。
-
如果您在訓練最後一個建議模型之後標示 20 個以上範例 (正或負標籤),則系統會自動開始在背景中建置新的建議模型。 當新建議已備妥可加上標籤時,您會收到通知。
將文件新增至訓練資料
若要新增更多文件,請完成下列步驟:
- 導覽至 標註文件 視圖。
- 在「文件清單」畫面中,按一下 新增文件。
當集合中沒有其他文件可新增至句子分類器工作區時,無法使用此選項。 若要將更多文件新增至集合,請導覽至集合的「活動」頁面,然後按一下 上傳資料 磚以瀏覽並新增更多文件。
即使您從集合新增更多文件,也不一定會使用所有文件來訓練模型。 與實體擷取程式 (其中所有已完成文件都用於訓練) 不同的是,句子分類器只會使用含標籤的句子進行訓練,且會忽略未含標籤的資料。
您無法從集合中選擇要顯示在 文件清單 畫面中進行標示的文件。 如果您要標示特定類型的文件,請考慮建立只包含那些文件的新集合。
訓練分類器
標示文件之後,您可以在 訓練分類器 視圖中檢閱訓練資料。 訓練資料用於訓練句子分類器模型。
要訓練分類器,請完成下列步驟:
-
導覽至 訓練分類器 視圖。
-
檢閱您的標籤摘要,以檢查您是否已標示足夠的標籤來訓練分類器。
若要訓練分類器,每個句子類別必須至少具有 20 個正標籤及兩個負標籤。 否則,會停用 訓練分類器 按鈕,且您無法開始訓練。 會忽略沒有正標籤或負標籤的句子類別。
-
檢閱您是否要套用進階選項以進行訓練。 大部分模型不需要變更進階選項。
您的句子會隨機分割成一組。 訓練集用來訓練分類器。 測試集用於在模型訓練完成後進行測試。 盲人組有保留的句子,您在訓練期間看不到這些句子。 它們用來定期產生模型的無偏誤評估。 預設分割會使用標準比例進行訓練。 如需相關資訊,請參閱 用於訓練的文件集。
-
按一下 訓練分類器。
當您訓練分類器時,Discovery 會使用訓練集的句子來建置機器學習模型。 測試結果會顯示在 評估分類器 視圖中供您檢閱。
用於訓練的文件集
您可以變更包含訓練資料之文件集中包含的句子比例。
您所標示的句子會隨機分割成下列集合:
-
訓練集: 您標示並用來訓練句子分類器機器學習模型的句子。 訓練集的目標是教導模型正確的標籤。
-
測試集: 用來測試訓練模型的句子。 產生模型之後,它會自動對測試集中的文件執行測試。 您可以分析結果,以判斷模型發生錯誤的區域,並尋找改善模型效能的方法。
-
盲目集: 在完成數次測試和改進反覆運算之後,保留並用來定期測試模型的句子。 盲區中的句子是故意摘掉的。 當您使用測試集中的句子來測試模型並分析結果時,您會熟悉基礎測試句子。 因為測試句子是用來反覆改善模型的,所以它們會開始間接影響模型的訓練。 這就是為什麼你可能想要有盲語的句子。 盲目集可讓您定期產生模型的無偏誤評估。
訓練集的預設分割比例是 70%,測試集的預設分割比例是 30%,盲目集的預設分割比例是 0%。 您可以透過增加盲目集的比例,來具有盲目集的句子。 在此情況下,評估分類器 視圖的分類器評分表格中的數目 (例如 誤判、誤判),以及其他不符合 檢閱訓練結果 視圖中所顯示的句子數目。 這是因為評估會考量盲目集中的句子,但它們不會出現在 檢閱訓練結果 視圖中。
評估分類器
若要檢閱來自您所建立之句子分類器模型測試執行的度量值,請按一下 評估分類器 標籤。
下表說明可用的評估指標。
| 度量 | 說明 |
|---|---|
| 混淆矩陣 | 提供標示句子詳細數字細分的表格。 使用它來比較機器學習模型所標示的內容與訓練資料中所標示的內容。 |
| F1 評分 | 測量是否達到查準率與查全率之間的最佳平衡。 F1 分數可以解譯為查準率與查全率值的加權平均。 F1 分數的最佳值為 1,最差值為 0。 如果模型沒有足夠的訓練資料可從中學習,則整體評分較低。 |
| 精準度 | 測量將多少個整體句子分類為正確的句子類別。 誤判是指不應該分類句子,但已分類 (預測 = 正、實際 = 負)。 誤判通常表示低精準度。 |
| 查全率 | 測量應分類句子的頻率。 誤否定是指應分類句子,但未分類 (預測 = 負數,實際 = 正數)。 誤否定通常表示低查全率。 |
-
檢閱所提供關於分類器模型測試執行的度量值,以判定是否需要更多訓練。
-
按一下 檢閱測試集中的訓練結果,以更詳細地探索測試結果。
查看測試集中的訓練結果 測試集中的句子會與左窗格清單中顯示的實際及預測標籤一起顯示。 如果您按一下清單中的句子,它會顯示在右窗格的文件視圖中。
- 實際標籤是人員手動標示的範例。 它們被視為正確的標籤。
- 預測標籤是句子分類器識別並標示為句子類別的範例。
模型的效能會根據預測標籤與實際標籤的相符程度來分級。
-
若要過濾清單,請按一下 過濾器 圖示,並選擇 句子類別 及 預測,然後按一下 套用。
檢閱效能分析的訓練結果
若要檢閱來自績效明細的訓練結果,請完成下列步驟:
-
按一下 效能明細 (依句子類別) 表格中的數字。
即會顯示 檢閱訓練結果 對話框。
-
檢閱相關句子,這些句子是根據您按一下的數字。
改善分類器
下表顯示一般問題的建議修正程式。
| 問題 | 補救問題的動作 |
|---|---|
| 整體評分低 | 您在訓練集中可能沒有足夠的含標籤句子。 在更多文件中標示更多句子。 |
| 低查全率 | 使用分類器遺漏要分類之句子類別的新範例來標示更多文件。 檢閱誤判句子,以檢查其中是否有唯一術語。 如果您看到此類獨特詞彙,請搜尋包含此類詞彙的句子,並為其新增正標籤。 |
| 低查準率 | 仔細檢閱誤判句子。 你可能漏了一些句子的標籤。 特別是檢查具有負面標籤的句子。 當句子具有特定句子類別 (例如,類別 A) 的負標籤時,請檢查另一個句子類別 (例如,類別 B) 是否需要正標籤。 如果句子實際上屬於類別 B,但您沒有為它指定正的類別 B 標籤,則它會降低精準度評分。 此外,如果您找到通常出現在誤判句子中的術語,請使用此類術語對句子指定負面標籤。 |
將句子分類器發佈為強化
當您認為句子分類器已備妥時,請發佈句子分類器模型。 在您進行改良的數個測試執行之後,當評分未變更時,您可以考量模型已備妥。 您可以在發佈模型之後返回以更新並重新訓練模型。
若要發佈句子分類器,請完成下列步驟:
- 導覽至 評估分類器 視圖,然後按一下 發佈分類器。
- 按一下發佈。
- 按一下套用至資料。
- 選擇集合,然後選取您要套用句子分類器強化的文字欄位。
- 按一下套用。
下載句子分類器模型
您在一個專案中建立並部署的句子分類器模型可作為強化,可套用至相同服務實例中任何專案的集合。
如果您想要在專案中使用來自另一個服務實例的句子分類器模型,則可以匯出或下載句子分類器模型。 若要在其他位置使用它,請遵循 使用匯入的 ML 模型來尋找自訂項目 中的步驟來建立機器學習模型。 您無法繼續編輯匯入至另一個專案的句子分類器。
您必須完整訓練您要匯出的句子分類器。
若要匯出句子分類器,請完成下列步驟:
-
使用您要匯出的句子分類器開啟專案。
-
從「改善及自訂」頁面的「改善工具」畫面中,展開 變更網域概念,然後按一下 傳送分類器。
-
從 句子分類器 清單中,尋找您要匯出的句子分類器。
-
按一下分類器的 動作 圖示,然後選取 下載模型 以將模型儲存至系統。
除非已訓練模型,否則無法使用 下載模型 選項。
句子分類器模型會儲存為 .sc 檔案。 您可以將它作為機器學習模型匯入至另一個服務實例中的專案,然後將它套用至集合。
下載句子分類器的標示資料
您可以從 Discovery下載或匯出句子分類器的標示資料。 您可以使用匯出的標籤資料,在 Watson Studio 及「自然語言處理程序 (NLP)」之類的服務上訓練或建置大型語言模型 (LLM)。
若要匯出已標籤的資料,請完成下列步驟:
-
從「改善及自訂」頁面的「改善工具」畫面中,展開 變更網域概念,然後按一下 傳送分類器。
-
對於您要從中匯出含標籤的資料的句子分類器,按一下 動作 圖示,然後選取 下載含標籤的資料。
下載含標籤資料的壓縮檔。 壓縮檔包含下列 JSON 檔案。
labeled_data.json: 包含文字和標籤。 資料格式基於 Watson Natural Language Processing 中文字分類的輸入資料格式。 如需相關資訊,請參閱 輸入資料格式。metadata.json: 包含工作區及含標籤資料的 meta 資料。
將 labeled_data.json 轉換為 CSV
輸入下列指令,以將 labeled_data.json 轉換為 CSV:
$ cat labeled_data.json | jq -r '.[] | [.text, .labels[]] | @csv'
標籤資料會轉換成下列格式:
"sentence1", class-label1, class-label2
"sentence2", class-label3
"sentence3", ...
...
套用句子分類器強化
當您發佈句子分類器時,您可以指定要套用句子分類器的欄位。
稍後要將豐富應用到不同或更多字段,請完成以下步驟:
-
從導覽畫面中,按一下 管理集合。
-
按一下以開啟您要套用強化的集合。
-
按一下 強化。
-
在清單中尋找句子分類器名稱,然後選擇要套用強化的欄位。
您可以選擇包含文字或 html 的欄位。
-
按一下套用變更並重新處理。
如需如何將句子分類器強化套用至集合的相關資訊,請參閱 管理強化
句子分類器輸出
當強化將文件中的其中一個句子分類時,會將項目新增至文件 JSON 表示法的 enriched_text.element_classes 區段。 此區段包含分類器模型所分類的句子及其句子類別。
句子分類器不會將信賴分數低於 0.5的句子分類。
下列 JSON 輸出是句子分類的範例結果。
監視一段時間內的效能
您可以隨時重新訓練句子分類器模型。 每次訓練模型時,請檢閱效能指標評分,以判定您最近的變更是增加還是減少模型的評分。
如果要比較一個測試執行與另一個測試執行,請在「評估分類器」視圖中按一下 檢視評分歷程。 歷程視圖會顯示最近 5 次訓練執行。
To retain the score information for more than the most recent 5 training runs, you can export the metrics in comma-separated value format, and track the scores in a separate application. Click the tabular representation icon , and then click **Download as CSV**.
{: tip}
如果後續訓練執行導致較低的評分,請不要發佈該版本的模型。
刪除句子分類器
您可以刪除未使用的句子分類器,例如從句子分類器發佈的強化未套用至集合時。
例如,如果您達到方案容許的句子分類器數目上限,則可能想要刪除句子分類器。
有兩個不同的限制: 句子分類器工作區數目上限及句子分類器強化數目上限。 當您導覽至「改善工具」畫面,展開 Tach 網域概念,按一下 Sentence 分類器,然後按一下 新建 按鈕時,即可建立句子分類器工作區。 當您發佈訓練過的句子分類器或上傳句子分類器模型時,您可以建立句子分類器強化。 如需限制的相關資訊,請參閱 Sentence classifier limits。
請記住,限制是根據服務實例而非專案來定義。 如果您在現行專案中沒有句子分類器數目上限,但無法建立新的句子分類器工作區或發佈已訓練的句子分類器,則請檢查相同服務實例中的其他專案。 可能有句子分類器工作區或強化未在可刪除的其他專案中使用。
移除句子分類器強化
從正在使用句子分類器的任何集合中移除該句子分類器強化 (已從您要刪除的句子分類器發佈)。 如需相關資訊,請參閱 刪除強化。
移除句子分類器強化並不會移除其工作區。
移除句子分類器工作區
若要刪除句子分類器工作區,請完成以下步驟:
-
從「改善及自訂」頁面的「改善工具」畫面中,展開 變更網域概念,然後按一下 傳送分類器。
-
尋找您要刪除的句子分類器工作區,按一下 動作 圖示,然後選取 刪除。
移除句子分類器工作區並不會移除從工作區發佈的強化。
使用句子分類器的 API
句子分類器 API 是測試版功能。
您可以使用 API 將句子分類器強化套用至文件。 使用 API,您可以建立句子分類器強化,也可以管理強化,例如更新及刪除它。
若要使用句子分類器 API,請執行以下操作:
-
在 API 中使用
create an enrichment方法建立句子分類器強化。如需建立強化的相關資訊,請參閱 API 參考資料中的 建立強化。
您必須指定含標籤的資料,以在建立句子分類器強化時訓練句子分類器模型。 含標籤的資料必須採用下列 CSV 格式:
"sentence1", class-label1, class-label2 "sentence2", class-label3 "sentence3", ... ...每一列都是一個句子,後面接著與該句子相關聯的零或多個句子類別標籤的逗點區隔清單。
作為最佳作法,CSV 檔中的每一個句子類別標籤應該至少以 100 個句子來表示,以達到合理品質的句子分類。 與句子類別標籤相關聯的句子會被視為該句子類別的正面範例。 與句子類別標籤無關的句子會被視為該句子類別的負面範例。
順利建立句子分類器強化之後,請導覽至「管理集合」頁面,選擇集合,然後開啟 強化 標籤。 您可以在可用的強化清單中找到句子分類器強化。
在句子分類器強化 狀態 備妥之後,您可以將句子分類器強化套用至集合中的文件。
-
將您建立的句子分類器強化套用至文件中的欄位 (文字或 html),以分類句子。 如需套用強化及使用 API 管理強化的相關資訊,請參閱 使用 API 來管理強化。
句子分類器限制
您可以為每個服務實例建立的句子分類器數目取決於 Discovery 計劃類型。
| 方案 | 每個服務實例的句子分類器工作區 | 每個服務實例的句子分類器強化 | 每個分類器的句子類別數上限 | 訓練資料中的文件數上限 |
|---|---|---|---|---|
| 進階 | 10 | 20 | 5 | 1,000 家 |
| 企業 | 10 | 20 | 5 | 1,000 家 |
| 加號 (包括試用) | 3 | 5 | 3 | 200 |