分類文件
文件分類器機器學習模型會分析文件,並使用您定義的一組標籤中的適當標籤來標記文件。
當您想要以程式化方式將許多文件分類成群組時,分類文件非常有用。 例如,您可能有一個集合包含您所銷售產品的客戶註解。 如果您可以自動將意見分類為類別,則可以隔離客戶提及的緊急問題,並先解決這些問題。 根據先前的意見,您可以定義類別,例如下列標籤:
- 未正確運作
- 不像廣告的特徵
- 難以使用
- 遺漏組件
- 出貨的組件不符合組件指示中的組件清單
若要建立文件分類器,您可以建置機器學習模型,以辨識哪個類別最能擷取以自然語言指定的客戶意見點。 您可以將它們與類別標籤配對,以代表對您公司有意義的實際實務範例。
- 文件分類器與文字分類器之間的差異為何?
- 文件分類器可以根據從內文文字欄位中擷取的單字和詞組,以及來自其詞性的資訊,以及套用至納入考量的內文文字的其他強化,來分類文件。 也會使用其他非內文欄位中的資訊。 文字分類器可以根據從內文文字中擷取的單字及詞組,並將其詞性資訊納入考量,來分類文件。 如需如何建立文字分類器的相關資訊,請參閱 分類器。
開始之前
若要訓練文件分類器模型,您必須提供已適當標示的範例文件。 準備下列檔案:
- 訓練資料
-
必要。 用來訓練文件分類器機器學習模型的 CSV 檔案。 檔案可以包含每個直欄的索引鍵資料點。 資料點可能不同,但檔案必須包含下列直欄:
- 您要分類或標示的自然語言文字。
- 將文件文字中所表達的構想分類的標籤或類別名稱。 您可以將多個標籤套用至文字樣本。 以分號區隔多個標籤值。
- 測試資料
-
選用。 在訓練文件分類器機器學習模型之後,用來測試文件分類器機器學習模型的 CSV 檔案。 如果您未指定個別檔案來進行測試,則會使用訓練資料內容的子集來進行測試。
- 目標資料
-
必要。 含有您要分類之資料的 CSV 檔。
所有 CSV 檔 (訓練、測試及目標) 必須具有相同的直欄名稱。 直欄中的資料必須具有相同的資料類型,例如字串、數字等。
您可以使用在建立「內容採礦」專案時上傳的 CSV 檔案,也可以建立新的集合。
如需相關資訊,請參閱下列主題:
文件分類器訓練資料範例
下表顯示可能儲存在用來訓練文件分類器之 CSV 檔案中的內容類型範例。
| Claim_id | Date | 產品 _line | 產品 | Client_segments | 用戶端位置 | 用戶端經歷時間 | 意見 | 標籤 |
|---|---|---|---|---|---|---|---|---|
| 0 | 2016/1/1 |
茶 | 檸檬茶 | 不是成員 | 曼哈頓 | 20 | 吸管是從果汁包上剝離出來的 | package_container |
| 1 | 2016/1/2 |
冰淇淋 | 香草冰淇淋 | 銀級成員 | 皇后區 | 20 | 我給我的孩子買了冰激凌,但杯子裡有一根線。 | 污染竄改 |
請注意,範例中有兩個必要欄位。 必要欄位具有下列名稱:
Feedback: 要標示的自然語言文字。Label: 要套用至意見回饋的標籤。
開啟「內容挖掘」應用程式
如果您沒有這麼做,請建立專案並在其中新增集合。 如果您已建立專案及集合,則可以跳過此程序並 建立文件分類器。
-
在 Discovery中,建立「內容採礦」專案。
-
選擇上傳資料以建立集合。 為集合命名,然後按下一步。
-
上傳包含訓練資料的 CSV 檔案。
訓練資料檔案必須至少包含下列資訊:
- 包含您要分類之範例文字的直欄。 例如,範例文字可能是產品檢閱。
- 包含指派給範例文字之類別或種類標籤的直欄。
-
收集處理完成後,按一下啟動應用程式以開啟「內容挖掘」應用程式。
即會顯示集合的資料類型詳細資料。
建立文件分類器
若要建立文件分類器,請完成下列步驟:
-
從「內容採礦」應用程式中,按一下瀏覽途徑中的 集合 鏈結,以開啟 建立集合 頁面。
即會顯示索引建立的狀態。 在繼續執行此程序之前,請等待集合完全編製索引。
-
若要建立分類器,請按一下 集合,然後從清單中選擇 分類器。
收藏選單 -
按一下建立分類器。
-
為分類器命名。
稍後將模型部署為強化時,會為強化提供
{classifier name} - {model name}格式的名稱。 例如,如果分類器名稱為Product reviews且模型名稱為v0.1,則強化名稱為Product reviews - v0.1。選擇性地從 語言 欄位中選取訓練資料,以新增說明並識別訓練資料的語言。
-
按下一步
-
在「訓練資料」頁面上,從清單中選取您先前上傳的檔案,然後按 下一步。
或者,您可以上傳包含訓練資料的 CSV 檔。
顯示 Fields(欄位 )頁面。 它會顯示從您所新增檔案產生之欄位的詳細資料。 一般而言,CSV 檔中的每一個直欄都會轉換成欄位,並獲指派從直欄標頭複製的名稱。
-
取消選取您要從文件分類器的資料集中排除要從中學習的任何 meta 資料欄位,然後按 下一步。
您包含的任何欄位都會用作分類中的其他特徵。 預設選取所有欄位。 您可能需要水平捲動以檢閱所有欄位。
-
在「分類器」頁面上,指定用於機器學習訓練及預測的欄位。
- 回答欄位
- 從具有分類標籤的訓練資料檔中選取欄位。 在先前的範例中,
Label欄位是最佳選擇。 - 預測欄位
- 針對預測類別值產生的資料類型名稱。 依預設,資料類型名稱具有語法
<Answer field value>_predicted。 例如,Label_predicted。 - 測試資料集
- 指定用來測試分類器模型的資料集。 依預設,您上傳並配置的訓練資料 CSV 檔案會分割成三個資料集,分別用於訓練、驗證及測試。 不過,您可以選擇性地指定用於測試模型的個別資料集。
- 訓練聯合模型
- 根據資料集中特定欄位的值建立多個模型。 例如,如果文件具有
Product欄位,則您可以配置分類器,以針對欄位中指定的每一個產品名稱值建立個別分類器模型。 依預設,分類器會建立一個機器學習分類器模型。
您不需要指定包含要分類之文字的欄位。 系統會自動偵測此欄位。 您可以檢查可分析文字擷取來源的欄位,並變更它,或變更另一個欄位的索引類型來擴增它。 如需相關資訊,請參閱 識別文字欄位。
按下一步。
-
如果您要將強化套用至訓練資料中的文字,請從 目標欄位 清單中至少選取一個您要套用強化的欄位。
一般而言,您想要選擇包含您要分類之文字內文的欄位。 在先前的範例中,
Feedback欄位是最佳選擇。接下來,選取您要套用的任何註解程式,以強化目標欄位中的文字,然後按 下一步。
預設選取語音部分註解器。
-
在「確認」頁面上,檢閱分類器配置設定。 若要進行變更,請使用 上一步 按鈕。 否則,請按一下 儲存。
顯示「總覽」頁面。
-
按一下 新建模型,以建立並訓練您的機器學習模型。
-
您可以選擇性地變更模型名稱並新增說明。
您可以變更指定給下列資料集的預設比例值:
- 訓練資料集: 更新訓練模型的加權。
- 驗證集: 在訓練期間監視訓練模型的精確度。 精確度結果用來繪製訓練損失圖形。
- 測試資料集: 計算訓練模型的評分。
-
按一下建立。
模型訓練可能需要幾分鐘才能完成。
部署文件分類器模型
訓練模型之後,將模型部署為強化。
-
按一下 動作 直欄中的溢位功能表圖示,然後按一下 部署模型。 指定名稱及其他詳細資料,然後按一下 部署。
-
執行下列其中一項作業:
分類結果
將強化套用至集合之後,即會產生資料類型,您可以使用該資料類型來尋找預測的類別。 在此範例中,預測欄位命名為 label_answer_predicted。
使用產生的資料類型,依分類來過濾文件,並分析文件子集。 這樣做可協助您尋找型樣並探索其他見解。 您可以匯出這些目標文件,以與團隊成員共用或進一步分析。 如需相關資訊,請參閱 匯出資料。
當文件分類器分類文件時,它會將分類儲存在 document_level_enrichment.classes.class_name 欄位中。
例如,下列 JSON 摘錄顯示以 package_container 類別分類的文件。
文件分類器限制
您可以為每個服務實例建立的文件分類器及標籤數目取決於 Discovery 方案類型。
| 限制 | 企業 | 進階 | Cloud Pak for Data |
|---|---|---|---|
| 每個服務實例的文件分類器數目 | 20 | 20 | 無限制 |
| 含標籤的資料列數 | 20,000 | 20,000 | 20,000 |
| 強化之後訓練資料的大小上限 (MB) | 1,024 | 1,024 | 1,024 |
| 標籤數目 | 1,000 家 | 1,000 家 | 1,000 家 |
| 目標欄位數 | 50 | 50 | 50 |