此文件適用於 IBM Watson® Knowledge Studio on IBM Cloud®。 若要查看舊版 Knowledge Studio on IBM Marketplace 的文件,請按一下此鏈結

建立工作區

建置自訂模型的第一個步驟是建立工作區。

關於此作業

對於您要建置及使用的每一個模型,您可以建立一個包含建置模型所需之構件和資源的單一工作區。 然後,您可以訓練模型,以產生可部署至外部服務以供使用的自訂模型。

建立工作區之前,請先回答下列問題:

  • 您要建立哪種類型的模型?

    • 機器學習模型:使用統計方法來尋找文件中的實體及關係。 此類型模型可隨著資料量的成長進行調整。
    • 以規則為基礎的模型:使用宣告方法來尋找文件中的實體。 這種類型的模型較可以預測,且更容易理解及維護。 不過,它不會從新資料中學習。 它只能尋找它被教育要尋找的型樣。
    • 進階規則模型:提供比以規則為基礎的模型更深入的自訂作業以便進行文字分析。 如需指示,請參閱建立進階規則模型

    您也可以建立一個同時包含一個以規則為基礎的模型及一個機器學習模型的工作區。

  • 哪些服務會使用模型?

    如需可搭配使用自訂模型的其他 Watson 服務的相關資訊,請參閱 Watson 服務整合

程序

若要建立工作區,請完成下列步驟:

  1. 以 Knowledge Studio 管理者身分登入,然後按一下建立工作區

    具有專案經理角色的人員可以執行幾乎所有作業,但建立工作區除外。 管理者必須先建立工作區,並為其指派專案經理。

  2. 為工作區提供名稱。 請選擇一個反映您領域內容或模型用途的簡稱。 如果您需要,稍後可以變更工作區名稱。

  3. 識別工作區中文件的語言。 您新增至工作區的文件以及您建立或上傳的字典,必須使用您指定的語言。

  4. 選用項目:如果您要變更應用程式所用的記號器(即預設的機器學習型記號器),則可以展開進階選項區段,然後選擇字典型記號器

    預設記號器比字典型記號器更高階;其使用機器學習,根據其以來源文件的語言所完成的統計學習,來識別來源文件中的記號。 其會識別查準率較高的記號,因為其瞭解更自然且細微的語言型樣。 字典型記號器會根據語言規則來識別記號。 如需詳細資料,請參閱記號器

  5. 選用項目:如果您要將專案經理新增至工作區,則展開進階選項區段,然後從清單中選取要新增為專案經理的人員名稱。 管理者稍後可以藉由編輯工作區來新增或移除專案經理。

    只會顯示您從「使用者帳戶管理」頁面中針對實例而指派給專案經理角色的人員名稱。 如需新增使用者的相關資訊,請參閱組合團隊

    如果您使用「精簡」訂閱方案,請跳過此步驟。 您無法新增其他使用者,因此您無法將任何人指派給專案經理角色。 您不需要個別的專案經理。 當您作為管理者時,可以執行專案經理一般會執行的所有作業。

  6. 按一下建立

下一步

建立工作區之後,您就可以開始配置工作區資源。

若要變更工作區說明或工作區名稱,或是要於稍後新增或移除專案經理,管理者可以編輯工作區。 從 Knowledge Studio 首頁,按一下工作區磚上的顯示功能表圖示,然後選擇編輯功能表選項。

相關概念

從另一個工作區上傳資源

相關參考資料

語言支援

記號器

記號器會將字元分組成記號,將記號分組成句子。 記號大概相等於單字。

記號器為了識別文件的記號而必須採取的動作,視文件的語言而有所不同。 在英文中,記號通常相當於句子中以空格分隔的單字。 不過,記號與單字不一定一對一相符;其他文字元素在某些情況下會被視為記號。 例如,句子結尾的標點符號被視為記號,而縮寫形式通常會展開成兩個記號。 在不使用空格的語言中(例如,中文),會使用較複雜的統計演算法來識別記號。

記號化程序很重要,因為它決定使用者在基準編輯器中可強調顯示註釋的字元群組。 實體及關係提及項目的註釋通常會與記號界限對齊,且必須在句子內加上標籤;它們不能跨越句子界限。

支援的類型

Knowledge Studio 支援下列記號器:

  • 機器學習型記號器(預設值)

    這是較高階的記號器,根據其以來源文件的語言所完成的統計學習,來識別來源文件中的記號。 此記號器會尋找擷取更自然且細微的語言型樣的記號。 您無法自訂此記號器。

  • 字典型記號器

    此記號器是以語言字典為基礎。 它會尋找遵循來源文件語言規則的記號。 只有進階使用者才能自訂此記號器。

您必須選擇在建立工作區時要使用的記號器。 您無法於稍後切換至不同的記號器。 為取得最佳結果,請使用預設記號器。 只有想要透過唯一性字典機制來修改記號器行為的進階使用者,可以選擇字典型記號器。 然後,他們可以藉由新增項目至字典的方式來予以自訂。 不過,必須小心執行自訂作業,因為當您在字典中新增單字時,變更可能會以非預期的方式影響機器學習模型。

輸入、輸出及限制的摘要

不同的模型開發階段需要不同的輸入,且會產生不同的輸出。

針對模型開發程序的每一個階段,此表格彙總您所執行的一般活動、支援的輸入檔格式、可產生的輸出以及任何調整大小限制或其他需求。

所有模型類型

表 1:所有模型類型 | 任務 | 典型用法 | 支援的輸入格式 | 支援的輸出格式 | 限制和要求 | | --- | --- | --- | --- | --- | | 類型系統管理 | 建立類型系統或上傳及修改現有類型系統。 定義您領域的實體類型及關係類型。 您看不到可視化的類型系統。|

  • 您從 Knowledge Studio 工作區下載的 JSON 檔案。
  • 從「人工註釋工具 (HAT)」下載的 ZIP 檔
| JSON | 為避免人為註解的視覺負荷過重,請定義不超過 50 個實體類型和 50 個關係類型。 上載類型系統的檔案大小限制:20 MB | | 辭典管理 | 上傳只讀模式的 CSV 辭典檔案或從其他工作區下載的辭典 ZIP。 建立新的辭典,然後上傳術語詞條的 CSV 檔案或新增術語詞條。| 字典檔案:
  • UTF-8 格式的 CSV 檔
  • 從其他工作區下載的字典的 ZIP 檔
詞彙項目檔:
  • UTF-8 格式的 CSV 檔
|
  • UTF-8 格式的 CSV 檔
  • 要在其他工作區中使用的字典的 ZIP 檔
| 檔案大小限制:
  • 每個 CSV 詞彙項目檔 1 MB
  • 每個 CSV 唯讀字典檔 16 MB
  • 每個字典 15,000 個項目(唯讀字典除外)
  • 每個工作區 64 個字典
|

機器學習模型

表2:機器學習模型| 任務 | 典型用法 | 支援的輸入格式 | 支援的輸出格式 | 限制與要求 | | --- | --- | --- | --- | --- | | 文件管理 | 上傳一小部分具代表性的文件子集 上傳包含先前由人工註解員、機器學習模型或 UIMA 分析引擎新增註解的文件 您無法從 IBM Watson Explorer 擷取整個語料庫,以計算高價值文件的註解。|

  • UTF-8 格式的 CSV 檔
  • UTF-8 格式的文字
  • HTML
  • PDF 檔案(不支援掃描及有密碼保護的檔案)
  • Microsoft Word DOC 或 DOCX 檔案(不支援有密碼保護的檔案)
  • 包含從其他工作區下載的文件的 ZIP 檔案
  • 包含 UIMA CAS XMI 格式文件的 ZIP 檔
| 文件的 ZIP 存檔文件 | 文件的 ZIP 存檔文件 | 文件的 ZIP 存檔文件 | 文件的 ZIP 存檔文件
  • 每個文件 40,000 個字元
  • 每個工作區 10,000 個文件
  • 每個工作區 1,000 個文件集(包括註釋集)
  • 每個檔案 5 MB,每次上傳 200 MB(TXT、PDF、DOC、DOCX 和 HTML 檔案)
| | 預先註釋 | 使用字典或 IBM Watson® Natural Language Understanding 預先註釋器,提供人為註釋的起點。

您無法從 IBM Watson Explorer 重新註解語料庫。| 原始文件。

注意: 請勿預先註解已由人工註解員註解的文件,否則您將會遺失人工註解員所完成的工作 | 文件註釋 | 管理人為註釋。 註解實體、關係和核心參照鏈,以建立基礎真相 | 註解任務 | 基礎真相 | 註解實體、關係和核心參照鏈,以建立基礎真相 | 註解任務 | 基礎真相 | 基礎真相
  • 每個工作區有 256 個作用中註冊工作
| | 訓練與精進 | 訓練有監督的機器學習模型,從非結構化文字中萃取特定領域的資訊。 評估並改善監督的機器學習模型。 您無法建立半監督或未監督的機器學習模型。 您無法進行廣泛的特徵工程。| 不適用 | 機器學習模型 | 不適用
  • 每個工作區 1 個機器學習模型
  • 每個工作區 10 個模型版本
  • 工作區的最大數量由您的部署決定。
  • 您每個月最多可以執行的訓練行動次數由您的部署決定。
| | 出版 | 輸出機器學習模型,用於在其他 Watson 應用程式中執行文字擷取。| 不適用
  • ZIP 檔案
| 無

以規則為基礎的模型

表 3:基於規則的模型 | 任務 | 典型用法 | 支援的輸入格式 | 支援的輸出格式 | 限制和要求 | | --- | --- | --- | --- | --- | | 規則編輯器 | 建立或上傳文件到規則編輯器,從中定義類別、正規表達式和規則。|

  • 純文字(在編輯器中新增)
  • UTF-8 格式的 CSV 檔
  • 從「所有」文件集複製
| 無
  • 每個工作區 1 個以規則為基礎的模型
  • 每個文件 5,000 個字元
  • 每個工作區 100 個文件
  • 文件標題的大小上限是 256 個字元
  • 每個工作區 200 個規則
  • 每個工作區 400 個類別
  • 每個工作區 100 個正規表示式群組
  • 每個正規表示式群組 100 個正規表示式項目
  • 每個正規表示式項目 1,000 個字元
  • 每個工作區 5 個規則型模型版本
| | 發表 | 發表基於規則的模型,用於在其他 Watson 應用程式中執行模式識別。| 不適用
  • PEAR 檔案
| 基於規則的模型目前僅能匯出至 IBM Watson Discovery | | 基於規則的模型目前僅能匯出至