新增切面
為了協助您分析語言處理和文字分析的結果,Discovery 將對具有相似型樣或內容的文件進行組織和分類。
Facets 可協助您篩選文件,讓您可以更快速地執行深入分析。 無論您是想大海撈針,還是想發現意想不到的趨勢,從面著手都可以加速研究過程。
-
For 內容挖掘 projects, facets are extracted from your collection based on parts of speech information (that is captured by the 語言部分 enrichment that is applied to projects of this type by default). 您也可以檢視從文件中的元資料衍生出來的面。
提取的構面 -
For 文件檢索 projects, facets are extracted from your collection based on recognized entities (that are captured by the 實體 enrichment that is applied to projects of this type by default).
熱門實體方面
For more information about the 實體 and 語言部分 enrichments, see 應用預先建立的增強功能. 如需有關預設套用至專案的豐富內容的詳細資訊,請參閱 預設專案設定。
建立切面
如需更多關於如何在 Content Mining 專案中加入切面的資訊,請參閱 加入切面。
對於其他專案類型,您可以用以下方式建立面:
從集合的現有欄位建立資料類型
當您套用豐富功能到資料集中時,新的欄位就會加入索引中。 經由豐富辨識的資訊會儲存在這些新欄位中。 您可以使用豐富欄位作為面相的來源。
例如,如果您套用 Keywords 預先建立的豐富功能,您就可以根據在集合中找到的關鍵字來建立一個分面。 在處理您的文件時,Keywords enrichment 會識別出現的任何關鍵字提述,並將相關資訊儲存於一系列以 enriched_{field_name}.keywords 開頭的欄位中。 若要建立關鍵字分面,請新增一個分面,該分面的類別取自儲存關鍵字提及的欄位,即 enriched_{field_name}.keywords.mentions.text 欄位。 如需更多關於關鍵字增益的資訊,請參閱 應用預先建立的增益。
同樣地,您也可以使用特定領域增益所產生的欄位作為分面的來源。 事實上,當您建立 Regular expression 豐富內容時,您可以定義一個分面,用來分類任何已識別的表達式提述。 如需詳細資訊,請參閱 新增網域特定資源。
若要從現有欄位新增分面,請完成下列步驟:
-
在改進和自訂頁面中,按一下自訂顯示,然後按一下面板。
-
按一下新建資料類型 > 從集合中的現有欄位。
-
選擇您要使用的欄位,例如
enriched_text.entities.type。 新增面標籤並選擇篩選控制選項。 -
選用:您可以調整顯示的面值最大數目。
最大數目是每個面類型顯示的面值數目總和。 預設會顯示共 10 個面的值。
-
在測試資料類型時,您可以調整選項。
藉由建立字典來建立資料類型
透過建立辭典,新增一個分面來組合一組對您的使用個案有特殊意義的詞彙。
例如,零售服裝店的店主會收集顧客的評論,並希望能夠找到任何重複發生的投訴,以確定要停售的零售商品。 所有者可以建立字典,協助辨識和標記評論文字中提及的特定衣物。 為了支援依服裝物品類型篩選客戶回饋的目標,物主可能會新增類似下表所列的項目。
| 詞典條目 | 同義字 | 字典名稱 |
|---|---|---|
| 襯衫 | 上衣,鈕扣,外衣,襯衫,T恤,長袖,短袖,背心 | clothing |
| pants | 褲子,牛仔褲,緊身褲,運動衫,披肩,平底褲,長褲,短褲 | clothing |
A review that says, This long-sleeve is so badly proportioned. Who has arms that long! is returned when you filter the documents by the clothing facet.
若要透過建立辭典來建立分面,請完成下列步驟:
-
在改進和自訂頁面中,按一下自訂顯示,然後按一下面板。
-
按一下新建資料類型 > 藉由建立字典。
-
輸入分面的名稱,然後為要分類的詞彙建立字典。
儲存字典後,用於資料類型標籤的名稱將顯示在資料類型清單中。
-
在測試資料類型時,可以選取指導領域概念 > 字典,而新增更多詞彙至已建立的字典。
您建立的辭典會顯示在辭典頁面的清單中。 如需詳細資訊,請參閱 字典。
透過識別模式來建立面
Patterns 是測試版功能,僅支援英文文件。
IBM Cloud IBM Cloud 僅
This facet is available only to managed deployments and in 文件檢索 and 對話式搜尋 projects.
Patterns 特性使用型樣歸納來協助您教導 Discovery 辨識您資料中的型樣。 模式歸納會從您提供的範例中產生抽取模式。 在您指定幾個範例後,Discovery 會建議您必須驗證的更多規則,以完成模式。
型樣辨識最適合用於在大小寫、長度、文字或數值方面具有一致結構的文字。 您可以教導 Discovery 在文件中識別的型樣範例有:
- 所有
ISO標準號碼,例如ISO 45001、ISO 22000 - 所有貨幣金額,例如
$50.5 million,29 dollars、$29.00 - 所有日期,例如
8 September 2019、June 12, 2020
如果您需要識別特定的詞彙或文字,請建立一個面作為字典項目的一部分。 例如,使用字典分面來組合下列類型的資訊:
- 相同系列中的所有產品,
Cloud Pak for Data、Cloud Pak for Automation、Cloud Pak for Security - 同一種類中的所有術語:
carburetor、piston和valves
如需詳細資訊,請參閱 透過建立字典來建立分面。
若要透過識別圖案來新增刻面,請完成下列步驟:
-
在改進和自訂頁面中,按一下自訂顯示,然後按一下面板。
-
按一下新建資料類型 > 藉由識別型樣。
-
在 「從新模式建立構面」 頁面上,選擇選擇文件的方式。 您可以讓 Discovery 為您隨機選取 10 個文件,也可以自己選取多達 20 個文件。
如果您自己選擇文件,請遵循這些指引:
-
選擇包含您希望模型稍後能夠辨識的各種不同格式的模式提述的文件。
-
如果您想讓模型了解不符合模式的詞彙使用方式,請包含一份以錯誤方式使用該詞彙的文件,這樣您就可以故意省略其選擇。
例如,您要新增的圖案可能會捕捉提到的服裝。 In documents that mention a
topto refer to a shirt, you would selecttopas a clothing mention. But, you might also want to include a document that mentionsthe top 3 fashion trendsand purposely not selecttopwhen the term is used in this context. 這個遺漏教導模型,當這個詞用來表示 最好的時,top 並不符合模式。 -
包含最多 5,000 個字元的文件。 任何超出限制的文件都會被截斷為 5,000 個字元。
-
-
按下一步。
-
選取符合您想要定義模式的範例字或詞組。
例如,如果您想要定義日期模式,請開始高亮顯示每個文件中提到的日期。 如果您犯錯,請移至選取項目上,然後按一下
x將其刪除。請務必選擇每個提及的圖案。 模型會從您省略的內容和選擇的內容中學習。
-
繼續選取範例。 當您找出足夠的範例後,Discovery 會顯示建議的範例清單,供您驗證。 Choose 是 or 沒有 for each one.
如果想要在上下文中確認範例,請按一下預覽文件圖示。
-
繼續反白範例和驗證建議,直到顯示訊息表示您提供了足夠的範例。
-
按一下 檢視範例索引標籤,以檢視範例清單。
-
如果範例正確,便按一下儲存型樣。
如果系統無法確定有效的樣式,則永遠不會啟用儲存樣式按鈕。 如果您選擇相互矛盾的範例來說明模式,系統無法判定有效的模式。 如果您無法儲存工作,請按一下 Reset 按鈕重新開始。 文件會還原為原始狀態,不再選擇先前已識別的任何範例。
儲存型樣後,為資料類型標籤指定的名稱將顯示在資料類型清單中。
何時使用模式分面而非正則表達欄位
建立基於樣式的分面類似於從欄位建立樣式,而該欄位是應用 Regular expression 豐富到集合而衍生出來的。
- 如果您要擷取的資訊遵循嚴格的格式規則,您可以使用 Regular expression 豐富功能來尋找它。 套用豐富化,然後您就可以使用結果欄位做為面的來源。
- 如果您要擷取的資訊可以出現在不同的格式樣式中,則模式面是較好的選擇。 例如,日期或貨幣可以各種方式格式化。 沒有單一的 regex 規則可以捕捉所有的變化。 透過模式面,您可以提供多個真實世界的範例,顯示指定資訊的不同方式。