使用「內容採礦」應用程式分析資料
使用 Discovery Content Mining 應用程式來分析資料。 應用程式會在視覺化中顯示資訊子集,可協助您尋找型樣、趨勢及異常。
只有已安裝部署或企業和高級計劃管理部署的使用者才能使用「內容挖掘」應用程式。
概觀影片
影片文稿
Watson Discovery 由 Stuart Strolin 呈現的內容採礦專案。 (音樂簡介) 此視訊的目的是讓您熟悉 Watson Discovery中的內容採礦專案。
內容採礦是 Watson Discovery 的主要使用案例之一,用於分析及探索結構化和非結構化資料,以尋找見解並擷取隱藏意義。 公民分析師和資料科學家都使用它。
內容採礦專案可用於所有類型的分析,因為使用者介面不是特定產業或資料集特有的。
在此實務範例中,您是虛構汽車公司的分析師。 營運報告已提醒該公司其中一部汽車的意外率不尋常。 你的工作就是找出原因
使用內容採礦專案,您可以透過查看國家汽車事故報告中的非結構化資料來開始分析。 您會看到一個介面,可讓您選取汽車型號並開始分析 (在「集合」頁面上)。 在此情況下,您對 Hill Walker 有興趣。 您可以在頁面開頭的搜尋區段中輸入該資訊。 但只要按一下項目就會更容易。 您可以新增任意數目的搜尋詞彙和條件。 但實際上,您想要讓應用程式引導您的分析。
您現在看到的是導覽視圖 (引導模式)。 它會追蹤您的分析,並提供後續步驟的選項。 它也會提供符合現行分析狀態的文件數目計數。 在這個小集合中,與 Hill Walker 相關的文件只有 51 份。 在正式作業資料集中,數字通常會大很多。 分析趨勢和異常通常是一個好方法,因為它可讓您查看是否有任何異常現象。
馬上你就會發現希爾沃克在 12 月和 1 月有問題 您決定將此起始探索縮小為僅在 12 月進行進一步調查。
請注意頂端的導覽視圖如何一律讓您知道您在分析中的位置。 接下來,您選取 分析原因及性質,因為您對發生事件的原因感興趣。
您注意到像「雪」和「剎車」之類的單字會一起強調顯示 (在「詞性」區段中),因此您將這些新增至分析中。
Content Miner 專案已將您的調查範圍縮小為可以輕鬆閱讀的少數投訴。(按一下顯示文件)
這裡的共同主題是在雪的條件下剎車的工作方式有一個意想不到的問題。 您現在擁有所需的資訊,可要求工程部門對制動系統執行詳細檢查,並判斷它在雪狀狀況下無法如預期般運作的原因。
在此示範中,您看到使用 Watson Discovery 及內容採礦的公民分析師如何輕鬆探索非結構化文字中的隱藏意義。(特性、功能及使用案例的清單)
您要如何處理 Watson Discovery? (音樂)
如何運作
若要分析資料,請使用 資料類型。 資料類型可讓您將資料截塊並視覺化部分資訊,讓您更容易理解。
從集合的資料分析頁面中,您可以選擇在下列其中一個視圖中顯示資料:
- 資料類型
- 顯示從註釋衍生的資料類型,這些註釋由套用至文件的強化新增至文件。 強化可以包括內建「自然語言處理程序」強化,例如 詞性 或 實體。 它們也可以包括您新增的自訂強化,例如字典、正規表示式型樣及機器學習模型。
- meta 資料資料資料類型
- 顯示衍生自資料的資料類型。 當您將檔案新增至集合時,Discovery 會分析並檢索資料。 新增註釋以識別內容類型,並顯示為 meta 資料類型。 當您汲取結構化資料 (例如 CSV 檔中的記錄) 時,會產生最佳 meta 資料資料類型。 meta 資料資料資料類型的長度上限為 256 個字元。
- 自訂
- 只顯示您選擇要新增至視圖的資料類型。 您可以將強化衍生及內容衍生資料類型的混合新增至自訂視圖。
當您建立 內容採礦 專案類型時,詞性 資料類型會自動套用至您的資料。 此資料類型是一個很好的起點,因為它適用於所有資料,無論主旨為何。 輸出可讓您快速查看資料中最常見的術語。
從這個起點開始,您可以決定其他方式來過濾可能有用的資料。
例如,如果您的資料包含交通報告,則 Part of Speech 資料類型可能會顯示高頻關鍵字包括諸如 engine、煞車、fire、煙霧及 spark之類的術語。 根據這個一般術語,您可以建立字典來協助您分類及過濾資料。 範例中的關鍵字可能會引導您建立下列字典:
component字典,適用於引擎和剎車之類的術語phenomenon字典,用於諸如火、煙和火花之類的術語
當您將字典強化套用至資料時,它會產生 註釋。 您可以將註釋視為您新增至單字或詞組的標籤,其中標籤會分類或識別單字或詞組的意義。 產生的註釋會作為新的資料類型,可用來進一步過濾及剖析資料。
例如,使用新的 component 及 phenomenon 資料類型,您可以尋找交通事故所涉及元件與現象之間的相關性。
深入挖掘
若要深入挖掘資料,請套用或建立 AI 模型,以在文件中尋找不同類型的資訊。 您可以套用內建自然語言處理程序模型,例如 實體 強化,可辨識常用事物的提及項目,例如商業或位置名稱及其他類型的適當名詞。 或者,您可以套用自訂模型,以辨識資料特有的項目和種類。
開始使用
您必須先建立 Discovery Content Mining 專案,然後才能使用應用程式。 建立專案並上傳資料之後,您可以開啟「內容採礦」應用程式。
如需相關資訊,請參閱建立專案。
當然,如果您未將正確類型的資訊放入,則無法取得有用的見解。 請務必包含一致資料。 如果您想要尋找一段時間的趨勢,您的資料必須包括指定日期的資料點。
以 CSV 檔案格式提交的資料是最佳的。 如需提供感興趣分析功能的 CSV 檔案範例,請參閱 分析 CSV 檔案。