建立收藏集
合集是您新增到專案中的一組文件,以便您可以分析、豐富和擷取其中有用的資訊。
您可以透過下列方式將資料加入專案:
-
使用產品使用者介面上傳本機可存取的檔案。 此方法是入門和測試用例的最佳方式。
-
設定排程抓取儲存於外部資料來源的文件。
產品使用者介面提供多種內建的資料來源連接器供您選擇。 選項因您的部署類型而異。 如需詳細資訊,請參閱 支援的資料來源。
-
連接至沒有內建支援的外部資料來源:
- IBM Cloud
- 使用 IBM App Connect 設定排程抓取儲存在其他外部資料來源的文件。
- IBM Cloud Pak for Data IBM Software Hub
- 建立連接器以抓取儲存在其他外部資料來源的文件。
-
若要將資料新增至專案的過程自動化,請使用 Discovery API 建立一個集合,並將文件上傳至其中。
當您新增文件到 Discovery 時,原始文件會被抓取,文件中的資訊會儲存在索引中,以便日後進行豐富和分析或檢索。 並非所有原始文件的豐富內容都會保留。 例如,不會儲存.ppt 或.doc 檔案中的影像。 如需詳細資訊,請參閱 如何處理您的資料來源。
IBM Cloud 建立集合後,您可以按一下 預覽資料以在進階文件檢視中預覽資料。
選擇加入收藏的內容
當您決定如何將原始內容分割成合集時,有幾件事情需要考慮。
-
從不同資料來源取得內容
如果您在一種以上的資料來源(例如網站和 Salesforce )中儲存類似的內容,您可以在一個專案中建立兩個獨立的集合。 每個合集新增來自單一資料來源的文件。 當它們一起建構成單一專案時,使用者就可以同時搜尋兩個來源。
-
應用增益
建立合集是將要以類似方式豐富的文件分組的好方法。 例如,也許您的文件中有一個子集包含業界術語,而您想要新增可辨識這些詞彙的字典。 您可以建立單獨的合集,並使用詞彙建議功能來加快建立字典的過程。
-
建立獨立的智慧文件理解 (SDU) 模型
您可以使用 Smart Document Understanding 工具,根據文件的結構來識別內容。 如果您有 20 個 PDF 檔案是由銷售部門建立並使用一種範本,而 20 個 PDF 檔案是由研究部門建立並使用另一種範本,請將每組檔案歸類到其自己的集合中。 然後,您可以使用 SDU 工具為每個結構分別建立模型,這個模型可以了解獨特的結構。 您也可以使用該工具定義原始文件特有的自訂欄位。
建立集合
在建立集合之前,您必須先建立專案。 如需相關資訊,請參閱建立專案。
需要注意的事項:
- 一個集合只能支援一個外部資料來源。
- 文集中的文件必須只有一種語言,也就是您為文集指定的語言。
若要建立集合,請完成下列步驟:
-
開啟專案,移至「管理集合」頁面,然後按一下「新增集合」。
- 智慧型文件處理、會話式搜尋、文件擷取和自訂專案類型最多可包含 5 個收藏集。
- 內容挖掘專案只能包含 1 個集合。
-
上傳資料 至您的收藏集。
IBM Cloud 若要連線至不同的資料來源而非上載資料,請按一下 Need to connect to a data source? 欄位旁的連結。
您可以選擇下列方式連接資料來源,而不是上傳資料。
-
抓取外部資料來源。
有關支援的資料來源,請參閱您部署類型的適當主題:
- IBM Cloud Pak for DataIBM Software HubIBM Cloud Pak for Data 資料來源
- IBM CloudIBM Cloud 資料來源
這些主題也說明如何連接至每個部署類型預設不支援的資料來源。
有關如何解決在將文件新增至集合時可能遇到的問題的信息,請參閱 擷取故障排除。
有關如何以程式方式建立集合的詳細資訊,請參閱 API 參考文件。
光學字元辨識
當您建立收藏集時,可以套用的其中一項選購功能是光學字元識別。 光學字元識別 (OCR) 功能可從影像中擷取文字。 此功能對於保存圖表或圖形中描繪的資訊,或嵌入檔案 (例如掃描的 PDF) 中的文字非常有用。 透過將視覺資訊轉換成文字,之後就可以進行搜尋。
在雲端管理的實例中推出了該技術的新版本。 OCR v2 由 IBM Research 開發,能夠更好地從掃描的文件和其他影像中提取文字,這些文件和影像有以下限制:
- 由於掃瞄器設定不正確、解析度不足、光線不良 (例如使用行動擷取)、對焦失準、頁面錯誤對齊,以及文件列印不良而造成低品質影像
- 具有不規則字型或各種顏色、字型大小和背景的文件
啟用 OCR 時需要注意的事項:
- 啟用 OCR 時,擷取包含影像的文件所需的時間會增加。
- OCR 目前不支援從文件和掃描影像中提取手寫文字。
- OCR 可以讀取清晰和嘈雜的影像。 它可以將有雜訊的影像轉換為灰階影像,並使影像變得平滑和去斜。 但是,影像品質必須符合 80 DPI (每英吋點數)的最低要求。
- OCR 可以識別多種語言,但影像中文字的語言必須與新增檔案的集合所指定的語言相同。
有關支援 OCR v1 和 OCR v2 的語言的詳細資訊,請參閱 語言支援。
如需可套用 OCR 的檔案類型清單,請參閱 支援的 檔案類型表。
針對未經整理的資料啟用詞干處理
您可以設定 Discovery,以便在建立集合時,使用詞幹化而非詞彙化來進行規範化。 只有在資料集、查詢或兩者都包含許多拼寫錯誤、重音符號遺失和文法錯誤的資料時,此設定才會偶爾有用。
Discovery 將字詞正規化,以便更快速地識別和匹配字詞及其各種形式,例如複數或替代動詞變位。 預設情況下,Discovery 會使用詞彙化來根據字義將字彙規範化。 詞彙去莖法僅使用詞彙的莖來使詞彙規範化。
Lemmatization 更為精確,但最適用於經整理的資料。 如果您的資料未經妥善整理,則幹莖法的效果可能會更好。 無論單字拼寫是否正確,通常都會偵測到相同的字莖。 然而,词素化可能无法识别拼写错误的单词,或者可能误解其含义。 因此,分詞器會在索引中加入錯誤的字根來代表拼錯的字。 針對拼寫錯誤的字詞進行幹部化版本的搜尋,可能會比針對不正確的詞彙化版本進行搜尋得到更好的結果。
下表舉例說明某些字詞如何進行字莖化和詞彙化。
| 表面形式 (surface form) | 詞彙化形式 | 莖狀 |
|---|---|---|
| 執行中 | 執行 | 執行 |
| ran | 執行 | ran |
| 指導員 | 指導員 | 指示 |
| 指令 (instruction) | 指令 (instruction) | 指示 |
從範例中可以看出,詞彙分析器比幹詞器更能捕捉詞義。 running 和 ran 都被認定為同一字根動詞 run 的不同形式。 而 instructor 和 instruction 這兩個名詞在意義上的差異也被保留了下來。 但是,如果資料中包含如 instructer 和 instructoin 等拼寫錯誤的字詞,則幹詞化 (instruct ) 產生的規範化形式將傳回更好的匹配結果。
Discovery 在索引中收錄和儲存資料時,以及在執行時分析使用者提交的查詢時,都會將字詞標準化。 即使一個操作發生在集合層級,另一個發生在專案層級,兩個操作仍使用相同的歸一化方法。 當提交查詢時,它會聯合到專案中的每個集合,在那裡,查詢會根據該集合的配置進行規範化。 設定為使用幹部處理器的集合會透過使用幹部處理器將查詢規範化。 的集合,使用詞彙化將查詢規範化。
若要在建立集合時啟用詞幹擷取器而不是詞形還原器,請展開更多處理選項,然後將索引切換器時使用詞幹擷取而不是詞形還原設為開。
如果您將 Discovery 設定為使用幹莖產生器,請同時考慮設計從資料集中擷取資訊的查詢,以便在比對過程中容許字元差異。 如需詳細資訊,請參閱 字串變異運算符號。
如需更多有關幹莖器支援語言的資訊,請參閱 語言支援。
收集限制
每個專案可建立的集合數量因專案類型而異。
| 專案類型 | 每個專案的收藏 |
|---|---|
| 智慧型文件處理 | 5 |
| 文件擷取 | 5 |
| 合約文件檢索 | 5 |
| 交談式搜尋 | 5 |
| 內容採礦 | 1 |
| 自訂 | 5 |
每個服務實例可建立的集合數量取決於您的 Discovery 計劃類型。
| 方案 | 每個服務實例的收藏 |
|---|---|
| Cloud Pak for Data | 300 |
| 進階 | 300 |
| 企業 | 300 |
| Plus (包含試用版) | 40 |
IBM Cloud Pak for DataIBM Software Hub 您可以建立的收藏集數量取決於您的硬體配置。支援每個實體和安裝最多 300 個收藏集,但這個數量取決於許多因素,包括記憶體。Discovery
支援的檔案類型
Discovery 可以擷取特定檔案類型。 對於所有其他類型的檔案,會顯示警告訊息,並且不會擷取檔案。
下表顯示支援的檔案類型,以及因檔案類型而異的功能支援資訊。
| 檔案類型 | 支援文字擷取 | 支援智慧文件理解 (SDU) | 支援光學字元識別 (OCR) |
|---|---|---|---|
| CSV | |||
| DOC, DOCX | |||
| GIF | |||
| HTML | |||
| JPG | |||
| JSON | |||
| PNG | |||
| PPT, PPTX | |||
| TIFF | |||
| TXT | |||
| XLS、XLSX | |||
- 您可以使用 PDF 生成工具(如 Adobe Acrobat、Microsoft Office、Apple 上的 Preview 等)生成 PDF 檔案。
在處理 PDF 時,會忽略向量物件、向量化文字和 SVG 影像。 此外,Discovery 目前不支援從 PDF 中具有透明層或透明群組的影像中提取文字。
- 只渲染 PDF 中出現的支援影像檔案類型的影像。
- 對於掃描的影像,請使用 300 dpi 或更高的解析度,以獲得最佳的 OCR 效能。 根據 光學字元識別 的指引,最小 dpi 必須為 80
- 僅支援單頁影像檔案。
- 壓縮存檔檔案 (ZIP、GZIP、TAR) 內的檔案會被擷取。Discovery 擷取存檔內支援的檔案類型。 它會忽略所有其他檔案類型。 檔案名稱必須以 UTF-8 編碼。 例如,名稱包含日文字元的檔案必須先重新命名,才能加入 ZIP 檔案。
- Discovery 僅支援使用類似下面的指令產生的 MacOS zip 檔案:
zip -r my-folder.zip my-folder -x "*.DS_Store"。 不支援用滑鼠右鍵按一下資料夾,然後按一下壓縮所建立的 ZIP 檔案。 - 從「改進和自訂」頁面開啟的查詢結果的進階檢視中,不會顯示您上傳作為存檔檔案一部分的 PDF 檔案。 如果您希望檔案可從進階檢視檢視,請重新匯入 PDF 檔案與存檔檔案分開。
當您將檔案新增至「Document Retrieval for Contracts」專案類型時,任何支援 SDU 和 OCR 的檔案類型都會自動使用預先訓練的智慧文件理解模型和光學字元識別功能來處理。
文件限制
每個服務實例允許的文件數量取決於您的 Discovery 計劃類型。
文件限制適用於索引中的文件數量。 如果您計畫申請的增補內容可能會在之後增加文件數量,請在開始時上傳較少的文件。 例如,以下配置會產生更多文件:
- 分割文件時,文件會被分割成多個文件
- 您上傳的 CSV 檔案每行會產生一個文件
- 您抓取的資料庫資料來源會為每一資料庫行產生一個文件
- 在 JSON 檔案的陣列中定義的每個物件都會產生單獨的文件
| 方案 | 每個服務實例的文件 |
|---|---|
| Cloud Pak for Data | 無限制 |
| 進階 | 無限制 |
| 企業 | 無限制 |
| Plus (包含試用版) | 500,000 |
對於企業方案,每月 100,000 份文件之後就要收費。 如需有關定價的詳細資訊,請參閱 Discovery 定價方案。
允許的最大數目會因文件大小而略有不同。 將這些值作為一般指引。
檔案大小限制
抓取的文件
使用連接器可抓取的每個檔案的最大大小因部署類型而異。
IBM Cloud 上的管理部署 IBM Cloud
-
僅限 Premium 計劃:
- 盒裝:50 MB
- IBM Cloud 物件儲存:50 MB
- Salesforce Files 物件:50 MB
- 所有其他資料來源:10 MB
-
所有其他計劃:10 MB
IBM Cloud Pak for DataIBM Software Hub 上安裝部署 IBM Cloud Pak for Data
- 所有資料來源:32 MB
上傳的文件
您可以上傳的每個檔案大小取決於您的 Discovery 計劃類型。 有關詳細資訊,請參閱下列最大文件尺寸表。
| 方案 | 每份文件的檔案大小 |
|---|---|
| Cloud Pak for Data | 50 MB |
| 進階 | 50 MB |
| 企業 | 10 MB |
| Plus (包含試用版) | 10 MB |
領域限制
當文件新增至集合時,文件中的內容會進行評估,並新增至內部索引中的適當欄位。
對於結構化資料,例如上傳的 CSV 或 JSON 檔案,或來自抓取資料庫的資料,每一列或物件都會儲存為一個根層級欄位。 例如,如果將 CSV 檔案新增至集合,CSV 檔案中的每一列都會儲存為索引中的獨立欄位。
索引中最多可加入 1,000 個欄位。
您不能指定欄位的資料類型,例如日期或字串。 資料類型會在文件擷取時自動偵測並指定給欄位。 該指派基於從索引的第一個文件中檢測到的資料類型。 如果檢測到相同欄位中的值具有不同的資料類型,則後續文件中可能會發生輸入錯誤。 因此,如果您的文件在單一欄位中混合了多種資料類型,請首先擷取欄位中具有最靈活資料類型 (例如 String) 值的文件。
當您抓取網站或上傳 HTML 檔案時,HTML 內容會新增到集合中,並在 html 欄位中建立索引。
下表顯示每個文件欄位的最大大小限制。
| 欄位類型 | 每份文件允許的最大尺寸 |
|---|---|
html 欄位 |
5 MB |
| 所有其他欄位的總和 | 1 MB |
如果文件中欄位的最大大小超出允許的限制,則會按以下方式處理:
-
對於具有超大
html欄位的文件,除了html欄位外,文件中的所有欄位都會被編入索引。對於 IBM Cloud Pak for Data 4.0 及更早版本,整個文件都沒有索引。
-
對於具有過大非 HTML 欄位的文件,該文件不會被編入索引。
如果您要上傳 Microsoft Excel 檔案,而顯示的訊息顯示已超過非 HTML 欄位大小限制,請考慮將 XLS 檔案轉換為 CSV 檔案。 當您上傳逗號分隔值 (CSV) 檔案時,每一行都會被索引為獨立的文件。 因此,不會超出欄位大小限制。
有關如何處理上載檔案中欄位的詳細資訊,請參閱 如何處理欄位。
受支援的資料來源
下表顯示每一種部署類型支援的資料來源。
| 資料來源 | IBM Cloud | IBM Cloud Pak for Data |
|---|---|---|
| Box | ||
| 資料庫 (IBM Data Virtualization、IBM Db2、Microsoft SQL、Oracle、Postgres) | ||
| FileNet P8 | ||
| HCL Notes | ||
| IBM Cloud Object Storage | ||
| 本端檔案系統 | ||
| Salesforce | ||
| Microsoft SharePoint Online | ||
| Microsoft SharePoint 內部部署 | ||
| 網站 | ||
| Microsoft Windows 檔案系統 |
搜索排程選項
建立集合後,起始搜索將立即開始。 您為抓取排程選擇的頻率,會決定下一次抓取的開始時間。
若要建立爬行排程,請完成下列步驟:
-
在抓取排程部分,選擇頻率。
您可以排定爬蟲在特定的日期和時間執行。 如果您想避免目標系統在營業時間內負荷過重,此選項很有幫助。 如果在 1 - 9 的範圍內指定小時,請在小時數字前加一個 0。 例如,您可以將爬行安排在星期六的
01:00 AM。IBM Cloud 當您排程要每月執行爬行時,日數選項只限於 1 到 28,因為您必須指定每個月都會發生的日子,包括有 28 天的二月。
IBM Cloud Pak for Data 已安裝的部署有更多排程選項:
- 如果您要每 12 小時或每 10 天爬行一次,請選擇「自訂間隔」。 您可以排程讓爬蟲以自訂的天數或時數執行。
- 預設情況下,爬行會排定在非繁忙時間開始。
- 請勿將間隔設定為短於爬行完成所需時間的頻率。
- 請勿設定多個爬蟲以短時間間隔執行。
- 如果您在建立集合的時區以外的時區開啟集合,則會顯示世界協調時間 (UTC) 偏移資訊。
-
IBM Cloud Pak for DataIBM Software Hub 已安裝的部署有「更多排程設定」區段,您可以在此選擇用來抓取資料來源的排程類型。
所有連接器( Web 抓取連接器除外)的選擇如下:
- 完全爬取:重新擷取外部資料來源以更新集合中的文件。
- 抓取更新(尋找新增、修改及刪除的內容):僅當外部資料來源中的資料自上次抓取後新增、修改或刪除時,才會更新集合。
- 抓取新增和修改的內容:只有在上次抓取後新增或修改外部資料來源中的資料時,才會更新集合。
僅 Web 抓取連接器:網路爬行連接器安排爬行的方式與其他連接器類型不同。 僅針對網路抓取連接器,請從下列選項中選擇:
-
若要自行控制爬行的頻率,請選擇此選項:
完全搜索
當您選擇完整抓取排程類型時,抓取會以您在頁面的抓取排程部分指定的頻率進行。
-
若要讓系統為您管理爬取的頻率,請選擇下列其中一個選項:
抓取更新(尋找新增、修改和刪除的內容) 或抓取新增和修改的內容
當您選擇抓取更新或新增和修改內容的排程類型時,您為抓取排程指定的頻率會被忽略。 每個文件被抓取的頻率是可變的,並完全由服務管理。 而頻率的變化則取決於在文件中發現變更的頻率。 例如,如果在第一個抓取間隔結束時,集合中的 10 個文件中有 5 個發生了變化,那麼這 5 個文件的頻率就會自動增加。 目前,這些自我管理刷新的最高執行頻率是每天一次。
在設定這些排程爬取類型時,您無法中斷頻率的自動管理,也無法觸發一次性爬取。
如果您稍後想要變更彈性抓取排程設定,您可以前往處理設定頁面,編輯設定,然後按一下套用變更並重新處理。
IBM Cloud 下一次排定的爬行會顯示在 Activity(活動)頁面上。
如果您變更排程頻率,下次排程的爬行時間可能與您預期的不同。 預設會在特定時間或日期定期進行爬取。 例如,如果您在 8 月 11 日將抓取排程從每週一次變更為每月一次,則下一次抓取可能會排定在 8 月 31 日,而不是 9 月 11 日。 它的排程並非從您進行變更當天起算正好一個月。 相反,它會排程在指定為所選抓取頻率預設執行日的那一天執行。
停止爬行
您可以在不變更爬行排程頻率的情況下停止爬行。 如果您要執行耗時的任務,且不希望在任務間隔啟動或執行爬行,此動作會很有幫助。
IBM Cloud 若要停止爬行,請完成下列步驟:
-
從導覽面板開啟「管理收藏」頁面。
-
選取您要停止爬行的集合。
-
在 Activity(活動 )頁面上,如果抓取正在進行中,請按一下 Stop(停止)。
-
前往處理設定頁面。
-
將 Apply Schedule(套用排程 )設為 No(否 ),然後按一下 Apply changes(套用變更)並重新處理。
爬行會停止,除非您重新啟動,否則不會再開始。
IBM Cloud 若要重新啟動爬行,請完成下列步驟:
-
從導覽面板開啟「管理收藏」頁面。
-
選取您要重新開始爬行的集合。
-
前往處理設定頁面。
-
將 Apply Schedule(套用排程 )設為 Yes(是),然後按一下 Apply changes(套用變更)並重新處理。
爬行馬上開始。
下一次抓取將根據抓取排程選項中選擇的頻率開始。 如果要在排定頻率之前的任何時間開始爬行,請按一下「活動」頁面上的「重新爬行」。
IBM Cloud Pak for Data IBM Software Hub
您可以暫時停止正在進行的爬行。
若要暫時停止爬行,請完成下列步驟:
-
從導覽面板開啟「管理收藏」頁面。
-
選取您要暫時停止爬行的集合。
-
在 Activity(活動 )頁面上,按一下 Stop(停止 )。
抓取會根據抓取排程中指定的頻率重新開始。