Web 搜索
新增 Web 搜索集合以搜索網站、分析其頁面內容,以及儲存有意義的資訊。 指定一或多個基本網頁 URL,並配置 Web 搜索要遵循的鏈結頁面數目。 您可以配置與網站同步化的頻率,以便控制集合中資料的最新程度。
在建立網頁抓取集合之前,請聯絡網站所有者以獲得抓取網站的權限。 目前,Discovery的託管部署無法抓取 https://www.ibm.com。
IBM Cloud IBM Cloud 僅限
此資訊僅適用於受管理部署。 如需從已安裝部署連接至網站的相關資訊,請參閱 Web 搜索。
搜索哪些文件
您可以連接至下列類型的 Web 內容:
- 公用網站
- 需要鑑別的私人公司網站或其他網站
- 受公司防火牆保護的網站
在內容起始搜索期間,會搜索符合搜尋設定的所有網站頁面,並將其新增至集合的文件索引。 搜索會從您在 起始 URL 欄位中指定的網頁開始。 如果您的集合配置為遵循鏈結,則搜索會遵循起始頁上與起始頁共用相同子樹狀結構的鏈結。 例如,如果您指定 https://www.example.com/banking/faqs.html,則會搜索以 https://www.example.com/banking/ 開頭的 URL
鏈結。 如果您指定 https://www.example.com/banking,則會搜索含有以 https://www.example.com/ 開頭之 URL 的鏈結。
搜索無法存取安全子目錄。 例如,如果您期望抓取存取的子目錄(如 https://www.example.com/banking/pdfs )沒有被抓取,請檢查是否可以直接從網頁瀏覽器存取子目錄 URL。 如果您無法存取它,則搜索無法存取它。
在後續排定的重新搜索期間,會執行完整重新搜索,且任何變更都會反映在您的集合中。 從網站頁面新增至集合之後從外部網站刪除的文件不會從集合中刪除。 但是,從 2022 年 4 月之後建立的集合開始,當您從網路抓取設定中移除起始 URL 時,任何相關的文件都會被刪除。 已刪除的文件包括根據起始 URL 的網頁內容新增到集合中的索引文件,以及從起始 URL 所連結的網頁衍生出來的文件。 您無法透過變更其他設定來限制索引文件的數量,例如變更現有的 URL,以包含範圍比之前更有限的路徑,或將跟隨的最大連結數降低為 0。 只有刪除 URL,才能移除與之相關的索引文件。
Web 搜索器可以搜索使用 JavaScript 來呈現內容的網頁,但搜索器在個別頁面而非整個網站上運作最好。 它無法搜索使用動態 URL 的網站; 如果您在瀏覽器中檢視網頁的原始碼時看不到任何內容,則服務無法搜索它。
如果您要抓取的 URL 群組包含一些需要驗證的網站和一些不需要驗證的網站,請考慮為每種驗證類型建立不同的集合。 連接器不支援 Cookie 型搜索。
所有 Discovery 資料來源連接器都是唯讀的。 不論授與搜索帳戶的許可權為何,Discovery 絕不會寫入、更新或刪除原始資料來源中的任何內容。
下表說明 Discovery 可以搜索的物件。
| 已搜索的物件 |
|---|
| 網站、網站子目錄 |
連接到防火牆後面託管的網站的先決步驟
如果您想連線到託管在防火牆後面的網站,請配置IBM Cloud Satellite®連接器外部Discovery第一的。 欲了解更多信息,請參閱 Satellite連接器概述。
IBM® Secure Gateway for IBM Cloud® 已被廢棄。 使用的現有集合Secure Gateway可以遷移到IBM Cloud Satellite®在支援結束日期之前連接器。 欲了解更多信息,請參閱 Secure Gateway棄用日期和棄用詳細信息。
有價值的內容通常儲存在貴公司的內部網站上。 一般而言,此類內部網路網站只能從連接至您辦公室網路的電腦或透過 VPN 連線進行存取。 您可以使用以下方法在網路爬蟲和此類內部站點之間建立持久且更安全的連接Satellite連接器。
若要設定 Satellite Connector,請完成下列步驟:
- 建立 Satellite 連接器。 有關更多信息,請參閱 建立連接器。
- 運行連接器代理程式。 有關更多信息,請參閱 運行連接器代理。
- 建立和管理連接器端點。 有關更多信息,請參閱 建立和管理連接器端點。
限制
使用時的限制Satellite連接器有以下幾種:
- 您可以配置Satellite僅在建立新的 Web 爬網集合時使用連接器(建立集合後無法修改)。
- 如果連接到本地網路被設定為
On在更多連接設置,所有種子 URL 必須位於同一網域中。 - 如果種子 URL 使用 SSL (
https://),您可以使用基本驗證和絕對 URL。 - 如果種子 URL 使用 HTTP (
http://),則會受到下列限制:- 使用Satellite連接器時基本驗證不可用。
- 如果抓取的網頁有絕對 URL,例如
http://<seed_url_domain>/sample.html,則不會抓取連結的網頁。
連接至資料來源
若要配置 Web 搜索集合,請完成下列步驟:
-
從導覽窗格中,選擇 管理集合。
-
按一下新增收藏集。
-
按一下 需要連接至資料來源旁邊的鏈結? 欄位,按一下 Web 搜索,然後按 下一步。
-
命名集合。
-
如果網站上內容的語言不是英文,請選取適當的語言。
如需受支援語言的清單,請參閱語言支援。
-
選用: 您可以變更同步化排程。
如需相關資訊,請參閱 搜索排程選項。
-
指定要抓取的網站 URL。
-
如果要抓取的網站需要登入,請將基本驗證設定為
On,將網頁的 URL 加入 Starting URL 欄位,然後按一下 Add。新增具有網站存取權的使用者名稱及密碼,然後按一下 儲存認證。 每個集合只能指定一組認證。
例如,您可以指定
https://cloud.ibm.com為起始 URL,並加入您的 IBMid 作為憑證。如果您要從網站的特定區段開始搜索,請在 起始 URL 欄位中指定它。 分節的網域名稱必須與您之前指定的 URL 中的網域相符。
例如,您可以將起始 URL 改為
https://cloud.ibm.com/unifiedsupport/supportcenter。 -
對於要抓取的任何公開網頁,請將網站根頁面的 URL 加入 Starting URLs 欄位,然後按一下 Add。 您可以新增多個起始頁面。
URL 中最後的正斜線 (
/) 決定要抓取的子樹。 例如,如果您指定https://www.example.com/banking/faqs.html,則會搜索以https://www.example.com/banking/開頭的所有 URL。 如果您指定https://www.example.com/banking,則會搜索所有以https://www.example.com/開頭的 URL。預設情況下,抓取從起始 URL 連續跟進的連結數為
2。 若要變更中繼站數目或列出要從搜索中排除的網站區段,請按一下編輯圖示。-
允許的最大跳數為
20。 -
若要指定要排除的 URL 路徑,請新增網站路徑。 例如,如果起始 URL 是
https://example.com,您可以輸入/pricing/來排除https://example.com/pricing。會排除網址中包含您所指定網站路徑的任何區段。 例如,如果您指定
/licenses/,則除了其他頁面之外,還會排除https://example.com/products/licenses/europe頁面。 -
如果您要將抓取範圍限制在單一頁面,請將 URL 加入 Starting URLs 欄位。 例如,
https://www.example.com/banking/faqs.html。 按一下編輯圖示,將 要遵循的鏈結數目上限 設為0。
動態網站網路抓取功能由抓取設定中的抓取切換器執行 JavaScript 控制,該功能已被淘汰,並將於 2025 年 9 月前移除。 如需詳細資訊,請參閱 發佈說明。
-
-
如果您要搜索的網站在顯示之前使用 JavaScript 來自訂頁面內容,則必須採取額外步驟。
輸入起始 URL 並按一下新增後,按一下編輯圖示
URL。 將 「在爬網期間執行 JavaScript 切換器設定為 「開」,然後按一下「儲存」。
當啟用 JavaScript 處理程序時,它會花費 3 到 4 倍的時間來搜索頁面。 請只在您知道必要的個別網頁上使用它,因為頁面會動態呈現其內容。 如果您看到逾時訊息或搜索結束,但未將內容新增至集合,請減少搜索中包含的網頁數目。 例如,您可以在 起始 URL 欄位中指定要搜索的確切頁面,並將 要遵循的鏈結數目上限 設為 0。
-
要連接到託管在防火牆後面的網站,設定IBM Cloud Satellite連接器優先。
指定Satellite連接器細節。
若要指定詳細資訊,請完成下列步驟:
- 展開 其他連線設定,然後將 連接至內部部署網路 設為
On。 - 選擇 IBM Cloud Satellite®連接器作為連接類型。 依預設,會選取這個選項。
- 指定 Satellite Connector 終點 URL。
Satellite連接器詳細資料 - 展開 其他連線設定,然後將 連接至內部部署網路 設為
-
-
選用項目: 將另一個網址新增至 起始 URL 欄位。
單一集合的起始 URL 數目必須小於 100。 如果您需要搜索大量網站,請參閱 我需要搜索許多網站。 我的限制是多少?。
已搜索的網頁數目限制為 250,000 個,因此 Web 搜索器可能不會搜索所有指定的網站。
每個 URL 抓取的子 URL 數量限制為 10,000 個。 如果任何已搜索 URL 中的子 URL 數目超過 10,000 個,則搜索器將無法處理子 URL 中的任何內容。
-
如果您想要限制要新增至集合的檔案類型,您可以列出要併入或排除之檔案類型的副檔名。
如果網站頁面的 URL 不是以 .html結尾,請使用排除過濾器而非併入過濾器。 您必須至少新增一個要排除的副檔名。
如需受支援檔案類型的清單,請參閱 支援的檔案類型。
-
如果您想要 Web 搜索從網站上的影像擷取文字,請展開 其他處理設定,並將 套用光學字元識別 (OCR) 設為
On。當啟用 OCR 且您的文件包含影像時,處理需要較長的時間。 如需相關資訊,請參閱 光學字元辨識。
-
按一下完成。
會快速建立集合。 將資料新增至集合時,需要花費更多時間來處理資料。
如果您要檢查進度,請跳至「活動」頁面。 從導覽窗格中,按一下 管理集合,然後按一下以開啟集合。
我需要搜索許多網站。 我的限制是多少?
服務可以支援每個 Discovery 服務實例總共 500 個搜索器連線。 除了 Web 搜索之外,所有資料來源都使用一個搜索器連線。 對於 Web 搜索,每 5 個起始 URL 需要一個連線。 例如,如果您新增 10 個起始 URL,則 Discovery 會產生支援額外 5 個 URL 所需的額外搜索器連線。 因此,您可以使用的起始 URL 數目上限取決於服務實例中配置的其他資料集合。 您可以自行計算限制。
若要計算起始 URL 限制,請完成下列步驟:
-
計算服務實例中其他資料來源集合的數目,這表示此專案以及相同 Discovery 實例中的任何其他專案。
例如,您可能在一個專案中有 2 個 IBM Cloud Object Store 集合,在另一個專案中有 2 個 Salesforce 集合,以及在另一個專案中有 1 個 SharePoint 線上集合。 在此範例中,其他資料來源集合的總數為 5。
-
從容許的搜索器連線數目上限 (即 500) 扣除其他資料來源集合的數目。
例如,500-5 = 495。
-
將餘數乘以 5,以決定您可以使用的起始 URL 總數。
例如,495 x 5 = 2,475。
若要使用範例中容許的起始 URL 數目上限,您需要 25 個 Web 搜索集合,因為每一個集合容許配置最多 100 個起始 URL。 不過,請勿將實例配置成使用容許的絕對數目上限。 如果隨後將一個以上其他資料來源新增至此服務實例中的專案,則會影響實例可以順利搜索的起始 URL 數目。
疑難排解搜索器問題
- 傳回「403 禁止」錯誤
- 您要搜索的網站可能會封鎖來自特定具名實體集以外所有實體的要求。 可能的話,請將搜索器新增至網站的容許清單。 搜索器的識別標頭是
User-Agent: IBM-AppConnect/V1。