Web 搜索

抓取網站。 您可以抓取公共網站和需要驗證的網站。

IBM Cloud Pak for Data IBM Software Hub

此資訊僅適用於已安裝的部署。 如需從管理部署抓取網站的詳細資訊,請參閱 網路抓取

抓取哪些文件

  • 網站內容會以 HTML 檔案形式處理。
  • Web 搜索器不會搜索使用 JavaScript 呈現內容的動態網站。 若要確認是否使用 JavaScript,請在瀏覽器中檢視網站的原始碼。
  • 當重新抓取來源時,會新增文件,更新的文件會修改為目前的版本,而刪除的文件會在刷新過程中從集合的索引中刪除。
  • 所有 Discovery 資料來源連線器都是唯讀的。 無論賦予爬取帳戶多少權限,Discovery 永遠不會寫入、更新或刪除原始資料來源中的任何內容。

先決條件步驟

如果您要連線到需要驗證的網站,您需要知道存取該網站所需的驗證憑證。

  • 對於需要基本驗證的網站,請取得下列資訊:

    使用者名稱
    有權存取您要連線到網站上內容的使用者的使用者名稱。
    密碼
    與使用者名稱相關聯的密碼。
  • 對於需要 Windows NT LAN Manager (NTLM) 驗證的網站,請取得下列資訊:

    使用者名稱
    有權存取您要連線到網站上內容的使用者的使用者名稱。
    密碼
    與使用者名稱相關聯的密碼。
    NTLM 網域名稱
    正在驗證網站的使用者的 NTLM 網域名稱。
    NTLM 主機名稱
    NTLM 伺服器的主機名稱。
  • 對於需要表單式驗證的網站,請從下列選項中選擇您要存取網站的方式:

    • 直接存取:提交表單而不會得到登入頁面。

      表格動作 URL
      表單提交時要傳送表單資料至的 URL。 例如,/action_page.php
      必要欄位
      找出表單中必須提供的欄位值。
    • 間接存取:擷取登入頁面並填寫表格欄位。 請記下下列資訊,以便稍後提供:

      表單登入 URL
      URL 的網站登入頁面。
      表單名稱
      登入表單的名稱。
      必要欄位
      找出登入表單中必須提供的欄位值。

連接至網路抓取資料來源

如果您要抓取的 URL 群組包含一些需要驗證的網站和一些不需要驗證的網站,請考慮為每種驗證類型建立不同的集合。

從您的 Discovery 專案,完成下列步驟:

  1. 從導覽窗格中,選擇 Manage collections

  2. 按一下新增收藏集

  3. Click 網路抓取, and then click 下一頁.

  4. 為收藏命名。

  5. 如果網站的語言不是英文,請選擇適當的語言。

    如需受支援語言的清單,請參閱語言支援

  6. 選用:變更同步排程。

    網路抓取資料來源是設計用於每週只變更一到兩次的網站。 為了確保您的收集能捕捉到所有網站更新,請安排每週進行一次抓取。

    如需詳細資訊,請參閱 爬行排程選項

  7. 在「指定您要抓取的位置」部分,將網站 URL 加入 Starting URLs 欄位,然後按一下 Add。 繼續新增起始 URL。

    爬行器開始爬行的 URL。 預設情況下,網路爬取可以爬取子樹,而 URL 只能從種子中提供的路徑爬取。 請使用完整 URL,例如 http://www.example.com/。 Web 搜索中的起始 URL 在搜索內容方面有兩項限制:

    • 它會搜索與起始 URL 相同的網域名稱。
    • 它會搜索/起始 URL** 中截至並包含最後一個斜線 () 的所有 URL 內容。 如果起始 URL 具有子樹狀結構,則 Web 搜索不會搜索該子樹狀結構,除非您在起始 URL** 中指定了該子樹狀結構的 URL。
  8. 如果 URL 以 HTTPS 開頭:在進階設定部分,將忽略憑證切換開關設為,以忽略目標網站上的任何 SSL 憑證。

  9. 選用:按一下 驗證設定,指定要套用到一個或多個起始 URL 的驗證類型:

    • 選擇起始 URL。

    • 從下列選項中選擇驗證類型:

      • 基本鑑別
      • NTLM 認證
      • 表單鑑別
    • 針對 基本驗證,請提供下列詳細資訊:

      使用者名稱
      有權存取您要連線到網站上內容的使用者的使用者名稱。
      密碼
      與使用者相關聯的密碼。
    • 針對 NTLM 驗證,請提供下列詳細資訊:

      使用者名稱
      有權存取您要連線到網站上內容的使用者的使用者名稱。
      密碼
      與使用者相關聯的密碼。
      NTLM 網域名稱
      屬於正在驗證的使用者的 NTLM 網域名稱。
      NTLM 主機名稱
      NTLM 伺服器的主機名稱。
    • 對於 表格驗證,請提供下列詳細資訊:

      • 表單類型中,選取下列其中一個選項:

        直接
        如果您不想取得登入頁面,請按一下此選項。
        間接
        如果您要取得登入頁面,並且要在登入表單中填入參數,請按一下此選項。
      • 如果您選擇「直接」,請填寫下列欄位:

        表單動作 URL
        提交表單所需的表單動作 URL。
        表格方法
        指定 GET
      • 如果您選擇「間接」,請填寫下列欄位:

        表單登入網址
        如果您選擇間接表格類型,則必須填寫此欄位。
        表單名稱
        如果您選擇間接表格類型,則必須填寫此欄位。
        表格方法
        指定 POST
      • 表單參數部分,列出表單參數的鍵值對。

        完成 KeyValue 欄位,然後按一下 + 以新增一個或多個表單參數。

  10. 選購: If you are using a proxy server to access the data source server, then in the 代理伺服器設定 section, set the 啟用代理設定 switch to On. 為下列欄位新增數值:

    使用者名稱
    如果代理伺服器要求驗證,則使用代理伺服器使用者名稱與代理伺服器驗證。
    密碼
    代理伺服器密碼,如果代理伺服器需要驗證,用來與代理伺服器驗證。
    代理伺服器網域
    主機所在的網域。 您可以在這個欄位中指定萬用字元,例如星號 (*) 以搜索所有網域,或前導的星號 (*.server1.bar.com) 以搜索符合型樣的網域。
    代理伺服器主機名稱或 IP 位址
    如果要使用區域網路存取伺服器,請輸入主機名稱;如果要使用代理伺服器,請輸入伺服器的 IP 位址。
    Proxy 伺服器埠號
    您要連接至代理伺服器的網路連接埠。
  11. 可選:在 Advanced Configuration(進階組態 )中完成下列欄位:

    使用的代碼頁面

    指定網站頁面的字元編碼。 如果未指定,則使用預設值 UTF-8

    如果您要抓取中文網站,請指定 UTF-8

    URL 路徑深度

    要抓取的網站路徑層級。

    例如,如果您指定起始 URL 為 https://www.example.com,路徑深度為 4,則爬行器將存取頁面 https://www.example.com/some/more/examples/index.html,該頁面所處的路徑與根目錄 URL 相隔四層。

    您只能輸入正數值。 如果未指定,預設值為 5。 允許的最大路徑深度為 20

    最大跳數

    從起點開始連續追蹤的連結數目 URL。

    如果未指定,預設值為 5。 爬蟲可跟隨的最大連結數為 20。 若要不允許任何跳躍,請輸入 0

    忽略 robots.txt

    如果您希望爬行器忽略網站在其 robots.txt 檔案中列出的允許和拒絕規則,請啟用此設定。

    請記住,網站通常會使用該檔案來改善抓取結果。 例如,他們可能會使用 robots.txt 檔案來防止爬取重覆的資訊、防止讀取草稿內容,或是延遲爬取,以免網站負荷過重。

    抓取網域的規則

    指定允許或禁止爬蟲抓取的網域名稱。

    域名區分大小寫,通配符 (*) 可以出現在域名的任何位置。

    規則的順序很重要。 爬蟲會套用與候選 URL 匹配的第一條規則。 預設規則(forbid domain *)禁止所有 Web 抓取,且必須出現在網域名則清單中的最後一位。

    例如,您可以定義以下類型的規則:

    • 若要排除整個 ibm.com 網域:

      forbid domain www.ibm.com
      
    • 抓取任何以 ibm.com 結尾的網域:

      allow domain *.ibm.com
      
    • To crawl only port 443 on IBM domains that begin with server:

      allow domain server*.ibm.com:443
      
    抓取 URL 前綴的規則

    指定允許或禁止爬蟲抓取的 HTTP 和 HTTPS 前綴。

    通配符 (*) 可以在 URL 中出現一次或多次。

    規則的順序很重要。 爬蟲會套用與候選 URL 匹配的第一條規則。

    例如,您可以定義以下類型的規則:

    • 抓取此網域公共目錄中的頁面:

      allow prefix http://*.ibm.com/public/*
      
    • 排除此網域上的所有其他目錄:

      forbid prefix http://*.ibm.com/*
      
    進階爬行器屬性

    僅在 IBM 支援人員指示時使用。

  12. 選購: If you want to ignore any SSL certificates on the target website, set the 忽略證書 switch to On.

    此選項只適用於 HTTPS URL。

  13. If you want the crawler to extract text from images on the site, expand 更多處理設定, and set 應用光學字元識別 (OCR) to On.

    啟用 OCR 且您的文件包含影像時,處理時間會較長。 如需詳細資訊,請參閱 光學字元識別

  14. 按一下完成

集合快速建立。 當資料被加入集合時,需要更多時間來處理。

如果您要檢查進度,請前往 Activity 頁面。 從導覽窗格,按一下 管理收藏集,然後按一下開啟收藏集。