Web crawl

Eseguire il crawling di un sito web. È possibile eseguire il crawling di siti web pubblici e di siti web che richiedono l'autenticazione.

IBM Cloud Pak for Data IBM Software Hub

Queste informazioni si applicano solo alle distribuzioni installate. Per ulteriori informazioni sul crawling di un sito web da un'installazione gestita, vedere Crawl del sito web.

Quali documenti vengono carrellati

  • Il contenuto del sito web è elaborato come file HTML.
  • Il web crawler non esegue la ricerca per indicizzazione di siti web dinamici che utilizzano JavaScript per il rendering del contenuto. Puoi confermare l'uso di JavaScript visualizzando il codice sorgente del sito web nel tuo browser.
  • Quando una fonte viene ricaricata, i nuovi documenti vengono aggiunti, i documenti aggiornati vengono modificati nella versione corrente e i documenti eliminati vengono eliminati dall'indice della raccolta durante l'aggiornamento.
  • Tutti i connettori dell'origine dati Discovery sono di sola lettura. Indipendentemente dalle autorizzazioni concesse all'account di crawl, Discovery non scrive, aggiorna o cancella mai alcun contenuto nell'origine dati originale.

Fase preliminare

Se si desidera connettersi a un sito Web che richiede l'autenticazione, è necessario conoscere le credenziali di autenticazione necessarie per accedere al sito.

  • Per un sito web che richiede l'autenticazione di base, ottenere le seguenti informazioni:

    Nome utente
    Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
    Password
    La password associata al nome utente.
  • Per un sito web che richiede l'autenticazione di Windows NT LAN Manager (NTLM), ottenere le seguenti informazioni:

    Nome utente
    Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
    Password
    La password associata al nome utente.
    Nome dominio NTLM
    Il nome di dominio NTLM dell'utente che si sta autenticando con il sito.
    Nome host NTLM
    Il nome host del server NTLM.
  • Per un sito web che richiede l'autenticazione tramite modulo, scegliere la modalità di accesso al sito tra le seguenti opzioni:

    • Accesso diretto: Invia il modulo senza visualizzare la pagina di accesso.

      Azione di forma URL
      Il sito URL a cui inviare i dati del modulo quando questo viene inviato. Ad esempio, /action_page.php.
      Campi obbligatori
      Scoprite i valori dei campi che devono essere forniti nel modulo.
    • Accesso indiretto: Recupera la pagina di accesso e compila i campi del modulo. Prendete nota delle seguenti informazioni per poterle fornire in seguito:

      Accesso al modulo URL
      URL della pagina di accesso al sito web.
      Nome modulo
      Nome del modulo di accesso.
      Campi obbligatori
      Scoprite i valori dei campi che devono essere forniti nel modulo di accesso.

Connessione a un'origine dati di tipo web crawl

Se si desidera eseguire il crawling di un gruppo di URL che include alcuni siti web che richiedono l'autenticazione e altri che non la richiedono, è opportuno creare una raccolta diversa per ogni tipo di autenticazione.

Dal progetto Discovery, completare i seguenti passaggi:

  1. Nel riquadro di navigazione, scegliere Gestione collezioni.

  2. Fare clic su Nuova raccolta.

  3. Fate clic su Ricerca web, quindi su Avanti.

  4. Dare un nome alla collezione.

  5. Se la lingua del sito web non è l'inglese, selezionare la lingua appropriata.

    Per un elenco delle lingue supportate, vedi Supporto linguistico.

  6. Opzionale: Modificare la pianificazione della sincronizzazione.

    L'origine dati Web crawl è progettata per essere utilizzata con siti web che cambiano solo una o due volte alla settimana. Per garantire che la raccolta catturi tutti gli aggiornamenti del sito web, programmate il crawl settimanalmente.

    Per ulteriori informazioni, vedere Opzioni di pianificazione delrawl.

  7. Nella sezione Specificare dove si desidera effettuare il crawling, aggiungere il sito web URL al campo URL di partenza, quindi fare clic su Aggiungi. Continuare ad aggiungere gli URL di partenza.

    Gli URL da cui il crawler inizia la scansione. Per impostazione predefinita, il web crawler può eseguire la scansione dei sottoalberi e gli URL possono essere scansionati solo dal percorso fornito nel seed. Utilizza l'URL completo, ad esempio http://www.example.com/. L'URL di inizio nel web crawl presenta due limitazioni per quanto riguarda ciò viene sottoposto a ricerca per indicizzazione:

    • Esegue la ricerca per indicizzazione dello stesso nome di dominio dell'URL di inizio.
    • Esso esegue la scansione di tutti i contenuti dell' URL, fino all'ultima barra ( / ) inclusa, in Starting URLs. Se l' URL a di partenza ha un sottoalbero, il web crawl non esegue la scansione di tale sottoalbero, a meno che non si specifichi il suo URL in Starting URLs.
  8. Se il sito URL inizia con HTTPS: nella sezione Configurazione avanzata, impostare il selettore Ignora certificato su On per ignorare qualsiasi certificato SSL sul sito web di destinazione.

  9. Opzionale: Fare clic su Impostazioni di autenticazione per specificare il tipo di autenticazione da applicare a uno o più URL di partenza:

    • Scegliere il sito di partenza URL.

    • Scegliere il tipo di autenticazione tra le seguenti opzioni:

      • Autenticazione di base
      • Autenticazione NTLM
      • Autenticazione modulo
    • Per Autenticazione di base, fornire i seguenti dettagli:

      Nome utente
      Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
      Password
      La password associata all'utente.
    • Per autenticazione NTLM, fornire i seguenti dettagli:

      Nome utente
      Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
      Password
      La password associata all'utente.
      Nome dominio NTLM
      Il nome di dominio NTLM che appartiene all'utente che si sta autenticando.
      Nome host NTLM
      Il nome host del server NTLM.
    • Per autenticazione FORM, fornire i seguenti dettagli:

      • In Tipo di modulo, selezionare una delle seguenti opzioni:

        Diretto
        Fare clic su questa opzione se non si desidera recuperare la pagina di accesso.
        Indiretto
        Fare clic su questa opzione se si desidera recuperare la pagina di accesso e si desidera inserire i parametri nel modulo di accesso.
      • Compilare i seguenti campi se si sceglie Direct:

        URL dell'azione del modulo
        L'azione del modulo URL richiesta per l'invio del modulo.
        Metodo della forma
        Specificare GET.
      • Compilare i seguenti campi se si sceglie l'opzione Indiretto:

        URL di accesso al modulo
        Questo campo è obbligatorio se si seleziona il tipo di modulo Indiretto.
        Nome modulo
        Questo campo è obbligatorio se si seleziona il tipo di modulo Indiretto.
        Metodo della forma
        Specificare POST.
      • Nella sezione Parametri del modulo, elenco delle coppie chiave-valore dei parametri del modulo.

        Completare i campi Key e Value, quindi fare clic su + per aggiungere uno o più parametri del modulo.

  10. Opzionale: se si utilizza un server proxy per accedere al server di origine dati, nella sezione Impostazioni proxy, impostare l'interruttore Abilita impostazioni proxy su On. Aggiungere i valori ai seguenti campi:

    Nome utente
    Il nome utente del server proxy da usare per autenticarsi con il server proxy se quest'ultimo richiede l'autenticazione.
    Password
    La password del server proxy da usare per autenticarsi con il server proxy se quest'ultimo richiede l'autenticazione.
    Domini del server proxy
    Il dominio o i domini in cui risiedono gli host. Puoi specificare un carattere jolly in questo campo, ad esempio un asterisco (*) per ricercare per indicizzazione tutti i domini o un asterisco iniziale (*.server1.bar.com) per ricercare per indicizzazione i domini che corrispondono a un modello.
    Nome host o indirizzo IP del server proxy
    Il nome host se si desidera accedere al server utilizzando una LAN, o l'indirizzo IP del server che si desidera utilizzare come server proxy.
    Numero porta del server proxy
    La porta di rete a cui si desidera connettersi sul server proxy.
  11. Opzionale: Completare i seguenti campi in Configurazione avanzata:

    Pagina di codice da utilizzare

    Specificare la codifica dei caratteri delle pagine del sito web. Se non specificato, viene utilizzato il valore predefinito di UTF-8.

    Se si sta effettuando il crawling di siti web cinesi, specificare UTF-8.

    URL Profondità del percorso

    Il livello dei percorsi del sito da sottoporre a crawling.

    Ad esempio, se si specifica il percorso iniziale URL di https://www.example.com e una profondità di percorso di 4, il crawler accederà alla pagina https://www.example.com/some/more/examples/index.html, che si trova in un percorso a quattro livelli di distanza dalla radice URL.

    È possibile inserire solo un valore positivo. Se non specificato, il valore predefinito è " 5 ". La profondità massima del percorso consentita è 20.

    Salti massimi

    Il numero di collegamenti consecutivi da seguire dall'inizio URL.

    Se non specificato, il valore predefinito è " 5 ". Il numero massimo di collegamenti che il crawler può seguire è 20. Per non consentire alcun hop, immettere 0.

    Ignorare robots.txt

    Attivare questa impostazione se si desidera che il crawler ignori le regole di consenso e rifiuto delineate dal sito web nel suo file robots.txt.

    Tenete presente che i siti in genere utilizzano il file per migliorare i risultati del crawling. Ad esempio, potrebbero utilizzare il file robots.txt per evitare che vengano strisciate informazioni duplicate, per impedire la lettura di contenuti in bozza o per ritardare il crawling in modo da non sovraccaricare il sito.

    Regole per il crawling del dominio

    Specificare i nomi di dominio che si desidera consentire o vietare al crawler di effettuare il crawling.

    I nomi di dominio sono sensibili alle maiuscole e il carattere jolly (*) può essere presente in qualsiasi punto del nome di dominio.

    L'ordine delle regole è significativo. Il crawler applica la prima regola che corrisponde a un candidato URL. La regola predefinita, proibisci dominio *, proibisce tutti i crawling del Web e deve essere l'ultima nell'elenco delle regole di dominio.

    È possibile definire i seguenti tipi di regole, ad esempio:

    • Per escludere l'intero dominio ibm.com:

      forbid domain www.ibm.com
      
    • Per eseguire il crawling di qualsiasi dominio che termina con ibm.com:

      allow domain *.ibm.com
      
    • Per eseguire il crawling solo della porta 443 sui domini IBM che iniziano con server:

      allow domain server*.ibm.com:443
      
    Regole per il crawling dei prefissi di URL

    Specificare i prefissi HTTP e HTTPS che si desidera consentire o vietare al crawler di effettuare il crawling.

    Il carattere jolly (*) può essere presente una o più volte nel sito URL.

    L'ordine delle regole è significativo. Il crawler applica la prima regola che corrisponde a un candidato URL.

    È possibile definire i seguenti tipi di regole, ad esempio:

    • Per eseguire il crawling delle pagine della directory pubblica di questo dominio:

      allow prefix http://*.ibm.com/public/*
      
    • Per escludere tutte le altre directory di questo dominio:

      forbid prefix http://*.ibm.com/*
      
    Proprietà avanzate del crawler

    Utilizzarlo solo su indicazione dell'assistenza IBM.

  12. Opzionale: se si desidera ignorare qualsiasi certificato SSL sul sito web di destinazione, impostare l'interruttore Ignore certificate su On.

    Questa opzione si applica solo agli URL di HTTPS.

  13. Se si desidera che il crawler estragga il testo dalle immagini del sito, espandere Altre impostazioni di elaborazione e impostare Applica il riconoscimento ottico dei caratteri (OCR) su On.

    Quando l'OCR è abilitato e i documenti contengono immagini, l'elaborazione richiede più tempo. Per ulteriori informazioni, vedere Riconoscimento ottico dei caratteri.

  14. Fai clic su Finish.

La collezione viene creata rapidamente. L'elaborazione dei dati richiede più tempo per l'aggiunta alla raccolta.

Se si desidera controllare i progressi, andare alla pagina Attività. Nel riquadro di navigazione, fare clic su Gestione raccolte, quindi fare clic per aprire la raccolta.