Web crawl
Eseguire il crawling di un sito web. È possibile eseguire il crawling di siti web pubblici e di siti web che richiedono l'autenticazione.
IBM Cloud Pak for Data IBM Software Hub
Queste informazioni si applicano solo alle distribuzioni installate. Per ulteriori informazioni sul crawling di un sito web da un'installazione gestita, vedere Crawl del sito web.
Quali documenti vengono carrellati
- Il contenuto del sito web è elaborato come file HTML.
- Il web crawler non esegue la ricerca per indicizzazione di siti web dinamici che utilizzano JavaScript per il rendering del contenuto. Puoi confermare l'uso di JavaScript visualizzando il codice sorgente del sito web nel tuo browser.
- Quando una fonte viene ricaricata, i nuovi documenti vengono aggiunti, i documenti aggiornati vengono modificati nella versione corrente e i documenti eliminati vengono eliminati dall'indice della raccolta durante l'aggiornamento.
- Tutti i connettori dell'origine dati Discovery sono di sola lettura. Indipendentemente dalle autorizzazioni concesse all'account di crawl, Discovery non scrive, aggiorna o cancella mai alcun contenuto nell'origine dati originale.
Fase preliminare
Se si desidera connettersi a un sito Web che richiede l'autenticazione, è necessario conoscere le credenziali di autenticazione necessarie per accedere al sito.
-
Per un sito web che richiede l'autenticazione di base, ottenere le seguenti informazioni:
- Nome utente
- Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
- Password
- La password associata al nome utente.
-
Per un sito web che richiede l'autenticazione di Windows NT LAN Manager (NTLM), ottenere le seguenti informazioni:
- Nome utente
- Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
- Password
- La password associata al nome utente.
- Nome dominio NTLM
- Il nome di dominio NTLM dell'utente che si sta autenticando con il sito.
- Nome host NTLM
- Il nome host del server NTLM.
-
Per un sito web che richiede l'autenticazione tramite modulo, scegliere la modalità di accesso al sito tra le seguenti opzioni:
-
Accesso diretto: Invia il modulo senza visualizzare la pagina di accesso.
- Azione di forma URL
- Il sito URL a cui inviare i dati del modulo quando questo viene inviato. Ad esempio,
/action_page.php. - Campi obbligatori
- Scoprite i valori dei campi che devono essere forniti nel modulo.
-
Accesso indiretto: Recupera la pagina di accesso e compila i campi del modulo. Prendete nota delle seguenti informazioni per poterle fornire in seguito:
- Accesso al modulo URL
- URL della pagina di accesso al sito web.
- Nome modulo
- Nome del modulo di accesso.
- Campi obbligatori
- Scoprite i valori dei campi che devono essere forniti nel modulo di accesso.
-
Connessione a un'origine dati di tipo web crawl
Se si desidera eseguire il crawling di un gruppo di URL che include alcuni siti web che richiedono l'autenticazione e altri che non la richiedono, è opportuno creare una raccolta diversa per ogni tipo di autenticazione.
Dal progetto Discovery, completare i seguenti passaggi:
-
Nel riquadro di navigazione, scegliere Gestione collezioni.
-
Fare clic su Nuova raccolta.
-
Fate clic su Ricerca web, quindi su Avanti.
-
Dare un nome alla collezione.
-
Se la lingua del sito web non è l'inglese, selezionare la lingua appropriata.
Per un elenco delle lingue supportate, vedi Supporto linguistico.
-
Opzionale: Modificare la pianificazione della sincronizzazione.
L'origine dati Web crawl è progettata per essere utilizzata con siti web che cambiano solo una o due volte alla settimana. Per garantire che la raccolta catturi tutti gli aggiornamenti del sito web, programmate il crawl settimanalmente.
Per ulteriori informazioni, vedere Opzioni di pianificazione delrawl.
-
Nella sezione Specificare dove si desidera effettuare il crawling, aggiungere il sito web URL al campo URL di partenza, quindi fare clic su Aggiungi. Continuare ad aggiungere gli URL di partenza.
Gli URL da cui il crawler inizia la scansione. Per impostazione predefinita, il web crawler può eseguire la scansione dei sottoalberi e gli URL possono essere scansionati solo dal percorso fornito nel seed. Utilizza l'URL completo, ad esempio
http://www.example.com/. L'URL di inizio nel web crawl presenta due limitazioni per quanto riguarda ciò viene sottoposto a ricerca per indicizzazione:- Esegue la ricerca per indicizzazione dello stesso nome di dominio dell'URL di inizio.
- Esso esegue la scansione di tutti i contenuti dell' URL, fino all'ultima barra (
/) inclusa, in Starting URLs. Se l' URL a di partenza ha un sottoalbero, il web crawl non esegue la scansione di tale sottoalbero, a meno che non si specifichi il suo URL in Starting URLs.
-
Se il sito URL inizia con HTTPS: nella sezione Configurazione avanzata, impostare il selettore Ignora certificato su On per ignorare qualsiasi certificato SSL sul sito web di destinazione.
-
Opzionale: Fare clic su Impostazioni di autenticazione per specificare il tipo di autenticazione da applicare a uno o più URL di partenza:
-
Scegliere il sito di partenza URL.
-
Scegliere il tipo di autenticazione tra le seguenti opzioni:
- Autenticazione di base
- Autenticazione NTLM
- Autenticazione modulo
-
Per Autenticazione di base, fornire i seguenti dettagli:
- Nome utente
- Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
- Password
- La password associata all'utente.
-
Per autenticazione NTLM, fornire i seguenti dettagli:
- Nome utente
- Il nome utente di un utente con accesso al contenuto a cui ci si vuole collegare sul sito web.
- Password
- La password associata all'utente.
- Nome dominio NTLM
- Il nome di dominio NTLM che appartiene all'utente che si sta autenticando.
- Nome host NTLM
- Il nome host del server NTLM.
-
Per autenticazione FORM, fornire i seguenti dettagli:
-
In Tipo di modulo, selezionare una delle seguenti opzioni:
- Diretto
- Fare clic su questa opzione se non si desidera recuperare la pagina di accesso.
- Indiretto
- Fare clic su questa opzione se si desidera recuperare la pagina di accesso e si desidera inserire i parametri nel modulo di accesso.
-
Compilare i seguenti campi se si sceglie Direct:
- URL dell'azione del modulo
- L'azione del modulo URL richiesta per l'invio del modulo.
- Metodo della forma
- Specificare GET.
-
Compilare i seguenti campi se si sceglie l'opzione Indiretto:
- URL di accesso al modulo
- Questo campo è obbligatorio se si seleziona il tipo di modulo Indiretto.
- Nome modulo
- Questo campo è obbligatorio se si seleziona il tipo di modulo Indiretto.
- Metodo della forma
- Specificare POST.
-
Nella sezione Parametri del modulo, elenco delle coppie chiave-valore dei parametri del modulo.
Completare i campi Key e Value, quindi fare clic su + per aggiungere uno o più parametri del modulo.
-
-
-
Opzionale: se si utilizza un server proxy per accedere al server di origine dati, nella sezione Impostazioni proxy, impostare l'interruttore Abilita impostazioni proxy su
On. Aggiungere i valori ai seguenti campi:- Nome utente
- Il nome utente del server proxy da usare per autenticarsi con il server proxy se quest'ultimo richiede l'autenticazione.
- Password
- La password del server proxy da usare per autenticarsi con il server proxy se quest'ultimo richiede l'autenticazione.
- Domini del server proxy
- Il dominio o i domini in cui risiedono gli host. Puoi specificare un carattere jolly in questo campo, ad esempio un asterisco (
*) per ricercare per indicizzazione tutti i domini o un asterisco iniziale (*.server1.bar.com) per ricercare per indicizzazione i domini che corrispondono a un modello. - Nome host o indirizzo IP del server proxy
- Il nome host se si desidera accedere al server utilizzando una LAN, o l'indirizzo IP del server che si desidera utilizzare come server proxy.
- Numero porta del server proxy
- La porta di rete a cui si desidera connettersi sul server proxy.
-
Opzionale: Completare i seguenti campi in Configurazione avanzata:
- Pagina di codice da utilizzare
-
Specificare la codifica dei caratteri delle pagine del sito web. Se non specificato, viene utilizzato il valore predefinito di
UTF-8.Se si sta effettuando il crawling di siti web cinesi, specificare
UTF-8. - URL Profondità del percorso
-
Il livello dei percorsi del sito da sottoporre a crawling.
Ad esempio, se si specifica il percorso iniziale URL di
https://www.example.come una profondità di percorso di4, il crawler accederà alla paginahttps://www.example.com/some/more/examples/index.html, che si trova in un percorso a quattro livelli di distanza dalla radice URL.È possibile inserire solo un valore positivo. Se non specificato, il valore predefinito è "
5". La profondità massima del percorso consentita è20. - Salti massimi
-
Il numero di collegamenti consecutivi da seguire dall'inizio URL.
Se non specificato, il valore predefinito è "
5". Il numero massimo di collegamenti che il crawler può seguire è20. Per non consentire alcun hop, immettere0. - Ignorare robots.txt
-
Attivare questa impostazione se si desidera che il crawler ignori le regole di consenso e rifiuto delineate dal sito web nel suo file robots.txt.
Tenete presente che i siti in genere utilizzano il file per migliorare i risultati del crawling. Ad esempio, potrebbero utilizzare il file robots.txt per evitare che vengano strisciate informazioni duplicate, per impedire la lettura di contenuti in bozza o per ritardare il crawling in modo da non sovraccaricare il sito.
- Regole per il crawling del dominio
-
Specificare i nomi di dominio che si desidera consentire o vietare al crawler di effettuare il crawling.
I nomi di dominio sono sensibili alle maiuscole e il carattere jolly (*) può essere presente in qualsiasi punto del nome di dominio.
L'ordine delle regole è significativo. Il crawler applica la prima regola che corrisponde a un candidato URL. La regola predefinita, proibisci dominio *, proibisce tutti i crawling del Web e deve essere l'ultima nell'elenco delle regole di dominio.
È possibile definire i seguenti tipi di regole, ad esempio:
-
Per escludere l'intero dominio ibm.com:
forbid domain www.ibm.com -
Per eseguire il crawling di qualsiasi dominio che termina con
ibm.com:allow domain *.ibm.com -
Per eseguire il crawling solo della porta
443sui domini IBM che iniziano conserver:allow domain server*.ibm.com:443
-
- Regole per il crawling dei prefissi di URL
-
Specificare i prefissi HTTP e HTTPS che si desidera consentire o vietare al crawler di effettuare il crawling.
Il carattere jolly (*) può essere presente una o più volte nel sito URL.
L'ordine delle regole è significativo. Il crawler applica la prima regola che corrisponde a un candidato URL.
È possibile definire i seguenti tipi di regole, ad esempio:
-
Per eseguire il crawling delle pagine della directory pubblica di questo dominio:
allow prefix http://*.ibm.com/public/* -
Per escludere tutte le altre directory di questo dominio:
forbid prefix http://*.ibm.com/*
-
- Proprietà avanzate del crawler
-
Utilizzarlo solo su indicazione dell'assistenza IBM.
-
Opzionale: se si desidera ignorare qualsiasi certificato SSL sul sito web di destinazione, impostare l'interruttore Ignore certificate su
On.Questa opzione si applica solo agli URL di HTTPS.
-
Se si desidera che il crawler estragga il testo dalle immagini del sito, espandere Altre impostazioni di elaborazione e impostare Applica il riconoscimento ottico dei caratteri (OCR) su
On.Quando l'OCR è abilitato e i documenti contengono immagini, l'elaborazione richiede più tempo. Per ulteriori informazioni, vedere Riconoscimento ottico dei caratteri.
-
Fai clic su Finish.
La collezione viene creata rapidamente. L'elaborazione dei dati richiede più tempo per l'aggiunta alla raccolta.
Se si desidera controllare i progressi, andare alla pagina Attività. Nel riquadro di navigazione, fare clic su Gestione raccolte, quindi fare clic per aprire la raccolta.