Ricerca per indicizzazione web
Aggiungere una raccolta di ricerca per indicizzazione Web per eseguire la ricerca per indicizzazione su un sito web, analizzarne i contenuti e memorizzare informazioni significative. Specificare uno o più URL della pagina Web di base e configurare il numero di pagine collegate che la ricerca per indicizzazione Web deve seguire. È possibile configurare la frequenza di sincronizzazione con il sito Web, in modo da controllare l'aggiornamento dei dati nella raccolta.
Prima di creare una raccolta di web crawl, contattare il proprietario del sito web per ottenere le autorizzazioni per il crawling del sito. Attualmente, la distribuzione gestita di Discovery non può eseguire il crawling https://www.ibm.com.
IBM Cloud IBM Cloud solo
Queste informazioni si applicano solo alle installazioni gestite. Per ulteriori informazioni sulla connessione a un sito Web da una distribuzione installata, consultare Web crawl.
Documenti sottoposti a ricerca per indicizzazione
È possibile collegarsi ai seguenti tipi di contenuto Web:
- Siti web pubblici
- Siti web aziendali privati o altri siti che richiedono l'autenticazione
- Siti Web che si trovano dietro un firewall aziendale
Durante la scansione iniziale del contenuto, tutte le pagine del sito Web che corrispondono alle impostazioni di ricerca vengono sottoposte a ricerca per indicizzazione e aggiunte all'indice del documento della raccolta. La ricerca per indicizzazione
viene avviata sulla pagina Web specificata nel campo URL di avvio. Se la raccolta è configurata per seguire i collegamenti, la ricerca per indicizzazione segue i collegamenti sulla pagina iniziale che condividono la stessa struttura
secondaria della pagina iniziale. Ad esempio, se si specifica https://www.example.com/banking/faqs.html, i link con URL che iniziano con https://www.example.com/banking/ vengono sottoposti a ricerca per indicizzazione.
Se si specifica https://www.example.com/banking, i collegamenti con URL che iniziano con https://www.example.com/ vengono sottoposti a ricerca per indicizzazione.
La ricerca per indicizzazione non può accedere a sottodirectory sicure. Ad esempio, se una sottodirectory a cui ci si aspetta che il crawl acceda, come https://www.example.com/banking/pdfs, non viene crawlata, verificare se è possibile
accedere direttamente alla sottodirectory URL da un browser web. Se non puoi accedervi, il crawl non può accedervi.
Durante le successive ricerche per indicizzazione pianificate, viene eseguita una ricerca per indicizzazione completa e tutte le modifiche vengono riportate nella propria raccolta. I documenti che sono stati aggiunti alla raccolta dalle pagine del sito Web che vengono successivamente eliminati dal sito Web esterno non vengono eliminati dalla raccolta. Tuttavia, a partire dalle raccolte create dopo l'aprile 2022, quando si rimuove un URL iniziale dalla configurazione di web crawl, tutti i documenti associati vengono eliminati. I documenti eliminati includono i documenti indicizzati che sono stati aggiunti alla raccolta in base al contenuto della pagina web all'indirizzo URL di partenza e i documenti che sono stati derivati dalle pagine web a cui il sito URL di partenza era collegato. Non è possibile limitare il numero di documenti indicizzati modificando altre impostazioni, ad esempio cambiando il sito URL esistente per includere un percorso con un ambito più limitato rispetto a prima o riducendo a 0 il numero massimo di collegamenti da seguire. Solo eliminando il sito URL è possibile rimuovere i documenti indicizzati ad esso associati.
Il crawler Web può eseguire la ricerca per indicizzazione su pagine Web che utilizzano JavaScript per eseguire il rendering del contenuto, ma il crawler funziona meglio su singole pagine, non su interi siti Web. Non può eseguire la ricerca per indicizzazione su siti che utilizzano URL dinamici; se non è possibile visualizzare alcun contenuto quando si visualizza il codice sorgente di una pagina Web nel browser, il servizio non può eseguire la ricerca per indicizzazione.
Se si desidera eseguire la ricerca per indicizzazione su un gruppo di URL che include alcuni siti Web che richiedono l'autenticazione e altri che non la richiedono, considerare la creazione di una raccolta diversa per ciascun tipo di autenticazione. Il connettore non supporta la ricerca per indicizzazione basata su cookie.
Tutti i connettori dell'origine dati Discovery sono di sola lettura. Indipendentemente dalle autorizzazioni concesse all'account di ricerca per indicizzazione, Discovery non scrive, aggiorna o elimina mai alcun contenuto nell'origine dati originale.
La seguente tabella illustra gli oggetti su cui Discovery può eseguire la ricerca per indicizzazione.
| Oggetti sottoposti a ricerca per indicizzazione |
|---|
| Siti web, sottodirectory di siti web |
Fase preliminare per la connessione a un sito web ospitato dietro un firewall
Se si desidera connettersi a un sito web ospitato dietro un firewall, configurare prima il connettore IBM Cloud Satellite® all'esterno Discovery. Per ulteriori informazioni, consultare la sezione Satellite Panoramica del connettore.
IBM® Secure Gateway for IBM Cloud® è stato deprecato. Le collezioni esistenti che utilizzano Secure Gateway possono migrare al Connettore IBM Cloud Satellite® prima della data di fine supporto. Per ulteriori informazioni, vedere le date di deprezzamento e i dettagli di deprezzamento Secure Gateway.
Il contenuto prezioso viene spesso memorizzato sul sito Web interno dell'azienda. In genere, tali siti Web intranet sono accessibili solo da un computer collegato alla rete dell'ufficio o tramite una connessione VPN. È possibile stabilire una connessione persistente e più sicura tra il web crawler e questo tipo di sito interno utilizzando il connettore Satellite.
Per configurare il connettore Satellite, completare i seguenti passaggi:
- Creare un connettore Satellite. Per ulteriori informazioni, vedere Creazione di un connettore.
- Eseguire un agente connettore. Per ulteriori informazioni, vedere Esecuzione di un agente Connector.
- Creare e gestire gli endpoint del Connector. Per ulteriori informazioni, vedere Creazione e gestione degli endpoint di Connector.
Limitazioni
Le limitazioni dell'uso del connettore Satellite sono le seguenti:
- È possibile configurare il Connettore Satellite solo quando si crea una nuova raccolta di Web crawl (non si può modificare dopo la creazione della raccolta).
- Se Connetti alla rete locale è impostato su
Onin Altre impostazioni di connessione, tutti gli URL di semina devono essere nello stesso dominio. - Se il seme URL utilizza SSL (
https://), è possibile utilizzare l'autenticazione di base e gli URL assoluti. - Se il seme URL utilizza HTTP (
http://), si applicano le seguenti limitazioni:- L'autenticazione di base non è disponibile quando si usa il connettore Satellite Connettore.
- Se la pagina web crawlata ha un URL assoluto, ad esempio
http://<seed_url_domain>/sample.html, la pagina collegata non viene crawlata.
Connessione all'origine dati
Per configurare la raccolta di ricerca per indicizzazione Web, completare la seguente procedura:
-
Dal riquadro di spostamento, scegliere Gestisci raccolte.
-
Fare clic su Nuova raccolta.
-
Fare clic sul link accanto a È necessario connettersi a una origine dati? fare clic su Web crawl, quindi fare clic su Avanti.
-
Denominare la raccolta.
-
Se la lingua del contenuto del sito Web non è l'inglese, selezionare la lingua appropriata.
Per un elenco delle lingue supportate, vedi Supporto linguistico.
-
Facoltativo: è possibile modificare la pianificazione della sincronizzazione.
Per ulteriori informazioni, vedi Opzioni di pianificazione della ricerca per indicizzazione.
-
Specificare l'indirizzo URL del sito web che si desidera sottoporre a crawling.
-
Se il sito che si desidera sottoporre a crawling richiede un accesso, impostare l'autenticazione di base su
On, aggiungere il nome URL della pagina al campo Inizio URL e quindi fare clic su Aggiungi.Aggiungere un nome utente e una password con accesso al sito e fare clic su Salva credenziali. È possibile specificare solo una serie di credenziali per raccolta.
Ad esempio, è possibile specificare
https://cloud.ibm.comcome URL di partenza e aggiungere IBMid come credenziali.Se si desidera avviare la ricerca per indicizzazione da una sezione specifica del sito, specificarla nel campo URL di avvio. Il nome del dominio della sottosezione deve corrispondere al dominio del sito URL specificato in precedenza.
Ad esempio, si può cambiare l'indirizzo iniziale URL in
https://cloud.ibm.com/unifiedsupport/supportcenter. -
Per tutte le pagine Web pubbliche che si desidera sottoporre a crawling, aggiungere l'indirizzo URL per la pagina principale del sito Web nel campo URL di partenza, quindi fare clic su Aggiungi. È possibile aggiungere più di una pagina iniziale.
La barra finale (
/) nel campo URL determina il sottoalbero da analizzare. Se si specificahttps://www.example.com/banking/faqs.html, tutti gli URL che iniziano conhttps://www.example.com/banking/vengono sottoposti a ricerca per indicizzazione, ad esempio. Se si specificahttps://www.example.com/bankingtutti gli URL che iniziano conhttps://www.example.com/vengono sottoposti a ricerca per indicizzazione.Per impostazione predefinita, il numero di collegamenti consecutivi che il crawl segue dal sito iniziale URL è
2. Per modificare il numero di hop o per elencare le sezioni del sito Web da escludere dalla ricerca per indicizzazione, fare clic sull'icona di modifica.-
Il numero massimo di hop consentito è
20. -
Per specificare i percorsi di URL da escludere, aggiungere il percorso del sito. Ad esempio, se il sito iniziale URL è
https://example.com, si può escluderehttps://example.com/pricinginserendo/pricing/.Qualsiasi sezione dell'indirizzo Web che contiene il percorso del sito specificato viene esclusa. Ad esempio, se si specifica
/licenses/, la paginahttps://example.com/products/licenses/europeviene esclusa, tra gli altri. -
Se si desidera limitare il crawl a una singola pagina, aggiungere URL al campo URL di partenza. Ad esempio,
https://www.example.com/banking/faqs.html. Fare clic sull'icona di modifica per impostare Numero massimo di collegamenti da seguire su0.
La funzione di crawling dinamico dei siti web, controllata dall'opzione Esegui JavaScript durante il crawl nelle impostazioni di crawl, è deprecata e sarà rimossa entro settembre 2025. Per ulteriori informazioni, consultare le Note di rilascio.
-
-
Se il sito Web su cui si desidera eseguire la ricerca per indicizzazione utilizza JavaScript per personalizzare il contenuto della pagina prima che venga visualizzato, è necessario eseguire un ulteriore passo.
Dopo aver inserito il sito URL di partenza e aver fatto clic su Aggiungi, modificare il sito URL facendo clic sull'icona
. Impostate Execute JavaScript during crawl switcher su On, quindi fate clic su Save.
Quando l'elaborazione JavaScript è abilitata, ci vogliono da 3 a 4 volte di più per eseguire la ricerca per indicizzazione su una pagina. Utilizzarlo solo su singole pagine Web dove si sa che è necessario perché la pagina esegue il rendering del suo contenuto in modo dinamico. Se vengono visualizzati messaggi di timeout o la ricerca per indicizzazione termina senza aggiungere contenuto alla raccolta, diminuire il numero di pagine Web incluse nella ricerca per indicizzazione. Ad esempio, è possibile specificare la pagina esatta da sottoporre a ricerca per indicizzazione nel campo URL di avvio e impostare Numero massimo di link da seguire su 0.
-
Per connettersi a un sito web ospitato dietro un firewall, impostare prima il connettore IBM Cloud Satellite.
Specificare i dettagli del connettore Satellite.
Per specificare i dettagli, completare i seguenti passaggi:
- Espandi Ulteriori impostazioni di connessionee imposta Connect to on-premises network su
On. - Selezionare IBM Cloud Satellite® Connector come tipo di connessione. Questa opzione è selezionata per impostazione predefinita.
- Specificare l'URL dell'endpoint del connettore Satellite.
Satellite Dettagli del connettore - Espandi Ulteriori impostazioni di connessionee imposta Connect to on-premises network su
-
-
Facoltativo: aggiungere un altro indirizzo Web al campo URL di avvio.
Il numero di URL iniziali per una singola raccolta deve essere inferiore a 100. Se hai un requisito per eseguire la ricerca per indicizzazione su un gran numero di siti web, vedi Ho bisogno di eseguire la ricerca per indicizzazione su molti siti. Qual è il mio limite?.
Il numero di pagine Web sottoposte a ricerca per indicizzazione è limitato a 250.000, pertanto il crawler Web potrebbe non eseguire la ricerca per indicizzazione su tutti i siti Web specificati.
Il numero di URL figlio per URL che vengono strisciati è limitato a 10.000. Se il numero di URL figlio all'interno di un qualsiasi sito URL supera i 10.000, il crawler non può elaborare il contenuto degli URL figlio.
-
Se si desidera limitare i tipi di file da aggiungere alla raccolta, è possibile elencare le estensioni file per i tipi di file da includere o escludere.
Se gli URL per le pagine del sito Web non terminano in .html, utilizzare il filtro di esclusione invece del filtro di inclusione. È necessario aggiungere almeno un'estensione file da escludere.
Per un elenco dei tipi di file supportati, vedere Tipi di file supportati.
-
Se si desidera che la ricerca per indicizzazione web estragga il testo dalle immagini sul sito, espandere Ulteriori impostazioni di elaborazionee impostare Applica OCR (optical character recognition) su
On.Quando OCR è abilitato e i tuoi documenti contengono immagini, l'elaborazione richiede più tempo. Per ulteriori informazioni, consultare Riconoscimento dei caratteri ottici.
-
Fai clic su Finish.
La raccolta viene creata rapidamente. È necessario più tempo per l'elaborazione dei dati man mano che vengono aggiunti alla raccolta.
Se si desidera controllare l'avanzamento, andare alla pagina Attività. Dal riquadro di navigazione, fare clic su Gestisci raccolte, quindi fare clic per aprire la raccolta.
Ho bisogno di strisciare un sacco di siti. Qual è il limite?
Il servizio può supportare un totale di 500 connessioni del crawler per istanza del servizio Discovery. Tutte le origini dati tranne la ricerca per indicizzazione Web utilizzano una connessione crawler ciascuna. Per la ricerca per indicizzazione Web, è richiesta una connessione per ogni 5 URL di avvio. Se si aggiungono 10 URL di avvio, ad esempio, Discovery genera la connessione del crawler supplementare necessaria per supportare i 5 URL supplementari. Pertanto, il numero massimo di URL di avvio che puoi utilizzare dipende da altre raccolte di dati configurate nella tua istanza del servizio. Puoi calcolare tu stesso il limite.
Per calcolare il limite iniziale di URL, completare i seguenti passaggi:
-
Calcola il numero di altre raccolte di origini dati nell'istanza del servizio, il che significa che questo progetto e qualsiasi altro progetto nella stessa istanza Discovery.
Ad esempio, potresti avere 2 raccolte di archivi oggetti IBM Cloud in un progetto e 2 raccolte Salesforce e 1 raccolta SharePoint Online in un altro progetto. In questo esempio, il numero totale di altre raccolte di origini dati è 5.
-
Sottrarre il numero di altre raccolte di origine dati dal numero massimo consentito di connessioni crawler, che è 500.
Ad esempio, 500 - 5 = 495.
-
Moltiplicare il resto per 5 per determinare il numero totale di URL di avvio che è possibile utilizzare.
Ad esempio, 495 x 5 = 2.475.
Per utilizzare il numero massimo consentito di URL di avvio nell'esempio, è necessario disporre di 25 raccolte di ricerca per indicizzazione Web poiché ciascuna raccolta consente di configurare un massimo di 100 URL di avvio. Tuttavia, non configurare la tua istanza per utilizzare il numero massimo assoluto consentito. Se una o più origini dati aggiuntive vengono aggiunte successivamente a un progetto in questa istanza del servizio, influirà sul numero di URL di avvio su cui l'istanza può eseguire correttamente la ricerca per indicizzazione.
Risoluzione dei problemi del crawler
- È stato restituito un errore 403 non consentito
- Il sito Web su cui si desidera eseguire la ricerca per indicizzazione potrebbe bloccare le richieste da tutte le entità denominate tranne una serie specifica. Se possibile, aggiungere il crawler all'elenco dei consentiti per il sito. L'intestazione
di identificazione per il crawler è
User-Agent: IBM-AppConnect/V1.