Exploration Web
Ajoutez une collection d'exploration Web pour explorer un site Web, analyser son contenu de page et stocker des informations significatives. Spécifiez une ou plusieurs URL de page Web de base et configurez le nombre de pages liées que l'exploration Web doit suivre. Vous pouvez configurer la fréquence de synchronisation avec le site Web afin de contrôler la mise à jour des données de votre collection.
Avant de créer une collection d'exploration de sites web, contactez le propriétaire du site web pour obtenir l'autorisation d'explorer son site. Actuellement, le déploiement géré de Discovery ne peut pas crawler https://www.ibm.com.
IBM Cloud IBM Cloud seulement
Ces informations s'appliquent uniquement aux déploiements gérés. Pour plus d'informations sur la connexion à un site Web à partir d'un déploiement installé, voir Web crawl.
Quels documents sont explorés
Vous pouvez vous connecter aux types de contenu Web suivants:
- Sites Web publics
- Sites Web de sociétés privées ou autres sites nécessitant une authentification
- Sites Web situés derrière un pare-feu d'entreprise
Lors de l'exploration initiale du contenu, toutes les pages de site Web qui correspondent à vos paramètres de recherche sont explorées et ajoutées à l'index de document de votre collection. L'exploration démarre sur la page Web que vous spécifiez
dans la zone Starting URLs. Si votre collection est configurée pour suivre les liens, l'exploration suit les liens de la page de départ qui partagent la même sous-arborescence que la page de départ. Par exemple, si vous spécifiez
https://www.example.com/banking/faqs.html, les liens dont les URL commencent par https://www.example.com/banking/ sont explorés. Si vous spécifiez https://www.example.com/banking, les liens dont les URL
commencent par https://www.example.com/ sont explorés.
L'exploration ne peut pas accéder aux sous-répertoires sécurisés. Par exemple, si un sous-répertoire auquel vous souhaitez que l'exploration accède, tel que https://www.example.com/banking/pdfs, n'est pas exploré, vérifiez si vous
pouvez accéder directement au sous-répertoire URL à partir d'un navigateur web. Si vous ne pouvez pas y accéder, l'exploration ne peut pas y accéder.
Lors des réexplorations planifiées suivantes, une réexploration complète est effectuée et toutes les modifications sont reflétées dans votre collection. Les documents qui ont été ajoutés à votre collection à partir de pages de site Web qui sont supprimées ultérieurement du site Web externe ne sont pas supprimés de la collection. Toutefois, à partir des collections créées après avril 2022, lorsque vous supprimez un site de départ URL de la configuration de l'exploration du web, tous les documents associés sont supprimés. Les documents supprimés comprennent les documents indexés qui ont été ajoutés à la collection sur la base du contenu de la page web au point de départ URL et les documents qui ont été dérivés des pages web auxquelles le point de départ URL était lié. Vous ne pouvez pas limiter le nombre de documents indexés en modifiant d'autres paramètres, par exemple en modifiant le site URL existant pour y inclure un chemin d'accès dont la portée est plus limitée qu'auparavant ou en réduisant à 0 le nombre maximal de liens à suivre. Ce n'est qu'en supprimant le site URL que vous pouvez supprimer les documents indexés qui y sont associés.
Le moteur d'exploration Web peut explorer des pages Web qui utilisent JavaScript pour afficher du contenu, mais il fonctionne mieux sur des pages individuelles et non sur des sites Web entiers. Il ne peut pas explorer les sites qui utilisent des URL dynamiques ; si vous ne voyez pas de contenu lorsque vous affichez le code source d'une page Web dans votre navigateur, le service ne peut pas l'explorer.
Si vous souhaitez explorer un groupe d'URL comprenant des sites web nécessitant une authentification et d'autres non, envisagez de créer une collection différente pour chaque type d'authentification. Le connecteur ne prend pas en charge l'exploration basée sur les cookies.
Tous les connecteurs de source de données Discovery sont en lecture seule. Quels que soient les droits accordés au compte d'exploration, Discovery n'écrit, ne met à jour ou ne supprime jamais de contenu dans la source de données d'origine.
Le tableau suivant illustre les objets que Discovery peut explorer.
| Objets explorés |
|---|
| Sites Web, sous-répertoires de site Web |
Etape préalable à la connexion à un site web hébergé derrière un pare-feu
Si vous souhaitez vous connecter à un site Web hébergé derrière un pare-feu, configurez d'abord le connecteur IBM Cloud Satellite® extérieur Discovery. Pour plus d'informations, voir la Satellite Vue d'ensemble du connecteur.
IBM® Secure Gateway for IBM Cloud® est obsolète. Les collections existantes qui utilisent Secure Gateway peuvent migrer vers le connecteur IBM Cloud Satellite® avant la date de fin de support. Pour plus d'informations, voir les Secure Gateway dates de dépréciation et détails de dépréciation.
Les contenus de valeur sont souvent stockés sur le site Web interne de votre entreprise. Généralement, ces sites intranet sont accessibles uniquement à partir d'un ordinateur connecté à votre réseau de bureau ou via une connexion VPN. Vous pouvez établir une connexion persistante et plus sûre entre le robot d'exploration et ce type de site interne en utilisant le connecteur Satellite.
Pour configurer le connecteur Satellite, procédez comme suit :
- Créer un connecteur Satellite. Pour plus d'informations, voir Création d'un connecteur.
- Exécuter un agent connecteur. Pour plus d'informations, voir Exécution d'un agent connecteur.
- Créer et gérer les points d'extrémité du connecteur. Pour plus d'informations, voir Création et gestion des points de terminaison Connector.
Limitations
Les limites de l'utilisation du connecteur Satellite sont les suivantes :
- Vous pouvez configurer le connecteur Satellite uniquement lors de la création d'une nouvelle collection d'exploration du Web (vous ne pouvez pas le modifier après la création de la collection).
- Si Connecter au réseau interne est défini sur
Ondans Plus de paramètres de connexion, toutes les URL de semences doivent se trouver dans le même domaine. - Si la graine URL utilise SSL (
https://), vous pouvez utiliser l'authentification de base et les URL absolues. - Si la semence URL utilise HTTP (
http://), les limitations suivantes s'appliquent :- L'authentification de base n'est pas disponible lors de l'utilisation du connecteur Satellite Connecteur.
- Si la page web explorée a une adresse absolue URL, par exemple,
http://<seed_url_domain>/sample.html, la page liée n'est pas explorée.
Connexion à la source de données
Pour configurer la collection d'exploration Web, procédez comme suit:
-
Dans le panneau de navigation, sélectionnez Gestion des collections.
-
Cliquez sur Nouvelle collection.
-
Cliquez sur le lien en regard de Besoin de se connecter à une source de données? cliquez sur Web crawl, puis sur Next.
-
Attribuez un nom à la collection.
-
Si la langue du contenu du site Web n'est pas l'anglais, sélectionnez la langue appropriée.
Pour obtenir la liste des langues prises en charge, voir Langues prises en charge.
-
Facultatif: vous pouvez modifier la planification de synchronisation.
Pour plus d'informations, voir Options de planification d'exploration.
-
Indiquez l'adresse URL du site web que vous souhaitez explorer.
-
Si le site que vous souhaitez explorer nécessite une connexion, définissez l'authentification de base sur
On, ajoutez le URL de la page dans le champ Starting URL, puis cliquez sur Add.Ajoutez un nom d'utilisateur et un mot de passe avec accès au site, puis cliquez sur Sauvegarder les données d'identification. Vous ne pouvez spécifier qu'un seul ensemble de données d'identification par collection.
Par exemple, vous pouvez spécifier
https://cloud.ibm.comcomme URL de départ et ajouter votre IBMid comme justificatif d'identité.Si vous souhaitez démarrer l'exploration à partir d'une section spécifique du site, indiquez-la dans la zone Starting URLs. Le nom de domaine de la sous-section doit correspondre au domaine du site URL que vous avez spécifié précédemment.
Par exemple, vous pouvez changer le début de URL en
https://cloud.ibm.com/unifiedsupport/supportcenter. -
Pour toutes les pages web publiques que vous souhaitez explorer, ajoutez l'adresse URL de la page racine du site web dans le champ URL de départ, puis cliquez sur Ajouter. Vous pouvez ajouter plus d'une page de départ.
La barre oblique finale (
/) dans URL détermine le sous-arbre à explorer. Si vous spécifiezhttps://www.example.com/banking/faqs.html, toutes les URL commençant parhttps://www.example.com/banking/sont explorées, par exemple. Si vous spécifiezhttps://www.example.com/banking, toutes les URL commençant parhttps://www.example.com/sont explorées.Par défaut, le nombre de liens consécutifs que le crawl suit à partir du site de départ URL est
2. Pour modifier le nombre de tronçons ou pour répertorier les sections de site Web à exclure de l'exploration, cliquez sur l'icône d'édition.-
Le nombre maximum de sauts autorisés est de
20. -
Pour spécifier les chemins d'accès URL à exclure, ajoutez le chemin d'accès au site. Par exemple, si l'adresse de départ URL est
https://example.com, vous pouvez exclurehttps://example.com/pricingen saisissant/pricing/.Toute section de l'adresse Web qui contient le chemin de site que vous spécifiez est exclue. Par exemple, si vous spécifiez
/licenses/, la pagehttps://example.com/products/licenses/europeest exclue, entre autres. -
Si vous souhaitez limiter l'exploration à une seule page, ajoutez l' URL au champ URL de départ. Par exemple,
https://www.example.com/banking/faqs.html. Cliquez sur l'icône d'édition pour définir le nombre maximal de liens à suivre sur0.
La fonction d'exploration de sites web dynamiques, qui est contrôlée par le commutateur Exécuter JavaScript pendant l'exploration dans les paramètres d' exploration, est obsolète et sera supprimée d'ici septembre 2025. Pour plus d'informations, voir les notes de mise à jour.
-
-
Si le site Web que vous souhaitez explorer utilise JavaScript pour personnaliser le contenu de la page avant de l'afficher, vous devez effectuer une étape supplémentaire.
Après avoir saisi le URL de départ et cliqué sur Ajouter, modifiez le URL en cliquant sur l'icône
. Réglez l'option Execute JavaScript during crawl switcher sur On, puis cliquez sur Save.
Lorsque le traitement JavaScript est activé, l'exploration d'une page prend 3 à 4 fois plus de temps. Utilisez-le uniquement sur les pages Web individuelles où vous savez que c'est nécessaire car la page affiche son contenu de manière dynamique. Si vous voyez des messages de délai d'attente ou si l'exploration se termine sans ajouter de contenu à la collection, réduisez le nombre de pages Web incluses dans l'exploration. Par exemple, vous pouvez spécifier la page exacte à explorer dans la zone Starting URLs et définir le nombre maximal de liens à suivre sur 0.
-
Pour se connecter à un site web hébergé derrière un pare-feu, mettez en place le IBM Cloud Satellite Connecteur en premier.
Spécifiez les détails du connecteur Satellite.
Pour spécifier les détails, suivez les étapes suivantes :
- Développez Plus de paramètres de connexion, puis définissez Se connecter au réseau sur site sur
On. - Sélectionnez IBM Cloud Satellite® Connecteur comme type de connexion. Par défaut, cette option est sélectionnée.
- Spécifiez le point de terminaison du connecteur Satellite URL.
Satellite Détails du connecteur - Développez Plus de paramètres de connexion, puis définissez Se connecter au réseau sur site sur
-
-
Facultatif: ajoutez une autre adresse Web à la zone Starting URLs.
Le nombre d'URL de départ pour une collection unique doit être inférieur à 100. Si vous devez explorer un grand nombre de sites Web, voir J'ai besoin d'explorer un grand nombre de sites. Quelle est ma limite?.
Le nombre de pages Web explorées étant limité à 250 000, le moteur d'exploration Web risque de ne pas explorer tous les sites Web spécifiés.
Le nombre d'URL enfants par URL qui sont explorés est limité à 10 000. Si le nombre d'URL enfant dans une URL explorée est supérieur à 10 000, le moteur d'exploration ne peut traiter aucun contenu dans les URL enfant.
-
Si vous souhaitez limiter les types de fichier à ajouter à la collection, vous pouvez répertorier les extensions de fichier pour les types de fichier à inclure ou à exclure.
Si les URL des pages de votre site Web ne se terminent pas par .html, utilisez le filtre d'exclusion à la place du filtre d'inclusion. Vous devez ajouter au moins une extension de fichier à exclure.
Pour obtenir la liste des types de fichier pris en charge, voir Types de fichier pris en charge.
-
Si vous souhaitez que l'exploration Web extraie du texte à partir des images du site, développez Plus de paramètres de traitementet définissez Appliquer la reconnaissance optique des caractères (OCR) sur
On.Lorsque la reconnaissance optique des caractères est activée et que vos documents contiennent des images, le traitement prend plus de temps. Pour plus d'informations, voir Reconnaissance optique des caractères.
-
Cliquez sur Terminer.
La collection est créée rapidement. Le traitement des données à mesure qu'elles sont ajoutées à la collection prend plus de temps.
Si vous souhaitez vérifier la progression, accédez à la page Activité. Dans le panneau de navigation, cliquez sur Gérer les collections, puis cliquez pour ouvrir la collection.
J'ai besoin d'explorer beaucoup de sites. Quelle est ma limite?
Le service peut prendre en charge un total de 500 connexions de moteur d'exploration par instance de service Discovery. Toutes les sources de données, à l'exception de l'exploration Web, utilisent chacune une connexion de moteur d'exploration. Pour l'exploration Web, une connexion est requise pour 5 URL de départ. Si vous ajoutez 10 URL de départ, par exemple, Discovery génère la connexion de moteur d'exploration supplémentaire nécessaire pour prendre en charge les 5 URL supplémentaires. Par conséquent, le nombre maximal d'URL de départ que vous pouvez utiliser dépend des autres collections de données configurées dans votre instance de service. Vous pouvez calculer la limite vous-même.
Pour calculer la limite initiale de URL, procédez comme suit :
-
Calculez le nombre d'autres collections de sources de données dans l'instance de service, c'est-à-dire ce projet et tous les autres projets de la même instance Discovery.
Par exemple, vous pouvez avoir 2 collections IBM Cloud Object Store dans un projet et 2 collections Salesforce et 1 collection SharePoint Online dans un autre projet. Dans cet exemple, le nombre total d'autres collections de sources de données est de 5.
-
Soustrayez le nombre d'autres collections de sources de données du nombre maximal autorisé de connexions de moteur d'exploration, qui est de 500.
Par exemple, 500-5 = 495.
-
Multipliez le reste par 5 pour déterminer le nombre total d'URL de départ que vous pouvez utiliser.
Par exemple, 495 x 5 = 2,475.
Pour utiliser le nombre maximal autorisé d'URL de départ dans l'exemple, vous aurez besoin de 25 collections d'exploration Web car chaque collection autorise la configuration d'un maximum de 100 URL de départ. Cependant, ne configurez pas votre instance pour qu'elle utilise le nombre maximal absolu autorisé. Si une ou plusieurs sources de données supplémentaires sont ajoutées ultérieurement à un projet dans cette instance de service, cela aura un impact sur le nombre d'URL de départ que l'instance peut explorer avec succès.
Traitement des incidents liés au moteur d'exploration
- Une erreur 403 Forbidden est renvoyée
- Le site Web que vous souhaitez explorer peut bloquer les demandes provenant de tous les ensembles d'entités nommées, à l'exception d'un ensemble spécifique. Si possible, ajoutez le moteur d'exploration à la liste autorisée pour le site.
L'en-tête d'identification du moteur d'exploration est
User-Agent: IBM-AppConnect/V1.