Exploration Web

Parcourir un site web. Vous pouvez explorer les sites web publics et les sites web nécessitant une authentification.

IBM Cloud Pak for Data IBM Software Hub

Ces informations ne s'appliquent qu'aux déploiements installés. Pour plus d'informations sur l'exploration d'un site Web à partir d'un déploiement géré, voir Exploitation du site Web.

Quels sont les documents explorés ?

  • Le contenu du site est traité sous forme de fichiers HTML.
  • Le moteur d'exploration Web n'explore pas les sites Web dynamiques qui utilisent JavaScript pour rendre le contenu. Vous pouvez confirmer l'utilisation de JavaScript en affichant le code source du site Web dans votre navigateur.
  • Lorsqu'une source est réexplorée, les nouveaux documents sont ajoutés, les documents mis à jour sont modifiés dans leur version actuelle et les documents supprimés sont effacés de l'index de la collection pendant l'actualisation.
  • Tous les Discovery connecteurs de sources de données sont en lecture seule. Quelles que soient les autorisations accordées au compte d'exploration, Discovery n'écrit, ne met à jour ou ne supprime jamais de contenu dans la source de données d'origine.

Etape de prérequis

Si vous souhaitez vous connecter à un site web nécessitant une authentification, vous devez connaître les informations d'authentification requises pour accéder au site.

  • Pour un site web qui requiert une authentification de base, obtenez les informations suivantes :

    Nom d'utilisateur
    Le nom d'utilisateur d'un utilisateur ayant accès au contenu auquel vous souhaitez vous connecter sur le site web.
    Mot de passe
    Mot de passe associé au nom d'utilisateur.
  • Pour un site web qui requiert l'authentification Windows NT LAN Manager (NTLM), obtenez les informations suivantes :

    Nom d'utilisateur
    Le nom d'utilisateur d'un utilisateur ayant accès au contenu auquel vous souhaitez vous connecter sur le site web.
    Mot de passe
    Mot de passe associé au nom d'utilisateur.
    Nom de domaine NTLM
    Le nom de domaine NTLM de l'utilisateur qui s'authentifie auprès du site.
    Nom d'hôte NTLM
    Le nom d'hôte du serveur NTLM.
  • Pour un site web qui nécessite une authentification basée sur un formulaire, choisissez parmi les options suivantes la manière dont vous souhaitez accéder au site :

    • Accès direct : Soumet le formulaire sans obtenir la page de connexion.

      Action de forme URL
      L'adresse URL à laquelle les données du formulaire doivent être envoyées lorsque le formulaire est soumis. Par exemple, /action_page.php.
      Zones requises
      Découvrez les valeurs des champs qui doivent être fournies dans le formulaire.
    • Accès indirect : Accède à la page de connexion et remplit les champs du formulaire. Notez les informations suivantes afin de pouvoir les fournir ultérieurement :

      Formulaire de connexion URL
      URL de la page de connexion du site web.
      Nom du formulaire
      Nom du formulaire de connexion.
      Zones requises
      Découvrez les valeurs des champs qui doivent être fournies dans le formulaire de connexion.

Connexion à une source de données web crawl

Si vous souhaitez explorer un groupe d'URL qui comprend des sites Web nécessitant une authentification et d'autres non, envisagez de créer une collection différente pour chaque type d'authentification.

À partir de votre projet d' Discovery, procédez comme suit :

  1. Dans le volet de navigation, choisissez Gestion des collections.

  2. Cliquez sur Nouvelle collection.

  3. Cliquez sur L'exploration du web, puis cliquez sur Suivant.

  4. Nommez la collection.

  5. Si la langue du site web n'est pas l'anglais, sélectionnez la langue appropriée.

    Pour obtenir la liste des langues prises en charge, voir Langues prises en charge.

  6. En option: Modifier le calendrier de synchronisation.

    La source de données Web crawl est conçue pour être utilisée avec des sites web qui ne changent qu'une ou deux fois par semaine. Pour vous assurer que votre collection capture toutes les mises à jour du site web, planifiez le crawl de façon hebdomadaire.

    Pour plus d'informations, voir Options de planification du ramassage.

  7. Dans la section Spécifier où vous souhaitez explorer, ajoutez l’ URL du site Web au champ URL de départ, puis cliquez sur Ajouter. Continuer à ajouter des URL de départ.

    Les URL à partir desquelles le robot d'exploration commence à explorer. Par défaut, le web crawler peut explorer les sous-arbres, et les URL peuvent être explorées à partir du chemin fourni dans le seed uniquement. Utilisez l'URL complète, par exemple http://www.example.com/. L'URL de départ de l'exploration Web comporte deux limites quant à ce qui est exploré :

    • Exploration du même nom de domaine que l'URL de départ.
    • Exploration de tout le contenu d'URL jusqu'à et y compris la dernière barre oblique (/) dans les URL indiquées dans Starting URLs. Si votre URL de départ comporte une sous-arborescence, l'exploration Web ne l'explore que si vous spécifiez son URL dans Starting URLs.
  8. Si le site URL commence par HTTPS: Dans la section Configuration avancée, réglez l'interrupteur Ignorer le certificat sur On pour ignorer tout certificat SSL sur le site web cible.

  9. Optionnel: Cliquez sur Paramètres d'authentification pour spécifier le type d'authentification à appliquer à une ou plusieurs des URL de départ :

    • Choisissez le point de départ URL.

    • Choisissez le type d'authentification parmi les options suivantes :

      • Authentification de base
      • Authentification NTLM
      • L'authentification par formulaire
    • Pour Authentification de base, fournissez les détails suivants :

      Nom d'utilisateur
      Le nom d'utilisateur d'un utilisateur ayant accès au contenu auquel vous souhaitez vous connecter sur le site web.
      Mot de passe
      Mot de passe associé à l'utilisateur.
    • Pour l'authentification NTLM, fournissez les détails suivants :

      Nom d'utilisateur
      Le nom d'utilisateur d'un utilisateur ayant accès au contenu auquel vous souhaitez vous connecter sur le site web.
      Mot de passe
      Mot de passe associé à l'utilisateur.
      Nom de domaine NTLM
      Le nom de domaine NTLM qui appartient à l'utilisateur qui s'authentifie.
      Nom d'hôte NTLM
      Le nom d'hôte du serveur NTLM.
    • Pour l'authentification par formulaire, fournissez les détails suivants :

      • Dans Form type, sélectionnez l'une des options suivantes :

        Diriger
        Cliquez sur cette option si vous ne souhaitez pas afficher la page de connexion.
        Indirecte
        Cliquez sur cette option si vous souhaitez récupérer la page de connexion et remplir les paramètres du formulaire de connexion.
      • Complétez les champs suivants si vous choisissez Direct :

        URL de l'action du formulaire
        L'action de formulaire URL qui est nécessaire pour soumettre le formulaire.
        Méthode des formulaires
        Spécifiez GET.
      • Complétez les champs suivants si vous choisissez Indirect :

        URL de connexion au formulaire
        Ce champ est obligatoire si vous sélectionnez le type de formulaire Indirect.
        Nom du formulaire
        Ce champ est obligatoire si vous sélectionnez le type de formulaire Indirect.
        Méthode des formulaires
        Spécifiez POST.
      • Dans la section Paramètres du formulaire, liste des paires clé-valeur des paramètres du formulaire.

        Complétez les champs Clé et Valeur, puis cliquez sur + pour ajouter un ou plusieurs paramètres de formulaire.

  10. Optionnel: Si vous utilisez un serveur proxy pour accéder au serveur de la source de données, dans la section Paramètres proxy, réglez le commutateur Activer les paramètres proxy sur On. Ajoutez des valeurs aux champs suivants :

    Nom d'utilisateur
    Le nom d'utilisateur du serveur proxy à utiliser pour s'authentifier auprès du serveur proxy si ce dernier requiert une authentification.
    Mot de passe
    Le mot de passe du serveur proxy à utiliser pour s'authentifier auprès du serveur proxy si ce dernier requiert une authentification.
    Domaines du serveur proxy
    Le ou les domaines dans lesquels les hôtes résident. Vous pouvez entrer un caractère générique dans cette zone, par exemple un astérisque seul (*) pour explorer tous les domaines, ou une chaîne commençant par un astérisque (*.server1.bar.com) pour explorer des domaines suivant un modèle particulier.
    Nom d'hôte ou adresse IP du serveur proxy
    Le nom d'hôte si vous souhaitez accéder au serveur en utilisant un réseau local, ou l'adresse IP du serveur que vous souhaitez utiliser comme serveur proxy.
    Numéro de port du serveur proxy
    Le port réseau auquel vous souhaitez vous connecter sur le serveur proxy.
  11. Facultatif: Remplissez les champs suivants dans la Configuration avancée:

    Page de code à utiliser

    Spécifiez l'encodage des caractères des pages du site web. Si non spécifié, la valeur par défaut de UTF-8 est utilisée.

    Si vous parcourez des sites web chinois, indiquez UTF-8.

    URL Profondeur du chemin

    Le niveau des chemins d'accès au site à explorer.

    Par exemple, si vous spécifiez le point de départ URL de https://www.example.com et une profondeur de chemin de 4, le robot d'exploration accèdera à la page https://www.example.com/some/more/examples/index.html, qui se trouve sur un chemin situé à quatre niveaux de la racine URL.

    Vous ne pouvez saisir qu'une valeur positive. Si non spécifié, la valeur par défaut est 5. La profondeur de chemin maximale autorisée est de 20.

    Nombre maximal de sauts

    Le nombre de liens consécutifs à suivre depuis le début URL.

    Si non spécifié, la valeur par défaut est 5. Le nombre maximum de liens que le robot peut suivre est de 20. Pour n'autoriser aucun saut, entrez 0.

    Ignorer robots.txt

    Activez ce paramètre si vous souhaitez que le robot d'exploration ignore les règles d'autorisation et de refus définies par le site web dans son fichier robots.txt.

    Gardez à l'esprit que les sites utilisent généralement le fichier pour améliorer les résultats du crawl. Par exemple, ils peuvent utiliser le fichier robots.txt pour empêcher l'exploration d'informations en double, pour empêcher la lecture de contenus provisoires ou pour retarder l'exploration afin de ne pas surcharger leur site.

    Règles d'exploration du domaine

    Indiquez les noms de domaine que vous souhaitez autoriser ou interdire au crawler de parcourir.

    Les noms de domaine sont sensibles à la casse et le caractère générique (*) peut apparaître n'importe où dans le nom de domaine.

    L'ordre des règles est important. Le crawler applique la première règle qui correspond à un candidat URL. La règle par défaut, forbid domain *, interdit toute exploration du Web et doit apparaître en dernier dans la liste des règles de domaine.

    Vous pouvez définir les types de règles suivants, par exemple :

    • Pour exclure l'ensemble du domaine ibm.com:

      forbid domain www.ibm.com
      
    • Pour explorer tout domaine se terminant par ibm.com :

      allow domain *.ibm.com
      
    • Pour explorer uniquement le port 443 sur les domaines IBM qui commencent par server :

      allow domain server*.ibm.com:443
      
    Règles pour explorer les préfixes URL

    Spécifiez les préfixes HTTP et HTTPS que vous souhaitez autoriser ou interdire au crawler de parcourir.

    Le caractère générique (*) peut apparaître une ou plusieurs fois dans le site URL.

    L'ordre des règles est important. Le crawler applique la première règle qui correspond à un candidat URL.

    Vous pouvez définir les types de règles suivants, par exemple :

    • Pour explorer les pages de l'annuaire public de ce domaine :

      allow prefix http://*.ibm.com/public/*
      
    • Pour exclure tous les autres répertoires de ce domaine :

      forbid prefix http://*.ibm.com/*
      
    Propriétés avancées du crawler

    Ne l'utilisez que sur instruction du service d'assistance IBM.

  12. Optionnel: si vous souhaitez ignorer tout certificat SSL sur le site Web cible, réglez le commutateur Ignore certificate sur On.

    Cette option s'applique uniquement aux URL HTTPS.

  13. Si vous souhaitez que le robot extraie le texte des images du site, développez Plus de paramètres de traitement, et réglez Appliquer la reconnaissance optique de caractères (OCR) sur On.

    Lorsque l'OCR est activé et que vos documents contiennent des images, le traitement prend plus de temps. Pour plus d'informations, voir Reconnaissance optique des caractères.

  14. Cliquez sur Terminer.

La collection est créée rapidement. Le traitement des données prend plus de temps au fur et à mesure qu'elles sont ajoutées à la collection.

Si vous souhaitez vérifier l'état d'avancement du projet, rendez-vous sur la page Activité. Dans le volet de navigation, cliquez sur Gestion des collections, puis sur pour ouvrir la collection.