Web-Crawlersuche

Crawlen Sie eine Website. Sie können öffentliche Websites und Websites, die eine Authentifizierung erfordern, crawlen.

IBM Cloud Pak for Data IBM Software Hub

Diese Informationen gelten nur für installierte Bereitstellungen. Weitere Informationen zum Crawlen einer Website aus einer verwalteten Bereitstellung finden Sie unter Web-Crawl.

Welche Dokumente werden gecrawlt

  • Der Inhalt der Website wird als HTML-Dateien verarbeitet.
  • Der Web-Crawler durchsucht keine dynamischen Websites, die JavaScript verwenden, um Inhalte wiederzugeben. Sie können prüfen, ob JavaScript verwendet wird, indem Sie den Quellcode der Website in Ihrem Browser anzeigen.
  • Wenn eine Quelle erneut durchsucht wird, werden neue Dokumente hinzugefügt, aktualisierte Dokumente werden auf die aktuelle Version geändert und gelöschte Dokumente werden während der Aktualisierung aus dem Index der Sammlung gelöscht.
  • Alle Discovery Datenquellenkonnektoren sind schreibgeschützt. Unabhängig von den Berechtigungen, die dem Crawl-Konto gewährt werden, schreibt, aktualisiert oder löscht Discovery niemals Inhalte in der ursprünglichen Datenquelle.

Vorausgesetzter Schritt

Wenn Sie eine Verbindung zu einer Website herstellen möchten, die eine Authentifizierung erfordert, müssen Sie die Authentifizierungsdaten kennen, die für den Zugriff auf die Website erforderlich sind.

  • Für eine Website, die eine Basisauthentifizierung erfordert, erhalten Sie die folgenden Informationen:

    Benutzername
    Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
    Kennwort
    Das Passwort, das mit dem Benutzernamen verknüpft ist.
  • Für eine Website, die eine Windows NT LAN Manager (NTLM)-Authentifizierung erfordert, erhalten Sie die folgenden Informationen:

    Benutzername
    Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
    Kennwort
    Das Passwort, das mit dem Benutzernamen verknüpft ist.
    NTLM-Domänenname
    Der NTLM-Domänenname des Benutzers, der sich bei der Site authentifiziert.
    NTLM-Hostname
    Der Hostname des NTLM-Servers.
  • Für eine Website, die eine formularbasierte Authentifizierung erfordert, wählen Sie aus den folgenden Optionen aus, wie Sie auf die Website zugreifen möchten:

    • Direkter Zugang: Sendet das Formular ab, ohne die Anmeldeseite aufzurufen.

      Formularaktion URL
      Die E-Mail-Adresse URL, an die die Formulardaten gesendet werden, wenn das Formular abgeschickt wird. Beispiel: /action_page.php.
      Erforderliche Felder
      Ermitteln Sie die Feldwerte, die im Formular angegeben werden müssen.
    • Indirekter Zugang: Ruft die Anmeldeseite ab und füllt die Formularfelder aus. Notieren Sie sich die folgenden Informationen, damit Sie sie später angeben können:

      Formular-Login URL
      URL der Anmeldeseite der Website.
      Formularname
      Name des Anmeldeformulars.
      Erforderliche Felder
      Ermitteln Sie die Feldwerte, die im Anmeldeformular angegeben werden müssen.

Verbinden mit einer Web-Crawl-Datenquelle

Wenn Sie eine Gruppe von URLs crawlen möchten, die einige Websites enthält, für die eine Authentifizierung erforderlich ist, und einige, für die keine Authentifizierung erforderlich ist, sollten Sie für jeden Authentifizierungstyp eine eigene Sammlung erstellen.

Führen Sie die folgenden Schritte für Ihr Discovery-Projekt aus:

  1. Wählen Sie im Navigationsbereich Sammlungen verwalten.

  2. Klicken Sie auf "Neue Kollektion ".

  3. Klicken Sie auf Web crawl, und klicken Sie dann auf Weiter.

  4. Benennen Sie die Sammlung.

  5. Wenn die Sprache der Website nicht Englisch ist, wählen Sie die entsprechende Sprache.

    Eine Liste der unterstützten Sprachen finden Sie unter Sprachunterstützung.

  6. Optional: Ändern Sie den Synchronisierungszeitplan.

    Die Web-Crawl-Datenquelle ist für Websites gedacht, die sich nur ein- oder zweimal pro Woche ändern. Um sicherzustellen, dass Ihre Sammlung alle Website-Aktualisierungen erfasst, sollten Sie den Crawl wöchentlich durchführen.

    Weitere Informationen finden Sie unter Kriechplanoptionen.

  7. Fügen Sie im Abschnitt "Geben Sie an, wo Sie crawlen möchten " die Website URL zum Feld "Start-URLs" hinzu und klicken Sie dann auf "Hinzufügen ". Fügen Sie weitere Start-URLs hinzu.

    Die URLs, bei denen der Crawler mit dem Crawlen beginnt. Standardmäßig kann der Web-Crawler Teilbäume crawlen, und URLs können nur von dem Pfad gecrawlt werden, der im Seed angegeben ist. Verwenden Sie die vollständige URL, z. B. http://www.example.com/. Für die Start-URL der Web-Crawlersuche gelten hinsichtlich des Suchziels zwei Einschränkungen:

    • Die Crawlersuche wird für den Domänennamen der Start-URL durchgeführt.
    • Die Crawlersuche wird für den gesamten URL-Inhalt bis einschließlich zum letzten Schrägstrich (/) von Start-URLs durchgeführt. Wenn Ihre Start-URL eine Unterverzeichnisstruktur hat, wird bei der Web-Crawlersuche diese Unterverzeichnisstruktur nicht durchsucht, es sei denn, Sie geben die zugehörige URL in den Start-URLs an.
  8. Wenn die URL mit HTTPS beginnt: Setzen Sie im Abschnitt "Erweiterte Konfiguration" den Schalter "Zertifikat ignorieren" auf "Ein ", um alle SSL-Zertifikate auf der Zielwebsite zu ignorieren.

  9. Optional: Klicken Sie auf Authentifizierungseinstellungen, um den Authentifizierungstyp anzugeben, der auf eine oder mehrere der Start-URLs angewendet werden soll:

    • Wählen Sie den Startpunkt URL.

    • Wählen Sie die Art der Authentifizierung aus den folgenden Optionen aus:

      • Basisauthentifizierung
      • NTLM-Authentifizierung
      • Formularauthentifizierung
    • Geben Sie für Basisauthentifizierung die folgenden Details an:

      Benutzername
      Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
      Kennwort
      Das dem Benutzer zugeordnete Kennwort.
    • Geben Sie für NTLM-Authentifizierung die folgenden Details an:

      Benutzername
      Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
      Kennwort
      Das dem Benutzer zugeordnete Kennwort.
      NTLM-Domänenname
      Der NTLM-Domänenname, der dem Benutzer gehört, der sich authentifiziert.
      NTLM-Hostname
      Der Hostname des NTLM-Servers.
    • Geben Sie für FORM-Authentifizierung die folgenden Details an:

      • Wählen Sie für den Formulartyp eine der folgenden Optionen aus:

        Steuern
        Klicken Sie auf diese Option, wenn Sie die Anmeldeseite nicht aufrufen möchten.
        Indirekt
        Klicken Sie auf diese Option, wenn Sie die Anmeldeseite aufrufen und die Parameter im Anmeldeformular ausfüllen möchten.
      • Füllen Sie die folgenden Felder aus, wenn Sie Direkt wählen:

        Formular Aktion url
        Die Formularaktion URL, die zum Absenden des Formulars erforderlich ist.
        Formular-Methode
        Geben Sie GET an.
      • Füllen Sie die folgenden Felder aus, wenn Sie "Indirekt" wählen:

        Anmeldeformular url
        Dieses Feld ist erforderlich, wenn Sie den Formulartyp "Indirekt" auswählen.
        Formularname
        Dieses Feld ist erforderlich, wenn Sie den Formulartyp "Indirekt" auswählen.
        Formular-Methode
        Geben Sie POST an.
      • Im Abschnitt "Formularparameter" wird eine Liste der Schlüssel-Wert-Paare der Formularparameter angezeigt.

        Füllen Sie die Felder "Schlüssel" und "Wert" aus und klicken Sie dann auf +, um einen oder mehrere Formularparameter hinzuzufügen.

  10. Optional: Wenn Sie einen Proxyserver für den Zugriff auf den Datenquellenserver verwenden, setzen Sie im Abschnitt Proxyeinstellungen den Schalter Proxyeinstellungen aktivieren auf On. Fügen Sie Werte zu den folgenden Feldern hinzu:

    Benutzername
    Der Proxyserver-Benutzername, der für die Authentifizierung beim Proxyserver verwendet werden soll, wenn der Proxyserver eine Authentifizierung erfordert.
    Kennwort
    Das Kennwort für den Proxyserver, das für die Authentifizierung beim Proxyserver verwendet wird, wenn der Proxyserver eine Authentifizierung erfordert.
    Proxy-Server-Domänen
    Die Domäne(n), in der/denen sich die Hosts befinden. Sie können in diesem Feld ein Platzhalterzeichen angeben, z. B. einen Stern (*), um alle Domänen zu durchsuchen, oder einen führenden Stern (*.server1.bar.com), um Domänen zu durchsuchen, die einem Muster entsprechen.
    Hostname oder IP-Adresse des Proxyservers
    Der Hostname, wenn Sie über ein LAN auf den Server zugreifen möchten, oder die IP-Adresse des Servers, den Sie als Proxyserver verwenden möchten.
    Portnummer des Proxy-Servers
    Der Netzwerkport, mit dem Sie sich auf dem Proxy-Server verbinden möchten.
  11. Optional: Füllen Sie die folgenden Felder in der erweiterten Konfiguration aus:

    Zu verwendende Code-Seite

    Geben Sie die Zeichenkodierung der Website-Seiten an. Wenn keine Angabe gemacht wird, wird der Standardwert UTF-8 verwendet.

    Wenn Sie chinesische Websites crawlen, geben Sie UTF-8 an.

    URL Pfadtiefe

    Die Ebene der zu durchsuchenden Website-Pfade.

    Wenn Sie beispielsweise den Startpunkt URL von https://www.example.com und eine Pfadtiefe von 4 angeben, greift der Crawler auf die Seite https://www.example.com/some/more/examples/index.html zu, die sich in einem Pfad befindet, der vier Ebenen vom Stammverzeichnis URL entfernt ist.

    Sie können nur einen positiven Wert eingeben. Wenn nicht anders angegeben, ist der Standardwert 5. Die maximal zulässige Pfadtiefe ist 20.

    Maximale Sprünge

    Die Anzahl der aufeinanderfolgenden Links, denen man von Anfang an folgen muss URL.

    Wenn nicht anders angegeben, ist der Standardwert 5. Die maximale Anzahl von Links, denen der Crawler folgen kann, ist 20. Um keine Sprünge zuzulassen, geben Sie 0 ein.

    robots.txt ignorieren

    Aktivieren Sie diese Einstellung, wenn Sie möchten, dass der Crawler die Erlaubnis- und Ablehnungsregeln ignoriert, die von der Website in ihrer robots.txt-Datei angegeben sind.

    Beachten Sie, dass Websites die Datei in der Regel verwenden, um die Crawl-Ergebnisse zu verbessern. Sie könnten beispielsweise die Datei robots.txt verwenden, um zu verhindern, dass doppelte Informationen gecrawlt werden, um zu verhindern, dass Inhaltsentwürfe gelesen werden, oder um das Crawlen zu verzögern, um ihre Website nicht zu überlasten.

    Regeln zum Crawlen der Domäne

    Geben Sie die Domänennamen an, die Sie dem Crawler entweder erlauben oder verbieten wollen, zu crawlen.

    Bei Domänennamen wird zwischen Groß- und Kleinschreibung unterschieden, und das Platzhalterzeichen (*) kann an beliebiger Stelle im Domänennamen vorkommen.

    Die Reihenfolge der Regeln ist von Bedeutung. Der Crawler wendet die erste Regel an, die auf einen Kandidaten URL zutrifft. Die Standardregel, forbid domain *, verbietet jegliches Web-Crawling und muss in der Liste der Domainregeln an letzter Stelle stehen.

    Sie können z. B. folgende Arten von Regeln definieren:

    • Um die gesamte Domäne ibm.com auszuschließen:

      forbid domain www.ibm.com
      
    • Um jede Domäne zu crawlen, die mit ibm.com endet:

      allow domain *.ibm.com
      
    • Um nur Port 443 auf IBM-Domänen zu crawlen, die mit server beginnen:

      allow domain server*.ibm.com:443
      
    Regeln zum Crawlen von URL-Präfixen

    Geben Sie die Präfixe HTTP und HTTPS an, die Sie dem Crawler entweder erlauben oder verbieten möchten.

    Das Platzhalterzeichen (*) kann ein- oder mehrmals in der URL vorkommen.

    Die Reihenfolge der Regeln ist von Bedeutung. Der Crawler wendet die erste Regel an, die auf einen Kandidaten URL zutrifft.

    Sie können z. B. folgende Arten von Regeln definieren:

    • Zum Crawlen von Seiten im öffentlichen Verzeichnis dieser Domäne:

      allow prefix http://*.ibm.com/public/*
      
    • Um alle anderen Verzeichnisse in dieser Domäne auszuschließen:

      forbid prefix http://*.ibm.com/*
      
    Erweiterte Crawler-Eigenschaften

    Nur auf Anweisung des IBM Supports verwenden.

  12. Optional: Wenn Sie alle SSL-Zertifikate auf der Ziel-Website ignorieren möchten, setzen Sie den Schalter Zertifikat ignorieren auf On.

    Diese Option gilt nur für HTTPS-URLs.

  13. Wenn Sie möchten, dass der Crawler Text aus Bildern auf der Website extrahiert, erweitern Sie Weitere Verarbeitungseinstellungen und setzen Sie optische Zeichenerkennung (OCR) anwenden auf On.

    Wenn OCR aktiviert ist und Ihre Dokumente Bilder enthalten, dauert die Verarbeitung länger. Weitere Informationen finden Sie unter Optische Zeichenerkennung.

  14. Klicken Sie auf Beenden.

Die Sammlung ist schnell erstellt. Die Verarbeitung der Daten nimmt mehr Zeit in Anspruch, da sie der Sammlung hinzugefügt werden.

Wenn Sie den Fortschritt überprüfen möchten, gehen Sie auf die Seite Aktivität. Klicken Sie im Navigationsbereich auf Sammlungen verwalten und dann auf , um die Sammlung zu öffnen.