Web-Crawlersuche
Crawlen Sie eine Website. Sie können öffentliche Websites und Websites, die eine Authentifizierung erfordern, crawlen.
IBM Cloud Pak for Data IBM Software Hub
Diese Informationen gelten nur für installierte Bereitstellungen. Weitere Informationen zum Crawlen einer Website aus einer verwalteten Bereitstellung finden Sie unter Web-Crawl.
Welche Dokumente werden gecrawlt
- Der Inhalt der Website wird als HTML-Dateien verarbeitet.
- Der Web-Crawler durchsucht keine dynamischen Websites, die JavaScript verwenden, um Inhalte wiederzugeben. Sie können prüfen, ob JavaScript verwendet wird, indem Sie den Quellcode der Website in Ihrem Browser anzeigen.
- Wenn eine Quelle erneut durchsucht wird, werden neue Dokumente hinzugefügt, aktualisierte Dokumente werden auf die aktuelle Version geändert und gelöschte Dokumente werden während der Aktualisierung aus dem Index der Sammlung gelöscht.
- Alle Discovery Datenquellenkonnektoren sind schreibgeschützt. Unabhängig von den Berechtigungen, die dem Crawl-Konto gewährt werden, schreibt, aktualisiert oder löscht Discovery niemals Inhalte in der ursprünglichen Datenquelle.
Vorausgesetzter Schritt
Wenn Sie eine Verbindung zu einer Website herstellen möchten, die eine Authentifizierung erfordert, müssen Sie die Authentifizierungsdaten kennen, die für den Zugriff auf die Website erforderlich sind.
-
Für eine Website, die eine Basisauthentifizierung erfordert, erhalten Sie die folgenden Informationen:
- Benutzername
- Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
- Kennwort
- Das Passwort, das mit dem Benutzernamen verknüpft ist.
-
Für eine Website, die eine Windows NT LAN Manager (NTLM)-Authentifizierung erfordert, erhalten Sie die folgenden Informationen:
- Benutzername
- Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
- Kennwort
- Das Passwort, das mit dem Benutzernamen verknüpft ist.
- NTLM-Domänenname
- Der NTLM-Domänenname des Benutzers, der sich bei der Site authentifiziert.
- NTLM-Hostname
- Der Hostname des NTLM-Servers.
-
Für eine Website, die eine formularbasierte Authentifizierung erfordert, wählen Sie aus den folgenden Optionen aus, wie Sie auf die Website zugreifen möchten:
-
Direkter Zugang: Sendet das Formular ab, ohne die Anmeldeseite aufzurufen.
- Formularaktion URL
- Die E-Mail-Adresse URL, an die die Formulardaten gesendet werden, wenn das Formular abgeschickt wird. Beispiel:
/action_page.php. - Erforderliche Felder
- Ermitteln Sie die Feldwerte, die im Formular angegeben werden müssen.
-
Indirekter Zugang: Ruft die Anmeldeseite ab und füllt die Formularfelder aus. Notieren Sie sich die folgenden Informationen, damit Sie sie später angeben können:
- Formular-Login URL
- URL der Anmeldeseite der Website.
- Formularname
- Name des Anmeldeformulars.
- Erforderliche Felder
- Ermitteln Sie die Feldwerte, die im Anmeldeformular angegeben werden müssen.
-
Verbinden mit einer Web-Crawl-Datenquelle
Wenn Sie eine Gruppe von URLs crawlen möchten, die einige Websites enthält, für die eine Authentifizierung erforderlich ist, und einige, für die keine Authentifizierung erforderlich ist, sollten Sie für jeden Authentifizierungstyp eine eigene Sammlung erstellen.
Führen Sie die folgenden Schritte für Ihr Discovery-Projekt aus:
-
Wählen Sie im Navigationsbereich Sammlungen verwalten.
-
Klicken Sie auf "Neue Kollektion ".
-
Klicken Sie auf Web crawl, und klicken Sie dann auf Weiter.
-
Benennen Sie die Sammlung.
-
Wenn die Sprache der Website nicht Englisch ist, wählen Sie die entsprechende Sprache.
Eine Liste der unterstützten Sprachen finden Sie unter Sprachunterstützung.
-
Optional: Ändern Sie den Synchronisierungszeitplan.
Die Web-Crawl-Datenquelle ist für Websites gedacht, die sich nur ein- oder zweimal pro Woche ändern. Um sicherzustellen, dass Ihre Sammlung alle Website-Aktualisierungen erfasst, sollten Sie den Crawl wöchentlich durchführen.
Weitere Informationen finden Sie unter Kriechplanoptionen.
-
Fügen Sie im Abschnitt "Geben Sie an, wo Sie crawlen möchten " die Website URL zum Feld "Start-URLs" hinzu und klicken Sie dann auf "Hinzufügen ". Fügen Sie weitere Start-URLs hinzu.
Die URLs, bei denen der Crawler mit dem Crawlen beginnt. Standardmäßig kann der Web-Crawler Teilbäume crawlen, und URLs können nur von dem Pfad gecrawlt werden, der im Seed angegeben ist. Verwenden Sie die vollständige URL, z. B.
http://www.example.com/. Für die Start-URL der Web-Crawlersuche gelten hinsichtlich des Suchziels zwei Einschränkungen:- Die Crawlersuche wird für den Domänennamen der Start-URL durchgeführt.
- Die Crawlersuche wird für den gesamten URL-Inhalt bis einschließlich zum letzten Schrägstrich (
/) von Start-URLs durchgeführt. Wenn Ihre Start-URL eine Unterverzeichnisstruktur hat, wird bei der Web-Crawlersuche diese Unterverzeichnisstruktur nicht durchsucht, es sei denn, Sie geben die zugehörige URL in den Start-URLs an.
-
Wenn die URL mit HTTPS beginnt: Setzen Sie im Abschnitt "Erweiterte Konfiguration" den Schalter "Zertifikat ignorieren" auf "Ein ", um alle SSL-Zertifikate auf der Zielwebsite zu ignorieren.
-
Optional: Klicken Sie auf Authentifizierungseinstellungen, um den Authentifizierungstyp anzugeben, der auf eine oder mehrere der Start-URLs angewendet werden soll:
-
Wählen Sie den Startpunkt URL.
-
Wählen Sie die Art der Authentifizierung aus den folgenden Optionen aus:
- Basisauthentifizierung
- NTLM-Authentifizierung
- Formularauthentifizierung
-
Geben Sie für Basisauthentifizierung die folgenden Details an:
- Benutzername
- Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
- Kennwort
- Das dem Benutzer zugeordnete Kennwort.
-
Geben Sie für NTLM-Authentifizierung die folgenden Details an:
- Benutzername
- Der Benutzername eines Benutzers mit Zugriff auf den Inhalt, mit dem Sie sich auf der Website verbinden möchten.
- Kennwort
- Das dem Benutzer zugeordnete Kennwort.
- NTLM-Domänenname
- Der NTLM-Domänenname, der dem Benutzer gehört, der sich authentifiziert.
- NTLM-Hostname
- Der Hostname des NTLM-Servers.
-
Geben Sie für FORM-Authentifizierung die folgenden Details an:
-
Wählen Sie für den Formulartyp eine der folgenden Optionen aus:
- Steuern
- Klicken Sie auf diese Option, wenn Sie die Anmeldeseite nicht aufrufen möchten.
- Indirekt
- Klicken Sie auf diese Option, wenn Sie die Anmeldeseite aufrufen und die Parameter im Anmeldeformular ausfüllen möchten.
-
Füllen Sie die folgenden Felder aus, wenn Sie Direkt wählen:
- Formular Aktion url
- Die Formularaktion URL, die zum Absenden des Formulars erforderlich ist.
- Formular-Methode
- Geben Sie GET an.
-
Füllen Sie die folgenden Felder aus, wenn Sie "Indirekt" wählen:
- Anmeldeformular url
- Dieses Feld ist erforderlich, wenn Sie den Formulartyp "Indirekt" auswählen.
- Formularname
- Dieses Feld ist erforderlich, wenn Sie den Formulartyp "Indirekt" auswählen.
- Formular-Methode
- Geben Sie POST an.
-
Im Abschnitt "Formularparameter" wird eine Liste der Schlüssel-Wert-Paare der Formularparameter angezeigt.
Füllen Sie die Felder "Schlüssel" und "Wert" aus und klicken Sie dann auf +, um einen oder mehrere Formularparameter hinzuzufügen.
-
-
-
Optional: Wenn Sie einen Proxyserver für den Zugriff auf den Datenquellenserver verwenden, setzen Sie im Abschnitt Proxyeinstellungen den Schalter Proxyeinstellungen aktivieren auf
On. Fügen Sie Werte zu den folgenden Feldern hinzu:- Benutzername
- Der Proxyserver-Benutzername, der für die Authentifizierung beim Proxyserver verwendet werden soll, wenn der Proxyserver eine Authentifizierung erfordert.
- Kennwort
- Das Kennwort für den Proxyserver, das für die Authentifizierung beim Proxyserver verwendet wird, wenn der Proxyserver eine Authentifizierung erfordert.
- Proxy-Server-Domänen
- Die Domäne(n), in der/denen sich die Hosts befinden. Sie können in diesem Feld ein Platzhalterzeichen angeben, z. B. einen Stern (
*), um alle Domänen zu durchsuchen, oder einen führenden Stern (*.server1.bar.com), um Domänen zu durchsuchen, die einem Muster entsprechen. - Hostname oder IP-Adresse des Proxyservers
- Der Hostname, wenn Sie über ein LAN auf den Server zugreifen möchten, oder die IP-Adresse des Servers, den Sie als Proxyserver verwenden möchten.
- Portnummer des Proxy-Servers
- Der Netzwerkport, mit dem Sie sich auf dem Proxy-Server verbinden möchten.
-
Optional: Füllen Sie die folgenden Felder in der erweiterten Konfiguration aus:
- Zu verwendende Code-Seite
-
Geben Sie die Zeichenkodierung der Website-Seiten an. Wenn keine Angabe gemacht wird, wird der Standardwert
UTF-8verwendet.Wenn Sie chinesische Websites crawlen, geben Sie
UTF-8an. - URL Pfadtiefe
-
Die Ebene der zu durchsuchenden Website-Pfade.
Wenn Sie beispielsweise den Startpunkt URL von
https://www.example.comund eine Pfadtiefe von4angeben, greift der Crawler auf die Seitehttps://www.example.com/some/more/examples/index.htmlzu, die sich in einem Pfad befindet, der vier Ebenen vom Stammverzeichnis URL entfernt ist.Sie können nur einen positiven Wert eingeben. Wenn nicht anders angegeben, ist der Standardwert
5. Die maximal zulässige Pfadtiefe ist20. - Maximale Sprünge
-
Die Anzahl der aufeinanderfolgenden Links, denen man von Anfang an folgen muss URL.
Wenn nicht anders angegeben, ist der Standardwert
5. Die maximale Anzahl von Links, denen der Crawler folgen kann, ist20. Um keine Sprünge zuzulassen, geben Sie0ein. - robots.txt ignorieren
-
Aktivieren Sie diese Einstellung, wenn Sie möchten, dass der Crawler die Erlaubnis- und Ablehnungsregeln ignoriert, die von der Website in ihrer robots.txt-Datei angegeben sind.
Beachten Sie, dass Websites die Datei in der Regel verwenden, um die Crawl-Ergebnisse zu verbessern. Sie könnten beispielsweise die Datei robots.txt verwenden, um zu verhindern, dass doppelte Informationen gecrawlt werden, um zu verhindern, dass Inhaltsentwürfe gelesen werden, oder um das Crawlen zu verzögern, um ihre Website nicht zu überlasten.
- Regeln zum Crawlen der Domäne
-
Geben Sie die Domänennamen an, die Sie dem Crawler entweder erlauben oder verbieten wollen, zu crawlen.
Bei Domänennamen wird zwischen Groß- und Kleinschreibung unterschieden, und das Platzhalterzeichen (*) kann an beliebiger Stelle im Domänennamen vorkommen.
Die Reihenfolge der Regeln ist von Bedeutung. Der Crawler wendet die erste Regel an, die auf einen Kandidaten URL zutrifft. Die Standardregel, forbid domain *, verbietet jegliches Web-Crawling und muss in der Liste der Domainregeln an letzter Stelle stehen.
Sie können z. B. folgende Arten von Regeln definieren:
-
Um die gesamte Domäne ibm.com auszuschließen:
forbid domain www.ibm.com -
Um jede Domäne zu crawlen, die mit
ibm.comendet:allow domain *.ibm.com -
Um nur Port
443auf IBM-Domänen zu crawlen, die mitserverbeginnen:allow domain server*.ibm.com:443
-
- Regeln zum Crawlen von URL-Präfixen
-
Geben Sie die Präfixe HTTP und HTTPS an, die Sie dem Crawler entweder erlauben oder verbieten möchten.
Das Platzhalterzeichen (*) kann ein- oder mehrmals in der URL vorkommen.
Die Reihenfolge der Regeln ist von Bedeutung. Der Crawler wendet die erste Regel an, die auf einen Kandidaten URL zutrifft.
Sie können z. B. folgende Arten von Regeln definieren:
-
Zum Crawlen von Seiten im öffentlichen Verzeichnis dieser Domäne:
allow prefix http://*.ibm.com/public/* -
Um alle anderen Verzeichnisse in dieser Domäne auszuschließen:
forbid prefix http://*.ibm.com/*
-
- Erweiterte Crawler-Eigenschaften
-
Nur auf Anweisung des IBM Supports verwenden.
-
Optional: Wenn Sie alle SSL-Zertifikate auf der Ziel-Website ignorieren möchten, setzen Sie den Schalter Zertifikat ignorieren auf
On.Diese Option gilt nur für HTTPS-URLs.
-
Wenn Sie möchten, dass der Crawler Text aus Bildern auf der Website extrahiert, erweitern Sie Weitere Verarbeitungseinstellungen und setzen Sie optische Zeichenerkennung (OCR) anwenden auf
On.Wenn OCR aktiviert ist und Ihre Dokumente Bilder enthalten, dauert die Verarbeitung länger. Weitere Informationen finden Sie unter Optische Zeichenerkennung.
-
Klicken Sie auf Beenden.
Die Sammlung ist schnell erstellt. Die Verarbeitung der Daten nimmt mehr Zeit in Anspruch, da sie der Sammlung hinzugefügt werden.
Wenn Sie den Fortschritt überprüfen möchten, gehen Sie auf die Seite Aktivität. Klicken Sie im Navigationsbereich auf Sammlungen verwalten und dann auf , um die Sammlung zu öffnen.