Sammlungen erstellen

Eine Sammlung ist eine Reihe von Dokumenten, die Sie einem Projekt hinzufügen, um sie zu analysieren, anzureichern und nützliche Informationen daraus zu extrahieren.

Sie können Ihrem Projekt auf folgende Weise Daten hinzufügen:

  • Laden Sie lokal zugängliche Dateien über die Benutzeroberfläche des Produkts hoch. Diese Methode eignet sich am besten für den Einstieg und zum Testen Ihres Anwendungsfalls.

  • Einrichten eines geplanten Crawls von Dokumenten, die in einer externen Datenquelle gespeichert sind.

    Die Benutzeroberfläche des Produkts bietet mehrere integrierte Datenquellenkonnektoren, aus denen Sie wählen können. Die Optionen hängen von der Art der Bereitstellung ab. Weitere Informationen finden Sie unter Unterstützte Datenquellen.

  • Stellen Sie eine Verbindung zu einer externen Datenquelle her, für die keine integrierte Unterstützung verfügbar ist:

    IBM Cloud
    Verwenden Sie IBM App Connect, um einen geplanten Crawl von Dokumenten einzurichten, die in anderen externen Datenquellen gespeichert sind.
    IBM Cloud Pak for Data IBM Software Hub
    Erstellen Sie einen Konnektor zum Durchsuchen von Dokumenten, die in anderen externen Datenquellen gespeichert sind.
  • Um den Prozess des Hinzufügens von Daten zu Ihrem Projekt zu automatisieren, verwenden Sie die Discovery APIs, um eine Sammlung zu erstellen und Dokumente in diese hochzuladen.

Wenn Sie Dokumente zu Discovery hinzufügen, werden die Originaldokumente gecrawlt, und die Informationen aus den Dokumenten werden in einem Index gespeichert, damit sie später angereichert und analysiert oder abgerufen werden können. Nicht alle Inhalte des Originaldokuments werden beibehalten. Zum Beispiel werden Bilder aus.ppt- oder.doc-Dateien nicht gespeichert. Weitere Informationen finden Sie unter Wie Ihre Datenquelle verarbeitet wird.

IBM Cloud Nachdem Sie eine Sammlung erstellt haben, können Sie auf Datenvorschau klicken, um eine Vorschau der Daten in der erweiterten Dokumentenansicht anzuzeigen.

Auswählen, was in eine Sammlung aufgenommen werden soll

Bei der Entscheidung, wie Sie Ihre Quellinhalte in Sammlungen aufteilen, sind einige Dinge zu beachten.

  • Abrufen von Inhalten aus verschiedenen Datenquellen

    Wenn Sie ähnliche Inhalte in mehr als einer Art von Datenquelle speichern (z. B. eine Website und Salesforce ), können Sie ein Projekt mit zwei separaten Sammlungen erstellen. Jede Sammlung enthält Dokumente aus einer einzigen Datenquelle. Wenn sie in einem einzigen Projekt zusammengeführt werden, kann ein Benutzer in beiden Quellen gleichzeitig suchen.

  • Anwendung von Anreicherungen

    Das Anlegen einer Sammlung ist eine gute Möglichkeit, Dokumente zu gruppieren, die Sie auf ähnliche Weise anreichern möchten. Vielleicht enthält eine Teilmenge Ihrer Dokumente Branchenjargon und Sie möchten ein Wörterbuch hinzufügen, das die Begriffe erkennt. Sie können eine separate Sammlung anlegen und die Funktion für Begriffsvorschläge nutzen, um die Erstellung des Wörterbuchs zu beschleunigen.

  • Erstellung separater Smart Document Understanding (SDU)-Modelle

    Sie können das Werkzeug Smart Document Understanding verwenden, um Inhalte anhand der Struktur eines Dokuments zu identifizieren. Wenn Sie 20 PDF-Dateien haben, die von Ihrer Vertriebsabteilung erstellt wurden und eine Vorlage verwenden, und 20 PDF-Dateien, die von Ihrer Forschungsabteilung erstellt wurden und eine andere Vorlage verwenden, gruppieren Sie jedes Set in eine eigene Sammlung. Sie können dann das SDU-Tool verwenden, um ein Modell für jede Struktur separat zu erstellen, ein Modell, das die einzigartige Struktur versteht. Sie können das Tool auch verwenden, um benutzerdefinierte Felder zu definieren, die nur in den Quelldokumenten vorkommen.

Objektgruppe erstellen

Bevor Sie eine Sammlung erstellen können, müssen Sie ein Projekt erstellen. Weitere Informationen finden Sie unter Projekte erstellen.

Was Sie beachten sollten:

  • Eine Sammlung kann nur eine externe Datenquelle unterstützen.
  • Die Dokumente in der Sammlung dürfen nur in einer Sprache vorliegen, nämlich in der Sprache, die Sie für die Sammlung angegeben haben.

Führen Sie die folgenden Schritte aus, um eine Objektgruppe zu erstellen:

  1. Öffnen Sie ein Projekt, gehen Sie zur Seite Sammlungen verwalten, und klicken Sie auf Neue Sammlung.

    • Die Projekttypen Intelligente Dokumentenverarbeitung, Konversationssuche, Dokumentenabruf und Benutzerdefiniert können bis zu 5 Sammlungen enthalten.
    • Ein Content-Mining-Projekt kann nur 1 Sammlung enthalten.
  2. Laden Sie Daten in Ihre Sammlung hoch.

    IBM Cloud Um eine Verbindung zu einer anderen Datenquelle herzustellen, anstatt Daten hochzuladen, klicken Sie auf den Link neben dem Feld Muss eine Verbindung zu einer Datenquelle hergestellt werden?

    Sie können die folgenden Möglichkeiten wählen, um eine Verbindung zu einer Datenquelle herzustellen, anstatt Daten hochzuladen.

Informationen zur Fehlerbehebung bei Problemen, die beim Hinzufügen von Dokumenten zu einer Sammlung auftreten können, finden Sie unter Fehlerbehebung bei der Aufnahme von Dokumenten.

Weitere Informationen zur programmgesteuerten Erstellung einer Sammlung finden Sie in der API-Referenzdokumentation.

Optische Zeichenerkennung

Eine der optionalen Funktionen, die Sie bei der Erstellung einer Sammlung anwenden können, ist die optische Zeichenerkennung. Die OCR-Funktion (Optical Character Recognition) extrahiert Text aus Bildern. Diese Funktion ist nützlich für die Erhaltung von Informationen, die in Diagrammen oder Grafiken dargestellt sind, oder von Text, der in Dateien wie gescannten PDFs eingebettet ist. Durch die Umwandlung der visuellen Informationen in Text können sie später durchsucht werden.

Eine neue Version der Technologie wurde in Cloud-verwalteten Instanzen eingeführt. OCR v2 wurde von IBM Research entwickelt, um Text besser aus gescannten Dokumenten und anderen Bildern zu extrahieren, die die folgenden Einschränkungen aufweisen:

  • Schlechte Bildqualität aufgrund falscher Scannereinstellungen, unzureichender Auflösung, schlechter Beleuchtung (z. B. bei mobiler Erfassung), Schärfeverlust, falsch ausgerichteter Seiten und schlecht gedruckter Dokumente
  • Dokumente mit unregelmäßigen Schriftarten oder verschiedenen Farben, Schriftgrößen und Hintergründen

Was ist zu beachten, wenn Sie OCR aktivieren?

  • Die Zeit, die zum Einlesen eines Dokuments mit Bildern benötigt wird, erhöht sich, wenn OCR aktiviert ist.
  • OCR unterstützt derzeit nicht die Extraktion von handgeschriebenem Text aus Dokumenten und gescannten Bildern.
  • OCR kann sowohl klare als auch verrauschte Bilder lesen. Es kann verrauschte Bilder in Graustufen umwandeln und sie glätten und schräg stellen. Die Bildqualität muss jedoch die Mindestanforderung von 80 DPI (dots per inch) erfüllen.
  • OCR kann viele Sprachen erkennen, aber die Sprache des Textes im Bild muss mit der Sprache übereinstimmen, die für die Sammlung angegeben ist, der die Datei hinzugefügt wird.

Weitere Informationen zu den Sprachen, für die OCR v1 und OCR v2 unterstützt werden, finden Sie unter Sprachunterstützung.

Eine Liste der Dateitypen, auf die Sie OCR anwenden können, finden Sie in der Tabelle Unterstützte Dateitypen.

Ermöglichung von Stemming für unkuratierte Daten

Sie können Discovery so konfigurieren, dass bei der Erstellung einer Sammlung Stemming anstelle von Lemmatisierung zur Normalisierung verwendet wird. Diese Konfiguration ist nur gelegentlich nützlich, wenn Sammlungen, Abfragen oder beides Daten mit vielen Rechtschreibfehlern, fehlenden Akzentzeichen und grammatikalischen Fehlern enthalten.

Discovery normalisiert Wörter, um eine schnellere Erkennung und Zuordnung von Wörtern und ihren verschiedenen Formen zu ermöglichen, z. B. Pluralformen oder alternative Verbkonjugationen. Standardmäßig verwendet Discovery die Lemmatisierung, um Wörter auf der Grundlage ihrer Bedeutung zu normalisieren. Beim Stemming werden Wörter normalisiert, indem nur Wortstämme verwendet werden.

Die Lemmatisierung ist präziser, funktioniert aber am besten bei kuratierten Daten. Wenn Ihre Daten nicht gut kuratiert sind, könnte Stemming besser funktionieren. In der Regel wird derselbe Wortstamm erkannt, unabhängig davon, ob ein Wort richtig geschrieben ist oder nicht. Es kann jedoch sein, dass die Lemmatisierung ein falsch geschriebenes Wort nicht erkennt oder seine Bedeutung falsch interpretiert. Infolgedessen kann der Lemmatisierer den falschen Wortstamm hinzufügen, um das falsch geschriebene Wort im Index darzustellen. Eine Suche nach einer gestammten Version eines falsch geschriebenen Wortes führt wahrscheinlich zu besseren Ergebnissen als eine Suche nach einem falsch lemmatisierten Wort.

Die folgende Tabelle zeigt Beispiele dafür, wie einige Wörter gestammt bzw. lemmatisiert werden.

Vergleich zwischen Stemmer und Lemmatisierer
Oberflächenform Lemmatisierte Form Gestielte Form
wird ausgeführt Ausführung Ausführung
ran Ausführung ran
ausbilder ausbilder anweisen
Instruktion Instruktion anweisen

Wie Sie aus den Beispielen ersehen können, erfasst der Lemmatizer die Wortbedeutungen besser als der Stemmer. Sowohl running als auch ran werden als verschiedene Formen desselben Stammverbs run erkannt. Und der Bedeutungsunterschied zwischen den beiden Substantiven Ausbilder und Unterweisung bleibt erhalten. Wenn die Daten jedoch Rechtschreibfehler wie instructer und instructoin enthalten, liefert die normalisierte Form, die durch Stemming (instruct ) erzeugt wird, bessere Treffer.

Discovery normalisiert Wörter, wenn es Daten in den Index aufnimmt und speichert, und zur Laufzeit, wenn es Abfragen analysiert, die von Benutzern eingereicht werden. Für beide Vorgänge wird dieselbe Normalisierungsmethode verwendet, auch wenn der eine Vorgang auf der Sammlungsebene und der andere auf der Projektebene stattfindet. Wenn eine Abfrage eingereicht wird, wird sie an jede Sammlung innerhalb des Projekts weitergeleitet, wo die Abfrage auf der Grundlage der Konfiguration der jeweiligen Sammlung normalisiert wird. Sammlungen, die für die Verwendung des Stemmers konfiguriert sind, normalisieren die Abfrage mithilfe des Stemmings. Die Sammlungen, die nicht sind, normalisieren die Abfrage durch Lemmatisierung.

Um beim Erstellen der Sammlung den Stemmer anstelle des Lemmatisierers zu aktivieren, erweitern Sie Weitere Verarbeitungsoptionen und setzen Sie den Schalter Stemming anstelle von Lemmatisierung beim Indizieren verwenden auf Ein.

Wenn Sie Discovery so konfigurieren, dass der Stemmer verwendet wird, sollten Sie auch die Abfragen, die Informationen aus der Sammlung extrahieren, so gestalten, dass Zeichenunterschiede beim Abgleich berücksichtigt werden. Weitere Informationen finden Sie unter dem Operator Stringvariation.

Weitere Informationen zu den Sprachen, für die der Stemmer unterstützt wird, finden Sie unter Sprachunterstützung.

Erhebungsgrenzen

Die Anzahl der Sammlungen, die Sie pro Projekt erstellen können, ist je nach Projekttyp unterschiedlich.

Erhebungen nach Projektgrenzen
Projekttyp Sammlungen pro Projekt
Intelligente Dokumentenverarbeitung 5
Dokumentabruf 5
Dokumentenabruf für Verträge 5
Dialogsuche 5
Content Mining 1
Angepasst 5

Die Anzahl der Sammlungen, die Sie pro Serviceinstanz erstellen können, hängt von der Art Ihres Discovery Plans ab.

Plandetails
Planen Sammlungen pro Dienstinstanz
Cloud Pak for Data 300
Premium 300
Enterprise 300
Plus (enthält Testversion) 40

IBM Cloud Pak for DataIBM Software Hub Die Anzahl der Sammlungen, die Sie erstellen können, hängt von Ihrer Hardwarekonfiguration ab. Discovery unterstützt maximal 300 Sammlungen pro Instanz und Installation, aber diese Anzahl hängt von vielen Faktoren ab, unter anderem vom Arbeitsspeicher.

Unterstützte Dateitypen

Discovery können bestimmte Dateitypen einlesen. Bei allen anderen Dateitypen wird eine Warnmeldung angezeigt, und die Datei wird nicht eingelesen.

Die folgende Tabelle zeigt die unterstützten Dateitypen und Informationen über die Unterstützung von Funktionen, die je nach Dateityp variieren.

Dateityp Unterstützung der Textextraktion Unterstützung von Smart Document Understanding (SDU) Unterstützung von OCR (Optical Character Recognition)
CSV Häkchen-Symbol
DOC, DOCX Häkchen-Symbol Häkchen-Symbol Häkchen-Symbol
GIF Häkchen-Symbol
HTML Häkchen-Symbol
jpg Häkchen-Symbol Häkchen-Symbol Häkchen-Symbol
JSON Häkchen-Symbol
PDF Häkchen-Symbol Häkchen-Symbol Häkchen-Symbol
PNG Häkchen-Symbol Häkchen-Symbol Häkchen-Symbol
PPT, PPTX Häkchen-Symbol Häkchen-Symbol Häkchen-Symbol
TIFF Häkchen-Symbol Häkchen-Symbol Häkchen-Symbol
TXT Häkchen-Symbol
XLS, XLSX Häkchen-Symbol Häkchen-Symbol

  • Sie können PDF-Dateien mit Hilfe von PDF-Erzeugungsprogrammen wie Adobe Acrobat, Microsoft Office, Preview von Apple und anderen erstellen.

Die Vektorobjekte, vektorisierten Texte und SVG-Bilder werden bei der Verarbeitung von PDFs ignoriert. Außerdem unterstützt Discovery derzeit keine Textextraktion aus Bildern mit Transparenzebenen oder Transparenzgruppen in PDFs.

  • Es werden nur Bilder der unterstützten Bilddateitypen gerendert, die in der PDF-Datei vorkommen.
  • Verwenden Sie für gescannte Bilder 300 dpi oder mehr, um eine optimale OCR zu gewährleisten. Die Mindestdpi müssen gemäß den Richtlinien für die optische Zeichenerkennung 80 betragen
  • Es werden nur einseitige Bilddateien unterstützt.
  • Dateien in komprimierten Archivdateien (ZIP, GZIP, TAR) werden extrahiert. Discovery nimmt die unterstützten Dateitypen im Archiv auf. Alle anderen Dateitypen werden ignoriert. Die Dateinamen müssen in UTF-8 kodiert sein. Dateien mit Namen, die z. B. japanische Schriftzeichen enthalten, müssen umbenannt werden, bevor sie der ZIP-Datei hinzugefügt werden.
  • Discovery unterstützt komprimierte Mac OS-Dateien nur, wenn diese mit einem Befehl wie dem folgenden generiert wurden: zip -r my-folder.zip my-folder -x "*.DS_Store". ZIP-Dateien, die durch Rechtsklick auf einen Ordner und Klicken auf Komprimieren erstellt werden, werden nicht unterstützt.
  • PDF-Dateien, die Sie als Teil einer Archivdatei hochladen, werden in der erweiterten Ansicht für ein Abfrageergebnis, das Sie über die Seite Verbessern und Anpassen öffnen, nicht angezeigt. Wenn Sie möchten, dass die Datei in der erweiterten Ansicht angezeigt werden kann, importieren Sie die PDF-Datei separat von der Archivdatei erneut.

Wenn Sie Dateien zu einem Projekt des Typs Document Retrieval for Contracts hinzufügen, werden alle Dateitypen, die SDU und OCR unterstützen, automatisch mit einem vorab trainierten Modell für Smart Document Understanding und Optical Character Recognition verarbeitet.

Grenzen des Dokuments

Die Anzahl der Dokumente, die pro Service-Instanz zulässig sind, hängt von Ihrem Discovery Plan-Typ ab.

Das Dokumentenlimit bezieht sich auf die Anzahl der Dokumente im Index. Laden Sie zu Beginn weniger Dokumente hoch, wenn die von Ihnen geplanten Anreicherungen die Anzahl der Dokumente später erhöhen könnten. Die folgenden Konfigurationen erzeugen zum Beispiel mehr Dokumente:

  • Wenn Sie ein Dokument aufteilen, wird das Dokument in mehrere Dokumente aufgeteilt
  • CSV-Dateien, die Sie hochladen, erzeugen ein Dokument pro Zeile
  • Datenbankdatenquellen, die Sie crawlen, erzeugen ein Dokument pro Datenbankzeile
  • Jedes Objekt, das in einem Array in einer JSON-Datei definiert ist, ergibt ein eigenes Dokument
Anzahl der Dokumente pro Dienstinstanz
Planen Dokumente pro Dienstinstanz
Cloud Pak for Data Uneingeschränkt
Premium Uneingeschränkt
Enterprise Uneingeschränkt
Plus (enthält Testversion) 500.000

Beim Enterprise-Tarif werden Sie nach 100.000 Dokumenten pro Monat zur Kasse gebeten. Weitere Informationen zur Preisgestaltung finden Sie unter Discovery-Preispläne.

Die maximal zulässige Anzahl kann je nach Größe der Dokumente leicht variieren. Verwenden Sie diese Werte als allgemeine Richtwerte.

Grenzen der Dateigröße

Gecrawlte Dokumente

Die maximale Größe jeder Datei, die Sie mithilfe eines Connectors crawlen können, ist je nach Bereitstellungstyp unterschiedlich.

IBM Cloud Verwaltete Einsätze auf IBM Cloud

  • Nur Premium-Tarife:

    • Box: 50 MB
    • IBM Cloud Objektspeicher: 50 MB
    • Salesforce Files objekte: 50 MB
    • Alle anderen Datenquellen: 10 MB
  • Alle anderen Pläne: 10 MB

IBM Cloud Pak for DataIBM Software Hub Installierte Einsätze auf IBM Cloud Pak for Data

  • Alle Datenquellen: 32 MB

Hochgeladene Dokumente

Die Größe der einzelnen Dateien, die Sie hochladen können, hängt von der Art Ihres Discovery Plans ab. Einzelheiten finden Sie in der folgenden Tabelle Maximale Dokumentgröße.

Maximale Dokumentgröße
Planen Dateigröße pro Dokument
Cloud Pak for Data 50 MB
Premium 50 MB
Enterprise 10 MB
Plus (enthält Testversion) 10 MB

Feldgrenzen

Wenn ein Dokument zu einer Sammlung hinzugefügt wird, wird der Inhalt des Dokuments ausgewertet und zu den entsprechenden Feldern in einem internen Index hinzugefügt.

Bei strukturierten Daten, wie z. B. hochgeladenen CSV- oder JSON-Dateien oder Daten aus gecrawlten Datenbanken, wird jede Spalte bzw. jedes Objekt als Feld der Stammebene gespeichert. Wenn Sie beispielsweise eine CSV-Datei zur Sammlung hinzufügen, wird jede Spalte der CSV-Datei als separates Feld im Index gespeichert.

Es können maximal 1.000 Felder in den Index aufgenommen werden.

Sie können den Datentyp eines Feldes, z. B. Datum oder String, nicht zuweisen. Der Datentyp wird automatisch erkannt und dem Feld beim Einlesen des Dokuments zugewiesen. Die Zuordnung erfolgt auf der Grundlage des Datentyps, der im ersten indizierten Dokument erkannt wird. In nachfolgenden Dokumenten kann es zu Übernahmefehlern kommen, wenn für den Wert desselben Feldes ein anderer Datentyp erkannt wird. Wenn Ihre Dokumente eine Mischung aus verschiedenen Datentypen in einem einzigen Feld enthalten, nehmen Sie daher zuerst das Dokument auf, das einen Wert mit dem flexibelsten Datentyp, wie z. B. String, im Feld enthält.

Wenn Sie eine Website crawlen oder eine HTML-Datei hochladen, wird der HTML-Inhalt der Sammlung hinzugefügt und in einem html Feld indiziert.

In der folgenden Tabelle ist die maximale Größe der Felder pro Dokument angegeben.

Maximale Feldgrößen
Feldtyp Maximal zulässige Größe pro Dokument
Feld html 5 MB
Summe aller anderen Felder 1 MB

Wenn die maximale Größe der Felder im Dokument die zulässigen Grenzen überschreitet, werden sie wie folgt behandelt:

  • Bei einem Dokument mit einem übergroßen Feld html werden alle Felder des Dokuments mit Ausnahme des Feldes html indiziert.

    Für IBM Cloud Pak for Data Version 4.0 und früher wird das gesamte Dokument nicht indiziert.

  • Bei einem Dokument mit übergroßen Nicht-HTML-Feldern wird das Dokument nicht indiziert.

Wenn Sie eine Microsoft Excel-Datei hochladen und eine Meldung angezeigt wird, die darauf hinweist, dass die Größenbeschränkung für Nicht-HTML-Felder überschritten wurde, sollten Sie die XLS-Datei in eine CSV-Datei konvertieren. Wenn Sie eine CSV-Datei (Comma-Separated Value) hochladen, wird jede Zeile als separates Dokument indiziert. Dadurch werden keine Feldgrößengrenzen überschritten.

Weitere Informationen darüber, wie Felder in hochgeladenen Dateien behandelt werden, finden Sie unter Wie Felder behandelt werden.

Unterstützte Datenquellen

Die folgende Tabelle zeigt die unterstützten Datenquellen für jeden Implementierungstyp.

Unterstützte Datenquellen
Diese Tabelle enthält Zeilen-und Spaltenüberschriften. Die Zeilenüberschriften geben unterstützte Datenquellen an. Die Spaltenüberschriften geben die verschiedenen Optionen für den Produktimplementierungstyp an. Um zu verstehen, welche Datenquellen für Ihren Bereitstellungstyp verfügbar sind, wechseln Sie zu der Zeile, die die Datenquelle beschreibt, und suchen Sie die Spalten für den Bereitstellungstyp, an dem Sie interessiert sind.
Datenquelle IBM Cloud IBM Cloud Pak for Data
Box Häkchen-Symbol Häkchen-Symbol
Datenbank (IBM Data Virtualization, IBM Db2, Microsoft SQL, Oracle, Postgres) Häkchen-Symbol
FileNet P8 Häkchen-Symbol
HCL Notes Häkchen-Symbol
IBM Cloud Object Storage Häkchen-Symbol
Lokales Dateisystem Häkchen-Symbol
Salesforce Häkchen-Symbol Häkchen-Symbol
Microsoft SharePoint Online Häkchen-Symbol Häkchen-Symbol
Microsoft SharePoint (lokal) Häkchen-Symbol Häkchen-Symbol
Website Häkchen-Symbol Häkchen-Symbol
Microsoft Windows dateisystem Häkchen-Symbol

Planungsoptionen für die Crawlersuche

Wenn Sie eine Sammlung erstellen, wird die erste Crawlersuche sofort gestartet. Die Häufigkeit, die Sie für den Crawl-Zeitplan wählen, bestimmt, wann der nächste Crawl beginnt.

Führen Sie die folgenden Schritte aus, um einen Crawl-Zeitplan zu erstellen:

  1. Wählen Sie im Abschnitt Crawl-Zeitplan eine Häufigkeit aus.

    Sie können den Crawler so planen, dass er an einem bestimmten Tag und zu einer bestimmten Uhrzeit läuft. Diese Option ist hilfreich, wenn Sie eine starke Belastung des Zielsystems während der Geschäftszeiten vermeiden wollen. Wenn Sie eine Stunde im Bereich von 1 - 9 angeben, fügen Sie eine Null vor der Stundenziffer hinzu. Sie können den Crawl zum Beispiel für 01:00 AM an Samstagen planen.

    IBM Cloud Wenn Sie einen Crawl für eine monatliche Ausführung planen, sind die Optionen für die Tagesanzahl auf 1 bis 28 beschränkt, da Sie einen Tag angeben müssen, der in jedem Monat vorkommt, einschließlich Februar, der 28 Tage hat.

    IBM Cloud Pak for Data Installierte Bereitstellungen haben mehr Zeitplanoptionen:

    • Wenn Sie alle 12 Stunden oder alle 10 Tage crawlen möchten, wählen Sie Benutzerdefinierte Intervalle. Sie können den Crawler so planen, dass er an einer bestimmten Anzahl von Tagen oder Stunden läuft.
    • Standardmäßig wird der Crawl in den verkehrsschwachen Zeiten gestartet.
    • Stellen Sie das Intervall nicht kürzer ein als die Zeit, die der Crawl braucht, um zu Ende zu gehen.
    • Konfigurieren Sie nicht mehrere Crawler, die in kurzen Abständen laufen.
    • Wenn Sie eine Sammlung in einer anderen Zeitzone als derjenigen öffnen, in der die Sammlung erstellt wurde, werden die Informationen zum UTC-Versatz (Coordinated Universal Time) angezeigt.
  2. IBM Cloud Pak for DataIBM Software Hub Installierte Bereitstellungen haben einen Abschnitt Weitere Planungseinstellungen, in dem Sie die Art des Zeitplans für das Crawlen der Datenquelle auswählen können.

    Die Auswahlmöglichkeiten für alle Konnektoren (mit Ausnahme des Web-Crawl-Konnektors ) sind wie folgt:

    • Vollständiges Crawling: Die externe Datenquelle wird erneut gecrawlt, um die Dokumente in der Sammlung zu aktualisieren.
    • Crawling-Updates (Suche nach neuen, geänderten und gelöschten Inhalten): Aktualisiert die Sammlung nur, wenn Daten in der externen Datenquelle seit dem letzten Crawling hinzugefügt, geändert oder gelöscht wurden.
    • Crawlen neuer und geänderter Inhalte: Aktualisiert die Sammlung nur, wenn Daten in der externen Datenquelle seit dem letzten Crawlen hinzugefügt oder geändert wurden.

    Nur Web-Crawl-Konnektor: Der Web-Crawl-Connector plant Crawls anders als die anderen Connector-Typen. Wählen Sie nur für den Web Crawl Connector eine der folgenden Optionen:

    • Um die Häufigkeit der Crawls selbst zu steuern, wählen Sie diese Option:

      Vollständige Crawlersuche

      Wenn Sie einen vollständigen Crawl-Zeitplan wählen, erfolgt der Crawl mit der Häufigkeit, die Sie im Abschnitt Crawl-Zeitplan auf der Seite angeben.

    • Damit das System die Häufigkeit der Crawls für Sie verwalten kann, wählen Sie eine der folgenden Optionen:

      Crawling von Updates (Suche nach neuen, geänderten und gelöschten Inhalten) oder Crawling von neuen und geänderten Inhalten

      Wenn Sie einen Zeitplantyp wählen, der nach Updates oder nach neuen und geänderten Inhalten sucht, wird die Häufigkeit, die Sie für den Crawl-Zeitplan angeben, ignoriert. Die Häufigkeit, mit der jedes Dokument gecrawlt wird, ist variabel und wird vollständig vom Dienst verwaltet. Und die Häufigkeit hängt davon ab, wie oft Änderungen in einem Dokument gefunden werden. Wenn sich beispielsweise 5 der 10 Dokumente in einer Sammlung bis zum Ende des ersten Crawl-Intervalls geändert haben, wird die Häufigkeit für diese 5 Dokumente automatisch erhöht. Derzeit können diese selbstverwalteten Aktualisierungen höchstens einmal täglich durchgeführt werden.

      Sie können die automatische Verwaltung der Häufigkeit nicht unterbrechen und Sie können keinen einmaligen Crawl auslösen, wenn diese Arten von geplanten Crawls konfiguriert sind.

Wenn Sie die Einstellungen für den flexiblen Crawl-Zeitplan später ändern möchten, können Sie die Seite Verarbeitungseinstellungen aufrufen, die Einstellungen bearbeiten und dann auf Änderungen übernehmen und erneut verarbeiten klicken.

IBM Cloud Der nächste geplante Crawl wird auf der Seite Aktivität angezeigt.

Wenn Sie die Planungshäufigkeit ändern, ist die nächste geplante Crawl-Zeit möglicherweise nicht die, die Sie erwarten. Die Crawls sind standardmäßig so eingestellt, dass sie regelmäßig zu einer bestimmten Uhrzeit oder an einem bestimmten Tag stattfinden. Wenn Sie beispielsweise den Crawl-Zeitplan am 11. August von wöchentlich auf monatlich ändern, könnte der nächste Crawl für den 31. August statt für den 11. September geplant sein. Sie ist nicht für genau einen Monat ab dem Tag, an dem Sie die Änderung vorgenommen haben, vorgesehen. Stattdessen wird er an dem Tag ausgeführt, der als Standardtag für die gewählte Crawl-Frequenz festgelegt ist.

Anhalten eines Kriechvorgangs

Sie können einen Crawl stoppen, ohne die Häufigkeit des Crawl-Zeitplans zu ändern. Diese Aktion ist hilfreich, wenn Sie eine zeitaufwändige Aufgabe durchführen möchten und nicht wollen, dass der Crawl zwischen den Aufgaben gestartet oder ausgeführt wird.

IBM Cloud Führen Sie die folgenden Schritte aus, um einen Kriechvorgang zu beenden:

  1. Öffnen Sie im Navigationsbereich die Seite Sammlungen verwalten.

  2. Wählen Sie die Sammlung aus, für die Sie das Crawling stoppen möchten.

  3. Klicken Sie auf der Seite Aktivität auf Anhalten, wenn das Crawlen im Gange ist.

  4. Rufen Sie die Seite mit den Verarbeitungseinstellungen auf.

  5. Setzen Sie Zeitplan anwenden auf Nein, und klicken Sie dann auf Änderungen übernehmen und erneut verarbeiten.

    Der Kriechgang ist gestoppt und wird erst wieder gestartet, wenn Sie ihn neu starten.

IBM Cloud Führen Sie die folgenden Schritte aus, um den Crawl neu zu starten:

  1. Öffnen Sie im Navigationsbereich die Seite Sammlungen verwalten.

  2. Wählen Sie die Sammlung aus, für die Sie den Crawl neu starten möchten.

  3. Rufen Sie die Seite mit den Verarbeitungseinstellungen auf.

  4. Setzen Sie Zeitplan anwenden auf Ja, und klicken Sie dann auf Änderungen übernehmen und erneut verarbeiten.

    Das Krabbeln beginnt sofort.

    Der nächste Crawl beginnt mit der Häufigkeit, die in den Crawl-Zeitplanoptionen ausgewählt wurde. Wenn Sie den Crawl zu einem beliebigen Zeitpunkt vor der geplanten Häufigkeit starten möchten, klicken Sie auf der Seite Aktivität auf Neu crawlen.

IBM Cloud Pak for Data IBM Software Hub

Sie können einen laufenden Crawlvorgang vorübergehend stoppen.

Um einen Kriechvorgang vorübergehend zu stoppen, führen Sie die folgenden Schritte aus:

  1. Öffnen Sie im Navigationsbereich die Seite Sammlungen verwalten.

  2. Wählen Sie die Sammlung aus, für die Sie das Crawling vorübergehend stoppen möchten.

  3. Klicken Sie auf der Seite Aktivität auf Anhalten.

    Der Crawl beginnt erneut mit der im Crawl-Zeitplan festgelegten Häufigkeit.