Sammlungen erstellen
Eine Sammlung ist eine Reihe von Dokumenten, die Sie einem Projekt hinzufügen, um sie zu analysieren, anzureichern und nützliche Informationen daraus zu extrahieren.
Sie können Ihrem Projekt auf folgende Weise Daten hinzufügen:
-
Laden Sie lokal zugängliche Dateien über die Benutzeroberfläche des Produkts hoch. Diese Methode eignet sich am besten für den Einstieg und zum Testen Ihres Anwendungsfalls.
-
Einrichten eines geplanten Crawls von Dokumenten, die in einer externen Datenquelle gespeichert sind.
Die Benutzeroberfläche des Produkts bietet mehrere integrierte Datenquellenkonnektoren, aus denen Sie wählen können. Die Optionen hängen von der Art der Bereitstellung ab. Weitere Informationen finden Sie unter Unterstützte Datenquellen.
-
Stellen Sie eine Verbindung zu einer externen Datenquelle her, für die keine integrierte Unterstützung verfügbar ist:
- IBM Cloud
- Verwenden Sie IBM App Connect, um einen geplanten Crawl von Dokumenten einzurichten, die in anderen externen Datenquellen gespeichert sind.
- IBM Cloud Pak for Data IBM Software Hub
- Erstellen Sie einen Konnektor zum Durchsuchen von Dokumenten, die in anderen externen Datenquellen gespeichert sind.
-
Um den Prozess des Hinzufügens von Daten zu Ihrem Projekt zu automatisieren, verwenden Sie die Discovery APIs, um eine Sammlung zu erstellen und Dokumente in diese hochzuladen.
Wenn Sie Dokumente zu Discovery hinzufügen, werden die Originaldokumente gecrawlt, und die Informationen aus den Dokumenten werden in einem Index gespeichert, damit sie später angereichert und analysiert oder abgerufen werden können. Nicht alle Inhalte des Originaldokuments werden beibehalten. Zum Beispiel werden Bilder aus.ppt- oder.doc-Dateien nicht gespeichert. Weitere Informationen finden Sie unter Wie Ihre Datenquelle verarbeitet wird.
IBM Cloud Nachdem Sie eine Sammlung erstellt haben, können Sie auf Datenvorschau klicken, um eine Vorschau der Daten in der erweiterten Dokumentenansicht anzuzeigen.
Auswählen, was in eine Sammlung aufgenommen werden soll
Bei der Entscheidung, wie Sie Ihre Quellinhalte in Sammlungen aufteilen, sind einige Dinge zu beachten.
-
Abrufen von Inhalten aus verschiedenen Datenquellen
Wenn Sie ähnliche Inhalte in mehr als einer Art von Datenquelle speichern (z. B. eine Website und Salesforce ), können Sie ein Projekt mit zwei separaten Sammlungen erstellen. Jede Sammlung enthält Dokumente aus einer einzigen Datenquelle. Wenn sie in einem einzigen Projekt zusammengeführt werden, kann ein Benutzer in beiden Quellen gleichzeitig suchen.
-
Anwendung von Anreicherungen
Das Anlegen einer Sammlung ist eine gute Möglichkeit, Dokumente zu gruppieren, die Sie auf ähnliche Weise anreichern möchten. Vielleicht enthält eine Teilmenge Ihrer Dokumente Branchenjargon und Sie möchten ein Wörterbuch hinzufügen, das die Begriffe erkennt. Sie können eine separate Sammlung anlegen und die Funktion für Begriffsvorschläge nutzen, um die Erstellung des Wörterbuchs zu beschleunigen.
-
Erstellung separater Smart Document Understanding (SDU)-Modelle
Sie können das Werkzeug Smart Document Understanding verwenden, um Inhalte anhand der Struktur eines Dokuments zu identifizieren. Wenn Sie 20 PDF-Dateien haben, die von Ihrer Vertriebsabteilung erstellt wurden und eine Vorlage verwenden, und 20 PDF-Dateien, die von Ihrer Forschungsabteilung erstellt wurden und eine andere Vorlage verwenden, gruppieren Sie jedes Set in eine eigene Sammlung. Sie können dann das SDU-Tool verwenden, um ein Modell für jede Struktur separat zu erstellen, ein Modell, das die einzigartige Struktur versteht. Sie können das Tool auch verwenden, um benutzerdefinierte Felder zu definieren, die nur in den Quelldokumenten vorkommen.
Objektgruppe erstellen
Bevor Sie eine Sammlung erstellen können, müssen Sie ein Projekt erstellen. Weitere Informationen finden Sie unter Projekte erstellen.
Was Sie beachten sollten:
- Eine Sammlung kann nur eine externe Datenquelle unterstützen.
- Die Dokumente in der Sammlung dürfen nur in einer Sprache vorliegen, nämlich in der Sprache, die Sie für die Sammlung angegeben haben.
Führen Sie die folgenden Schritte aus, um eine Objektgruppe zu erstellen:
-
Öffnen Sie ein Projekt, gehen Sie zur Seite Sammlungen verwalten, und klicken Sie auf Neue Sammlung.
- Die Projekttypen Intelligente Dokumentenverarbeitung, Konversationssuche, Dokumentenabruf und Benutzerdefiniert können bis zu 5 Sammlungen enthalten.
- Ein Content-Mining-Projekt kann nur 1 Sammlung enthalten.
-
Laden Sie Daten in Ihre Sammlung hoch.
IBM Cloud Um eine Verbindung zu einer anderen Datenquelle herzustellen, anstatt Daten hochzuladen, klicken Sie auf den Link neben dem Feld Muss eine Verbindung zu einer Datenquelle hergestellt werden?
Sie können die folgenden Möglichkeiten wählen, um eine Verbindung zu einer Datenquelle herzustellen, anstatt Daten hochzuladen.
-
Crawling einer externen Datenquelle.
Informationen zu unterstützten Datenquellen finden Sie im entsprechenden Thema für Ihren Bereitstellungstyp:
- IBM Cloud Pak for DataIBM Software HubIBM Cloud Pak for Data datenquellen
- IBM CloudIBM Cloud datenquellen
In diesen Themen wird auch beschrieben, wie Sie eine Verbindung zu Datenquellen herstellen, die nicht standardmäßig pro Bereitstellungstyp unterstützt werden.
Informationen zur Fehlerbehebung bei Problemen, die beim Hinzufügen von Dokumenten zu einer Sammlung auftreten können, finden Sie unter Fehlerbehebung bei der Aufnahme von Dokumenten.
Weitere Informationen zur programmgesteuerten Erstellung einer Sammlung finden Sie in der API-Referenzdokumentation.
Optische Zeichenerkennung
Eine der optionalen Funktionen, die Sie bei der Erstellung einer Sammlung anwenden können, ist die optische Zeichenerkennung. Die OCR-Funktion (Optical Character Recognition) extrahiert Text aus Bildern. Diese Funktion ist nützlich für die Erhaltung von Informationen, die in Diagrammen oder Grafiken dargestellt sind, oder von Text, der in Dateien wie gescannten PDFs eingebettet ist. Durch die Umwandlung der visuellen Informationen in Text können sie später durchsucht werden.
Eine neue Version der Technologie wurde in Cloud-verwalteten Instanzen eingeführt. OCR v2 wurde von IBM Research entwickelt, um Text besser aus gescannten Dokumenten und anderen Bildern zu extrahieren, die die folgenden Einschränkungen aufweisen:
- Schlechte Bildqualität aufgrund falscher Scannereinstellungen, unzureichender Auflösung, schlechter Beleuchtung (z. B. bei mobiler Erfassung), Schärfeverlust, falsch ausgerichteter Seiten und schlecht gedruckter Dokumente
- Dokumente mit unregelmäßigen Schriftarten oder verschiedenen Farben, Schriftgrößen und Hintergründen
Was ist zu beachten, wenn Sie OCR aktivieren?
- Die Zeit, die zum Einlesen eines Dokuments mit Bildern benötigt wird, erhöht sich, wenn OCR aktiviert ist.
- OCR unterstützt derzeit nicht die Extraktion von handgeschriebenem Text aus Dokumenten und gescannten Bildern.
- OCR kann sowohl klare als auch verrauschte Bilder lesen. Es kann verrauschte Bilder in Graustufen umwandeln und sie glätten und schräg stellen. Die Bildqualität muss jedoch die Mindestanforderung von 80 DPI (dots per inch) erfüllen.
- OCR kann viele Sprachen erkennen, aber die Sprache des Textes im Bild muss mit der Sprache übereinstimmen, die für die Sammlung angegeben ist, der die Datei hinzugefügt wird.
Weitere Informationen zu den Sprachen, für die OCR v1 und OCR v2 unterstützt werden, finden Sie unter Sprachunterstützung.
Eine Liste der Dateitypen, auf die Sie OCR anwenden können, finden Sie in der Tabelle Unterstützte Dateitypen.
Ermöglichung von Stemming für unkuratierte Daten
Sie können Discovery so konfigurieren, dass bei der Erstellung einer Sammlung Stemming anstelle von Lemmatisierung zur Normalisierung verwendet wird. Diese Konfiguration ist nur gelegentlich nützlich, wenn Sammlungen, Abfragen oder beides Daten mit vielen Rechtschreibfehlern, fehlenden Akzentzeichen und grammatikalischen Fehlern enthalten.
Discovery normalisiert Wörter, um eine schnellere Erkennung und Zuordnung von Wörtern und ihren verschiedenen Formen zu ermöglichen, z. B. Pluralformen oder alternative Verbkonjugationen. Standardmäßig verwendet Discovery die Lemmatisierung, um Wörter auf der Grundlage ihrer Bedeutung zu normalisieren. Beim Stemming werden Wörter normalisiert, indem nur Wortstämme verwendet werden.
Die Lemmatisierung ist präziser, funktioniert aber am besten bei kuratierten Daten. Wenn Ihre Daten nicht gut kuratiert sind, könnte Stemming besser funktionieren. In der Regel wird derselbe Wortstamm erkannt, unabhängig davon, ob ein Wort richtig geschrieben ist oder nicht. Es kann jedoch sein, dass die Lemmatisierung ein falsch geschriebenes Wort nicht erkennt oder seine Bedeutung falsch interpretiert. Infolgedessen kann der Lemmatisierer den falschen Wortstamm hinzufügen, um das falsch geschriebene Wort im Index darzustellen. Eine Suche nach einer gestammten Version eines falsch geschriebenen Wortes führt wahrscheinlich zu besseren Ergebnissen als eine Suche nach einem falsch lemmatisierten Wort.
Die folgende Tabelle zeigt Beispiele dafür, wie einige Wörter gestammt bzw. lemmatisiert werden.
| Oberflächenform | Lemmatisierte Form | Gestielte Form |
|---|---|---|
| wird ausgeführt | Ausführung | Ausführung |
| ran | Ausführung | ran |
| ausbilder | ausbilder | anweisen |
| Instruktion | Instruktion | anweisen |
Wie Sie aus den Beispielen ersehen können, erfasst der Lemmatizer die Wortbedeutungen besser als der Stemmer. Sowohl running als auch ran werden als verschiedene Formen desselben Stammverbs run erkannt. Und der Bedeutungsunterschied zwischen den beiden Substantiven Ausbilder und Unterweisung bleibt erhalten. Wenn die Daten jedoch Rechtschreibfehler wie instructer und instructoin enthalten, liefert die normalisierte Form, die durch Stemming (instruct ) erzeugt wird, bessere Treffer.
Discovery normalisiert Wörter, wenn es Daten in den Index aufnimmt und speichert, und zur Laufzeit, wenn es Abfragen analysiert, die von Benutzern eingereicht werden. Für beide Vorgänge wird dieselbe Normalisierungsmethode verwendet, auch wenn der eine Vorgang auf der Sammlungsebene und der andere auf der Projektebene stattfindet. Wenn eine Abfrage eingereicht wird, wird sie an jede Sammlung innerhalb des Projekts weitergeleitet, wo die Abfrage auf der Grundlage der Konfiguration der jeweiligen Sammlung normalisiert wird. Sammlungen, die für die Verwendung des Stemmers konfiguriert sind, normalisieren die Abfrage mithilfe des Stemmings. Die Sammlungen, die nicht sind, normalisieren die Abfrage durch Lemmatisierung.
Um beim Erstellen der Sammlung den Stemmer anstelle des Lemmatisierers zu aktivieren, erweitern Sie Weitere Verarbeitungsoptionen und setzen Sie den Schalter Stemming anstelle von Lemmatisierung beim Indizieren verwenden auf Ein.
Wenn Sie Discovery so konfigurieren, dass der Stemmer verwendet wird, sollten Sie auch die Abfragen, die Informationen aus der Sammlung extrahieren, so gestalten, dass Zeichenunterschiede beim Abgleich berücksichtigt werden. Weitere Informationen finden Sie unter dem Operator Stringvariation.
Weitere Informationen zu den Sprachen, für die der Stemmer unterstützt wird, finden Sie unter Sprachunterstützung.
Erhebungsgrenzen
Die Anzahl der Sammlungen, die Sie pro Projekt erstellen können, ist je nach Projekttyp unterschiedlich.
| Projekttyp | Sammlungen pro Projekt |
|---|---|
| Intelligente Dokumentenverarbeitung | 5 |
| Dokumentabruf | 5 |
| Dokumentenabruf für Verträge | 5 |
| Dialogsuche | 5 |
| Content Mining | 1 |
| Angepasst | 5 |
Die Anzahl der Sammlungen, die Sie pro Serviceinstanz erstellen können, hängt von der Art Ihres Discovery Plans ab.
| Planen | Sammlungen pro Dienstinstanz |
|---|---|
| Cloud Pak for Data | 300 |
| Premium | 300 |
| Enterprise | 300 |
| Plus (enthält Testversion) | 40 |
IBM Cloud Pak for DataIBM Software Hub Die Anzahl der Sammlungen, die Sie erstellen können, hängt von Ihrer Hardwarekonfiguration ab. Discovery unterstützt maximal 300 Sammlungen pro Instanz und Installation, aber diese Anzahl hängt von vielen Faktoren ab, unter anderem vom Arbeitsspeicher.
Unterstützte Dateitypen
Discovery können bestimmte Dateitypen einlesen. Bei allen anderen Dateitypen wird eine Warnmeldung angezeigt, und die Datei wird nicht eingelesen.
Die folgende Tabelle zeigt die unterstützten Dateitypen und Informationen über die Unterstützung von Funktionen, die je nach Dateityp variieren.
| Dateityp | Unterstützung der Textextraktion | Unterstützung von Smart Document Understanding (SDU) | Unterstützung von OCR (Optical Character Recognition) |
|---|---|---|---|
| CSV | |||
| DOC, DOCX | |||
| GIF | |||
| HTML | |||
| jpg | |||
| JSON | |||
| PNG | |||
| PPT, PPTX | |||
| TIFF | |||
| TXT | |||
| XLS, XLSX | |||
- Sie können PDF-Dateien mit Hilfe von PDF-Erzeugungsprogrammen wie Adobe Acrobat, Microsoft Office, Preview von Apple und anderen erstellen.
Die Vektorobjekte, vektorisierten Texte und SVG-Bilder werden bei der Verarbeitung von PDFs ignoriert. Außerdem unterstützt Discovery derzeit keine Textextraktion aus Bildern mit Transparenzebenen oder Transparenzgruppen in PDFs.
- Es werden nur Bilder der unterstützten Bilddateitypen gerendert, die in der PDF-Datei vorkommen.
- Verwenden Sie für gescannte Bilder 300 dpi oder mehr, um eine optimale OCR zu gewährleisten. Die Mindestdpi müssen gemäß den Richtlinien für die optische Zeichenerkennung 80 betragen
- Es werden nur einseitige Bilddateien unterstützt.
- Dateien in komprimierten Archivdateien (ZIP, GZIP, TAR) werden extrahiert. Discovery nimmt die unterstützten Dateitypen im Archiv auf. Alle anderen Dateitypen werden ignoriert. Die Dateinamen müssen in UTF-8 kodiert sein. Dateien mit Namen, die z. B. japanische Schriftzeichen enthalten, müssen umbenannt werden, bevor sie der ZIP-Datei hinzugefügt werden.
- Discovery unterstützt komprimierte Mac OS-Dateien nur, wenn diese mit einem Befehl wie dem folgenden generiert wurden:
zip -r my-folder.zip my-folder -x "*.DS_Store". ZIP-Dateien, die durch Rechtsklick auf einen Ordner und Klicken auf Komprimieren erstellt werden, werden nicht unterstützt. - PDF-Dateien, die Sie als Teil einer Archivdatei hochladen, werden in der erweiterten Ansicht für ein Abfrageergebnis, das Sie über die Seite Verbessern und Anpassen öffnen, nicht angezeigt. Wenn Sie möchten, dass die Datei in der erweiterten Ansicht angezeigt werden kann, importieren Sie die PDF-Datei separat von der Archivdatei erneut.
Wenn Sie Dateien zu einem Projekt des Typs Document Retrieval for Contracts hinzufügen, werden alle Dateitypen, die SDU und OCR unterstützen, automatisch mit einem vorab trainierten Modell für Smart Document Understanding und Optical Character Recognition verarbeitet.
Grenzen des Dokuments
Die Anzahl der Dokumente, die pro Service-Instanz zulässig sind, hängt von Ihrem Discovery Plan-Typ ab.
Das Dokumentenlimit bezieht sich auf die Anzahl der Dokumente im Index. Laden Sie zu Beginn weniger Dokumente hoch, wenn die von Ihnen geplanten Anreicherungen die Anzahl der Dokumente später erhöhen könnten. Die folgenden Konfigurationen erzeugen zum Beispiel mehr Dokumente:
- Wenn Sie ein Dokument aufteilen, wird das Dokument in mehrere Dokumente aufgeteilt
- CSV-Dateien, die Sie hochladen, erzeugen ein Dokument pro Zeile
- Datenbankdatenquellen, die Sie crawlen, erzeugen ein Dokument pro Datenbankzeile
- Jedes Objekt, das in einem Array in einer JSON-Datei definiert ist, ergibt ein eigenes Dokument
| Planen | Dokumente pro Dienstinstanz |
|---|---|
| Cloud Pak for Data | Uneingeschränkt |
| Premium | Uneingeschränkt |
| Enterprise | Uneingeschränkt |
| Plus (enthält Testversion) | 500.000 |
Beim Enterprise-Tarif werden Sie nach 100.000 Dokumenten pro Monat zur Kasse gebeten. Weitere Informationen zur Preisgestaltung finden Sie unter Discovery-Preispläne.
Die maximal zulässige Anzahl kann je nach Größe der Dokumente leicht variieren. Verwenden Sie diese Werte als allgemeine Richtwerte.
Grenzen der Dateigröße
Gecrawlte Dokumente
Die maximale Größe jeder Datei, die Sie mithilfe eines Connectors crawlen können, ist je nach Bereitstellungstyp unterschiedlich.
IBM Cloud Verwaltete Einsätze auf IBM Cloud
-
Nur Premium-Tarife:
- Box: 50 MB
- IBM Cloud Objektspeicher: 50 MB
- Salesforce Files objekte: 50 MB
- Alle anderen Datenquellen: 10 MB
-
Alle anderen Pläne: 10 MB
IBM Cloud Pak for DataIBM Software Hub Installierte Einsätze auf IBM Cloud Pak for Data
- Alle Datenquellen: 32 MB
Hochgeladene Dokumente
Die Größe der einzelnen Dateien, die Sie hochladen können, hängt von der Art Ihres Discovery Plans ab. Einzelheiten finden Sie in der folgenden Tabelle Maximale Dokumentgröße.
| Planen | Dateigröße pro Dokument |
|---|---|
| Cloud Pak for Data | 50 MB |
| Premium | 50 MB |
| Enterprise | 10 MB |
| Plus (enthält Testversion) | 10 MB |
Feldgrenzen
Wenn ein Dokument zu einer Sammlung hinzugefügt wird, wird der Inhalt des Dokuments ausgewertet und zu den entsprechenden Feldern in einem internen Index hinzugefügt.
Bei strukturierten Daten, wie z. B. hochgeladenen CSV- oder JSON-Dateien oder Daten aus gecrawlten Datenbanken, wird jede Spalte bzw. jedes Objekt als Feld der Stammebene gespeichert. Wenn Sie beispielsweise eine CSV-Datei zur Sammlung hinzufügen, wird jede Spalte der CSV-Datei als separates Feld im Index gespeichert.
Es können maximal 1.000 Felder in den Index aufgenommen werden.
Sie können den Datentyp eines Feldes, z. B. Datum oder String, nicht zuweisen. Der Datentyp wird automatisch erkannt und dem Feld beim Einlesen des Dokuments zugewiesen. Die Zuordnung erfolgt auf der Grundlage des Datentyps, der im ersten indizierten Dokument erkannt wird. In nachfolgenden Dokumenten kann es zu Übernahmefehlern kommen, wenn für den Wert desselben Feldes ein anderer Datentyp erkannt wird. Wenn Ihre Dokumente eine Mischung aus verschiedenen Datentypen in einem einzigen Feld enthalten, nehmen Sie daher zuerst das Dokument auf, das einen Wert mit dem flexibelsten Datentyp, wie z. B. String, im Feld enthält.
Wenn Sie eine Website crawlen oder eine HTML-Datei hochladen, wird der HTML-Inhalt der Sammlung hinzugefügt und in einem html Feld indiziert.
In der folgenden Tabelle ist die maximale Größe der Felder pro Dokument angegeben.
| Feldtyp | Maximal zulässige Größe pro Dokument |
|---|---|
Feld html |
5 MB |
| Summe aller anderen Felder | 1 MB |
Wenn die maximale Größe der Felder im Dokument die zulässigen Grenzen überschreitet, werden sie wie folgt behandelt:
-
Bei einem Dokument mit einem übergroßen Feld
htmlwerden alle Felder des Dokuments mit Ausnahme des Feldeshtmlindiziert.Für IBM Cloud Pak for Data Version 4.0 und früher wird das gesamte Dokument nicht indiziert.
-
Bei einem Dokument mit übergroßen Nicht-HTML-Feldern wird das Dokument nicht indiziert.
Wenn Sie eine Microsoft Excel-Datei hochladen und eine Meldung angezeigt wird, die darauf hinweist, dass die Größenbeschränkung für Nicht-HTML-Felder überschritten wurde, sollten Sie die XLS-Datei in eine CSV-Datei konvertieren. Wenn Sie eine CSV-Datei (Comma-Separated Value) hochladen, wird jede Zeile als separates Dokument indiziert. Dadurch werden keine Feldgrößengrenzen überschritten.
Weitere Informationen darüber, wie Felder in hochgeladenen Dateien behandelt werden, finden Sie unter Wie Felder behandelt werden.
Unterstützte Datenquellen
Die folgende Tabelle zeigt die unterstützten Datenquellen für jeden Implementierungstyp.
| Datenquelle | IBM Cloud | IBM Cloud Pak for Data |
|---|---|---|
| Box | ||
| Datenbank (IBM Data Virtualization, IBM Db2, Microsoft SQL, Oracle, Postgres) | ||
| FileNet P8 | ||
| HCL Notes | ||
| IBM Cloud Object Storage | ||
| Lokales Dateisystem | ||
| Salesforce | ||
| Microsoft SharePoint Online | ||
| Microsoft SharePoint (lokal) | ||
| Website | ||
| Microsoft Windows dateisystem |
Planungsoptionen für die Crawlersuche
Wenn Sie eine Sammlung erstellen, wird die erste Crawlersuche sofort gestartet. Die Häufigkeit, die Sie für den Crawl-Zeitplan wählen, bestimmt, wann der nächste Crawl beginnt.
Führen Sie die folgenden Schritte aus, um einen Crawl-Zeitplan zu erstellen:
-
Wählen Sie im Abschnitt Crawl-Zeitplan eine Häufigkeit aus.
Sie können den Crawler so planen, dass er an einem bestimmten Tag und zu einer bestimmten Uhrzeit läuft. Diese Option ist hilfreich, wenn Sie eine starke Belastung des Zielsystems während der Geschäftszeiten vermeiden wollen. Wenn Sie eine Stunde im Bereich von 1 - 9 angeben, fügen Sie eine Null vor der Stundenziffer hinzu. Sie können den Crawl zum Beispiel für
01:00 AMan Samstagen planen.IBM Cloud Wenn Sie einen Crawl für eine monatliche Ausführung planen, sind die Optionen für die Tagesanzahl auf 1 bis 28 beschränkt, da Sie einen Tag angeben müssen, der in jedem Monat vorkommt, einschließlich Februar, der 28 Tage hat.
IBM Cloud Pak for Data Installierte Bereitstellungen haben mehr Zeitplanoptionen:
- Wenn Sie alle 12 Stunden oder alle 10 Tage crawlen möchten, wählen Sie Benutzerdefinierte Intervalle. Sie können den Crawler so planen, dass er an einer bestimmten Anzahl von Tagen oder Stunden läuft.
- Standardmäßig wird der Crawl in den verkehrsschwachen Zeiten gestartet.
- Stellen Sie das Intervall nicht kürzer ein als die Zeit, die der Crawl braucht, um zu Ende zu gehen.
- Konfigurieren Sie nicht mehrere Crawler, die in kurzen Abständen laufen.
- Wenn Sie eine Sammlung in einer anderen Zeitzone als derjenigen öffnen, in der die Sammlung erstellt wurde, werden die Informationen zum UTC-Versatz (Coordinated Universal Time) angezeigt.
-
IBM Cloud Pak for DataIBM Software Hub Installierte Bereitstellungen haben einen Abschnitt Weitere Planungseinstellungen, in dem Sie die Art des Zeitplans für das Crawlen der Datenquelle auswählen können.
Die Auswahlmöglichkeiten für alle Konnektoren (mit Ausnahme des Web-Crawl-Konnektors ) sind wie folgt:
- Vollständiges Crawling: Die externe Datenquelle wird erneut gecrawlt, um die Dokumente in der Sammlung zu aktualisieren.
- Crawling-Updates (Suche nach neuen, geänderten und gelöschten Inhalten): Aktualisiert die Sammlung nur, wenn Daten in der externen Datenquelle seit dem letzten Crawling hinzugefügt, geändert oder gelöscht wurden.
- Crawlen neuer und geänderter Inhalte: Aktualisiert die Sammlung nur, wenn Daten in der externen Datenquelle seit dem letzten Crawlen hinzugefügt oder geändert wurden.
Nur Web-Crawl-Konnektor: Der Web-Crawl-Connector plant Crawls anders als die anderen Connector-Typen. Wählen Sie nur für den Web Crawl Connector eine der folgenden Optionen:
-
Um die Häufigkeit der Crawls selbst zu steuern, wählen Sie diese Option:
Vollständige Crawlersuche
Wenn Sie einen vollständigen Crawl-Zeitplan wählen, erfolgt der Crawl mit der Häufigkeit, die Sie im Abschnitt Crawl-Zeitplan auf der Seite angeben.
-
Damit das System die Häufigkeit der Crawls für Sie verwalten kann, wählen Sie eine der folgenden Optionen:
Crawling von Updates (Suche nach neuen, geänderten und gelöschten Inhalten) oder Crawling von neuen und geänderten Inhalten
Wenn Sie einen Zeitplantyp wählen, der nach Updates oder nach neuen und geänderten Inhalten sucht, wird die Häufigkeit, die Sie für den Crawl-Zeitplan angeben, ignoriert. Die Häufigkeit, mit der jedes Dokument gecrawlt wird, ist variabel und wird vollständig vom Dienst verwaltet. Und die Häufigkeit hängt davon ab, wie oft Änderungen in einem Dokument gefunden werden. Wenn sich beispielsweise 5 der 10 Dokumente in einer Sammlung bis zum Ende des ersten Crawl-Intervalls geändert haben, wird die Häufigkeit für diese 5 Dokumente automatisch erhöht. Derzeit können diese selbstverwalteten Aktualisierungen höchstens einmal täglich durchgeführt werden.
Sie können die automatische Verwaltung der Häufigkeit nicht unterbrechen und Sie können keinen einmaligen Crawl auslösen, wenn diese Arten von geplanten Crawls konfiguriert sind.
Wenn Sie die Einstellungen für den flexiblen Crawl-Zeitplan später ändern möchten, können Sie die Seite Verarbeitungseinstellungen aufrufen, die Einstellungen bearbeiten und dann auf Änderungen übernehmen und erneut verarbeiten klicken.
IBM Cloud Der nächste geplante Crawl wird auf der Seite Aktivität angezeigt.
Wenn Sie die Planungshäufigkeit ändern, ist die nächste geplante Crawl-Zeit möglicherweise nicht die, die Sie erwarten. Die Crawls sind standardmäßig so eingestellt, dass sie regelmäßig zu einer bestimmten Uhrzeit oder an einem bestimmten Tag stattfinden. Wenn Sie beispielsweise den Crawl-Zeitplan am 11. August von wöchentlich auf monatlich ändern, könnte der nächste Crawl für den 31. August statt für den 11. September geplant sein. Sie ist nicht für genau einen Monat ab dem Tag, an dem Sie die Änderung vorgenommen haben, vorgesehen. Stattdessen wird er an dem Tag ausgeführt, der als Standardtag für die gewählte Crawl-Frequenz festgelegt ist.
Anhalten eines Kriechvorgangs
Sie können einen Crawl stoppen, ohne die Häufigkeit des Crawl-Zeitplans zu ändern. Diese Aktion ist hilfreich, wenn Sie eine zeitaufwändige Aufgabe durchführen möchten und nicht wollen, dass der Crawl zwischen den Aufgaben gestartet oder ausgeführt wird.
IBM Cloud Führen Sie die folgenden Schritte aus, um einen Kriechvorgang zu beenden:
-
Öffnen Sie im Navigationsbereich die Seite Sammlungen verwalten.
-
Wählen Sie die Sammlung aus, für die Sie das Crawling stoppen möchten.
-
Klicken Sie auf der Seite Aktivität auf Anhalten, wenn das Crawlen im Gange ist.
-
Rufen Sie die Seite mit den Verarbeitungseinstellungen auf.
-
Setzen Sie Zeitplan anwenden auf Nein, und klicken Sie dann auf Änderungen übernehmen und erneut verarbeiten.
Der Kriechgang ist gestoppt und wird erst wieder gestartet, wenn Sie ihn neu starten.
IBM Cloud Führen Sie die folgenden Schritte aus, um den Crawl neu zu starten:
-
Öffnen Sie im Navigationsbereich die Seite Sammlungen verwalten.
-
Wählen Sie die Sammlung aus, für die Sie den Crawl neu starten möchten.
-
Rufen Sie die Seite mit den Verarbeitungseinstellungen auf.
-
Setzen Sie Zeitplan anwenden auf Ja, und klicken Sie dann auf Änderungen übernehmen und erneut verarbeiten.
Das Krabbeln beginnt sofort.
Der nächste Crawl beginnt mit der Häufigkeit, die in den Crawl-Zeitplanoptionen ausgewählt wurde. Wenn Sie den Crawl zu einem beliebigen Zeitpunkt vor der geplanten Häufigkeit starten möchten, klicken Sie auf der Seite Aktivität auf Neu crawlen.
IBM Cloud Pak for Data IBM Software Hub
Sie können einen laufenden Crawlvorgang vorübergehend stoppen.
Um einen Kriechvorgang vorübergehend zu stoppen, führen Sie die folgenden Schritte aus:
-
Öffnen Sie im Navigationsbereich die Seite Sammlungen verwalten.
-
Wählen Sie die Sammlung aus, für die Sie das Crawling vorübergehend stoppen möchten.
-
Klicken Sie auf der Seite Aktivität auf Anhalten.
Der Crawl beginnt erneut mit der im Crawl-Zeitplan festgelegten Häufigkeit.