Daten mit der Content-Mining-Anwendung analysieren
Verwenden Sie die Content-Mining-Anwendung Discovery, um Ihre Daten zu analysieren. Die Anwendung zeigt Untergruppen Ihrer Informationen in Visualisierungen, die Ihnen helfen können, Muster, Trends und Anomalien zu finden.
Nur Benutzer von installierten Bereitstellungen oder von verwalteten Bereitstellungen mit Enterprise- und Premium-Plan können die Content-Mining-Anwendung verwenden.
Übersichtsvideo
Videomitschrift
Watson Discovery Content Mining Project präsentiert von Stuart Strolin. (Musikeinführung) Dieses Video soll Sie mit dem Content-Mining-Projekt in Watson Discoveryvertraut machen.
Content-Mining ist einer der primären Anwendungsfälle für Watson Discovery und wird verwendet, um sowohl strukturierte als auch unstrukturierte Daten zu analysieren und zu untersuchen, um Erkenntnisse zu gewinnen und verborgene Bedeutungen zu extrahieren. Sie wird sowohl vom Bürgeranalytiker als auch vom Data-Scientist verwendet.
Das Content-Mining-Projekt kann für alle Analysetypen verwendet werden, weil die Benutzerschnittstelle nicht für eine bestimmte Branche oder Datengruppe spezifisch ist.
In diesem Szenario sind Sie ein Analyst für ein fiktives Automobilunternehmen. Betriebsberichte haben das Unternehmen auf eine ungewöhnliche Unfallrate für eines ihrer Autos aufmerksam gemacht. Ihre Aufgabe ist es, herauszufinden, warum.
Mit dem Content-Mining-Projekt beginnen Sie Ihre Analyse, indem Sie die unstrukturierten Daten aus den nationalen Kfz-Vorfallberichten anzeigen. Es wird eine Schnittstelle angezeigt, über die Sie das Automodell auswählen und mit der Analyse beginnen können (auf der Seite "Sammlungen"). In diesem Fall interessieren Sie sich für den Hill Walker. Sie können diese Informationen im Suchabschnitt am Anfang der Seite eingeben. Aber es ist einfacher, nur auf das Element zu klicken. Sie können beliebig viele Suchbegriffe und Bedingungen hinzufügen. Aber in Wirklichkeit möchten Sie die Anwendung Ihre Analyse leiten lassen.
Nun wird die Navigationsansicht (im geführten Modus) angezeigt. Es verfolgt Ihre Analyse und bietet Optionen für die nächsten Schritte. Außerdem wird die Anzahl der Dokumente angezeigt, die Ihrem aktuellen Analysestatus entsprechen. In dieser kleinen Sammlung beträgt die Anzahl der Dokumente, die den Hill Walker betreffen, nur 51. In einem Produktionsdataset wäre die Zahl normalerweise viel größer. Die Analyse von Trends und Anomalien ist oft eine gute Möglichkeit, um zu beginnen, da es Ihnen ermöglicht, zu sehen, ob etwas ungewöhnlich scheint.
Sofort bemerken Sie, dass der Hill Walker im Dezember und Januar Probleme hat. Sie beschließen, weitere Untersuchungen durchzuführen, indem Sie diese erste Exploration auf den Monat Dezember eingrenzen.
Beachten Sie, dass Sie in der Navigationsansicht oben immer über die Position informiert werden, an der Sie sich in Ihrer Analyse befinden. Als Nächstes wählen Sie Ursache und Merkmale analysieren aus, da Sie daran interessiert sind, warum Dinge passieren.
Sie stellen fest, dass Wörter wie 'snow' und 'brake 'zusammen hervorgehoben werden (im Abschnitt' Part of Speech '), sodass Sie diese zu Ihrer Analyse hinzufügen.
Das Projekt Content Miner hat Ihre Untersuchung auf eine kleine Anzahl von Beschwerden eingegrenzt, die leicht zu lesen sind. (klickt Auf Dokumente Anzeigen)
Das gemeinsame Thema hier ist, dass es ein unerwartetes Problem mit der Art und Weise, wie die Bremsen arbeiten unter verschneiten Bedingungen. Sie haben nun die Informationen, die Sie benötigen, um die Ingenieurabteilung zu bitten, eine detaillierte Inspektion des Bremssystems durchzuführen und festzustellen, warum es nicht wie erwartet unter verschneiten Bedingungen funktioniert.
In dieser Demonstration haben Sie gesehen, wie ein Bürgeranalyst mithilfe von Watson Discovery und Content-Mining ohne großen Aufwand verborgene Bedeutung in unstrukturiertem Text erkennen kann. (Liste der Features, Funktionen und Anwendungsfälle)
Was werden Sie mit Watson Discoverytun? (Musik outro)
Funktionsweise
Zum Analysieren Ihrer Daten verwenden Sie Facetten. Facetten bieten Ihnen eine Möglichkeit, Ihre Daten zu zerlegen und eine Untergruppe von Informationen zu visualisieren, sodass sie leichter zu verstehen sind.
Auf der Datenanalyseseite für Ihre Sammlung können Sie auswählen, dass die Daten in einer der folgenden Anzeigen angezeigt werden sollen:
- Facetten
- Zeigt Facetten an, die aus Annotationen abgeleitet wurden, die Ihren Dokumenten durch Aufbereitungen hinzugefügt wurden, die auf Ihre Dokumente angewendet wurden. Aufbereitungen können integrierte Aufbereitungen für die Verarbeitung natürlicher Sprache enthalten, z. B. Wortart oder Entitäten. Sie können auch benutzerdefinierte Aufbereitungen enthalten, die Sie hinzufügen, z. B. Wörterverzeichnisse, Muster für reguläre Ausdrücke und Modelle für maschinelles Lernen.
- Metadatenfacetten
- Zeigt Facetten an, die von Ihren Daten abgeleitet sind Wenn Sie einer Objektgruppe Dateien hinzufügen, analysiert und indexiert Discovery die Daten. Annotationen werden hinzugefügt, um Inhaltstypen anzugeben, und als Metadatenfacetten angezeigt. Die besten Metadatenfacetten ergeben sich, wenn Sie strukturierte Daten wie Datensätze aus einer CSV-Datei aufnehmen. Die maximale Länge einer Metadatenfacette beträgt 256 Zeichen.
- Angepasst
- Zeigt nur die Facetten an, die Sie zur Sicht hinzufügen möchten. Sie können Ihrer angepassten Ansicht eine Mischung aus von Aufbereitung abgeleiteten und von Inhalten abgeleiteten Facetten hinzufügen.
Wenn Sie einen Projekttyp Inhaltsmining erstellen, wird die Facette Wortart automatisch auf Ihre Daten angewendet. Diese Facette ist ein großartiger Ausgangspunkt, da sie für alle Daten gültig ist, unabhängig vom Thema. Die Ausgabe gibt Ihnen einen Überblick über die Terminologie, die in den Daten am häufigsten verwendet wird.
Ausgehend von diesem Ausgangspunkt können Sie andere Möglichkeiten zum Filtern der Daten festlegen.
Wenn Ihre Daten beispielsweise aus Verkehrsberichten bestehen, kann die Facette Part of Speech anzeigen, dass Schlüsselwörter mit hoher Häufigkeit Begriffe wie engine, brake, fire, smokeund sparkenthalten. Anhand dieser allgemeinen Terminologie können Sie Wörterverzeichnisse erstellen, die Sie beim Kategorisieren und Filtern der Daten unterstützen. Die Schlüsselwörter aus dem Beispiel könnten Sie zum Erstellen der folgenden Wörterverzeichnisse führen:
component-Wörterbuch für Begriffe wie Motor und Bremsephenomenon-Wörterverzeichnis für Begriffe wie 'fire', 'smoke' und 'spark '
Wenn Sie die Aufbereitung des Wörterverzeichnisses auf Ihre Daten anwenden, generiert sie Annotationen. Sie können sich Annotationen als Tags vorstellen, die Sie zu Wörtern oder Ausdrücken hinzufügen, wobei der Tag die Bedeutung des Wortes oder der Wortfolge kategorisiert oder identifiziert. Die resultierenden Annotationen fungieren als neue Facetten, mit deren Hilfe Sie Ihre Daten weiter filtern und zerlegen können.
Mit Ihren neuen Facetten component und phenomenon können Sie beispielsweise nach Korrelationen zwischen Komponenten und Phänomenen suchen, die an Datenverkehrsvorfällen beteiligt sind.
Hier erfahren Sie mehr über die Möglichkeiten zur Analyse Ihrer Daten.
Tiefer graben
Um noch tiefer in Ihre Daten einzutauchen, wenden oder erstellen Sie KI-Modelle an, die verschiedene Arten von Informationen in Ihren Dokumenten finden können. Sie können integrierte Modelle für die Verarbeitung natürlicher Sprache anwenden, wie z. B. die Aufbereitung Entitäten, die Erwähnungen allgemein bekannter Dinge wie Geschäfts-oder Standortnamen und andere Typen von Eigennamen erkennen kann. Sie können auch ein angepasstes Modell anwenden, das Terme und Kategorien erkennt, die für Ihre Daten eindeutig sind.
Erweitern Sie Ihre Analyse, indem Sie eigene Facetten hinzufügen.
Einführung
Bevor Sie die Anwendung verwenden können, müssen Sie ein Discovery Content-Mining-Projekt erstellen. Nachdem das Projekt erstellt und Daten hochgeladen wurden, können Sie die Content-Mining-Anwendung öffnen.
Weitere Informationen finden Sie unter Projekte erstellen.
Natürlich können Sie keine nützlichen Erkenntnisse gewinnen, wenn Sie nicht die richtige Art von Informationen einfügen. Achten Sie darauf, konsistente Daten einzuschließen. Wenn Sie Trends im Zeitverlauf suchen möchten, müssen Ihre Daten Datenpunkte enthalten, die ein Datum angeben.
Daten, die im CSV-Dateiformat übergeben werden, sind optimal. Ein Beispiel für eine CSV-Datei, die interessante Analysefunktionen bietet, finden Sie unter CSV-Dateien analysieren.