Reguläre Ausdrücke zum Suchen von Begriffen verwenden

Definieren Sie reguläre Ausdrücke, die Signifikanzmuster erfassen. Beispiel: AB10045 ist die Syntax, die für Ihre Bestellnummern verwendet wird.

Definieren Sie reguläre Ausdrücke, die Informationen aus Feldern in Ihrer Sammlung identifizieren und extrahieren können.

Dieser reguläre Ausdruck findet beispielsweise Vorkommen von Kreditkartennummern mit einem bestimmten Format und einer bestimmten Länge.

4[0-9]{15}

Der folgende reguläre Ausdruck findet Vorkommen einer US-Sozialversicherungsnummer.

(?!666|000|9\d{2})\d{3}-(?!00)\d{2}-(?!0{4})\d{4}

Führen Sie die folgenden Schritte aus, um einen regulären Ausdruck hinzuzufügen:

  1. Wählen Sie im Abschnitt Konzepte der Teach-Domäne der Anzeige Verbesserungstools die Option Regulärer Ausdruck.

  2. Klicken Sie auf Hochladen.

  3. Optional: Geben Sie einen Facettenpfad an, um Text zu kategorisieren, der dem regulären Ausdruck entspricht. Der Text kann später durch diese Facette gefiltert werden.

    Wenn Sie eine Hierarchie von Kategorien verwenden, fügen Sie einen Punkt zwischen Kategorienamen im Facettenpfad hinzu, um die Hierarchie darzustellen. Wenn Sie beispielsweise einen regulären Ausdruck hinzufügen, der Telefonnummern erkennen kann, haben Sie möglicherweise einen Facettenpfad wie international.europe.

  4. Fügen Sie den regulären Ausdruck hinzu.

    • Verwenden Sie einen regulären Ausdruck von Java™.

      Weitere Informationen finden Sie in der Dokumentation zu Java. Eine weitere nützliche Ressource ist Regex 101.

    • Halten Sie den regulären Ausdruck so kurz und verständlich wie möglich.

    • Die besten regulären Ausdrücke werden schnell in eine Übereinstimmung oder Nichtübereinstimmung aufgelöst.

    • Verwenden Sie allgemeine Muster. Verwenden Sie zum Beispiel a(b|c|d) anstelle von (ab|ac|ad).

    • Die Engine für reguläre Ausdrücke schlägt möglicherweise fehl, wenn sie zurückverfolgt, weil sie am Ende der Zeichenfolge keine negative Übereinstimmung finden kann und dann zu viele Permutationen versucht. Um Rückspuren zu verhindern, ziehen Sie die Verwendung eines possessiven Quantors wie (a+b*)++c in Betracht.

  5. Klicken Sie auf Erstellen.

  6. Wählen Sie die Objektgruppe und das Feld aus, um nach Vorkommen von Text zu suchen, der diesem regulären Ausdrucksmuster entspricht.

In der Ausgabe finden Sie die Informationen, die durch die Anreicherung mit regulären Ausdrücken extrahiert wurden, unter enriched_{field_name} im Array entities.

In diesem Beispiel lautet der Facettenpfad regex.cccardnumber und das für die Aufbereitung ausgewählte Feld ist text.

{
  "enriched_text": [
    {
      "entities": [
        {
          "path": ".regex.cccardnumber",
          "type": "cccardnumber",
          "text": "4000000000000000"
        }
      ]
    }
  ],
  "text": [
    "He has 2 phones, 090-1234-5678 and 080-1234-5678. His credit card number is 4000000000000000."
  ]
}

Wenn Sie Testabfragen über die Seite Verbessern und anpassen übergeben, können Sie eine Facette hinzufügen, die auf dem Feld enriched_text.entities.model_name basiert. Daher wird die von Ihnen erstellte Aufbereitung für reguläre cccardnumber-Ausdrücke als Facettenwert angezeigt, nach dem Dokumente gefiltert werden können. Weitere Informationen zum Erstellen von Facetten finden Sie unter Facetten hinzufügen.

Grenzwerte für reguläre Ausdrücke

Die Anzahl der regulären Ausdrücke, die Sie pro Serviceinstanz definieren können, hängt vom Plantyp Discovery ab.

Details des Plans für reguläre Ausdrücke
Planen Reguläre Ausdrücke pro Serviceinstanz
Cloud Pak for Data Uneingeschränkt
Premium 100
Enterprise 100
Plus (einschließlich Testversion) 20