Utilice Watson NLP incorporado para buscar términos comunes

Aproveche las galardonadas prestaciones de Watson Natural Language Processing (NLP) añadiendo enriquecimientos precompilados a sus documentos.

Con Watson NLP, puede identificar y etiquetar información significativa en sus colecciones para que pueda comprender lo que significa todo y tomar decisiones más informadas.

Están disponibles los siguientes enriquecimientos de NLP de Watson:

  • Entidades: Reconoce nombres adecuados como personas, ciudades y organizaciones que se mencionan en el contenido.
  • Palabras clave: reconoce términos significativos en su contenido.
  • Categoría léxica: identifica las categorías léxicas (nombres y verbos, por ejemplo) del contenido.
  • Sentimiento: Comprende el sentimiento general del contenido.

Los siguientes enriquecimientos entrenados previamente están disponibles con Discovery:

Enriquecimientos de Watson NLP

Por ejemplo, la siguiente captura de pantalla muestra una transcripción de la declaración de independencia de EE.UU. que se ha añadido a una colección Discovery donde están habilitados los enriquecimientos de Entidades y Palabras clave. Las menciones reconocidas por los enriquecimientos se resaltan en el texto del documento.

Muestra un extracto de la Declaración de Independencia de Estados Unidos con varios términos resaltados.
Excerpt of the US Declaration of Independence with highlighted terms

Algunos de los enriquecimientos de NLP se aplican automáticamente a los proyectos. No es necesario que los aplique usted mismo si está utilizando uno de estos tipos de proyecto.

Enriquecimientos predeterminados por tipo de proyecto

Algunos enriquecimientos precompilados se aplican automáticamente a las colecciones de un proyecto basándose en el tipo de proyecto. La tabla siguiente muestra los enriquecimientos predeterminados que se aplican a cada tipo de proyecto.

enriquecimientos predeterminados por tipo de proyecto
Esta tabla tiene cabeceras de fila y columna. Las cabeceras de fila identifican tipos de proyecto. Las cabeceras de columna identifican distintos enriquecimientos. Para comprender qué enriquecimientos se aplican a un tipo de proyecto de forma predeterminada, vaya a la fila que describe los enriquecimientos y busque las columnas para el tipo de proyecto en el que está interesado.
Enriquecimiento Recuperación de documentos Recuperación de documentos para contratos Búsqueda de conversación Content Mining
Lista de Contratos Icono de marca de selección
Entidades Icono de marca de selección Icono de marca de selección
Palabras clave
Categoría léxica Icono de marca de selección
Opinión de documento
Comprensión de tablas Icono de marca de selección

Para obtener más información sobre los siguientes enriquecimientos preconstruidos, consulte los siguientes temas:

Para obtener más información sobre cómo crear enriquecimientos personalizados, consulte Adición de recursos específicos de dominio.

Para obtener más información sobre cómo obtener el máximo provecho de los enriquecimientos, lea la publicación del blog Enriqueciendo sus documentos puede hacer que la búsqueda sea más efectiva.

Para obtener más información sobre cómo aplicar enriquecimientos utilizando la API, consulte Aplicación de enriquecimientos utilizando la API.

Añadir enriquecimientos

Para añadir un enriquecimiento NLP, siga estos pasos:

  1. Abra el proyecto y vaya a la página Gestionar colecciones.

  2. Pulse para abrir la colección que desea enriquecer.

  3. Abra la pestaña Enriquecimientos.

  4. Desplácese para encontrar el enriquecimiento de NLP que desea aplicar a los documentos.

    Se listan tanto los enriquecimientos incorporados como los enriquecimientos personalizados. Los enriquecimientos incorporados tienen un valor de tipo System.

  5. Elija uno o más campos a los que aplicar el enriquecimiento.

    Puede aplicar enriquecimientos a los campos text y html, y a los campos personalizados que se han añadido desde archivos JSON o CSV cargados o desde la herramienta Smart Document Understanding (SDU).

  6. Pulse Aplicar cambios y volver a procesar.

Los enriquecimientos que habilite se aplicarán a los documentos en orden aleatorio. Para obtener información sobre cómo eliminar un enriquecimiento, consulte Gestión de enriquecimientos.

Entidades

Identifica entidades. Las entidades son términos que normalmente representan nombres adecuados como personas, ciudades y organizaciones que se mencionan en la recopilación de datos. Discovery puede reconocer entidades que forman parte de un sistema de tipos de entidad definido por el servicio Watson Natural Language Processing (NLP).

Si desea poder identificar términos poco comunes que son significativos para su empresa, puede entrenar su propio modelo para reconocer entidades personalizadas. Para obtener más información, consulte Extractor de entidad.

El servicio de extractor de entidad NLP de Watson que utiliza Discovery se denomina sistema de tipo NLU. El nombre se origina en el hecho de que el sistema de tipos lo utiliza el servicio Watson Natural Language Understanding (NLU) además del servicio Watson Discovery. Sin embargo, es la implementación de NLP de Watson del sistema de tipos que utiliza directamente Discovery, no la implementación de NLU de Watson. Como resultado, las dos implementaciones pueden producir resultados diferentes. Para obtener una idea general de los tipos de entidades reconocidas por el servicio, consulte Entidades.

La siguiente captura de pantalla muestra que el enriquecimiento Entidades reconoce los términos Sistemas de Gobierno y Rey de Gran Bretaña (entre otros) y los etiqueta como menciones de entidad.

Muestra la declaración con los términos Gobiernos y Rey de Gran Bretaña resaltados.
The recognized entities, Governments and King of Great Britain, are highlighted

En la vista JSON del documento, puede ver la estructura JSON subyacente de las menciones de entidad.

Muestra la vista JSON de las entidades Sistemas de Gobierno y Rey de Gran Bretaña que se identifican en el documento*Representación
de las
de entidades reconocidas*

Si desea buscar el tipo de entidad Organización, por ejemplo, puede copiar todo el contenido JSON en un editor de texto y buscar Organization. Pulse el icono Copiar desde la raíz de la vista de árbol JSON.

Ejemplo

Entrada

"IBM is an American multinational technology company headquartered in Armonk."

Respuesta

En la salida JSON:

  • text = serie. El texto de la entidad
  • type = serie. El tipo de entidad, como Organization, Location, Person, Number.
  • mentions = matriz. Las menciones y ubicaciones de entidades
  • model_name = serie. Para los modelos personalizados, este campo contiene el nombre del modelo proporcionado por el usuario. De lo contrario, este campo contiene el nombre predeterminado del modelo, como watson_knowledge_studio, dictionary, character_pattern o natural_language_understanding
{
  "entities": [
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.8317045,
          "location": {
            "end": 3,
            "begin": 0
          },
          "text": "IBM"
        }
      ],
      "text": "IBM",
      "type": "Organization"
    },
    {
      "model_name": "natural_language_understanding",
      "mentions": [
        {
          "confidence": 0.6114863,
          "location": {
            "end": 75,
            "begin": 69
          },
        "text": "Armonk"
        }
      ],
      "text": "Armonk",
      "type": "Location"
    }
  ]
}

Palabras clave

Devuelve las palabras clave importantes del contenido.

Por ejemplo, la siguiente captura de pantalla muestra los términos resaltados de la declaración de independencia de EE.UU. reconocidos por el enriquecimiento de palabras clave.

Muestra las palabras clave reconocidas en el texto del
reconocidos por el
de palabras clave*

En la vista JSON del documento, puede ver la estructura JSON subyacente de la mención de palabra clave Declaration.

Muestra la vista JSON de las palabras clave identificadas en el documento*Representación
de las
de enriquecimiento de palabras clave*

Ejemplo

Entrada

"Watson Discovery is an award-winning AI search technology."

Respuesta

En la salida JSON:

  • text = el texto de palabra clave
  • mentions = Las menciones y ubicaciones de entidades
{
  "keywords": [
    {
      "mentions": [
        {
          "location": {
            "end": 157,
            "begin": 141
          },
          "text": "Watson Discovery"
        }
      ],
      "text": "Watson Discovery",
      "relevance": 0.503613
    },
    {
      "mentions": [
        {
          "location": {
           "end": 177,
            "begin": 164
          },
          "text": "award-winning"
        }
      ],
      "text": "award-winning",
      "relevance": 0.728722
    },
    {
      "mentions": [
        {
          "location": {
            "end": 198,
            "begin": 181
          },
          "text": "search technology"
        }
      ],
      "text": "search technology",
      "relevance": 0.779356
    }
  ]
}

Límites de palabras clave

El enriquecimiento Palabras clave puede identificar hasta 50 palabras clave, cada una con una o varias menciones, por documento.

Categoría léxica

Reconoce y etiqueta partes del discurso, incluyendo sustantivos, verbos, adjetivos, adverbios, conjunciones, interjecciones y números.