Utilizar modelos ML importados para buscar términos personalizados

Utilice modelos personalizados de Machine Learning que utilicen reglas o contexto para reconocer y etiquetar entidades.

Añada los modelos de Machine Learning que ha creado con las herramientas de IBM que puede utilizar para definir su propio sistema de tipos.

El tipo de modelos que puede añadir depende del despliegue:

  • IBM Cloud Pak for Data puede añadir modelos que se hayan creado con xml-ph-0000@deepl.internal xml-ph-0001@deepl.internal modelos de Studio o con una instancia de xml-ph-00 IBM Software Hub Puede añadir modelos que se hayan creado con Watson Explorer Content Analytics modelos de Studio, o con una instancia de IBM Watson® Knowledge Studio alojada en IBM Cloud Pak® for Data o IBM Cloud. A partir de la versión de 4.6.2, también puede añadir modelos de extractores de entidades personalizados que se hayan creado y exportado desde otra instancia de Discovery.

  • IBM Cloud Puede añadir modelos creados con una instancia de IBM Watson® Knowledge Studio alojada únicamente en IBM Cloud.

    Para utilizar un modelo de Knowledge Studio que se ha creado con Knowledge Studio en IBM Cloud Pak for Data, migre los datos de campo a una instancia de IBM Cloud de Knowledge Studio.

Se admiten los siguientes tipos de modelos:

  • Modelos basados en reglas creados en Knowledge Studio que encuentran entidades en documentos basados en reglas que defina. (Formato de archivo: .pear)
  • Modelos de aprendizaje automático creados en Knowledge Studio que comprenden los matices lingüísticos, el significado y las relaciones específicas de su sector (formato de archivo: .zip)
  • Extractores de entidad personalizados que se crean y exportan desde Discovery. (Formato de archivo: .ent)
  • Clasificadores de sentencia que se crean y exportan desde Discovery. (Formato de archivo: .sc)
  • IBM Cloud Pak for Data modelos de análisis de texto UIMA personalizados creados en xml-ph-0000@deepl.internal xml-ph-0001@deepl.internal Studio IBM Software Hub Modelos de análisis de texto UIMA personalizados creados en Watson Explorer Content Analytics Studio. (Formato de archivo: .pear)

Desde los despliegues instalados, se ha añadido soporte para importar modelos de extractor de entidad con el release 4.6.2.

El descubrimiento no puede identificar los subtipos de entidad definidos por un modelo Knowledge Studio.

Para añadir un modelo de e Machine Learning, siga estos pasos:

  1. Cree el modelo y expórtelo desde la herramienta que utilice para crearlo.

    Para obtener más información, consulte la siguiente documentación:

  2. En la sección Enseñar conceptos de dominio del panel Herramientas de mejora y, a continuación, pulse Importar modelos de aprendizaje automático.

  3. Especifique un nombre para el modelo y, a continuación, elija el idioma que se ha utilizado para definir el modelo.

  4. Pulse Cargar para buscar el archivo que ha exportado anteriormente.

  5. Pulse Crear.

  6. Elija la colección y el campo donde desea aplicar los enriquecimientos del modelo y, a continuación, pulse Aplicar.

Si el modelo es demasiado grande para cargarlo desde la interfaz de usuario del producto, puede utilizar el método Crear un enriquecimiento de la API para importar el archivo.

Ejemplo de modelo basado en reglas

Por ejemplo, cuando se aplica un modelo de aprendizaje automático como enriquecimiento a un campo, extrae todos los tipos de entidad de ese campo que se especificaron en un modelo basado en reglas de aprendizaje automático ( Knowledge Studio ). Si el modelo reconoce tipos de entidad como person, surname y job title, se reconocen en los documentos y se etiquetan.

En la salida, la información extraída por el enriquecimiento Machine Learning en la matriz enriched_{field_name}, dentro de la matriz entities. En este ejemplo, el campo seleccionado para el enriquecimiento es text.

{
  "enriched_text": [
    {
      "entities": [
        {
          "path": ".wksrule.entities.PERSON",
          "text": "George Washington",
          "type": "PERSON"
        },
        {
          "path": ".wksrule.entities.GIVENNAME",
          "text": "George",
          "type": "GIVENNAME"
        },
        {
          "path": ".wksrule.entities.SURNAME",
          "text": "Washington",
          "type": "SURNAME"
        },
        {
          "path": ".wksrule.entities.POSITION",
          "text": "politician",
          "type": "POSITION"
        },
        {
          "path": ".wksrule.entities.POSITION",
          "text": "soldier",
          "type": "POSITION"
        },
        {
          "path": ".wksrule.entities.JOBTITLE",
          "text": "President of the United States",
          "type": "JOBTITLE"
        }
      ],
      "text": [
        "George Washington (February 22, 1732‚ December 14, 1799) was an American politician and soldier who served as the first President of the United States from 1789 to 1797 and was one of the Founding Fathers of the United States."
      ]
    }
  ]
}

Como resultado, si alguien utiliza la API para enviar una consulta de lenguaje de consulta Discovery para buscar apariciones del enriquecimiento de enriched_{field_name}.entities.type:jobtitle, se devuelven los pasajes que tratan sobre el puesto de trabajo de una persona.

Ejemplo de modelo de aprendizaje automático

En este ejemplo, un modelo de aprendizaje automático extrae tipos de entidad como person, oranization y date, e información sobre las relaciones entre las entidades. Cuando este modelo de aprendizaje automático se aplica como enriquecimiento a un campo, utiliza el aprendizaje automático para comprender los matices lingüísticos, el significado y las relaciones que se mencionan en el documento.

En la salida, la información extraída por el enriquecimiento Machine Learning en la matriz enriched_{field_name}, dentro de las matrices entities y relations. En este ejemplo, el campo seleccionado para el enriquecimiento es text.

{
  "enriched_text": [
    {
      "entities": [
        {
          "count": 1,
          "text": "Democratic Party",
          "type": "ORGANIZATION"
        },
        {
          "count": 1,
          "text": "March 15, 1767",
          "type": "DATE"
        },
        {
          "count": 1,
          "text": "President",
          "type": "POSITION"
        },
        {
          "count": 1,
          "text": "Andrew Jackson",
          "type": "PERSON"
        }
      ],
      "relations": [
        {
          "sentence": "Andrew Jackson (March 15, 1767‚ June 8, 1845) was an American soldier and statesman who served as the seventh President of the United States from 1829 to 1837 and was the founder of the Democratic Party."
        }
      ]
    }
  ]
}

Límites del modelo de aprendizaje automático

El número de modelos de Machine Learning (ML) que puede crear por instancia de servicio depende del tipo de plan Discovery.

Límites de plan de modelo ML
Planifique Modelos ML por instancia de servicio
Cloud Pak for Data Ilimitado
Premium 10
Empresa 10
Plus (incluye prueba) 3

Para cada modelo de aprendizaje automático de Knowledge Studio, el número máximo de entidades que se pueden detectar es 50.

Modelos de reglas avanzadas

Añada un modelo de reglas avanzadas para aplicar un modelo de extracción de texto que se ha creado y exportado desde el editor de reglas avanzadas de IBM Watson® Knowledge Studio a la colección.

El modelo debe crearse con el despliegue de Knowledge Studio adecuado:

  • IBM Cloud Pak for Data puede añadir modelos que se hayan creado y exportado desde los siguientes lugares IBM Software Hub Puede añadir modelos que se hayan creado y exportado desde los siguientes lugares:

    • IBM Watson® Knowledge Studio que se ha creado con un despliegue de IBM Cloud Pak® for Data anterior al release 4.5.
    • IBM Watson® Knowledge Studio que se aloja en IBM Cloud
    • Editor de NLP creado por colaboradores del Centro de tecnologías de datos e IA de código abierto
  • IBM Cloud Puede añadir modelos que se hayan creado con una instancia de IBM Watson® Knowledge Studio alojada únicamente en IBM Cloud.

Eliminación de Knowledge Studio

Ha finalizado el soporte para crear modelos con el editor de reglas avanzadas beta en Knowledge Studio. Los modelos de reglas que se han exportado desde Knowledge Studio antes de la fecha de fin de soporte se pueden seguir utilizando en Discovery.

Las fechas de fin de soporte difieren en función del tipo de despliegue:

  • IBM Cloud 30 de junio de 2022
  • IBM Cloud Pak for Data IBM Cloud Pak for Data lanza 4.5.1 el 3 de agosto de 2022.

IBM Cloud Como alternativa al uso de un modelo generado por el Editor de reglas avanzadas de Knowledge Studio, puede definir una reglaañadiendo un enriquecimiento de Patrones.

Adición de un modelo existente

Para añadir un modelo de reglas avanzado, realice los pasos siguientes:

  1. Cree el modelo y exporte el archivo ZIP que contiene los recursos del modelo.

    Para obtener más información sobre cómo exportar el modelo, consulte las instrucciones para el origen del modelo:

  2. En la sección Enseñar conceptos de dominio del panel Herramientas de mejora, elija Modelo de reglas avanzado.

  3. Pulse Cargar.

  4. Especifique un nombre para el modelo y, a continuación, elija el idioma que se ha utilizado para definir el modelo.

  5. Especifique un nombre para el campo de resultado, que es el campo del índice donde se almacenará la salida de este enriquecimiento.

  6. Pulse Cargar para buscar el archivo ZIP que ha exportado anteriormente.

  7. Pulse Crear.

  8. Elija la colección y el campo donde desea aplicar los enriquecimientos del modelo y, a continuación, pulse Aplicar.

Formato de salida para reglas avanzadas

Knowledge Studio utiliza Annotation Query Language (AQL) para definir las reglas en un modelo de reglas avanzado. Cada modelo está definido por una o más vistas. Cada vista es una estructura de datos relacional que contiene varios registros de datos. Cada registro se compone de valores en columnas definidas por el esquema de la vista. Para facilitar la representación de estos modelos, que son personalizados y, por lo tanto, tienen varios esquemas, se utiliza un esquema de salida JSON uniforme.

  • Cada objeto JSON representa una vista AQL (Annotation Query Language).
  • Los pares de nombre y valor de los objetos JSON representan los nombres y valores de los atributos de la vista.
  • Las tuplas en una vista AQL se representan como una matriz de objetos JSON, con un objeto para cada tupla en la vista.

La siguiente tabla describe cómo se representan los tipos de datos AQL en la sintaxis JSON.

Esquema de salida JSON del modelo de reglas avanzado
Tipo de datos AQL Sintaxis JSON Ejemplo de JSON
Entero número 5
Flotante número 4.13
Boolean booleano true
Texto serie "some string"
Amplitud objeto con el formato {"text": String, "location": {"begin": Integer, "end": Integer}} { "text": "Jane", location": {"begin": 5, "end": 9} }
Caso especial: valor nulo nulo null
Lista de enteros matriz de valores de número [ 1, 2, 3, 4, 5]
Lista de flotantes matriz de valores de número [ 4.13, 4.5 ]
Lista de booleanos matriz de valores booleanos [ true, true, false]
Lista de texto matriz de valores de serie [ "some string", "another string" ]
Lista de espacios matriz de objetos con el formato {"text":String, "location": {"begin": Integer, "end": Integer}} [{ "text":"Jane", "location": {"begin": 5, "end": 9} }, { "text":"...", "location": {"begin": 15, "end": 40} }]
Caso especial: lista vacía matriz con 0 elementos [ ]

Límites de modelo de reglas avanzadas

El número de modelos de reglas avanzadas que puede definir por instancia de servicio depende del tipo de plan Discovery.

Límites del plan de modelo de reglas avanzadas
Planifique Modelos de reglas avanzadas por instancia de servicio
Cloud Pak for Data Ilimitado
Premium 3
Empresa 3
Plus (incluye prueba) 1