Migración a Discovery v2

En noviembre de 2019 se presentó un rediseño del producto, Discovery v2. Discovery v2 ofrece ventajas significativas sobre Discovery v1.

Obtenga información sobre cómo migrar una instancia de servicio de v1 Discovery a Discovery v2, incluido cómo mover datos y actualizar las aplicaciones.

Las principales diferencias estructurales entre Discovery v1 y v2 incluyen:

  • No existe ningún concepto de entorno en v2. Los detalles de despliegue, como el tamaño y la capacidad de índice, se gestionan cuando elige el plan de servicio adecuado para sus necesidades. Para despliegues gestionados, puede elegir un plan Plus, Enterprise o Premium, por ejemplo. Para los despliegues instalados, el dimensionamiento se gestiona mediante el tipo de despliegue que especifique al instalar el servicio en Cloud Pak for Data.

  • No hay ningún objeto de configuración único en v2. El control de los enriquecimientos que se aplican a los documentos se gestiona en las colecciones y objetos de proyecto en v2. Otras prestaciones de configuración de v1, como la posibilidad de personalizar el paso de conversión de la ingestión, no están disponibles en v2.

  • Hay mayor soporte programático disponible para los enriquecimientos personalizados en v2. Hay disponibles nuevos métodos de API de enriquecimiento que puede utilizar para crear enriquecimientos. v2 también introduce métodos de API de clasificador de documentos que puede utilizar para entrenar modelos de clasificador de documentos mediante programación. Puede aplicar estos enriquecimientos personalizados a una colección utilizando la API.

  • Las prestaciones de una búsqueda de consulta en lenguaje natural se expanden en v2 para habilitar la devolución de los pasajes principales por documento y de respuestas sucinta de los pasajes. Se introducen otras prestaciones de búsqueda avanzada, incluida la recuperación de tablas. En v2, el parámetro de deduplicación no está disponible y las funciones de registro de consultas y entrenamiento de relevancia continuo no están disponibles.

  • Para obtener más información sobre las diferencias de características, consulte la tabla de comparación de características.

  • Para obtener más información sobre las diferencias de API detalladas, consulte Comparación de versiones de API.

Discovery v2 está disponible para todos los usuarios de instancias de plan Plus o Enterprise, o instancias de plan Premium que se crearon después del 15 de julio de 2020. v2 también está disponible para el cartucho IBM Watson® Discovery para los usuarios de IBM Cloud Pak® for Data.

Visión general de la migración

La migración de Discovery v1 a v2 es un proceso de varios pasos que puede realizar de forma independiente.

Las dos versiones del servicio Discovery tienen muchas diferencias, pero puede adoptar técnicas y programas de utilidad que se han aplicado a una instancia de v1 para utilizarlas con la nueva instancia de v2.

Para migrar de v1 a v2, debe completar los siguientes pasos de alto nivel:

  1. Planifique la migración.
  2. Transferir los documentos.
  3. Actualice la aplicación para que utilice la API v2.
  4. Prueba de regresión y despliegue la aplicación actualizada.
  5. Suprima la instancia de servicio del plan v1.

Algunos pasos requieren que realice cambios programáticos utilizando la API y otros implican cambios que puede realizar desde la interfaz de usuario del producto.

Planificar la migración

Familiarícese con las novedades de v2 y obtenga información sobre cómo difiere de v1 antes de suministrar una instancia de v2. Su primera instancia de prueba del plan v2 Plus está disponible de forma gratuita durante 30 días. Obtenga información y planifique la migración antes de suministrar la instancia para que pueda obtener el máximo provecho de la versión de prueba.

Cuando esté listo para iniciar la migración, cree una planificación de migración que usted y su equipo puedan seguir a medida que complete el proceso. Asegúrese de configurar la nueva instancia de servicio v2 y volver a crear proyectos y colecciones en la nueva instancia de servicio antes de pasar a utilizar el servicio v2 y antes de suprimir la instancia v1.

Obtenga información sobre las opciones del plan Discovery v2, para que pueda elegir el plan adecuado para sus necesidades a largo plazo. El plan Plus que utilice para empezar puede ser suficiente. Sin embargo, puede optar por utilizar un plan Enterprise o Premium en su lugar. Desde un plan Plus, puede realizar una actualización in situ a un plan Enterprise, pero no a un plan Premium.

Planifique cómo adaptar la aplicación

Uno de los principales cambios entre versiones es que Discovery v2 introduce proyectos. Un proyecto consta de una o más colecciones. La ventaja de utilizar proyectos es que una consulta se puede ejecutar en muchas colecciones al mismo tiempo. Cada colección puede contener documentos que usted cargue o que rastree desde una única fuente de datos, como un sitio web, Microsoft SharePoint, y más.

Aspectos a tener en cuenta al adaptar la aplicación para utilizar proyectos:

  • Aunque el concepto de un entorno no existe en v2, los datos se siguen organizando en recopilaciones. En v2, las colecciones se agrupan en proyectos. En la mayoría de los casos, desea migrar una única colección v1 a una única colección v2.

    Si desea mantener la información de entrenamiento de relevancia que se aplica a una colección v1, añada los documentos de colección a una sola colección en el proyecto v2.

  • Decida cuántas colecciones desea añadir a cada proyecto v2. Todos los tipos de proyecto, excepto los proyectos de Content Mining, pueden contener hasta 5 colecciones. Elija el tipo de proyecto adecuado para sus datos.

    Para optimizar los resultados de la búsqueda, se aplican automáticamente diferentes enriquecimientos y opciones de configuración a las colecciones que se añaden a distintos tipos de proyecto. Para más información, consulte los temas siguientes:

  • La API Discovery v2 ha cambiado para tener en cuenta proyectos y colecciones, entre otras mejoras. Algunas llamadas de API han cambiado para dar soporte a acciones a nivel de proyecto en lugar de a nivel de colección, como por ejemplo el envío de una consulta y la ejecución de un entrenamiento de relevancia. Muchos otros métodos de API han cambiado y algunos no están disponibles en v2. Para obtener una comparación detallada de los métodos de API v1 y v2, consulte Comparación de versiones de API.

Selección de un plan de servicios

Elija entre los planes gestionados Plus, Enterprisey Premium u opte por una instalación local adquiriendo el cartucho Discovery para IBM Cloud Pak for Data. Revise las ventajas y los límites de cada tipo de plan antes de elegir uno.

La tabla siguiente muestra los tipos de plan para despliegues gestionados que generalmente son similares entre v1 y v2.

Planes similares
Plan v1 actual Ejemplo de uso de datos v1 Plan v2 similar
Lite No aplicable Versión de prueba plus (sin cargo solo durante 30 días)
Avanzado (uso bajo) 10.000 documentos, 10.000 consultas al mes Más
Avanzado (uso alto) 100.000 documentos, 100.000 consultas al mes Empresa
Premium No aplicable Enterprise o Premium

Para obtener información sobre el almacenamiento actual, los documentos y las colecciones utilizados, pulse el icono Detalles de entorno en la cabecera de la interfaz de usuario del producto.

No puede realizar una actualización in situ desde un plan v1, como Lite o Advanced, a un plan v2. Debe crear un nuevo plan v2 y, a continuación, mover los datos a la nueva instancia de servicio. Al migrar los datos de v1 a v2, es probable que tenga una instancia de v1 y v2 desplegadas al mismo tiempo. Considere la posibilidad de utilizar la prueba gratuita de 30 días que está disponible con la primera instancia del plan Plus durante este tiempo.

Recopilación de métricas

Tome nota de la siguiente información para poder compararla con los datos de la instancia de servicio después de la migración:

  • Número de recopilaciones

    Para obtener el número de colecciones en una instancia en v1, utilice la API Listar colecciones.

  • Número de documentos por colección

    Para obtener el número de documentos de una colección en v1, utilice la API Obtener detalles de colección.

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}`
    

    La API devuelve información sobre el estado de los documentos de la colección, que incluye el número total de documentos disponibles.

    "document_counts": {
        "available": 34,
        "{other}":"{values...}"
    }
    

Transferencia de documentos de v1 a v2

La forma de transferir los documentos depende de la técnica que se utilizó para ingerirlos en v1.

Vuelva a crear una colección a la vez. Si inicia varios procesos de ingestión al mismo tiempo, puede gravar los recursos del sistema y aumentar el tiempo global que tarda en completarse el proceso. También desea estar atento a los mensajes informativos generados por el proceso de ingestión. Es más fácil resolver un problema de ingestión, por ejemplo, al ingerir una colección a la vez.

Datos cargados

Si ha utilizado la API para cargar documentos en Discovery v1, hay una API similar disponible en v2 para cargar documentos en colecciones. Debe actualizar los flujos de trabajo que utilice para automatizar el proceso para tener en cuenta la nueva organización de proyectos y colecciones.

Si los documentos originales que ha ingerido en Discovery v1 ya no están disponibles, puede utilizar la API de consulta para extraer el texto del documento de Discovery v1. A continuación, puede añadir el texto a una colección en Discovery v2. Para obtener más información, consulte Recuperación de documentos.

Datos rastreados

Si ha rastreado datos de un origen de datos externo en v1, puede continuar rastreando datos del mismo origen de datos externo en v2. Se da soporte a todos los mismos orígenes de datos.

Para utilizar datos de un origen de datos externo, debe volver a crear las colecciones dentro de un proyecto v2 y configurar cómo se rastrea el origen de datos. Para obtener más información, consulte Visión general de orígenes de datos.

El servicio necesita tiempo y recursos para rastrear e ingerir documentos de orígenes de datos externos. Vuelva a crear los conectores de uno en uno. Factorice el tiempo que tarda en volver a rastrear los datos en la planificación del plan de migración.

Recopilaciones de datos precompiladas

Las siguientes recopilaciones de orígenes de datos incorporadas no están disponibles en v2:

Watson Discovery Noticias
Este origen de datos enriquecido previamente no se ofrece en v2. Para obtener más información sobre una forma alternativa de obtener datos de noticias, consulte Utilización de un servicio de noticias con v2.
Kit de COVID-19
Esta colección precompilada se ha diseñado para ayudarle a impulsar un chatbot dinámico que se crea con IBM® watsonx™ Assistant y Discovery para responder a las preguntas de sus clientes sobre COVID-19. En v2, puede crear una solución similar. Cree un tipo de proyecto Búsqueda conversacional con recopilaciones que rastreen sitios web de confianza para obtener respuestas a las preguntas de COVID-19.

Ingestión de datos

Para ingerir datos de v1 en una instancia de Discovery v2, realice los pasos siguientes:

  1. Crear una instancia de servicio de v2.

  2. Cree un proyecto.

  3. Añada una colección al proyecto.

    • Datos cargados:

      Desde la API, puede crear una colección y añadirle documentos con dos métodos distintos. Utilice el método Crear una colección para crear la colección. A continuación, añada los mismos documentos de origen que ha añadido a la colección v1 a la colección v2. Utilice los métodos Añadir documento o Actualizar documento. Para asignar el mismo ID de documento v1 al documento a medida que lo añade a la colección v2, añada el ID de documento al punto final. Para obtener más información, consulte Retención de ID de documento.

      En la interfaz de usuario del producto v2, cargue los mismos documentos de origen que ha añadido a la colección v1 en la colección v2.

    • Datos rastreados: no puede rastrear datos de un origen de datos externo mediante programación en v2. Desde la interfaz de usuario del producto, vuelva a crear la conexión con el origen de datos externo y, a continuación, rastree el origen de datos externo desde cero.

  4. En la interfaz de usuario del producto, puede configurar la colección Discovery v2. Por ejemplo, puede elegir si desea habilitar el reconocimiento óptico de caracteres. Para un origen de datos externo, puede establecer la planificación de rastreo.

  5. Aplique enriquecimientos a los datos. Puede aplicar enriquecimientos predefinidos de procesamiento de lenguaje natural o enriquecimientos personalizados que cree.

    En v1, los enriquecimientos se asocian con la configuración que se genera al crear el entorno. En v2, los enriquecimientos se asocian con la configuración de la colección. Algunos enriquecimientos se aplican a la colección de forma predeterminada, en función del tipo de proyecto utilizado. Para obtener más información, consulte Valores predeterminados del proyecto. En v2, puede configurar la colección para utilizar cualquier subconjunto de enriquecimientos disponibles en los campos del documento.

Retención de ID de documento

Los ID de documento se asignan a los documentos que añade a una colección v2 cuando los carga desde la interfaz de usuario del producto o los añade utilizando el método de API Añadir un documento.

Es posible que desee conservar los ID de los documentos v1 en v2 si está utilizando procesos que dependen de estos identificadores exclusivos. Por ejemplo, las pruebas de regresión para la aplicación pueden verificar que se devuelven documentos específicos comprobando los ID de documento. El entrenamiento de relevancia utiliza los ID de documento para realizar un seguimiento de los documentos entre ejecuciones de entrenamiento. Estos procesos son más fáciles de adaptar si los ID de documento son los mismos entre las instancias v1 y v2. De lo contrario, los procesos que se utilizan con la instancia de Discovery v1 se deben volver a correlacionar con los ID asignados a los documentos después de que se añadan a la instancia de Discovery v2.

Si ha especificado sus propios ID de documentos al añadir documentos a la instancia de servicio v1, puede conservar los ID utilizando el método Actualizar un documento en lugar del método Añadir un documento. Con el método de actualización, puede asignar un ID de documento al documento a medida que lo añade a la colección v2. Para obtener más información, consulte Actualizar un documento.

Si los datos se almacenan en un archivo JSON, una matriz del documento original genera un ID de documento con un número añadido. Por ejemplo, original_id_n. Para conservar el ID de documento original sin el sufijo de número, elimine la matriz en el archivo JSON. Cambie [ {"name": "value"} ] por {"name": "value"}, por ejemplo.

Si los documentos v1 tienen ID generados por el sistema, puede enviar una consulta de búsqueda vacía para recuperar una lista de los documentos y sus ID. A continuación, puede asignar el mismo ID a cada documento a medida que lo añade a la nueva colección en v2.

Recuperación de documentos

En algunos casos, los documentos originales que se han ingerido en Discovery V1 ya no están disponibles. Puede utilizar la instancia de Discovery v1 para recuperar información del documento. Discovery crea una copia de texto de cada documento que ingiere. La copia es sólo texto, por lo que los documentos en formato HTML, PDF u otros formatos no de texto se convierten a una versión de sólo texto.

Sólo puede recuperar los primeros 10.000 documentos de una colección utilizando este método. Para obtener más información sobre una forma de recuperar más de 10.000 documentos, consulte Recuperación de más de 10.000 documentos de una colección.

Para transferir información de documento de v1 a v2, realice los pasos siguientes:

  1. Extraiga los documentos de v1 utilizando la API para enviar una consulta vacía.

    Por ejemplo, GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=.

    La API devuelve los resultados. El campo matching_results especifica el número total de resultados. El objeto de resultados devuelve los documentos coincidentes. Cada documento se devuelve como un objeto JSON independiente. Devuelve un máximo de 10 documentos de forma predeterminada.

    {
      "matching_results": 34,
      "session_token": "nnn",
      "results": [
        {"{result objects}":"{maximum of 10 by default}"}
      ]
    }
    
  2. Puede utilizar los parámetros count y offset para revisar los resultados de la consulta y guardar todos los documentos.

    Por ejemplo, para obtener 100 documentos a la vez, puede establecer count en 100 y offset en 0 y enviar la consulta.

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=0
    

    A continuación, puede establecer de nuevo el recuento en 100, pero esta vez establezca el desplazamiento en 100 para obtener los siguientes 100 documentos.

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}/query?q=&count=100&offset=100`
    

    Repita este proceso, incrementando el desplazamiento en 100 hasta que recupere todos los documentos.

  3. Prepare los documentos exportados que se van a ingerir en v2.

    Cada archivo JSON resultante que obtiene de Discovery v1 contiene datos que se extraen del documento original, como por ejemplo texto, html y otros campos. Si los metadatos personalizados se asociaron con el documento cuando se cargó en v1, también está presente en el archivo JSON. Además, el archivo contiene varios campos generados por el análisis v1. Conserve sólo un subconjunto de estos datos como parte del documento que añada a Discovery v2.

    Las sugerencias siguientes pueden ayudarle a decidir qué campos mantener:

    • Incluya el campo text o cualquier otro campo con contenido textual que desee que pueda enriquecer o buscar en Discovery v2.
    • Incluya los metadatos personalizados que se almacenan en el documento. Estos metadatos suelen ser específicos de la aplicación que utiliza Discovery y se utilizan para filtrar documentos en una búsqueda. Por ejemplo, metadata.customer_id.
    • No incluya enriquecimientos de Discovery v1. Por ejemplo, enriched_text.entities. Discovery v2 genera sus propios enriquecimientos.
    • Excluya los campos generados por Discovery a menos que los utilice la aplicación y que contengan información que sea exclusiva de la versión v1 del documento. En ese caso, cambie el nombre del campo para que no se sustituya cuando se ingiera el documento en Discovery v2. Por ejemplo, extracted_metadata.publicationdate es un campo generado por Discovery cuando se ingiere un documento. Tal vez desee conservar la información de metadata.parent_document_id de v1 para comprender cómo se generaron originalmente los subdocumentos a partir de un único documento de origen.
    • Evite los campos que tienen nombres de campo reservados. Para obtener más información, consulte Cómo se manejan los campos.
  4. Ingiera cada documento JSON v1 editado en la instancia de Discovery v2. El ID de documento Discovery v1 se puede mantener en Discovery v2. Para obtener más información sobre cómo conservar el ID de documento, consulte Retención de ID de documento.

Recuperación de más de 10.000 documentos de una colección

Una consulta sólo puede devolver hasta 10.000 documentos. Sin embargo, si desea recuperar más de 10.000 documentos de la colección, necesita una forma de separar los documentos en subgrupos no solapados. Cada subgrupo debe contener menos de 10.000 documentos que una consulta puede devolver. A continuación, puede paginar a través de los resultados para recuperar los documentos.

La paginación de los resultados está restringida al máximo de 10.000 documentos devueltos por la consulta. En concreto, el uso combinado de los parámetros de paginación count y offset no puede superar los 10.000 documentos.

Una forma de separar los documentos en subgrupos no solapados es aprovechar un campo que existe en cada documento y contiene un valor exclusivo. Por ejemplo, el campo SHA-1 contiene un hash del archivo de origen original y se formatea como un valor de serie hexadecimal. Puede utilizar el primer carácter del campo como una forma de dividir la colección en subgrupos. Puesto que SHA-1 contiene un valor hexadecimal, el primer carácter puede tener hasta 16 valores posibles (0-9 o a-f). Si filtra por first_char_of (SHA-1) == 0, es posible que devuelva aproximadamente 1/16 de toda la colección. A continuación, puede realizar un bucle a través de cada uno de los 16 valores posibles para obtener el resto de los documentos. Si no se devuelve un número óptimo de documentos en uno de los subgrupos, puede utilizar los 2 primeros caracteres del campo SHA-1 para dividir la colección en 256 subgrupos en su lugar.

Transferencia de entrenamiento de relevancia

El entrenamiento de relevancia realizado en Discovery v1 se puede transferir a Discovery v2. La transferencia del entrenamiento funciona mejor con un proyecto Discovery v2 que tiene una colección que contiene los mismos documentos de la colección Discovery v1.

Incluso si se han añadido recopilaciones o se han cambiado documentos, se puede transferir el entrenamiento de relevancia. Sin embargo, debe actualizar el entrenamiento para tener en cuenta los cambios.

Para transferir el entrenamiento de relevancia, realice los pasos siguientes:

  1. Cargue los documentos en Discovery v2.

  2. Descargue mediante programación las consultas que se han utilizado para el entrenamiento de relevancia en Discovery v1. Para obtener más información, consulte Listar datos de entrenamiento.

  3. Vuelva a crear mediante programación los datos de entrenamiento de relevancia en Discovery v2. Añada cada consulta de entrenamiento por separado utilizando el método Crear una consulta. Para obtener más información, consulte Crear una consulta de entrenamiento.

    Asegúrese de especificar el ID de colección v2. También debe especificar el ID de documento.

    Si no ha conservado los ID de documento entre las colecciones v1 y v2, debe encontrar el ID de documento v2 que corresponde al ID de documento v1 al que se hace referencia en el ejemplo de consulta descargado.

Transferencia de modelos

Puede reutilizar algunos de los modelos que ha creado en v1 con el proyecto v2.

Modelos SDU (Smart Document Understading)

Puede importar un modelo SDU que se haya creado con Discovery v1 en Discovery v2. Sin embargo, el rendimiento del modelo puede diferir entre versiones. Compare los resultados del modelo v1 SDU en v2 para verificar que el comportamiento es el mismo. No puede editar el modelo de SDU v1 importado. Si el modelo importado no puede reconocer los elementos de documento que ha reconocido en v1 y que son importantes para su caso de uso, debe volver a crear el modelo SDU en la interfaz de usuario del producto Discovery v2. Para obtener más información, consulte Exportación de modelos SDU en la documentación de v1 y importación del modelo SDU en la documentación de v2.

Modelos de aprendizaje de máquina

No puede desplegar modelos directamente en instancias de servicio de Discovery v2 desde Knowledge Studio. En su lugar, debe exportar los modelos de aprendizaje automático de Knowledge Studioy, a continuación, importarlos a Discovery. El modelo debe haberse exportado desde Knowledge Studio después del 16 de julio de 2020. Si tiene un modelo que se ha exportado antes de esa fecha, debe volver a exportar el modelo desde Knowledge Studio. Solo los planes Knowledge Studio de pago dan soporte a la exportación de modelos.

Para obtener más información, consulte uno de los temas siguientes:

Para obtener información sobre cómo importar un modelo a Discovery v2, consulte Importación de modelos de Machine Learning.

Actualice la aplicación para que utilice la API v2

Los SDK de desarrollador de Watson dan soporte a Discovery v1 y v2.

Estas instrucciones presuponen que la aplicación está utilizando la versión más reciente de la API v1 (versión 2019-04-30).

Al portar una aplicación que actualmente utiliza la API Discovery v1 para utilizar v2, debe planificar cómo abordar las siguientes diferencias de alto nivel entre las dos versiones.

Además de estos cambios de alto nivel, revise las diferencias en un nivel por método para comprender qué más debe cambiar. Para obtener más información, consulte Comparación de versiones de API.

  • v2 organiza los datos por proyecto y colecciones; no hay ningún concepto de entorno. Por ejemplo, compare las solicitudes siguientes para obtener una colección:

    v1 Obtener recopilación

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}
    

    v2 Obtener recopilación

    GET {url}/v2/projects/{project_id}/collections/{collection_id}
    
  • En v1, el entrenamiento de relevancia se ejecuta en una única colección. En v2, el entrenamiento de relevancia se ejecuta en un proyecto. El proyecto puede contener muchas colecciones. Si es así, el entrenamiento de relevancia se aplica en todas las colecciones. Para obtener información sobre cómo transferir el entrenamiento de relevancia, consulte Transferencia del entrenamiento de relevancia.

    Por ejemplo, compare las siguientes solicitudes que devuelvan el estado del entrenamiento de relevancia:

    v1 Obtener recopilación

    GET {url}/v1/environments/{environment_id}/collections/{collection_id}
    

    v2 Obtener proyecto

    GET {url}/v2/projects/{project_id}
    
  • El envío de una consulta es similar entre las dos versiones. En v2, puede consultar todas las colecciones de un proyecto o puede limitar la consulta a una o más colecciones especificando un parámetro collection_ids. Por ejemplo, compare las siguientes solicitudes para consultar datos:

    Solicitud v1 Query

    POST {url}/v1/environments/{environment_id}/collections/{collection_id}/query
    

    Datos que se envían con la solicitud:

    {
      "query": "text:IBM"
    }
    

    Solicitud v2 Query

    POST {url}/v2/projects/{project_id}/query
    

    Datos que se envían con la solicitud:

    {
      "collection_ids": [
        "{collection_id_1}",
        "{collection_id_2}"
      ],
      "query": "text:IBM"
    }
    

    Opcionalmente, puede omitir el parámetro collection_ids para consultar en todas las colecciones del proyecto.

  • El parámetro passage para una consulta tiene una nueva opción per_document que clasifica los documentos por calidad de documento y, a continuación, devuelve los pasajes de mayor rango por documento en un campo document_passages para cada entrada de documento en la lista de resultados de la respuesta. Si es false, clasifica los pasajes de todos los documentos por calidad de pasaje independientemente de la calidad del documento y los devuelve en un campo de pasajes aparte en la respuesta.

  • Cuando se devuelven pasajes para una consulta, también puede habilitar el resultado de la respuesta. Cuando es true, los objetos de respuesta se devuelven como parte de cada pasaje de los resultados de la consulta. Cuando find_answers y per_document se establecen ambos en true, los resultados de la búsqueda de documentos y los resultados de la búsqueda de pasajes dentro de cada documento se reordenan utilizando las confianzas de respuesta. El objetivo de este reordenamiento es colocar la mejor respuesta como primera respuesta del primer pasaje del primer documento. De forma similar, si el parámetro find_answers se establece en true y el parámetro per_document se establece en false, los resultados de la búsqueda de pasajes se reordenan en orden decreciente de la respuesta de confianza más alta para cada documento y pasaje.

  • Tanto v1 como v2 dan soporte a palabras vacías personalizadas. Sin embargo, existen algunas diferencias en cómo se utilizan las palabras vacías personalizadas:

    • No hay ninguna lista de palabras vacías personalizadas predeterminada para las colecciones de japonés en v2.
    • Cuando define palabras vacías personalizadas en v1, la lista de palabras vacías sustituye a la lista de palabras vacías existente. En v2, la lista aumenta la lista predeterminada. No puede sustituir la lista, lo que significa que no puede eliminar las palabras vacías que forman parte de la lista predeterminada en v2.

Actualizar cómo maneja la aplicación los resultados de la consulta

Es posible que sea necesario actualizar la forma en que la aplicación muestra los resultados de la consulta debido a las siguientes diferencias entre la sintaxis del documento de resultados de la consulta entre las consultas v1 y v2:

  • En el nivel de enriquecimiento de entidad, la información siguiente no está soportada en v2:

    • Desambiguación
    • Emoción
    • Opinión

    El enriquecimiento Parte de voz se aplica automáticamente a los documentos de la mayoría de los tipos de proyecto en v2, pero los campos de índice generados por el enriquecimiento no se muestran en la representación JSON del documento.

    Diferencias en la estructura de datos de las " caption-side="bottom"} en la estructura de datos de las{: caption="

  • En lugar de count y relevance en v1, v2 incluye las menciones.

    Cada entrada de la mención corresponde a una aparición de la entidad en el texto del documento. En el ejemplo siguiente, se encuentran siete apariciones. Para cada aparición, se muestran una puntuación de confianza y los desplazamientos del texto de mención. Puede utilizar los desplazamientos para resaltar la mención en el texto del documento cuando el resultado se visualiza en una interfaz de usuario.

    Mentions in Discovery v2
    Entity mentions in Discovery v2

  • La estructura JSON de las respuestas de consulta se reorganiza ligeramente en v2.

  • La información de optimización de almacenamiento no se incluye en la respuesta de consulta v2.

  • En v2, enriched_text es una matriz en lugar de un objeto.

  • En Discovery v2, se utiliza el enriquecimiento Entidades v2. Los nombres de tipo de entidad en v2 se especifican en mayúsculas, en lugar de en mayúsculas. Si utiliza una consulta o agregación que especifica un nombre de entidad, debe cambiar las mayúsculas y minúsculas. Por ejemplo, cambie PERSON por Person.

  • Los campos de los archivos JSON que se añaden a una colección se convierten de forma diferente durante la ingestión entre v1 y v2. Si la aplicación manipula estos resultados, es posible que tenga que realizar ajustes.

    Puede especificar los objetos normalizations y conversions en el método Actualizar una colección de la API para mover o fusionar campos JSON.

    Cómo se manejan los campos de origen JSON
    Contenido de campo JSON original Representación v1 Representación v2 Notas
    "field": null "field": null N/D v1 conserva el valor nulo. v2 omite el campo nulo por completo.
    "field": "" "field": "" N/D v1 conserva el valor de texto vacío. v2 omite totalmente el campo de texto vacío.
    "field": "value2" "field": "value2" "field": "value2" Sin diferencia.
    "field": [] "field": [] N/D v1 conserva la matriz vacía. v2 omite el campo con la matriz vacía por completo.
    "field": [ "value4" ] "field": [ "value4" ] "field": "value4" v1 conserva la matriz singleton. v2 convierte la matriz singleton sólo en el valor; no se almacena como parte de una matriz.
    "field": [ 1, 2, 3 ] "field": [ 1, 2, 3 ] "field": [ 1, 2, 3 ] Sin diferencia.
    "field": [ "v6", "v7", "v8" ] "field": [ "v6", "v7", "v8"] "field": [ "v6", "v7", "v8"] Sin diferencia.

Verificación de que los datos se han migrado correctamente

Para verificar que la migración se ha realizado correctamente, compare las métricas siguientes con las métricas de que ha anotado antes de la migración.

  • Número de recopilaciones

    Asegúrese de volver a crear todas las colecciones que ha utilizado en v1 y que desea conservar. Con el método de API v2 Listar colecciones, puede obtener una lista de colecciones, pero debe enviar una solicitud por proyecto. No puede utilizar una llamada para obtener el número total de recopilaciones por instancia de servicio.

  • Número de documentos por colección

    Para las recopilaciones con datos cargados, compruebe el número de documentos de la recopilación enviando una consulta vacía con el método de API Consultar un proyecto. Especifique el parámetro de ID de colección para limitar los resultados a sólo documentos de una colección. Una consulta vacía devuelve todos los documentos. Por lo tanto, puede obtener el número total de documentos del valor matching_results en la respuesta.

    El número de documentos por colección debe estar cerca del número de documentos almacenados en la misma colección en v1. Es posible que los números no sean los mismos.

    Para los datos rastreados, no se sorprenda si la colección v2 tiene menos documentos. Los conectores v1 no suprimen documentos de una colección Discovery que se han suprimido del origen de datos externo. La versión v2 de la colección tiene un rastreo más reciente de los datos tal como existen hoy en el origen de datos externo.

No espere que los resultados de la búsqueda sean los mismos para las consultas que envía en las instancias v1 y v2.

Utilización de un servicio de noticias con v2

Si ha utilizado el origen de datos de noticias Watson Discovery en v1 y desea crear un origen de datos con una función equivalente en v2, busque un servicio de proveedor de datos de noticias y sucesos. Busque un servicio que ofrezca una API de noticias que extraiga artículos de noticias en formato JSON. A continuación, puede cargar los archivos JSON para crear una recopilación de noticias en el proyecto v2.

Eliminar su instancia de servicio de v1

Después de migrar los datos y de actualizar las aplicaciones para utilizar la nueva instancia de servicio v2, asegúrese de suprimir la instancia de servicio v1. Se le facturará por la instancia de servicio v1 hasta que la suprima. Para obtener más información, consulte Supresión de una instancia de servicio gestionado.