Fractionner les documents pour rendre les résultats de la requête plus succincts

Fractionnez vos documents afin que la fonction de recherche puisse trouver des informations plus concises à renvoyer dans les résultats de la requête.

Pour plus d'informations sur les avantages du fractionnement de documents, lisez l'article de blogue Using IBM Watson Discovery's New Document Segmentation Feature sur Medium.com.

Vous pouvez fractionner uniquement les documents auxquels un modèle Smart Document Understanding entraîné par l'utilisateur est appliqué.

Lorsque vous fractionnez un document, le document d'origine est divisé en segments. Chaque segment contient un ensemble d'informations plus uniforme. En fractionnant le contenu de vos documents en groupes segmentés, vous pouvez enrichir et indexer vos données à un niveau plus granulaire.

Pour contrôler la façon dont vos documents sont fractionnés, spécifiez une zone, telle que subtitle ou question, à utiliser comme marqueur de saut de page. Les options de saut de page sont renseignées avec les zones créées lorsque vous appliquez un modèle SDU (Smart Document Understanding) entraîné par l'utilisateur aux documents. Pour plus d'informations, voir Utilisation de Smart Document Understanding. Vous ne pouvez pas fractionner des documents avec des champs générés par un modèle Smart Document Understanding préentraîné.

Lorsqu'un document est traité à nouveau, il est évalué du début à la fin. Chaque fois que le champ de marqueur de saut de page apparaît, le document d'origine est fractionné et un nouveau segment est créé. Le fractionnement se poursuit à chaque champ de marqueur jusqu'à ce que le document d'origine soit divisé en plusieurs segments.

Avant de commencer, déterminez la zone à utiliser comme marqueur de saut de page.

  • Vous pouvez utiliser toutes les zones qui sont indexées par défaut. Pour voir vos choix, consultez la liste Zones à indexer. Les zones dont la valeur est Type sont stockées dans l'index.
  • Le nombre de segments par document est limité à 1,000. Une fois le numéro de segment 999 créé, tout contenu de document restant est stocké dans le segment 1,000.
  • Les métadonnées des documents PDF et Microsoft Word et les métadonnées personnalisées sont extraites et incluses dans l'index avec chaque segment.

Soyez prudent avec les documents qui contiennent des sections répétitives, comme un catalogue comportant une section de description et de spécifications pour chaque entrée de produit. Si vous fractionnez le document à un niveau trop granulaire, les sous-sections, telles qu'une section avec des détails de spécification, peuvent être dissociées du produit auquel elles appartiennent.

Pour fractionner les documents d'une collection, procédez comme suit:

  1. Cliquez sur Manage collections dans le panneau de navigation, puis cliquez pour ouvrir une collection.

  2. Ouvrez la page Gérer les zones.

    Une liste des champs identifiés s'affiche.

  3. Dans la section Améliorer les résultats de la recherche en divisant vos documents, cliquez sur Diviser le document.

  4. Choisissez la zone que vous souhaitez utiliser comme marqueur de saut de page dans la liste déroulante Sélectionner une zone.

    La liste que vous pouvez sélectionner inclut un sous-ensemble de toutes les zones identifiées.

  5. Cliquez sur Apply changes and reprocess.

Vous pouvez vérifier le statut du processus de fractionnement à partir de la page Activité.

La zone de métadonnées inclut l'ID du document parent. Chaque segment résultant du document d'origine peut contenir des informations différentes. Par exemple, si vous fractionnez le document en fonction de la zone de sous-titre, le premier segment peut contenir uniquement une zone de titre. Le segment suivant peut contenir un sous-titre et une zone de texte. Le troisième peut contenir une zone de sous-titre, une zone de texte et une zone de pied de page.

Mise à jour des documents fractionnés

Si un document fractionné change et que vous souhaitez le télécharger à nouveau, travaillez avec un développeur pour remplacer le document à l'aide de l'API. Un développeur peut utiliser la méthode Mettre à jour un document pour remplacer le document parent d'origine. Pour plus d'informations, voir la référence de l'API. Pour fournir la variable de chemin {document_id} qui doit être envoyée avec la demande, copiez le contenu de la zone parent_document_id de l'un des segments du document.

Lorsque vous remplacez le document d'origine, tous les segments sont écrasés, sauf si la version mise à jour du document comporte moins de segments que le document d'origine. Ces segments plus anciens restent dans l'index.

Suppression de segments de document de l'index

Vous pouvez supprimer des documents d'une collection à partir de la page Manage data. Pour rechercher tous les segments de document qui ont été générés à partir d'un seul document, recherchez les documents ayant la même valeur de zone metadata.parent_document_id. Pour plus d'informations, voir Exclusion de contenu des résultats de requête.

IBM Cloud Pak for Data IBM Cloud Pak for Data avant la 4.6.5 version

La page Manage data est disponible dans les déploiements installés à partir de l'édition 4.6.5. Dans les éditions précédentes, un développeur peut supprimer des segments de document à l'aide de l'API. Pour plus d'informations, voir l'API de suppression de document.