Appliquer un modèle SDU préentraîné
Appliquez un modèle SDU (Smart Document Understanding) prédéfini qui peut extraire du texte et qui est entraîné pour identifier les tableaux, les listes et les sections dans les documents.
Utilisez le modèle préentraîné si vos documents contiennent des tables contenant des informations précieuses que vous souhaitez capturer. Le modèle est également capable de préserver la signification inhérente à la structure d'imbrication des tables, des listes et des sections. L'utilisation du modèle préentraîné accélère le processus de capture des informations à partir de la structure d'un document.
Si vous souhaitez personnaliser la façon dont la structure de document est utilisée pour déduire la signification d'un document ou si vous souhaitez fractionner des documents avec un champ généré par un modèle SDU, créez un modèle entraîné par l'utilisateur à la place. Pour plus d'informations, voir Définition d'un modèle SDU entraîné par l'utilisateur.
Un modèle préentraîné est appliqué automatiquement aux projets Document Retrieval for Contracts. Au lieu d'annoter le contenu lié à un contrat dans vos documents, le projet applique un modèle qui sait déjà comment reconnaître les termes et les concepts qui sont importants pour les contrats.
Préparation de documents
Vous pouvez appliquer un modèle SDU préentraîné aux types de fichier suivants uniquement:
- Fichiers image (PNG, TIFF, JPG)
- Microsoft PowerPoint
- Microsoft Word
- format PDF
Pour obtenir la liste complète des types de fichier pris en charge par Discovery, voir Types de fichier pris en charge.
L'outil Smart Document Understanding utilise la reconnaissance optique des caractères (OCR) pour extraire le texte des images dans les fichiers qu'il analyse. Les images doivent répondre aux exigences de qualité minimales prises en charge par la reconnaissance optique des caractères. Pour plus d'informations, voir Reconnaissance optique des caractères.
L'outil ne peut pas lire les documents présentant les caractéristiques suivantes ; supprimez-les de votre collection avant de commencer:
- Les documents dont le texte semble se superposer à d'autres textes sont considérés comme doublement superposés et ne peuvent pas être annotés.
- Les documents qui contiennent plusieurs colonnes de texte sur une seule page ne peuvent pas être annotés.
Lorsque vous appliquez un modèle de compréhension intelligente des documents, le temps de conversion de votre collection peut augmenter en raison des ressources nécessaires pour appliquer le modèle d'intelligence artificielle à vos documents.
Appliquer un modèle préentraîné
Pour appliquer un modèle Smart Document Understanding préentraîné à votre collection, procédez comme suit:
-
Ouvrez la page Gestion des collections à partir du panneau de navigation.
-
Sélectionnez la collection à laquelle vous souhaitez appliquer le modèle.
-
Ouvrez la page Identifier les champs.
-
Choisissez Modèles pré-entraînés
L'option Extraction de texte uniquement est utilisée par défaut. Avec ce modèle, tout texte reconnu dans les documents source est indexé dans la zone
text. -
Cliquez sur Soumettre, puis sur Appliquer les modifications et retraiter.
Description de la sortie
Si le modèle SDU trouve et traite une structure, telle qu'une table, dans le document, il stocke une représentation de la structure dans une zone nommée enriched_{field}, où {field} est la zone dans laquelle la structure
a été stockée.
L'extrait suivant montre la représentation JSON d'une table de la zone enriched_html d'un document qui a été traité par le modèle SDU préentraîné.
Si vous souhaitez extraire du texte de la structure traitée, vous pouvez utiliser la zone location pour rechercher les valeurs d'index qui identifient le début et la fin de la chaîne de texte.
Pour plus d'informations sur la structure des tables indexées, voir Présentation des tables.
Identification et résolution des problèmes
Suivez ces solutions si vous rencontrez des problèmes lors de l'utilisation de l'outil Smart Document Understanding.
Ressources insuffisantes pour traiter le document
- Erreur
- Lorsque vous appliquez un modèle préentraîné à votre collection, le traitement des documents n'aboutit pas et un message
Insufficient resources to process documents'affiche. - Cause
- L'erreur s'affiche car des erreurs de mémoire insuffisante se produisent lors des phases d'analyse, d'identification de structure ou d'assemblage du processus qui génère le modèle d'apprentissage automatique. Les ressources sont insuffisantes lorsqu'un ou plusieurs des documents de votre collection sont trop volumineux ou comportent un trop grand nombre de tables complexes à gérer par l'outil.
- La solution
- Passez en revue votre collection pour y rechercher des documents volumineux ou des documents comportant de nombreux tableaux et les fractionner en documents plus petits avant d'appliquer le modèle préentraîné à la collection. Les limites exactes varient en fonction de la complexité de vos documents. En règle générale, fractionnez les documents de plus de 400 pages et évitez d'inclure plus de 20 tableaux complexes dans un seul document.