Cette documentation concerne IBM Watson® Knowledge Studio on IBM Cloud®. Pour consulter la documentation de la version précédente de Knowledge Studio on IBM Marketplace, cliquez sur ce lien.
Ajouter des documents pour l'annotation
Pour entraîner un modèle d'apprentissage automatique, vous devez ajouter à votre espace de travail des documents qui reflètent des connaissances spécialisées, comme des articles de journaux ou d'autres textes propres au secteur concerné.
A propos de cette tâche
Cette section décrit seulement comment ajouter des documents pour l'annotation. Pour définir les règles d'un modèle à base de règles, vous devez ajouter ou transférer des documents d'où vous pourrez tirer les motifs à définir en tant que règles. Pour plus d'informations, consultez Ajouter des documents pour définir des règles.
Documents
Pour entraîner un modèle d'apprentissage automatique, vous devez rassembler des documents représentatifs des contenus relatifs à votre domaine et d'une grande valeur pour votre application.
Efforcez-vous de trouver des documents d'entraînement qui soient vraiment représentatifs du contenu présentant un intérêt dans le domaine concerné, c'est-à-dire qui contiennent de nombreuses mentions pertinentes qu'il est donc utile d'annoter. Pour choisir les meilleurs documents, suivez ces quelques consignes :
- Efforcez-vous de fournir un ensemble de documents dont la taille totale est d'environ 300 000 mots. Prévoyez davantage de mots pour un système de types complexe, moins pour un système simple.
- Limitez le contenu de chaque document à une ou deux pages; moins de 2 000 mots, et plus près de 1 000 mots par document, c'est le mieux. Au début de l'élaboration du modèle, il est également conseillé de limiter chaque document à quelques paragraphes. Marquer les mentions et les relations dans un long document est à la portée de l'annotateur humain, mais celui-ci aura certainement plus de difficultés à marquer les coréférences s'étalant sur plusieurs pages.
- Les documents sont souvent limités à 600 mentions
- Assurez-vous que les données dans les documents sont réparties entre tous les types d'entités, sous-types et rôles, ainsi qu'entre les relations entre eux. A terme, l'objectif à atteindre est d'avoir au moins 50 annotations pour chaque type d'entité et 50 pour chaque type de relation dans la collection de documents.
- Encore une fois, les documents doivent représenter l'étendue du sujet que l'application couvrira, mais en cas d'asymétrie dans la fréquence d'occurrence des types d'entités et des types de relations, essayez d'obtenir au moins 50 exemplaires de chaque type, voire davantage pour les types d'entités dont les mentions ont tendance à être des syntagmes.
- Le jeu que vous créez pour l'entraînement doit contenir au moins 10 documents annotés.
Lorsque vous êtes prêt à créer et entraîner le modèle, les documents que vous ajoutez à l'espace de travail peuvent être divisés en jeux à utiliser comme données d'apprentissage, données de test et données aveugles. Cette séparation en plusieurs jeux de données est essentielle à l'évaluation des performances du modèle.
Vous pouvez ajouter des documents de différentes manières. Pour plus d'informations sur les types de document pris en charge, les limites de taille et d'autres informations, voir Création d'un espace de travail > Synthèse des entrées, des sorties et des limites.
- Fichier CSV à deux colonnes, au format UTF-8
- Fichiers texte au format UTF-8
- Fichiers HTML
- Fichiers PDF (les fichiers scannés et protégés par mot de passe ne sont pas pris en charge)
- Fichiers Microsoft Word DOC ou DOCX (les fichiers protégés par mot de passe ne sont pas pris en charge)
- Fichier .zip contenant des documents précédemment téléchargés d'un espace de travail Knowledge Studio
- Fichier .zip contenant des fichiers XMI au format UIMA CAS
Fichiers CSV
A partir de votre machine locale, vous pouvez transférer un fichier CSV à deux colonnes contenant des échantillons de textes. Vous ne devez transférer qu'un seul fichier CSV à la fois. La première colonne contiendra le nom de fichier du document,
la deuxième contiendra le texte du document. Pour obtenir un exemple du format requis, voir le documents-new.csv fichier dans les fichiers exemple du tutoriel.
Fichiers PDF
Le texte ne peut pas être extrait d'un fichier PDF dans certains cas, selon la façon dont le PDF a été créé. En général, le texte ne peut pas être extrait des polices imbriquées qui ne sont pas mappées à des caractères Unicode. Si vous n'êtes pas sûr de pouvoir extraire du texte d'un PDF, vous pouvez essayer de copier le texte à partir du PDF puis de le coller dans un éditeur de texte. Si vous ne voyez pas les mêmes caractères que ceux qui sont visibles dans le PDF lui-même, l'extraction de texte échouera probablement.
Documents formatés
Lorsque des documents formatés sont convertis en texte brut, il est possible que la perte du formatage entraîne un mauvais découpage en unités lexicales des mots. Par exemple, si une ligne de table dans un fichier DOCX contient des valeurs de cellule qui ne se terminent pas par un pont, les valeurs peuvent être converties en une seule phrase. Autre exemple, si un document PDF contient un mot très long avec un tiret en fin de ligne, ce mot peut être converti en deux mots. Dans de tels cas, les documents peuvent ne pas être adaptés à l'apprentissage automatique, sauf si vous prétraitez les fichiers afin de corriger les limites liées au formatage.
Documents d'un autre espace de travail Watson Knowledge Studio
Si vous avez précédemment téléchargé des documents d'un espace de travail Knowledge Studio, vous pouvez transférer le fichier .zip que vous avez téléchargé. Une option vous permet de préciser si vous voulez inclure ou non les annotations de référence dans les fichiers importés.
Une fois annotés, les documents sont stockés au format de fichier JSON. Dans ces fichiers, le langage de marquage reflète la manière dont le texte du document d'origine a été analysé et découpé en unités lexicales et inclut des
éléments pour toutes les annotations qui ont été ajoutées par l'annotateur humain. Pour améliorer l'exactitude du modèle au fil du temps, vous pouvez transférer ces fichiers vers un autre espace de travail et préserver ainsi toutes les annotations
existantes. Un annotateur humain peut alors réviser, supprimer et compléter les annotations dans ces documents. Vous pouvez aussi faire l'impasse sur l'annotation humaine et utiliser ces fichiers pour créer les jeux de données d'entraînement,
de test et aveugles qui serviront à évaluer et améliorer les performances du modèle.
Fichiers XMI au format UIMA CAS
Pour aider à entraîner un modèle, vous pouvez transférer des documents qui ont été pré-annotés par un moteur d'analyse UIMA (Unstructured Information Management Architecture). Les documents ainsi pré-annotés doivent être dans la forme de sérialisation XMI de la structure CAS (Common Analysis Structure) UIMA et combinés dans un fichier .zip. Vous pouvez, par exemple, transférer des documents qui ont été annotés dans une collection IBM Watson Explorer.
Un annotateur humain peut alors réviser, supprimer et compléter les annotations dans ces documents. Vous pouvez aussi faire l'impasse sur l'annotation humaine et utiliser ces fichiers pour créer les jeux de données d'entraînement, de test et aveugles qui serviront à évaluer et améliorer les performances du modèle. Pour plus d'informations sur la façon de créer ces fichiers et les conditions qu'ils doivent remplir pour pouvoir être transférés, voir Transférer des documents pré-annotés.
Anonymiser les données
Si vous voulez construire un modèle qui soit optimisé pour vos données et que, pour des raisons de confidentialités, il n'est pas souhaitable que vos documents soient transférés en l'état vers Knowledge Studio, vous pouvez y supprimer toutes les données personnelles, puis utiliser la version anonymisée des documents pour entraîner le modèle. Vous ne devez pas expurger l'information ni la remplacer par des variables. Les meilleurs résultats sont obtenus lorsque les vraies informations sont remplacées par de fausses informations du même type.
Par exemple, si vous voulez occulter les noms de clients, au lieu de les expurger un à un ou de les remplacer par une variable telle que USER_NAME, remplacez-les par des noms fictifs, utilisant une variété de styles syntaxiques de noms typiques, tels que Jeanne Martin, M. Dupont, Me Dietrich ou Dr Moreau. Vous pouvez écrire un script créant des concaténations d'une variété de prénoms et de noms de famille ainsi que de titres et de noms de famille et ajoutant des patronymes seuls pour créer des noms imaginaires qui puissent être insérés dans le document afin de remplacer les vrais noms d'utilisateurs. Le but est de simuler le plus fidèlement possible les vraies valeurs figurant dans les documents source. Car si chaque nom est remplacé par le même texte (USER_NAME) ou expurgé, le modèle ne sera pas entraîné correctement et finira par s'habituer à rencontrer ce schéma à chaque occurrence d'un nom. Ce que vous voulez, c'est qu'il soit capable de reconnaître comme tels les noms de personnes, lorsqu'il sera exécuté sur de nouveaux documents et rencontrera une variété de noms qu'il n'a encore jamais vus.
Ajouter des documents à un espace de travail
Pour entraîner un modèle, vous devez ajouter à votre espace de travail des exemples de documents représentatifs des contenus relatifs à votre domaine.
A propos de cette tâche
Il est bon de commencer par une collection de documents relativement petite. Utilisez-la pour entraîner les annotateurs humains (si votre espace de travail met en jeu un processus d'annotation humaine) et pour peaufiner vos directives d'annotation. Il est plus facile pour un annotateur humain d'identifier les chaînes de coréférences dans les petits documents. A mesure que l'exactitude des annotations s'améliore, vous pouvez ajouter davantage de documents au corpus afin de donner plus de relief à l'effort d'entraînement.
Procédure
Pour ajouter des documents à un espace de travail :
-
Connectez-vous en tant qu'administrateur ou chef de projet Knowledge Studio et sélectionnez votre espace de travail.
-
Sélectionnez l'onglet Actifs > Documents > Jeux de documents.
-
Cliquez sur Transférer des jeux de documents pour ajouter des documents au corpus.
-
Téléchargez les documents dans l'un des formats pris en charge. Pour plus d'informations sur les types de document pris en charge, les limites de taille et d'autres informations, voir Création d'un espace de travail > Synthèse des entrées, des sorties et des limites.
Remarques sur les fichiers .zip des documents téléchargés à partir d'un autre espace de travail
Lorsque des documents annotés sont importés, ils sont redécoupés en unités lexicales. Ce processus peut modifier ce que Knowledge Studio considère comme étant les limites des phrases. Comme les annotations sont définies phrase par phrase, certaines d'entre elles pourraient être invalidées au cours de ce processus. Après avoir transféré des documents originaires d'un autre espace de travail, faites un examen rapide des annotations pour remédier à toute divergence.
- Si vous avez précédemment téléchargé des documents à partir d'un espace de travail Knowledge Studio, faites glisser le fichier .zip contenant les documents téléchargés ou cliquez pour rechercher et sélectionner le fichier. Si vous voulez inclure les annotations qui ont été ajoutées aux documents avant qu'ils ne soient téléchargés, veillez à sélectionner l'option d'inclusion des données de référence avant de cliquer sur Transférer. Seules seront importées (transférées) les annotations ayant été promues au rang de données de référence avant que les documents ne soient téléchargés.
- Avant de transférer des annotations de référence, vous devez transférer le système de types de l'espace de travail d'origine dans l'espace de travail en cours. Pour plus d'informations, voir Transférer des ressources d'un autre espace de travail.
Remarques sur les fichiers .zip des documents XMI au format UIMA CAS
- Si vous avez précédemment téléchargé des documents annotés, contenus dans des fichiers XMI au format UIMA CAS, vous pouvez transférer le fichier .zip contenant le contenu analysé. Pensez, dans ce cas, à indiquer qu'il s'agit du type de contenu à transférer avant de cliquer sur Transférer. Pour plus d'informations sur la façon de créer ces fichiers et les conditions qu'ils doivent remplir pour pouvoir être transférés, voir Transférer des documents pré-annotés.
-
Lorsque les documents ont été ajoutés, cliquez sur leurs noms pour prévisualiser et vérifier leur contenu. Par exemple, vérifiez que les fichiers texte sont au format UTF-8 et exempts de problèmes d'accents ou de normalisation des caractères. Vérifiez également la qualité de segmentation du texte en phrases. Si vous relevez des défauts, il se pourrait que vous deviez prétraiter les fichiers avant de les ajouter au corpus. Ils doivent en effet être aussi propres et bien formatés que possible avant de passer entre les mains des annotateurs humains.
Etape suivante
Divisez le corpus en plusieurs jeux de documents et affectez ces derniers à des annotateurs humains.
Les administrateurs et les chefs de projet peuvent annoter les jeux de documents directement sans créer de tâches d'annotation.
Supprimer des documents
Vous pouvez supprimer un document si vous déterminez qu'il n'est pas représentatif de textes du domaine concerné susceptibles de profiter au modèle.
Pour supprimer un document, choisissez l'option qui s'applique à votre cas :
- Supprimer un document qui n'est associé à aucune tâche d'annotation
- Supprimer un document associé à une tâche d'annotation lorsque l'annotation humaine n'a pas encore commencé
- Supprimer un document associé à une tâche d'annotation lorsque l'annotation humaine a déjà commencé
Supprimer un document qui n'est associé à aucune tâche d'annotation
Si le document que vous voulez supprimer n'est pas associé à une tâche d'annotation, procédez comme suit pour le supprimer.
Procédure
Connectez-vous en tant qu'administrateur Knowledge Studio et sélectionnez votre espace de travail.
- Sélectionnez l'onglet Actifs > Documents > Jeux de documents.
- Sélectionnez le jeu de documents contenant le document que vous voulez supprimer. Le jeu de documents s'ouvre.
- Localisez le document que vous voulez retirer et cliquez sur Supprimer.
Supprimer un document associé à une tâche d'annotation lorsque l'annotation humaine n'a pas encore commencé
Si le document que vous voulez supprimer est associé à une tâche d'annotation et que l'annotation humaine n'a pas encore commencé, procédez comme suit pour le supprimer.
Procédure
-
Connectez-vous en tant qu'administrateur Knowledge Studio et sélectionnez votre espace de travail.
-
Supprimez la tâche d'annotation :
- Ouvrez la page Modèle d'apprentissage automatique > Annotations. Cliquez sur l'onglet Tâches d'annotation.
- Localisez la tâche d'annotation à laquelle le document est associé, cliquez sur son icône Afficher le menu, puis cliquez sur Supprimer.
-
Supprimez le document conformément à la procédure Supprimer un document qui n'est associé à aucune tâche d'annotation.
-
Une fois le document supprimé, vous pouvez recréer la tâche d'annotation et lui associer le même jeu d'annotations, qui contient maintenant un document de moins.
Supprimer un document associé à une tâche d'annotation lorsque l'annotation humaine a déjà commencé
Si le document que vous voulez supprimer est associé à une tâche d'annotation et que l'annotation humaine a commencé, procédez comme suit pour le supprimer.
Ne supprimez pas une tâche si une annotation humaine est en cours, sinon vous perdriez le travail déjà accompli.
Procédure
- Dites aux annotateurs humains d'ignorer le document non voulu dans le jeu.
- Lorsque le travail d'annotation des autres documents est achevé et que les annotateurs humains ont soumis tous les documents pour ajouter le jeu aux données de référence, passez en revue et acceptez les documents soumis.
- Résolvez les éventuels conflits d'annotations.
- Lorsque tous les documents font partie des données de référence et que la tâche est terminée, supprimez celle-ci conformément à la procédure Supprimer un document associé à une tâche d'annotation lorsque l'annotation humaine n'a pas encore commencé.
- Supprimez le document conformément à la procédure Supprimer un document qui n'est associé à aucune tâche d'annotation.
Vous pouvez vérifier que les annotations des documents restants ne sont pas perdues en téléchargeant les jeux de documents et en examinant les documents dans le dossier gt.
Modèle de données
Les diagrammes ci-après synthétisent le cheminement des documents dans un système Knowledge Studio et ce qui diffère entre les documents du corpus, ceux d'une tâche d'annotation et ceux des données de référence.
Le corpus contient des documents divisés en plusieurs jeux de documents :
- Un document n'est rien d'autre que des chaînes de texte.
- Un jeu de documents est un pointeur vers un groupe de documents. Il ne contient pas de copies des documents eux-mêmes.
- Certains jeux de documents peuvent pointer vers un unique document. Ce type de configuration se contrôle au moyen du paramètre de chevauchement que vous spécifiez au moment de créer les jeux d'annotations.
Figure 1. Cette figure illustre deux jeux de documents qui pointent vers trois documents. Les documents se divisent entre les jeux.
Les données de référence comprennent les annotations (mentions, relations et mentions coréférencées) qui sont ajoutées aux documents. Elles sont particulières à chaque document.
Figure 2. Cette figure montre que les données de référence sont constituées des annotations qui sont ajoutées au document 1, au document 2, au document 3, et ainsi de suite.
Lorsque vous créez une tâche d'annotation, des copies des annotations sont créées pour chaque document membre du jeu d'annotations que vous ajoutez à la tâche. Les annotateurs annotent les documents. Les annotations sont isolées les unes des autres ainsi que des annotations de référence. Une tâche d'annotation est temporaire. Son rôle est de permettre aux annotateurs humains d'annoter du texte dans des espaces isolés. Par opposition, les données de référence sont permanentes et singulières.
Figure 2. Cette
figure montre que le gestionnaire de projet crée des jeux d'annotations et les affecte à une tâche d'annotation. David et Philippe, les annotateurs humains, annotent les documents des jeux qui leur sont affectés.
Une fois que le chef de projet a approuvé les jeux d'annotations d'une tâche d'annotation, les annotations des documents qui ne figurent pas également dans les autres jeux d'annotations (absence de chevauchements entre documents) deviennent des annotations de référence. Lorsque des documents se chevauchent entre jeux d'annotations (cas représenté par le document 2 dans cet exemple), le chef de projet doit arbitrer et résoudre les éventuels conflits. Ce n'est qu'une fois approuvées par l'intermédiaire de cet arbitrage que les annotations des documents chevauchants deviennent des annotations de référence.
Les données de référence sont ensuite utilisées pour entraîner et tester un modèle d'apprentissage automatique. Elles peuvent sinon servir de base à l'itération suivante de développement du modèle. Dans ce dernier cas, vous devez créer une nouvelle tâche d'annotation.
Figure 3. Cette figure illustre comment les annotations ajoutées par deux annotateurs humains deviennent des données de référence. L'un des documents, le document 2, est annoté par les deux annotateurs humains. Les annotations ajoutées à ce
document chevauchant doivent être arbitrées avant d'être versées aux données de référence.