Transfert de données
Vous pouvez effectuer un téléchargement de document unique à partir de votre système de fichiers local à tout moment pour ajouter des données à un projet.
Vous pouvez télécharger jusqu'à 200 fichiers à la fois.
Pour traiter des jeux de documents de plus de 200 fichiers, vous pouvez les ajouter à une source de données externe et utiliser un moteur d'exploration de source de données pour les télécharger. Pour les déploiements IBM Cloud Pak for Data, vous pouvez utiliser une source de données Système de fichiers local à cette fin.
Pour plus d'informations sur la taille maximale autorisée pour chaque fichier, voir Limites de document.
Avant de télécharger un fichier CSV dans un projet Content Mining, envisagez d'ajouter des en-têtes au fichier source afin que les zones générées à partir du fichier aient des noms significatifs. Sans en-têtes, les zones reçoivent des noms génériques,
tels que column_0, column_1, etc.
Pour télécharger des données, procédez comme suit :
-
Ouvrez votre projet, accédez à la page Manage collections, puis cliquez sur New collection.
-
Procédez comme suit en fonction de votre type de déploiement:
IBM Cloud Pak for Data IBM Software Hub
-
Choisissez Télécharger les données comme source de données, puis cliquez sur Suivant.
Vous pouvez également vous connecter à une autre source de données au lieu de télécharger des données telles que la réutilisation de données à partir d'une collection ou l'exploration d'une source de données externe. Pour plus d'informations, voir Réutilisation des données d'une collection et Présentation des sources de données Cloud Pak for Data.
-
Attribuez un nom à la collection. Si la langue des documents stockés n'est pas l'anglais, sélectionnez la langue appropriée. Pour obtenir la liste des langues prises en charge, voir Langues prises en charge.
-
Si vous le souhaitez, cliquez sur Plus de paramètres de traitement pour développer le menu. Vous pouvez sélectionner les paramètres suivants :
-
Définissez le commutateur Application de la reconnaissance optique des caractères (OCR) sur Activé pour activer la reconnaissance optique des caractères.
Lorsque la reconnaissance optique des caractères est activée et que vos documents contiennent des images, le traitement prend plus de temps. Pour plus d'informations, voir Reconnaissance optique des caractères.
-
Définissez Utiliser la réduction au radical au lieu de la lemmatisation lors de l'indexation sur On pour utiliser la réduction au radical au lieu de la lemmatisation afin de normaliser les mots dans l'index et les requêtes. Pour plus d'informations, voir Activation de la réduction au radical pour les données non traitées.
-
-
Cliquez sur Suivant
-
Téléchargez des données en recherchant les fichiers que vous souhaitez explorer.
Vous pouvez faire glisser des documents que vous souhaitez ajouter à votre collection.
Pour plus d'informations sur les types de fichier pris en charge, voir Types de fichier pris en charge.
-
Cliquez sur Terminer.
IBM Cloud
-
Attribuez un nom à la collection. Si la langue des documents stockés n'est pas l'anglais, sélectionnez la langue appropriée. Pour obtenir la liste des langues prises en charge, voir Langues prises en charge.
-
Téléchargez des données en recherchant les fichiers que vous souhaitez ajouter.
Vous pouvez faire glisser des documents que vous souhaitez ajouter à votre collection.
Pour plus d'informations sur les types de fichier pris en charge, voir Types de fichier pris en charge.
Vous pouvez également vous connecter à une autre source de données au lieu de télécharger des données telles que la réutilisation de données à partir d'une collection ou l'exploration d'une source de données externe. Pour vous connecter à une autre source de données, cliquez sur le lien en regard de Besoin de vous connecter à une source de données? zone. Pour plus d'informations, voir Réutilisation de données à partir d'une collection et Présentation des sources de données Cloud.
-
Si vous le souhaitez, cliquez sur Plus de paramètres de traitement pour développer le menu. Vous pouvez sélectionner les éléments suivants :
-
Définissez le commutateur Application de la reconnaissance optique des caractères (OCR) sur Activé pour activer la reconnaissance optique des caractères.
Lorsque la reconnaissance optique des caractères est activée et que vos documents contiennent des images, le traitement prend plus de temps. Pour plus d'informations, voir Reconnaissance optique des caractères.
-
Définissez Utiliser la réduction au radical au lieu de la lemmatisation lors de l'indexation sur On pour utiliser la réduction au radical au lieu de la lemmatisation afin de normaliser les mots dans l'index et les requêtes. Pour plus d'informations, voir Activation de la réduction au radical pour les données non traitées
-
-
Cliquez sur Terminer.
-
Le téléchargement du fichier est effectué rapidement. Le traitement des données à mesure qu'elles sont ajoutées à la collection prend plus de temps. Une fois les fichiers téléchargés et traités, la page Activité affiche les résultats du téléchargement.
Contrairement aux sources de données explorées, vous ne pouvez pas planifier de mises à jour régulières pour les fichiers téléchargés. Si vous souhaitez ajouter une version ultérieure d'un fichier, supprimez la version antérieure du fichier, puis téléchargez la version la plus récente.
Pour plus d'informations sur le traitement des incidents que vous pouvez rencontrer lors de l'ajout de documents à une collection, voir Traitement des incidents liés à l'ingestion.
Pour plus d'informations sur ce qui se passe ensuite, voir Comment votre source de données est traitée.