Caricamento dei dati

È possibile eseguire un caricamento di un documento singolo dal file system locale in qualsiasi momento per aggiungere dati a un progetto.

È possibile caricare fino a 200 file alla volta.

Per elaborare serie di documenti più grandi di 200 file, è possibile aggiungerli a un'origine dati esterna e utilizzare un crawler di origine dati per caricarle. Per le distribuzioni IBM Cloud Pak for Data, puoi utilizzare un'origine dati File system locale per questo scopo.

Per ulteriori informazioni sulla dimensione massima consentita per ciascun file, consultare Limiti del documento.

Prima di caricare un file CSV in un progetto Content Mining, considerare l'aggiunta di intestazioni al file di origine in modo che tutti i campi generati dal file abbiano nomi significativi. Senza intestazioni, ai campi vengono assegnati nomi generici, come column_0, column_1 e così via.

Per caricare i dati, procedere come segue:

  1. Aprire il progetto, andare alla pagina Gestisci raccolte, quindi fare clic su Nuova raccolta.

  2. Effettuare le seguenti operazioni in base al proprio tipo di distribuzione:

    IBM Cloud Pak for Data IBM Software Hub

    1. Scegliere Carica dati come origine dati e fare clic su Avanti.

      È anche possibile connettersi a un'altra origine dati invece di caricare i dati, come ad esempio riutilizzare i dati da una raccolta o eseguire la ricerca per indicizzazione su un'origine dati esterna. Per ulteriori informazioni, vedi Riutilizzo dei dati da una raccolta e Panoramica delle origini dati Cloud Pak for Data.

    2. Denominare la raccolta. Se la lingua dei documenti in memoria non è l'inglese, selezionare la lingua appropriata. Per un elenco delle lingue supportate, vedi Supporto linguistico.

    3. Facoltativamente, fare clic su Altre impostazioni di elaborazione per espandere il menu. È possibile selezionare le seguenti impostazioni:

      • Impostare il commutatore Applica riconoscimento carattere ottico (OCR) su On per abilitare OCR.

        Quando OCR è abilitato e i tuoi documenti contengono immagini, l'elaborazione richiede più tempo. Per ulteriori informazioni, consultare Riconoscimento dei caratteri ottici.

      • Impostare Utilizza stemming invece di lemmatization quando si esegue l'indicizzazione su On per utilizzare stemming invece di lemmatization per normalizzare le parole nell'indice e nelle query. Per ulteriori informazioni, consultare Abilitazione dello stemming per i dati non curati.

    4. Fai clic su Next

    5. Caricare i dati ricercando i file su cui si desidera eseguire la ricerca per indicizzazione.

      È possibile trascinare i documenti che si desidera aggiungere alla raccolta.

      Per ulteriori informazioni sui tipi di file supportati, consultare Tipi di file supportati.

    6. Fai clic su Finish.

    IBM Cloud

    1. Denominare la raccolta. Se la lingua dei documenti in memoria non è l'inglese, selezionare la lingua appropriata. Per un elenco delle lingue supportate, vedi Supporto linguistico.

    2. Caricare i dati ricercando i file che si desidera aggiungere.

      È possibile trascinare i documenti che si desidera aggiungere alla raccolta.

      Per ulteriori informazioni sui tipi di file supportati, consultare Tipi di file supportati.

      È anche possibile connettersi a un'altra origine dati invece di caricare i dati, come ad esempio riutilizzare i dati da una raccolta o eseguire la ricerca per indicizzazione su un'origine dati esterna. Per connettersi a un'origine dati differente, fare clic sul link accanto a È necessario connettersi a una origine dati? . Per ulteriori informazioni, vedi Riutilizzo dei dati da una raccolta e Panoramica delle origini dati cloud.

    3. Facoltativamente, fare clic su Altre impostazioni di elaborazione per espandere il menu. È possibile selezionare quanto segue:

      • Impostare il commutatore Applica riconoscimento carattere ottico (OCR) su On per abilitare OCR.

        Quando OCR è abilitato e i tuoi documenti contengono immagini, l'elaborazione richiede più tempo. Per ulteriori informazioni, consultare Riconoscimento dei caratteri ottici.

      • Impostare Utilizza stemming invece di lemmatization quando si esegue l'indicizzazione su On per utilizzare stemming invece di lemmatization per normalizzare le parole nell'indice e nelle query. Per ulteriori informazioni, consultare Abilitazione dello stemming per i dati non curati

    4. Fai clic su Finish.

Il caricamento file è stato completato rapidamente. È necessario più tempo per l'elaborazione dei dati man mano che vengono aggiunti alla raccolta. Una volta caricati ed elaborati i file, la pagina Attività mostra i risultati di caricamento.

Diversamente dalle origini dati sottoposte a ricerca per indicizzazione, non è possibile pianificare aggiornamenti regolari per i file caricati. Se si desidera aggiungere una versione più recente di un file, eliminare la versione precedente del file e quindi caricare la versione più recente.

Per informazioni su come risolvere i problemi che potresti riscontrare durante l'aggiunta di documenti a una raccolta, vedi Risoluzione dei problemi di inserimento.

Per ulteriori informazioni sulle operazioni successive, consultare Modalità di elaborazione dell'origine dati.