Generazione di dati a partire da una tassonomia per Inferenza AI di Red Hat
La generazione dei dati è il processo che consente di generare automaticamente domande e risposte sintetiche sulla base delle domande e delle risposte inserite nei file QNA. Il processo utilizzato da Red Hat AI Inference per generare dati pone l'accento sulla qualità e sulla pertinenza dei contenuti.
Per saperne di più sul processo di generazione dei dati, visita il sito Red Hat.
Red Hat AI Inference Le funzionalità di allineamento dei modelli, generazione di dati sintetici e gestione della tassonomia sono obsolete e saranno rimosse il 25 settembre 2026. Per proseguire con i flussi di lavoro di personalizzazione e allineamento dei modelli, esegui la migrazione a Red Hat® OpenShift® AI On OpenShift. Scopri di più sull'intelligenza artificiale di Red Hat® OpenShift®.
Prerequisiti
Generazione di dati tramite la console
-
Nella console, aprire il servizio " Red Hat AI Inference ".
-
Fai clic su Inferenza AI di Red Hat Progetti > il tuo progetto > Dati di addestramento > Genera.
-
Inserisci un nome alfanumerico per i dati di addestramento e seleziona la tassonomia da utilizzare.
-
Facoltativo: verificare il costo stimato indicato prima di avviare il processo di generazione dei dati.
-
Fai clic su Genera. Lo stato è
queued, quindirunning. -
Attendere che lo stato diventi “
completed”. Una volta completata la generazione dei dati, viene creata una directory denominata “synthetic_data”, contenente i file di log, all’interno del bucket “ Object Storage ”. È possibile consultare questi registri per la risoluzione dei problemi o per la verifica.
Importazione dei propri dati di addestramento nella console
È possibile importare i propri dati generati in precedenza per integrare la generazione dei dati in Inferenza AI di Red Hat. Potresti voler importare i tuoi dati se devi eseguire una o più delle seguenti operazioni.
- Durante la generazione dei dati, importare uno o più documenti relativi alle conoscenze e alle competenze.
- Unire più serie di dati di addestramento in un'unica serie.
- Genera i dati, scaricali, quindi modifica una parte dei dati e rigenerali.
- Unisci i dati generati in precedenza con quelli appena importati.
- Importare i dati, generare i dati di addestramento, quindi combinare tali dati con quelli generati in un altro ciclo di generazione.
- Combina il buffer di riproduzione con i dati importati dalla tua tassonomia. Questa funzionalità è disponibile solo tramite API o CLI.
- Importa i dati e genera dati di addestramento dalla tua tassonomia. Questa funzionalità è disponibile solo tramite API o CLI.
Per importare i propri dati, è possibile fare riferimento a precedenti sessioni di generazione dei dati, importare file dal proprio bucket Object Storage oppure caricare file dal proprio computer locale.
Segui i passaggi riportati di seguito per importare i tuoi dati di addestramento.
-
Nella console, aprire il servizio " Red Hat AI Inference ".
-
Fai clic su Inferenza AI di Red Hat Progetti > il tuo progetto > Dati di addestramento > Importa.
-
Inserisci un nome alfanumerico per i tuoi dati.
-
Selezionare una delle seguenti opzioni.
-
Object Storage: Seleziona i file esistenti nel tuo bucket Object Storage.
- Seleziona l'istanza e il bucket in cui sono archiviati i tuoi dati esistenti.
- Fai clic su Next.
- Seleziona i file che desideri importare.
-
Carica file: seleziona i file dal tuo computer. Si noti che il limite per il caricamento dei file è di 40 Mb.
- Seleziona un'istanza di Object Storage e un bucket oppure crea una nuova istanza e un nuovo bucket per archiviare i tuoi dati.
- Concedi i permessi di “ Inferenza AI di Red Hat Writer” per il bucket.
- Opzionale: Impostazioni di archiviazione. Specificare i seguenti dettagli aggiuntivi relativi alle modalità di archiviazione dei dati.
- Percorso del file Bucket.
- Cartella all'interno del bucket.
- Object Storage nome dell'istanza.
- Gruppo di risorse.
- Object Storage nome del bucket.
- Resilienza del bucket.
- Fai clic su Next.
- Seleziona i file relativi alle conoscenze e alle competenze che desideri caricare dal tuo computer locale.
-
-
Fai clic su Import.
Unire i dati di addestramento nella console
Potresti generare i dati in blocchi più piccoli e gestibili, in modo da evitare timeout o limiti di sistema. È quindi possibile unire questi sottoinsiemi di dati in un unico insieme di dati da utilizzare per l'addestramento.
Segui i passaggi riportati di seguito per unire i dati nella console.
-
Nella console, aprire il servizio " Red Hat AI Inference ".
-
Fai clic su Progetti di Inferenza AI di Red Hat > il tuo progetto > Dati di addestramento.
-
Seleziona dall'elenco fino a 20 delle tue voci relative ai dati di addestramento e fai clic su " Unisci".
-
Inserisci un nome alfanumerico per i tuoi dati.
-
Seleziona l'istanza di Object Storage e il bucket in cui desideri archiviare i dati unificati.
-
Fai clic su Crea.
Generazione di dati tramite l'interfaccia a riga di comando (CLI)
-
Elenca le tue tassonomie e prendi nota di quella che desideri utilizzare.
ibmcloud ilab taxonomy listOutput di esempio.
id name taxonomy_path 669a88c9488ee7b95ce8fe05 test-tax taxonomy.tar.gz -
Genera dati dalla tua tassonomia. Prendi nota dell'ID dei dati da utilizzare nel passaggio successivo. Utilizza caratteri alfanumerici nel nome.
ibmcloud ilab data generate [--name NAME] [--taxonomy-id TAXONOMY-ID]Comando di esempio.
ibmcloud ilab data generate --name testdata --taxonomy-id 669a88c9488ee7b95ce8fe05Output di esempio.
id 66a268c170dcb21150050e8e name test-data state queued status created_at 2024-07-19T15:40:29.000Z taxonomy_id 669a88c9488ee7b95ce8fe05 -
Controlla i dettagli relativi alla generazione dei tuoi dati. Inserisci l'ID dei dati. Lo stato è
queued, quindirunning. Attendere che lo stato diventi “completed”. Quando lo stato è "completed" nel bucket " Object Storage ", viene creata una directory "synthetic_data" contenente i log utili per la risoluzione dei problemi.ibmcloud ilab data get --id DATA_IDEsempio di comando
data get.ibmcloud ilab data get --id 66a268c170dcb21150050e8eOutput di esempio.
id 66a268c170dcb21150050e8e name test-data state running status Generating data for taxonomy path compositional_skills->STEM->math->area: 12% 12/100 (total qna processed 1/147) created_at 2024-07-19T15:40:29.000Z taxonomy_id 669a88c9488ee7b95ce8fe05 -
Opzionale: quando lo stato è “
completed”, è possibile consultare alcune metriche, come le stime relative ai token, per calcolare il costo stimato.Esempio di comando
data getcon l'opzione--output jsonibmcloud ilab data get --id 66a268c170dcb21150050e8e --output jsonEsempio di output JSON
{ "created_at": "2026-08-04T15:40:29.000Z", "data_metrics": { "samples": { "knowledge": 30, "skills": 70, "total": 100 }, "tokens": { "data_leaf_nodes": { "compositional_<taxonomy_path>": 26196, "knowledge_<taxonomy_path>": 1228930, }, "data_tokens_total": 5993486, "training_estimated": 411435913, "training_phases": { "phase_1_knowledge": 1389992, "phase_2_skills": 410045921 } } }, "id": "66a268c170dcb21150050e8e", "last_signal_at": "2026-08-04T17:20:32.000Z", "name": "test-data", "state": "completed", "status": "completed", "taxonomy_id": "669a88c9488ee7b95ce8fe05" }
Importazione dei propri dati di addestramento tramite la CLI
Potresti voler importare i tuoi dati per uno o più dei seguenti motivi.
- Durante la generazione dei dati, importare uno o più documenti relativi alle conoscenze e alle competenze.
- Unire più serie di dati di addestramento in un'unica serie.
- Genera i dati, scaricali, quindi modifica una parte dei dati e rigenerali.
- Unisci i dati generati in precedenza con quelli appena importati.
- Importare i dati, generare i dati di addestramento, quindi combinare tali dati con quelli generati in un altro ciclo di generazione.
- Combina il buffer di riproduzione con i dati importati dalla tua tassonomia. Questa funzionalità è disponibile solo tramite API o CLI.
- Importa i dati e genera dati di addestramento dalla tua tassonomia. Questa funzionalità è disponibile solo tramite API o CLI.
È possibile importare i propri dati di addestramento per integrare la generazione dei dati in Inferenza AI di Red Hat. Per importare i propri dati generati in precedenza, specificare una o più delle seguenti opzioni:
- Gli ID di generazione dei dati delle esecuzioni precedenti.
- Un bucket di Object Storage che contiene i file relativi alle conoscenze e alle competenze dell'
.jsonl.
Segui questi passaggi per importare i tuoi dati.
- Elenca le tue tassonomie e prendi nota di quella che desideri utilizzare.
Output di esempio.ibmcloud ilab taxonomy listid name taxonomy_path 669a88c9488ee7b95ce8fe05 test-tax taxonomy.tar.gz - Se hai già generato dei dati che desideri utilizzare, elenca i dati e prendi nota degli UUID che intendi utilizzare. È possibile includere fino a 20 fonti di dati.
ibmcloud ilab data list - Genera dati dalla tua tassonomia. Prendi nota dell'ID dei dati da utilizzare nel passaggio successivo. Utilizza caratteri alfanumerici
nel nome.
Esempio di comando per includere più ID interni (fonti di dati) per la generazione dei dati.ibmcloud ilab data generate [--name NAME] [--taxonomy-id TAXONOMY-ID] [--internal-ids INTERNAL-IDs]ibmcloud ilab data generate --name testdata --taxonomy-id 65005b67-7de4-4216-b23c-ed4342f99c88 --internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40
Per ulteriori esempi, consulta la sezione successiva: Comandi di esempio per l'importazione dei propri dati di addestramento.
Esempi di comandi per importare i propri dati di addestramento
Esamina i seguenti comandi di esempio per importare i tuoi dati di addestramento o aggiungere file relativi a conoscenze e competenze a un processo di generazione dei dati.
Esempio di comando per includere più ID interni.
ibmcloud ilab data generate --name testdata --taxonomy-id 65005b67-7de4-4216-b23c-ed4342f99c88 --internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40
Comando di esempio per unire più origini dati generate in precedenza (ID interni) e file “ .jsonl ” provenienti da un bucket di Object Storage.
ibmcloud ilab data generate \
--name testdata \
--taxonomy-id 669a88c9488ee7b95ce8fe05 \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40 \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
Comando di esempio per combinare i dati generati in precedenza con i file relativi alle conoscenze e alle competenze dell' .jsonl, archiviati in un bucket di Object Storage. È inoltre possibile specificare, facoltativamente, un
bucket di output Object Storage in cui archiviare i dati generati (SDG).
ibmcloud ilab data generate \
--name testdata \
--taxonomy-id 669a88c9488ee7b95ce8fe05 \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59 \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Comando di esempio per unire i dati specificandone gli ID interni.
ibmcloud ilab data generate \
--name testdata \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40 \
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Comando di esempio per unire dati generati in precedenza specificandone gli ID interni e includere competenze e conoscenze provenienti da un bucket Object Storage.
ibmcloud ilab data generate \
--name testdata \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59 \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Comando di esempio per unire competenze e conoscenze da un bucket Object Storage.
ibmcloud ilab data generate \
--name testdata \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Generazione di dati tramite l'API
-
Elenca le tue tassonomie e prendi nota di quella che desideri utilizzare.
Comando di esempio.
curl -X 'GET' \ 'https://us-east.instructlab.ibm.com/v1/taxonomies' \ -H 'accept: application/json`Output di esempio.
{ "taxonomies": [ { "id": "202a03c4-dcf1-432a-82b7-abecb2e019f7", "name": "example-taxonomy-name-1", "taxonomy_path_cos": "taxonomies/taxonomy.tar.gz", "created_at": "2024-10-23T02:58:50.000Z" } ] } -
Genera dati dalla tua tassonomia. Prendi nota dell'ID dei dati da utilizzare nel passaggio successivo. Utilizza caratteri alfanumerici nel nome.
Comando di esempio.
curl -X 'POST' \ 'https://us-east.instructlab.ibm.com/v1/data' \ -H 'accept: application/json' \ -H 'Content-Type: application/json' \ -d '{ "name": "example-data-1", "taxonomy_id": "202a03c4-dcf1-432a-82b7-abecb2e019f7" }'Output di esempio.
{ "id": "add785e6-a8c3-4f5f-ab89-c506a3f115da", "name": "example-data-1", "state": "", "status": "queued", "created_at": "2024-10-23T02:58:50.000Z", "last_signal_at": "2026-08-04T17:20:32.000Z", "taxonomy_id": "202a03c4-dcf1-432a-82b7-abecb2e019f7", "data_metrics": { "samples": { "additionalProp1": 1, "additionalProp2": 2, "additionalProp3": 3 } } } -
Controlla i dettagli relativi alla generazione dei tuoi dati. Inserisci l'ID dei dati. Lo stato è
queued, quindirunning. Attendere che lo stato diventi “completed”.Comando di esempio.
curl -X 'GET' \ 'https://us-east.instructlab.ibm.com/v1/data/add785e6-a8c3-4f5f-ab89-c506a3f115da' \ -H 'accept: application/json'Output di esempio.
{ "id": "add785e6-a8c3-4f5f-ab89-c506a3f115da", "name": "example-data-1", "state": "", "status": "queued", "created_at": "2024-10-23T02:58:50.000Z", "last_signal_at": "2026-08-04T17:20:32.000Z", "taxonomy_id": "202a03c4-dcf1-432a-82b7-abecb2e019f7", "data_metrics": { "samples": { "additionalProp1": 1, "additionalProp2": 2, "additionalProp3": 3 } } }
Quando lo stato è " completed" nel bucket " Object Storage ", viene creata una directory " synthetic_data " contenente i log utili per la risoluzione dei problemi.
Cosa c'è nel mio bucket " Object Storage " dopo la generazione dei dati?
Una volta generati i dati, il bucket Object Storage conterrà una directory denominata synthetic_data contenente i seguenti file.
Artifacts- Questi file contengono i campioni presenti su ciascun nodo foglia. Questi non vengono utilizzati per l'addestramento del modello, ma sono forniti per facilitare la lettura e possono essere utilizzati per verificare se un QNA sta generando il numero previsto di campioni.
Logs- Questi file contengono i log di esecuzione di Red Hat AI Inference e i dettagli di sistema.
knowledge_train_msgs.jsonleskills_train_msgs.jsonl- Questi sono i file di addestramento della Fase 1 e della Fase 2 e contengono gli esempi utilizzati per addestrare il modello.
Per capire perché e come vengono generati i tuoi dati, consulta il documento della community "Domande frequenti sugli SDG ".
Esempio di formato " .jsonl "
Esamina il seguente esempio di struttura “ .jsonl ” relativa alle competenze e alle conoscenze.
{
"messages": [
{
"content": "string", // The text of the message
"role": "string" // The role of the sender (e.g., "system", "user", "assistant")
}
],
"metadata": "string", // A JSON-encoded string containing additional info (e.g., num_turns, group, dataset)
"id": "string" // A unique identifier for the conversation
}
Passi successivi
Dopo aver generato i dati dalla tua tassonomia, puoi iniziare ad addestrare il tuo modello.