Génération de données à partir d'une taxonomie pour l' Inférence d'IA Red Hat
La génération de données consiste à générer automatiquement des questions et réponses synthétiques à partir des questions et réponses que vous avez incluses dans les fichiers QNA. Le processus utilisé par Red Hat AI Inference pour générer des données met l'accent sur la qualité et la pertinence du contenu.
Pour en savoir plus sur le processus de génération de données, consultez Red Hat.
Red Hat AI Inference Les fonctionnalités d'alignement de modèles, de génération de données synthétiques et de gestion de la taxonomie sont obsolètes et seront supprimées le 25 septembre 2026. Pour poursuivre les workflows de personnalisation et d'alignement des modèles, migrez vers Red Hat® OpenShift® AI On OpenShift. En savoir plus sur l'IA d' Red Hat® OpenShift®.
Prérequis
Génération de données à l'aide de la console
-
Dans la console, ouvrez le service Red Hat AI Inference.
-
Cliquez sur Inférence d'IA Red Hat Projects > votre projet > Données d'entraînement > Générer.
-
Saisissez un nom alphanumérique pour les données d'entraînement et sélectionnez la taxonomie à utiliser.
-
Facultatif : vérifiez le coût estimé qui vous est fourni avant de lancer le processus de génération des données.
-
Cliquez sur Générer. L'état est
queued, puisrunning. -
Attendez que l'état soit
completed. Une fois la génération des données terminée, un répertoiresynthetic_datacontenant les fichiers journaux est créé dans le compartiment Object Storage. Vous pouvez consulter ces journaux à des fins de dépannage ou de vérification.
Importation de vos propres données d'entraînement dans la console
Vous pouvez importer vos propres données générées précédemment pour compléter la génération de données dans l' Inférence d'IA Red Hat. Vous pouvez importer vos propres données si vous devez effectuer l'une ou plusieurs des opérations suivantes.
- Importez un ou plusieurs documents relatifs aux connaissances et aux compétences lors de la génération de données.
- Regroupez plusieurs séries de données d'entraînement en une seule.
- Générez des données, téléchargez-les, puis manipulez une partie de vos données et régénérez-les.
- Combinez vos données générées précédemment avec les données nouvellement importées.
- Importez des données, générez des données d'entraînement, puis combinez ces données avec celles issues d'un autre cycle de génération de données.
- Combinez le tampon de relecture et les données importées depuis votre taxonomie. Cette fonctionnalité est disponible uniquement via l'API ou l'interface de ligne de commande (CLI).
- Importez des données et générez des données d'entraînement à partir de votre taxonomie. Cette fonctionnalité est disponible uniquement via l'API ou l'interface de ligne de commande (CLI).
Pour importer vos propres données, vous pouvez vous référer à des exécutions précédentes de génération de données, importer des fichiers depuis votre compartiment Object Storage ou télécharger des fichiers depuis votre ordinateur local.
Suivez les étapes suivantes pour importer vos propres données d'entraînement.
-
Dans la console, ouvrez le service Red Hat AI Inference.
-
Cliquez sur Inférence d'IA Red Hat Projects > votre projet > Données d'entraînement > Importer.
-
Saisissez un nom alphanumérique pour vos données.
-
Sélectionnez l'une des options suivantes.
-
Object Storage: sélectionnez des fichiers existants dans votre compartiment Object Storage.
- Sélectionnez l'instance et le compartiment dans lesquels vos données existantes sont stockées.
- Cliquez sur Suivant.
- Sélectionnez les fichiers que vous souhaitez importer.
-
Télécharger des fichiers: Sélectionnez des fichiers sur votre ordinateur. Veuillez noter que la taille maximale des fichiers à télécharger est limitée à 40 Mo.
- Sélectionnez une instance et un compartiment d' Object Storage, ou créez une nouvelle instance et un nouveau compartiment pour stocker vos données.
- Accorder les autorisations Inférence d'IA Red Hat Writer pour le compartiment.
- Facultatif: paramètres de stockage. Précisez les détails supplémentaires suivants concernant le stockage de vos données.
- Chemin d'accès au fichier dans le compartiment.
- Répertoire situé dans le compartiment.
- Object Storage nom de l'instance.
- Groupe de ressources.
- Object Storage nom du compartiment.
- Résilience des buckets.
- Cliquez sur Suivant.
- Sélectionnez les fichiers de connaissances et de compétences que vous souhaitez importer depuis votre ordinateur local.
-
-
Cliquez sur Import.
Fusionner les données de formation dans la console
Vous pouvez générer des données par petits blocs faciles à gérer, afin d'éviter les délais d'expiration ou les limites du système. Vous pouvez ensuite fusionner ces petits ensembles de données en un seul ensemble de données à des fins d'entraînement.
Suivez les étapes suivantes pour fusionner des données dans la console.
-
Dans la console, ouvrez le service Red Hat AI Inference.
-
Cliquez sur Inférence d'IA Red Hat Projects > votre projet > Données d'entraînement.
-
Sélectionnez jusqu'à 20 entrées de vos données d'entraînement dans la liste, puis cliquez sur Fusionner.
-
Saisissez un nom alphanumérique pour vos données.
-
Sélectionnez l'instance d' Object Storage et le compartiment dans lesquels vous souhaitez stocker les données fusionnées.
-
Cliquez sur Créer.
Génération de données à l'aide de l'interface de ligne de commande (CLI)
-
Répertoriez vos taxonomies et notez celle que vous souhaitez utiliser.
ibmcloud ilab taxonomy listExemple de sortie.
id name taxonomy_path 669a88c9488ee7b95ce8fe05 test-tax taxonomy.tar.gz -
Générez des données à partir de votre taxonomie. Notez l'identifiant des données à utiliser à l'étape suivante. Utilisez des caractères alphanumériques dans le nom.
ibmcloud ilab data generate [--name NAME] [--taxonomy-id TAXONOMY-ID]Exemple de commande.
ibmcloud ilab data generate --name testdata --taxonomy-id 669a88c9488ee7b95ce8fe05Exemple de sortie.
id 66a268c170dcb21150050e8e name test-data state queued status created_at 2024-07-19T15:40:29.000Z taxonomy_id 669a88c9488ee7b95ce8fe05 -
Vérifiez les détails relatifs à la génération de vos données. Indiquez l'identifiant des données. L'état est
queued, puisrunning. Attendez que l'état soitcompleted. Lorsque l'état estcompleted, dans le compartiment Object Storage, un répertoiresynthetic_dataest créé contenant les journaux destinés au dépannage.ibmcloud ilab data get --id DATA_IDExemple de commande
data get.ibmcloud ilab data get --id 66a268c170dcb21150050e8eExemple de sortie.
id 66a268c170dcb21150050e8e name test-data state running status Generating data for taxonomy path compositional_skills->STEM->math->area: 12% 12/100 (total qna processed 1/147) created_at 2024-07-19T15:40:29.000Z taxonomy_id 669a88c9488ee7b95ce8fe05 -
Facultatif : lorsque l'état est
completed, vous pouvez consulter des indicateurs, tels que les estimations de jetons, afin de calculer le coût estimé.Exemple de commande
data getavec l'option--output jsonibmcloud ilab data get --id 66a268c170dcb21150050e8e --output jsonExemple de sortie JSON
{ "created_at": "2026-08-04T15:40:29.000Z", "data_metrics": { "samples": { "knowledge": 30, "skills": 70, "total": 100 }, "tokens": { "data_leaf_nodes": { "compositional_<taxonomy_path>": 26196, "knowledge_<taxonomy_path>": 1228930, }, "data_tokens_total": 5993486, "training_estimated": 411435913, "training_phases": { "phase_1_knowledge": 1389992, "phase_2_skills": 410045921 } } }, "id": "66a268c170dcb21150050e8e", "last_signal_at": "2026-08-04T17:20:32.000Z", "name": "test-data", "state": "completed", "status": "completed", "taxonomy_id": "669a88c9488ee7b95ce8fe05" }
Importer vos propres données d'entraînement à l'aide de l'interface de ligne de commande (CLI)
Vous pouvez souhaiter importer vos propres données pour l'une ou plusieurs des raisons suivantes.
- Importez un ou plusieurs documents relatifs aux connaissances et aux compétences lors de la génération de données.
- Regroupez plusieurs séries de données d'entraînement en une seule.
- Générez des données, téléchargez-les, puis manipulez une partie de vos données et régénérez-les.
- Combinez vos données générées précédemment avec les données nouvellement importées.
- Importez des données, générez des données d'entraînement, puis combinez ces données avec celles issues d'un autre cycle de génération de données.
- Combinez le tampon de relecture et les données importées depuis votre taxonomie. Cette fonctionnalité est disponible uniquement via l'API ou l'interface de ligne de commande (CLI).
- Importez des données et générez des données d'entraînement à partir de votre taxonomie. Cette fonctionnalité est disponible uniquement via l'API ou l'interface de ligne de commande (CLI).
Vous pouvez importer vos propres données d'entraînement pour compléter la génération de données dans l' Inférence d'IA Red Hat. Pour importer vos propres données générées précédemment, indiquez un ou plusieurs des éléments suivants :
- Les identifiants de génération de données des exécutions précédentes.
- Un compartiment Object Storage contenant des fichiers relatifs aux connaissances
.jsonlet aux compétences.
Suivez les étapes suivantes pour importer vos données.
- Répertoriez vos taxonomies et notez celle que vous souhaitez utiliser.
Exemple de sortie.ibmcloud ilab taxonomy listid name taxonomy_path 669a88c9488ee7b95ce8fe05 test-tax taxonomy.tar.gz - Si vous avez déjà généré des données que vous souhaitez utiliser, répertoriez-les et notez les UUID que vous souhaitez utiliser. Vous pouvez inclure jusqu'à 20 sources de données.
ibmcloud ilab data list - Générez des données à partir de votre taxonomie. Notez l'identifiant des données à utiliser à l'étape suivante. Utilisez des caractères
alphanumériques dans le nom.
Exemple de commande permettant d'inclure plusieurs identifiants internes (sources de données) pour la génération de données.ibmcloud ilab data generate [--name NAME] [--taxonomy-id TAXONOMY-ID] [--internal-ids INTERNAL-IDs]ibmcloud ilab data generate --name testdata --taxonomy-id 65005b67-7de4-4216-b23c-ed4342f99c88 --internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40
Pour plus d'exemples, consultez la section suivante : Exemples de commandes pour importer vos propres données d'entraînement.
Exemples de commandes pour importer vos propres données d'entraînement
Consultez les exemples de commandes suivants pour importer vos propres données d'entraînement ou ajouter des fichiers de connaissances et de compétences à une tâche de génération de données.
Exemple de commande permettant d'inclure plusieurs identifiants internes.
ibmcloud ilab data generate --name testdata --taxonomy-id 65005b67-7de4-4216-b23c-ed4342f99c88 --internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40
Exemple de commande permettant de combiner plusieurs sources de données générées précédemment (identifiants internes) ainsi que des fichiers .jsonl provenant d’un compartiment Object Storage.
ibmcloud ilab data generate \
--name testdata \
--taxonomy-id 669a88c9488ee7b95ce8fe05 \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40 \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
Exemple de commande permettant de combiner des données générées précédemment avec des fichiers de connaissances .jsonl et de compétences stockés dans un compartiment Object Storage. Vous pouvez également, si vous le souhaitez,
spécifier un compartiment de sortie Object Storage pour stocker les données générées (SDG).
ibmcloud ilab data generate \
--name testdata \
--taxonomy-id 669a88c9488ee7b95ce8fe05 \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59 \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Exemple de commande permettant de fusionner des données en spécifiant leurs identifiants internes.
ibmcloud ilab data generate \
--name testdata \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59,299ee20c-0b04-4d8e-ad12-a3d98feece40 \
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Exemple de commande permettant de fusionner des données générées précédemment en spécifiant leurs identifiants internes, ainsi que d’inclure des compétences et des connaissances provenant d’un compartiment Object Storage.
ibmcloud ilab data generate \
--name testdata \
--internal-ids 8c6b9224-a4f1-4649-907c-0f11d14cfc59 \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Exemple de commande permettant de fusionner des compétences et des connaissances à partir d'un compartiment Object Storage.
ibmcloud ilab data generate \
--name testdata \
--knowledge-paths PATH \
--skills-paths PATH \
--skills-knowledge-cos-bucket STRING \
--skills-knowledge-cos-bucket-endpoint ENDPOINT
--output-cos-bucket-string STRING \
--output-cos-bucket-endpoint ENDPOINT
Génération de données à l'aide de l'API
-
Répertoriez vos taxonomies et notez celle que vous souhaitez utiliser.
Exemple de commande.
curl -X 'GET' \ 'https://us-east.instructlab.ibm.com/v1/taxonomies' \ -H 'accept: application/json`Exemple de sortie.
{ "taxonomies": [ { "id": "202a03c4-dcf1-432a-82b7-abecb2e019f7", "name": "example-taxonomy-name-1", "taxonomy_path_cos": "taxonomies/taxonomy.tar.gz", "created_at": "2024-10-23T02:58:50.000Z" } ] } -
Générez des données à partir de votre taxonomie. Notez l'identifiant des données à utiliser à l'étape suivante. Utilisez des caractères alphanumériques dans le nom.
Exemple de commande.
curl -X 'POST' \ 'https://us-east.instructlab.ibm.com/v1/data' \ -H 'accept: application/json' \ -H 'Content-Type: application/json' \ -d '{ "name": "example-data-1", "taxonomy_id": "202a03c4-dcf1-432a-82b7-abecb2e019f7" }'Exemple de sortie.
{ "id": "add785e6-a8c3-4f5f-ab89-c506a3f115da", "name": "example-data-1", "state": "", "status": "queued", "created_at": "2024-10-23T02:58:50.000Z", "last_signal_at": "2026-08-04T17:20:32.000Z", "taxonomy_id": "202a03c4-dcf1-432a-82b7-abecb2e019f7", "data_metrics": { "samples": { "additionalProp1": 1, "additionalProp2": 2, "additionalProp3": 3 } } } -
Vérifiez les détails relatifs à la génération de vos données. Indiquez l'identifiant des données. L'état est
queued, puisrunning. Attendez que l'état soitcompleted.Exemple de commande.
curl -X 'GET' \ 'https://us-east.instructlab.ibm.com/v1/data/add785e6-a8c3-4f5f-ab89-c506a3f115da' \ -H 'accept: application/json'Exemple de sortie.
{ "id": "add785e6-a8c3-4f5f-ab89-c506a3f115da", "name": "example-data-1", "state": "", "status": "queued", "created_at": "2024-10-23T02:58:50.000Z", "last_signal_at": "2026-08-04T17:20:32.000Z", "taxonomy_id": "202a03c4-dcf1-432a-82b7-abecb2e019f7", "data_metrics": { "samples": { "additionalProp1": 1, "additionalProp2": 2, "additionalProp3": 3 } } }
Lorsque l'état est completed, dans le compartiment Object Storage, un répertoire synthetic_data est créé contenant les journaux destinés au dépannage.
Que contient mon compartiment Object Storage après la génération de données?
Une fois les données générées, votre compartiment Object Storage contient un répertoire synthetic_data comprenant les fichiers suivants.
Artifacts- Ces fichiers contiennent les exemples présents sur chaque nœud feuille. Ces documents ne sont pas utilisés pour l'entraînement du modèle, mais sont fournis à des fins de lisibilité et peuvent servir à vérifier si un QNA génère le nombre d'échantillons attendu.
Logs- Ces fichiers contiennent les journaux d'exécution d' Red Hat AI Inference ainsi que des informations sur le système.
knowledge_train_msgs.jsonletskills_train_msgs.jsonl- Il s'agit des fichiers de formation des phases 1 et 2, qui contiennent des exemples utilisés pour l'entraînement du modèle.
Pour comprendre pourquoi et comment vos données sont générées, consultez le document communautaire FAQ SDG.
Exemple de format .jsonl
Consultez l'exemple de structure .jsonl suivant concernant les compétences et les connaissances.
{
"messages": [
{
"content": "string", // The text of the message
"role": "string" // The role of the sender (e.g., "system", "user", "assistant")
}
],
"metadata": "string", // A JSON-encoded string containing additional info (e.g., num_turns, group, dataset)
"id": "string" // A unique identifier for the conversation
}
Etapes suivantes
Une fois que vous avez généré des données à partir de votre taxonomie, vous pouvez commencer à entraîner votre modèle.