Adaption Labs génère un jeu d’entraînement à partir d’une description

Adaption Labs lance Invent a Dataset, un service qui génère des jeux d’instructions ou de préférences à partir d’une description, sans imposer de corpus initial ni de schéma prédéfini.

Décrire ce qu’un modèle doit apprendre, choisir un domaine et indiquer le nombre d’exemples souhaité. Invent a Dataset promet de prendre en charge les étapes suivantes : définir la structure du jeu de données, sélectionner le contenu pertinent et produire les exemples nécessaires à l’entraînement.

Présenté par Adaption Labs, le service inverse le point de départ habituel d’un projet de personnalisation. Une équipe ne commence plus nécessairement par les documents, conversations ou tableaux qu’elle possède déjà. Elle formule le comportement recherché, puis laisse la plateforme fabriquer un jeu de données correspondant à cette spécification.

L’entreprise cite la synthèse de documents selon les règles d’une organisation, le classement de demandes adressées au service client et l’application de politiques variant selon les régions ou les produits. D’autres exemples présentés sur la page du service portent sur des avis d’hôtels, l’assistance technique, les annonces immobilières en vietnamien et les questions médicales.

Le principe répond à une difficulté bien connue. Un corpus disponible n’a généralement pas été conçu pour entraîner un modèle. Il peut contenir les bonnes informations sans les présenter sous la forme d’une instruction et de sa réponse attendue. Sa transformation nécessite alors du nettoyage, de la déduplication, la définition de catégories, la rédaction d’exemples et parfois une longue campagne d’annotation.

Invent a Dataset tente de déplacer ce travail vers une interface de spécification. L’utilisateur sélectionne au moins un domaine ou sous-domaine, fixe un nombre cible de lignes et peut ajouter une description libre pouvant atteindre 10 000 caractères. Ce texte précise le sujet, le public, le niveau de détail ou la manière dont les réponses doivent être rédigées.

Le mot « inventer » pourrait laisser penser que l’outil crée librement chaque exemple à partir d’une simple phrase. La documentation technique apporte une nuance importante : la description sert notamment à effectuer une recherche sémantique qui sélectionne des données sources, puis elle est intégrée aux instructions de génération.

Le service peut donc être utilisé sans que le client fournisse son propre corpus, mais il ne fonctionne pas sans données au sens général. Il s’appuie sur des contenus sélectionnés par la plateforme et sur des modèles capables de les transformer. Adaption Labs ne détaille pas publiquement, dans sa présentation, la composition complète de ces sources, les modèles employés pour générer les exemples ou les contrôles de provenance appliqués à chaque ligne.

Deux structures d’entraînement sont actuellement proposées. Le format par défaut produit des paires comprenant une instruction et une réponse. Il est destiné à l’apprentissage supervisé, couramment désigné par l’acronyme SFT.

Le second format génère des paires de préférence. Deux réponses sont associées à une même instruction, l’une étant retenue et l’autre rejetée. Ces données peuvent servir à des méthodes telles que la DPO, qui apprennent au modèle à favoriser certains comportements sans exiger une note numérique pour chaque réponse.

La génération s’effectue de manière asynchrone. Une requête crée le jeu de données et renvoie immédiatement son identifiant, accompagné de l’état `running`. L’application doit ensuite vérifier régulièrement son avancement avant de télécharger le résultat.

Le nombre de lignes demandé reste une cible plutôt qu’une garantie stricte. La documentation prévient que le volume effectivement livré peut se situer légèrement au-dessus ou en dessous. Des limites par lancement s’appliquent également selon la formule souscrite.

Une fois le traitement terminé, les données peuvent être exportées en JSONL, JSON, CSV ou Parquet. Les jeux d’instructions placent le texte généré dans des champs réservés à l’instruction et à la réponse améliorées. Les champs correspondant aux exemples d’origine restent vides, puisqu’aucune ligne fournie par l’utilisateur n’a servi de point de départ direct.

Invent a Dataset est accessible à travers l’application web d’Adaption Labs et son API. Le kit Python expose notamment des commandes permettant de consulter la liste actualisée des domaines, d’obtenir une estimation du coût, de lancer la génération, de suivre son état et de télécharger le fichier.

L’estimation constitue une étape facultative, mais utile lorsque le volume est important. Elle indique le nombre de crédits nécessaires sans démarrer le traitement ni débiter le compte. Adaption Labs qualifie encore le prix d’Invent de provisoire et ne publie pas de tarif unitaire général sur la page de lancement. Les crédits dépendent du nombre de lignes produites après les éventuelles expansions linguistiques.

La plateforme peut en effet traduire une partie des exemples vers plusieurs langues ou les localiser pour des couples précis de pays et de langues. Une localisation ne se limite pas à remplacer les mots : elle vise également à adapter les formulations au contexte géographique choisi. Chaque variante supplémentaire augmente toutefois le volume facturé.

Cette fonction peut faciliter l’entraînement de modèles destinés à des marchés peu couverts par les données disponibles. Elle ne dispense pas d’une validation locale. Une traduction grammaticalement correcte peut employer le mauvais registre, ignorer une pratique administrative ou présenter comme universelle une règle qui ne s’applique que dans une région.

La même réserve vaut pour les secteurs réglementés. Un ensemble de questions médicales ou juridiques cohérent sur le plan rédactionnel n’est pas nécessairement exact, à jour ni approprié à une juridiction particulière. La génération réduit le travail de rédaction, mais ne transfère pas au système la responsabilité de valider les faits et les règles métier.

La description initiale devient donc une pièce déterminante. Si elle omet un cas rare, une exception contractuelle ou une catégorie ambiguë, le jeu produit risque de reproduire ce silence. Un système capable