Passer au contenu principal
W&B Inference vous permet d’utiliser un LoRA personnalisé avec certains modèles de base. Ce tutoriel montre comment créer un LoRA affiné à l’aide d’un post-entraînement supervisé avec la bibliothèque TRL. Cet exemple utilise un jeu de données de paires requête/réponse pour affiner un modèle afin qu’il réponde à la manière d’un cowboy. Vous pouvez également créer un LoRA avec W&B Training, qui propose un apprentissage par renforcement sans serveur.

Jeu de données post-entraînement

Le jeu de données suivant contient 50 paires de requêtes et de réponses, présentées sous forme de liste de messages, par exemple :
Utilisateur : “Quelle est votre couleur préférée ?”
Assistant : “Eh bien, partenaire, ma couleur préférée, c’est l’orange flamboyant d’un coucher de soleil dans le désert…”
Le fichier d’exemple contient un objet JSON par ligne. Enregistrez les données suivantes dans votre répertoire de travail sous le nom cowboy_examples.jsonl.
cowboy_examples.jsonl

post-entraînement

Ce script entraîne un adaptateur LoRA sur des exemples du fichier JSONL et le téléverse vers W&B en tant qu’Artifact afin qu’il puisse être utilisé avec la W&B Inference API ou le Playground. Dans les grandes lignes, ce script effectue les opérations suivantes :
  1. Se connecte à W&B. L’intégration Hugging Face Transformers de W&B Models enregistre automatiquement la progression de l’entraînement et les métriques.
  2. Charge le modèle de base (OpenPipe/Qwen3-14B-Instruct) depuis Hugging Face.
  3. Configure LoRA à l’aide d’hyperparamètres, tels que le rang et alpha, définis comme constantes en haut du fichier.
  4. Charge les exemples du fichier dans un jeu de données, puis exécute SFTTrainer. Par défaut, le script utilise tous les exemples.
  5. Enregistre le LoRA et le téléverse vers W&B en tant qu’Artifact afin qu’il puisse être utilisé avec W&B Inference.
Une fois le script terminé, ouvrez dans votre navigateur la dernière URL affichée pour voir l’Artifact enregistré. Elle ressemble à ceci : Artifact URL: https://wandb.ai/<yourentity>/create-lora-tutorial/artifacts/lora/OpenPipe_Qwen3-14B-Instruct_cowboy/v0 Enregistrez le programme suivant sous create_lora.py et mettez à jour la valeur ENTITY avec votre entité W&B. Pour simplifier l’exécution, le script utilise des métadonnées de script intégrées pour déclarer les dépendances.
create_lora.py
Exécutez le script à l’aide de uv :
Le temps d’exécution dépend du matériel. Vous pouvez ajouter l’argument --max-examples=10 pour accélérer l’entraînement, mais cela peut nuire à la capacité du LLM à répondre en restant dans le personnage.

Utiliser LoRA

Vous pouvez rapidement essayer votre nouveau LoRA dans le playground W&B Weave. Lorsque vous ouvrez l’URL de l’artifact, cliquez sur le bouton “Try in playground”.
LoRA dans l’interface Artifacts
Saisissez ensuite votre prompt en bas de l’interface de chat.
LoRA dans l’interface Playground
Pour utiliser votre LoRA nouvellement créé depuis votre code, voir le guide Use Serverless LoRA Inference pour suivre les instructions étape par étape.

Étapes suivantes

Une fois le LoRA créé, vous pouvez faire varier son entraînement, par exemple :
  • Entraîner le LoRA avec moins d’exemples pour voir s’il produit toujours l’effet souhaité.
  • Modifier les réponses dans le jeu de données pour mettre en scène un autre personnage, comme un pirate ou un ninja.