Premiers pas avec le fine-tuning : LoRA et QLoRA
Quand l’ingénierie de prompts et le RAG ne suffisent plus, le fine-tuning permet à un modèle de maîtriser durablement un style ou une tâche donnés. Ce tutoriel présente les méthodes de fine-tuning efficaces les plus répandues : LoRA et QLoRA.
ParAI Resource Hub
Quand avez-vous vraiment besoin de fine-tuning ?
S’il s’agit seulement d’apporter des connaissances, préférez le RAG. Le fine-tuning se justifie davantage pour imposer un style ou un format de sortie fixe, ou pour apprendre une tâche précise à un petit modèle.
Le fine-tuning exige une certaine quantité de données annotées de qualité : réfléchissez à vos objectifs et à votre méthode d’évaluation avant d’investir.
Le coût du fine-tuning complet
Le fine-tuning de tous les paramètres met à jour l’ensemble des poids du modèle, avec des coûts mémoire et calcul colossaux — pour les grands modèles, c’est presque hors de portée des particuliers et petites équipes.
L’idée centrale de LoRA
LoRA (Low-Rank Adaptation) gèle les poids d’origine et insère à côté une paire de petites matrices de bas rang qui apprennent le « delta ». Les paramètres entraînables ne représentent souvent qu’un pour cent du fine-tuning complet, voire moins.
À la fin de l’entraînement, vous obtenez un adaptateur minuscule, chargeable à la demande — pratique pour en maintenir plusieurs selon les tâches.
QLoRA et la quantification
Sur la base de LoRA, QLoRA quantifie d’abord le modèle de base en 4 bits avant l’entraînement, réduisant encore drastiquement la mémoire : affiner des modèles assez grands sur une seule carte grand public devient faisable.
Préparation des données et conseils pratiques
La qualité des données prime sur la quantité : construisez des paires instruction-réponse claires et cohérentes qui couvrent vos scénarios cibles.
Commencez avec un learning rate faible et peu d’époques, surveillez de près les performances en validation pour éviter le surapprentissage, et appuyez-vous sur des bibliothèques comme Hugging Face PEFT pour démarrer vite.
Fusionner et déployer les adaptateurs
Après l’entraînement, vous pouvez soit fusionner les poids LoRA dans le modèle de base pour obtenir un fichier autonome, soit les garder séparés et les charger à la demande. La fusion simplifie le déploiement mais vous fait perdre la flexibilité de changer d’adaptateur sans ré-exporter. Gardez des adaptateurs séparés pour servir plusieurs tâches depuis le même modèle de base ; fusionnez pour un artifact unique à usage unique.