Pourquoi Fine-Tone ?
Les modèles pré-entraînés sont puissants mais peuvent ne pas correspondre à votre domaine. L’ajustement fin les adapte à vos besoins spécifiques sans la former de zéro.
Le problème du coût
L’ajustement fin complet d’un modèle à 7B nécessite ~160 Go de VRAM. Cela fait 2 à 4 GPU A100 à 2 à 3 $ par heure chacun.
Méthodes à efficacité paramétrique
- LoRA : Ajouter de petites matrices entraînables aux couches gelées. Réduit les paramètres entraînables de 100 fois.
- QLoRA : Quantiser le modèle de base en 4 bits, puis appliquer LoRA. Il convient à un modèle 65B sur un seul GPU de 48 Go.
- Réglage des préfixes : Entraîne uniquement les petits vecteurs de préfixes. Mémoire minimale.
- Couches adaptatrices : Insérer de petits modules entraînables entre les couches figées.
Installation pratique
- Matériel : Une seule RTX 4090 (24 Go) ou A10G (24 Go) gère la plupart des tâches QLoRA.
- Options cloud : RunPod, Lambda Labs, Vast.ai à 0,3-0,8 $/heure.
- Cadres : PEFT de Visage Câlin, Paresse, Axolotl.
Étape par étape
1. Préparez votre jeu de données (format JSONL, exemples 1K-10K).
2. Choisissez un modèle de base correspondant à votre domaine de tâche.
3. Configurez QLoRA avec les rangs 16-64 et alpha 16-32.
4. S’entraîner pendant 1 à 3 époques, en surveillant la perte de validation.
5. Fusionner les adaptateurs et évaluer les données de test en attente.
Conseils
- Commencer avec 1 000 exemples de haute qualité avant de passer à 10 000 exemplaires.
- Utiliser le format suivant des instructions même pour les tâches de complétion.
- Toujours évaluer sur des données que le modèle n’a pas vues lors de l’entraînement.