Pourquoi Fine-Tone ?

Les modèles pré-entraînés sont puissants mais peuvent ne pas correspondre à votre domaine. L’ajustement fin les adapte à vos besoins spécifiques sans la former de zéro.

Le problème du coût

L’ajustement fin complet d’un modèle à 7B nécessite ~160 Go de VRAM. Cela fait 2 à 4 GPU A100 à 2 à 3 $ par heure chacun.

Méthodes à efficacité paramétrique

  • LoRA : Ajouter de petites matrices entraînables aux couches gelées. Réduit les paramètres entraînables de 100 fois.
  • QLoRA : Quantiser le modèle de base en 4 bits, puis appliquer LoRA. Il convient à un modèle 65B sur un seul GPU de 48 Go.
  • Réglage des préfixes : Entraîne uniquement les petits vecteurs de préfixes. Mémoire minimale.
  • Couches adaptatrices : Insérer de petits modules entraînables entre les couches figées.

Installation pratique

  • Matériel : Une seule RTX 4090 (24 Go) ou A10G (24 Go) gère la plupart des tâches QLoRA.
  • Options cloud : RunPod, Lambda Labs, Vast.ai à 0,3-0,8 $/heure.
  • Cadres : PEFT de Visage Câlin, Paresse, Axolotl.

Étape par étape

1. Préparez votre jeu de données (format JSONL, exemples 1K-10K).

2. Choisissez un modèle de base correspondant à votre domaine de tâche.

3. Configurez QLoRA avec les rangs 16-64 et alpha 16-32.

4. S’entraîner pendant 1 à 3 époques, en surveillant la perte de validation.

5. Fusionner les adaptateurs et évaluer les données de test en attente.

Conseils

  • Commencer avec 1 000 exemples de haute qualité avant de passer à 10 000 exemplaires.
  • Utiliser le format suivant des instructions même pour les tâches de complétion.
  • Toujours évaluer sur des données que le modèle n’a pas vues lors de l’entraînement.