왜 파인튜닝인가?

사전 학습된 모델은 강력하지만 도메인과 맞지 않을 수 있습니다. 미세 조정은 처음부터 교육하지 않고도 당신의 구체적인 필요에 맞게 조정합니다.

비용 문제

7B 매개변수 모델의 완전한 미세 조정에는 ~160GB VRAM이 필요합니다. 즉, A100 GPU 2-4개를 시간당 2-3달러에 구입하는 셈입니다.

매개변수 효율적인 방법

  • LoRA: 얼린 층에 작은 훈련 가능한 행렬을 추가합니다. 훈련 가능한 매개변수를 100배 줄입니다.
  • QLoRA: 기본 모델을 4비트로 양자화한 후 LoRA를 적용합니다. 65B 모델을 48GB GPU 한 개에 장착할 수 있습니다.
  • 접두사 튜닝: 작은 접두사 벡터만 학습합니다. 메모리 오버헤드가 최소화됩니다.
  • 어댑터 레이어: 얼린 층 사이에 작은 훈련 가능한 모듈을 삽입합니다.

실용 설정

  • 하드웨어: 단일 RTX 4090(24GB) 또는 A10G(24GB)가 대부분의 QLoRA 작업을 처리합니다.
  • 클라우드 옵션: RunPod, Lambda Labs, Vast.ai 시간당 $0.3-0.8.
  • 프레임워크: 포옹 페이스 PEFT, 언슬로스, 아홀로틀.

단계별

1. 데이터셋 준비(JSONL 형식, 1K-10K 예시).

2. 작업 도메인에 맞는 기본 모델을 선택하세요.

3. QLoRA를 랭크 16-64, 알파 16-32로 설정.

4. 1-3 에포크를 훈련시키며 검증 손실을 모니터링합니다.

5. 어댑터를 병합하고 보류된 테스트 데이터를 평가합니다.

  • 1,000개의 고품질 예제로 시작하여 10,000개로 확장합니다.
  • 완료 작업에도 지시-따르는 형식을 사용하세요.
  • 항상 훈련 중에 모델이 못한 데이터를 기준으로 평가하세요.