2026년 8월 25일 화요일

All about SFT ⑤ — LoRA와 파라미터 효율 파인튜닝

7B 모델을 full fine-tuning 하려면 얼마나 필요할까? 파라미터당 약 16바이트(가중치+옵티마이저+그래디언트) × 7B = 112GB+, A100 80GB 한 장으로도 부족하다(Transformer Math 101). 이 산수가 PEFT(파라미터 효율 파인튜닝)의 존재 이유다. LoRA는 같은 모델을 16GB로, QLoRA는 6GB로 내린다.

핵심 계보

  • LoRA (2021, Microsoft) — 표준. 사전학습 가중치 W를 동결하고 업데이트 ΔW를 저랭크 행렬 B·A로 분해해 그것만 학습한다. 학습 파라미터 1/10000, 성능은 full FT 동등, 그리고 결정적 장점: 병합하면 추론 오버헤드 0. (전사(前史)가 궁금하면 Adapters, 2019 — 추론 지연이 남는 구조였고, 그래서 LoRA가 이겼다.)
  • QLoRA (2023, UW) — base를 4비트(NF4)로 양자화해 동결하고 그 위에 LoRA. 65B를 48GB GPU 한 장에서 파인튜닝하며 16비트 성능 보존. 소비자 GPU 시대를 연 논문 — 7B가 4비트로 4~5GB라 RTX 4090 한 장, 무료 Colab T4로도 SFT가 된다(load_in_4bit=True 한 줄).
  • 개선 변형 3종DoRA (2024, ICML oral): 크기/방향 분해로 낮은 랭크에서 LoRA를 일관되게 능가(use_dora=True). rsLoRA (2023): 스케일링을 α/√r로 고쳐 고랭크(r≥64) 학습을 복원(use_rslora=True). LoRA+ (2024): B 행렬에 더 큰 학습률로 공짜 수렴 가속. 셋 다 HF PEFT 플래그 하나다.

LoRA vs Full FT — 실증의 결론

  • LoRA Learns Less and Forgets Less (2024, TMLR) — 정면 비교의 결정판. LoRA는 타깃 도메인에서 full FT에 뒤지지만 원래 능력을 훨씬 잘 보존하며, weight decay·dropout보다 강한 정규화로 작동한다. 실무 규칙: 수만~수십만 샘플 SFT는 LoRA로 충분, 수십억 토큰급 도메인 주입(continued pretraining)만 full FT.
  • LoRA Without Regret (2025, Thinking Machines) — 2025년의 기준점. 결론들: ① attention만 말고 모든 linear 층(MLP 포함)에 적용, ② 데이터 정보량이 어댑터 용량을 안 넘으면 LoRA ≈ full FT, ③ LoRA 최적 학습률은 full FT의 약 10배, ④ RL에는 rank 1도 충분. TRL 공식 재현 문서까지 있다.
  • Raschka 실무 팁 (2023) — 수백 회 실험 기반: r=16~32에서 시작, α=r 또는 2r, 여러 epoch가 오히려 해로울 수 있다, 옵티마이저 선택은 거의 무관.

도구와 메모리 감각

HF PEFT가 이 글의 모든 기법을 한 API로 제공하고(LoraConfig(r=16, lora_alpha=32, target_modules="all-linear")), Unsloth는 커스텀 커널로 학습 2배 가속 + VRAM 70~80% 절감 — 무료 Colab에서 7B QLoRA가 도는 노트북을 공식 제공한다. 메모리 암산표: 파라미터당 full FT ≈ 16B / LoRA ≈ 2B+α / QLoRA ≈ 0.6B (7B 모델 기준 112GB+ / 16GB / 6GB).

정리

2026년의 기본값: 모든 linear 층에 r=16~32, α=2r, lr ≈ 1e-4~2e-4(full FT의 10배)로 LoRA/QLoRA. full FT는 대규모 도메인 주입에만. 다음 글: 데이터와 어댑터를 실제 학습으로 연결하는 레시피의 디테일 — chat template, loss masking, packing.

— All about SFT 시리즈 ⑤ / 다음 글: SFT 학습 레시피의 디테일

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...