2026년 8월 25일 화요일

LoRA 실전 ⑥ — 실습 레시피: 무료 Colab부터 24GB까지, 그리고 Windows 함정

이제 실제로 돌려보자. VRAM별 도구 선택, 실측 소요 시간, 그리고 Windows 사용자가 반드시 알아야 할 함정 하나까지.

VRAM별 추천 경로

  • GPU 없음 → 무료 Colab T4 (16GB)Unsloth 공식 노트북에서 모델 고르고 데이터만 갈아끼우면 끝. 14B dense까지, MoE인 gpt-oss-20b도 14GB로 학습 가능 — 무료 티어의 2025-26 최대 사건. 주의: 세션 12시간 한도 + 예고 없는 끊김 → Drive 마운트 + save_pretrained로 어댑터(~100-200MB)를 살려라. 예측 가능성이 필요하면 Kaggle(주 30 GPU시간, T4×2, 9시간 세션)이 낫다.
  • 12-24GB Windows 데스크톱 → LLaMA-Factory WebUI — 코딩 없이 GUI로 학습-평가-내보내기. VRAM표: QLoRA 7B=6GB / 13B=12GB / 30B=24GB. EXAONE 템플릿 내장, Kanana는 llama3 템플릿으로. Windows 팁: dataloader_num_workers: 0.
  • Linux/WSL2 파워유저 → Axolotl — 10줄 YAML이 실험 기록 그 자체. 단 Ampere+ 필요, Windows 네이티브 미지원.
  • 속도가 급하면 어디서든 Unsloth — 같은 카드에서 2배 빠르고 VRAM 70% 절감, 16GB에서 컨텍스트 40K 토큰(HF+FA2는 2.5K)(공식 벤치).

시간 감각

Schmid의 실측: Llama-3.1-8B QLoRA, 1만 샘플 1 epoch = 24GB 카드에서 packing+FA2+Liger 켜면 ~2.2시간(안 켜면 6시간 — packing이 최대 레버). 무료 T4는 약 2배. 한국어 사례: KoAlpaca가 12B 4-bit를 T4에서 50샘플당 ~4분으로 학습했다 — 1만 샘플이면 ~3시간.

Windows 함정 둘

  • bitsandbytes는 이제 그냥 깔린다 — 2023-24년의 악명 높은 "윈도우에서 안 깔려요"는 끝났다. 공식 Windows 휠 제공(CUDA 11.8-13.2). WSL2가 필요한 건 Axolotl·vLLM·flash-attn뿐.
  • Sysmem Fallback 함정 — Windows NVIDIA 드라이버(536.40+)는 VRAM이 차면 OOM을 내는 대신 조용히 시스템 RAM으로 흘린다 → 학습이 죽지 않고 5-10배 느려진다. Linux는 시끄럽게 죽는데 Windows는 조용히 기어간다. 해결: NVIDIA 제어판 → 3D 설정 관리 → "CUDA - Sysmem Fallback Policy" → "Prefer No Sysmem Fallback" (python.exe에 지정). 빨리 죽어야 배치 크기를 고칠 수 있다.

OOM 생존 키트 (비용순)

① 배치 1-2 + gradient accumulation 4-16 → ② gradient checkpointing(~20% 느림) → ③ optim="paged_adamw_8bit" → ④ max_seq_length 축소 → ⑤ 그래도 안 되면 상위 카드 렌탈. Unsloth 특유의 함정 둘: eval 중 OOM은 per_device_eval_batch_size=2 + fp16_full_eval=True로, GGUF 저장 크래시는 maximum_memory_usage=0.5로.

정리

한 줄 교훈: 도구는 OS와 VRAM이 고른다 — 무료 T4는 Unsloth 노트북, Windows 12-24GB는 LLaMA-Factory, Linux는 Axolotl. 그리고 Windows라면 학습 전에 Sysmem Fallback부터 꺼라. 다음 글: 학습이 끝난 모델을 병합·변환·서빙하는 법.

— LoRA 실전 시리즈 ⑥ / 다음 글: 병합·GGUF 변환·서빙

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...