"내 카드로 뭘 파인튜닝할 수 있나?" — VRAM별로 지도를 그린다. 기준은 Unsloth 공식 최소치(QLoRA 4-bit: 7B=5GB, 14B=8.5GB, 32B=26GB, 70B=41GB)와 Modal의 보수적 수치(70B QLoRA 46GB) — 둘 사이가 정직한 범위다.
티어 사다리 (QLoRA 파인튜닝 기준)
- 무료 Colab T4 16GB — 14B까지 여유, MoE인 gpt-oss-20b(14GB)도 아슬하게. 단 세션 최대 12시간 + 예고 없는 끊김 — 체크포인트를 Drive에 저장하며 돌려라.
- RTX 3060 12GB — 14B QLoRA. 입문 가성비 카드.
- RTX 4060 Ti 16GB — 14B 여유 + 20B-MoE급.
- 중고 RTX 3090 / RTX 4090 24GB — 27B 편안, 32B는 빠듯. 중고 3090이 2026년에도 VRAM/원 최강인 이유: 생성 속도는 대역폭을 따르는데 3090은 936GB/s로 164 t/s(7B Q4)를 낸다 — 최신 미드레인지보다 빠르다(Puget 벤치).
- RTX 5090 32GB — 32B 여유. 생성 264 t/s로 4090의 1.4배(Vulkan 메가스레드).
- 70B QLoRA(41-46GB) — 40GB A100은 못 들어간다! 답은 48GB(A40 $0.35/hr, L40S)나 80GB A100, 또는 중고 3090 두 장 + FSDP+QLoRA(Answer.AI: 4비트로 70B가 ~35GB라 24GB×2에 들어간다). 16-bit LoRA는 7B만 해도 19GB — 12-16GB 카드는 전부 탈락이라 QLoRA가 기본값인 이유다.
렌탈 시세로 감 잡기 (RunPod 2026-08)
3090 $0.22-0.50/hr · 4090 $0.34-0.74 · 5090 $0.69-0.99 · A40 48GB $0.35-0.44 · A100 80GB $1.19-1.39 · H100 $1.99+. 즉 32B QLoRA 한 번(~6시간)이 렌탈 4090으로 $2-5. 시장 중앙값(GetDeploying)에서는 T4가 $0.81로 4090($0.44)보다 비싼 역전도 있다 — 소비자 카드 렌탈이 성능당 가격 최강.
NVIDIA vs AMD vs Intel (2026)
큰 변화: bitsandbytes가 AMD ROCm(Linux+Windows 휠, RX 6000-9000 전부)과 Intel XPU를 공식 지원한다 — QLoRA가 더 이상 NVIDIA 전유물이 아니다. Unsloth도 AMD에서 학습된다(Linux 한정). 다만 Windows-ROCm 멀티 GPU와 Intel 파인튜닝은 아직 2등 시민이라, 기본 추천은 여전히 NVIDIA — RX 7900 XTX 24GB(생성 191 t/s, 3090급)는 Linux 사용자 한정의 가성비 카드다.
정리
한 줄 교훈: 사기 전에 빌려라 — 실험 몇 번이면 $5 미만이고, 사겠다면 중고 3090(대역폭 936GB/s)이 여전히 답이다. 다음 글: 이 카드들에 무엇을 어떤 형식으로 얹을 것인가, 양자화 지도.
— LoRA 실전 시리즈 ③ / 다음 글: 양자화 지도
댓글 없음:
댓글 쓰기
국정원의 댓글 공작을 지탄합니다.