2026년 8월 25일 화요일

LoRA 실전 ③ — GPU 티어 가이드 2026

"내 카드로 뭘 파인튜닝할 수 있나?" — VRAM별로 지도를 그린다. 기준은 Unsloth 공식 최소치(QLoRA 4-bit: 7B=5GB, 14B=8.5GB, 32B=26GB, 70B=41GB)와 Modal의 보수적 수치(70B QLoRA 46GB) — 둘 사이가 정직한 범위다.

티어 사다리 (QLoRA 파인튜닝 기준)

  • 무료 Colab T4 16GB — 14B까지 여유, MoE인 gpt-oss-20b(14GB)도 아슬하게. 단 세션 최대 12시간 + 예고 없는 끊김 — 체크포인트를 Drive에 저장하며 돌려라.
  • RTX 3060 12GB — 14B QLoRA. 입문 가성비 카드.
  • RTX 4060 Ti 16GB — 14B 여유 + 20B-MoE급.
  • 중고 RTX 3090 / RTX 4090 24GB — 27B 편안, 32B는 빠듯. 중고 3090이 2026년에도 VRAM/원 최강인 이유: 생성 속도는 대역폭을 따르는데 3090은 936GB/s로 164 t/s(7B Q4)를 낸다 — 최신 미드레인지보다 빠르다(Puget 벤치).
  • RTX 5090 32GB — 32B 여유. 생성 264 t/s로 4090의 1.4배(Vulkan 메가스레드).
  • 70B QLoRA(41-46GB) — 40GB A100은 못 들어간다! 답은 48GB(A40 $0.35/hr, L40S)나 80GB A100, 또는 중고 3090 두 장 + FSDP+QLoRA(Answer.AI: 4비트로 70B가 ~35GB라 24GB×2에 들어간다). 16-bit LoRA는 7B만 해도 19GB — 12-16GB 카드는 전부 탈락이라 QLoRA가 기본값인 이유다.

렌탈 시세로 감 잡기 (RunPod 2026-08)

3090 $0.22-0.50/hr · 4090 $0.34-0.74 · 5090 $0.69-0.99 · A40 48GB $0.35-0.44 · A100 80GB $1.19-1.39 · H100 $1.99+. 즉 32B QLoRA 한 번(~6시간)이 렌탈 4090으로 $2-5. 시장 중앙값(GetDeploying)에서는 T4가 $0.81로 4090($0.44)보다 비싼 역전도 있다 — 소비자 카드 렌탈이 성능당 가격 최강.

NVIDIA vs AMD vs Intel (2026)

큰 변화: bitsandbytes가 AMD ROCm(Linux+Windows 휠, RX 6000-9000 전부)과 Intel XPU를 공식 지원한다 — QLoRA가 더 이상 NVIDIA 전유물이 아니다. Unsloth도 AMD에서 학습된다(Linux 한정). 다만 Windows-ROCm 멀티 GPU와 Intel 파인튜닝은 아직 2등 시민이라, 기본 추천은 여전히 NVIDIA — RX 7900 XTX 24GB(생성 191 t/s, 3090급)는 Linux 사용자 한정의 가성비 카드다.

정리

한 줄 교훈: 사기 전에 빌려라 — 실험 몇 번이면 $5 미만이고, 사겠다면 중고 3090(대역폭 936GB/s)이 여전히 답이다. 다음 글: 이 카드들에 무엇을 어떤 형식으로 얹을 것인가, 양자화 지도.

— LoRA 실전 시리즈 ③ / 다음 글: 양자화 지도

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...