2026년 8월 25일 화요일

LoRA 실전 ④ — 양자화 지도: 어떤 하드웨어에 어떤 형식인가

양자화 형식이 너무 많다 — GGUF, NF4, GPTQ, AWQ, FP8, EXL3... 하지만 용도별로 정리하면 지도는 단순하다: 학습은 NF4, GPU 서빙은 AWQ/FP8, 로컬·CPU는 GGUF. 이 글은 그 지도와 변환 명령어다. (전체 호환성 표는 HF 공식 매트릭스 — LoRA를 붙일 수 있는 형식은 bitsandbytes/GPTQ/AWQ/HQQ, GGUF는 추론 전용이라는 것이 핵심 열이다.)

세 가지 주력 형식

  • bitsandbytes NF4 — 학습용. QLoRA의 심장. load_in_4bit=True + nf4 + double_quant로 13B를 무료 T4 16GB에서 파인튜닝(HF 문서). 추론 속도가 최적은 아니므로 학습 후엔 다른 형식으로 변환.
  • GGUF — 로컬·CPU·Mac용. 3단 변환: convert_hf_to_gguf.py → (선택) llama-imatrix → llama-quantize Q4_K_M. Llama-3.1-8B 기준 Q4_K_M = 4.58GiB / 71.9 t/s, Q8_0 = 7.95GiB / 50.9 t/s — 작을수록 빠르다(대역폭 바운드)(공식 표). 품질은 KL-divergence로: Q4_K_M(0.0075)이 Q2_K(0.0588)보다 8배 좋고 크기는 1.6배(고전 측정) — "Q4_K_M 스위트스팟"의 근거. 다운로드할 땐 Unsloth Dynamic 3.0 (UD-Q4_K_XL) 리포가 같은 GB에서 측정 가능하게 더 좋다.
  • AWQ/GPTQ + FP8 — GPU 서빙용. vLLM으로 서빙하면 AWQ 4-bit(instruction 모델에 강함, MLSys 최우수논문)이 기본. RTX 40/H100(SM≥8.9)이면 FP8 — 2배 압축 + 최대 1.6배 처리량(vLLM 매트릭스). Ampere(3090)는 AWQ/GPTQ-INT4까지.

알아두면 좋은 조연들

  • HQQ — 캘리브레이션 데이터 없이 몇 분 만에 양자화. 내 파인튜닝 모델을 지금 당장 4비트로 만들고 싶을 때.
  • EXL3 — 70B를 1.6bpw로 16GB VRAM에 넣는 NVIDIA 전용 하이엔드 옵션. 단 CPU 경로 없음, 니치.
  • MXFP4 — gpt-oss가 이 형식으로 출고됐다(20b가 16GB에). 모델이 "양자화되어 배송되는" 시대의 신호.
  • 1-2비트(IQ1/IQ2, AQLM) — MMLU는 버텨도 에이전트·코딩 태스크에서 무너진다. 양자화 품질은 MMLU 델타가 아니라 KL-div/flip-rate로 판단하라(Accuracy is Not All You Need).

정리

결정 규칙: 학습 = NF4+LoRA → GPU 서빙 = AWQ(Ampere) 또는 FP8(Ada+) → 로컬 = 들어가는 가장 큰 GGUF K-quant. 그리고 VRAM이 선택을 허락하면 작은 모델 Q8보다 큰 모델 Q4가 낫다. 다음 글: 그래도 안 들어갈 때 — CPU RAM을 GPU의 확장 메모리로 쓰는 오프로딩.

— LoRA 실전 시리즈 ④ / 다음 글: 오프로딩

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...