이론은 갖췄다. 이제 무엇으로 학습하고, 무엇으로 평가하고, 한국어에서는 무엇을 쓰는가. 2026년의 도구 스택은 4강 구도로 정리됐고(torchtune은 2025년 7월 개발 중단), 평가는 "규칙 기반과 LLM 심판 기반을 반드시 병행"이 정답이 됐다.
학습 도구 4강
- TRL — 레퍼런스 구현. SFTTrainer/DPOTrainer/GRPOTrainer. 다른 모든 도구가 이 위에 얹혀 있어, 개념은 TRL 기준으로 익히면 어디서나 통한다.
- LLaMA-Factory — 웹 UI(LlamaBoard)로 코딩 없이 데이터 선택→학습→평가→내보내기. 진입장벽 최저, EXAONE·Kanana 같은 한국어 모델도 공식 지원. 처음 SFT를 돌려보는 사람의 1순위.
- Axolotl — YAML 설정 = 실험 기록. 멀티 GPU/멀티노드 스케일링과 세밀한 마스킹 제어에 강하다. 커뮤니티에 공개된 수많은 config를 출발점으로 재활용할 수 있다.
- Unsloth — 커스텀 커널로 2배 빠르고 VRAM 70~80% 절감. 무료 Colab T4에서 오늘 밤 한국어 SFT 실습이 가능한 거의 유일한 경로.
평가 — 좋아진 것처럼 보이는 나쁜 모델을 피하는 법
- MT-Bench & LLM-as-a-Judge (2023, LMSYS) — GPT-4 심판이 인간 선호와 80%+ 일치함을 보인 출발점이자, 심판의 4대 함정(위치 편향, 장황함 편향, 자기선호 편향, 수학 채점 한계)을 정량화한 경고문. 모든 judge 기반 평가 전에 필독.
- Length-Controlled AlpacaEval (2024) — "길게 쓰면 점수가 오른다"를 통계적으로 제거한 승률. $10 미만·3분 안에 SFT 개선 여부를 확인하는 가장 가성비 좋은 루프.
- IFEval (2023, Google) — "3문단으로", "쉼표 금지"처럼 프로그램으로 자동 검증 가능한 지시 이행 평가. 심판이 필요 없어 저렴하고 게이밍이 어렵다. judge 기반과 규칙 기반을 병행하라는 조언의 근거.
- lm-evaluation-harness — 평가 실행기의 표준. lm_eval --tasks kmmlu 한 줄로 한국어 지식 평가 재현. 한국어 특화판은 HRET (2025).
한국어 생태계
- KMMLU (2024) — 영어 번역이 아닌 한국 시험 원전 기반 45과목 35,030문항. 한국어 지식 평가의 사실상 표준 — 단, 2026년 시점에는 오류를 정제한 KMMLU-Redux/Pro (2025)를 쓰는 것이 실무 조언이다.
- LogicKor & KoMT-Bench — 한국어 생성 품질(judge 기반) 벤치마크. LogicKor 리더보드가 벤치마크 포화로 2024년 동결된 사건 자체가 LLM 심판의 한계를 보여주는 살아있는 교재다.
- KoAlpaca → KULLM → AI Hub — 한국어 instruction 데이터의 계보. KoAlpaca가 Alpaca 레시피의 한국어 이식(2023), KULLM이 고려대의 후속, 그리고 AI Hub가 도메인별(법률·의료·행정) 무료 한국어 데이터의 최대 공급원이다(회원가입·국내 접속 필요).
- EEVE (2024, 야놀자) — "한국어 SFT는 토크나이저에서 시작된다"는 교훈. 영어 중심 토크나이저는 한국어를 잘게 쪼개 같은 비용으로 절반의 한국어밖에 못 다룬다. 어휘 확장+커리큘럼으로 이를 고친 사례이고, 2026년의 실무자는 처음부터 한국어에 강한 EXAONE(LG)·Kanana(카카오)·HyperCLOVA X SEED(네이버)급을 베이스로 고른다.
정리
2026년 한국 실무자의 기본 조합: 한국어 강세 베이스 모델 + Unsloth/Axolotl로 LoRA SFT + lm-eval-harness(KMMLU-Redux)와 KoMT-Bench(judge)의 이중 평가. 한 줄 교훈: 도구는 무엇을 써도 결과가 비슷하지만, 평가를 잘못 고르면 좋아진 것처럼 보이는 나쁜 모델을 만들게 된다. 다음 글(보너스 1): 2025년을 뒤흔든 추론 모델 SFT — 1,000개의 예시로 o1급 추론을 만드는 법.
— All about SFT 시리즈 ⑧ / 다음 글: 추론 모델 SFT — long-CoT 증류
댓글 없음:
댓글 쓰기
국정원의 댓글 공작을 지탄합니다.