2026년 8월 25일 화요일

All about SFT ④ — 합성 데이터와 증류

2023년의 합성 데이터는 예산 절약 꼼수였다(Alpaca, $600). 2024년 이후로는 상황이 뒤집혔다: NVIDIA Nemotron-4의 정렬 데이터는 98% 이상이 합성이고, Llama 3·Qwen의 SFT 믹스도 대부분 모델이 만든 데이터다. 프런티어의 주식(主食)이 된 합성 데이터 — 그 표준 루프는 "다양하게 생성 → 혹독하게 검증 → 중복 제거 → 학습"이다.

생성의 계보

  • Self-Instruct (2022) — 이 분야의 원전. 사람이 쓴 시드 태스크 175개에서 시작해 모델이 스스로 지시문-입력-출력을 만들고, 중복을 걸러내고, 그걸로 파인튜닝하는 루프. 기억할 점: 품질은 생성 단계가 아니라 필터링 단계에서 결정된다.
  • Evol-Instruct / WizardLM (2023) — 새 지시문을 만드는 대신 기존 지시문을 더 어렵게 진화시킨다(제약 추가, 추론 심화, 주제 변이). 교훈: 난이도는 개수와 별개의 조절 축이다. 모델이 복잡한 지시에서 무너지면 데이터를 늘리기 전에 어렵게 만들어라.
  • Orca (2023, Microsoft) — 교사의 짧은 정답이 아니라 단계별 설명 흔적(reasoning trace)을 증류. 스타일 모방이 아니라 추론 과정을 배우게 한다 — 오늘날 R1 증류 모델들의 지적 조상.
  • Rejection Sampling FT (2023, Alibaba) — 여러 답을 뽑고 검증기로 정답만 남겨 학습(GSM8K 35.9→49.3%, 인간 라벨 0). Llama 2/3 포스트트레이닝 데이터의 실제 제조법. 검증기(단위 테스트, 정답 체크, 보상 모델)가 있다면 항상 이 길로.
  • Magpie (2024) — 가장 싼 트릭: 정렬된 모델에 채팅 템플릿의 사용자 턴 직전까지만 넣으면 모델이 그럴듯한 사용자 질문을 스스로 만들어낸다. 시드도 프롬프트 엔지니어링도 불필요. 이렇게 뽑은 데이터로 학습한 8B가 공식 Llama-3-8B-Instruct에 필적했다.
  • Persona Hub (2024, Tencent) — 순진한 합성 파이프라인의 실패 모드는 다양성 부족(같은 질문 1만 변주)이다. 해법: 10억 개 페르소나로 생성을 조건화해 커버리지를 곱절로. 현재 표준 관행.
  • Cosmopedia (2024, HF) + Nemotron-4 (2024, NVIDIA) — 산업 규모의 실제: 합성 250억 토큰(Cosmopedia)과, 인간 주석 2만 개에서 정렬 데이터 98%+를 합성한 340B 모델(Nemotron). Nemotron의 또 다른 의미: 출력을 다른 모델 학습에 써도 되는 "합법적 교사"로 명시적으로 포지셔닝됐다.

두 가지 주의보

  • Model Collapse (2024, Nature) — 자기 출력만으로 재귀 학습하면 분포 꼬리부터 사라지며 붕괴한다. 단, 반론(Gerstgrasser 2024)도 알아야 한다: 실데이터를 대체하지 않고 누적하면 붕괴하지 않는다. 실무 규칙: 필터 없는 자기 생성 데이터로 폐루프를 돌리지 말 것, 항상 실데이터 앵커를 유지할 것.
  • 교사 모델 약관(ToS) — OpenAI·Anthropic 약관은 출력으로 경쟁 모델을 학습시키는 것을 금지한다(2025년 OpenAI-DeepSeek 분쟁의 핵심). 상업 프로젝트라면 Nemotron·Llama·Apache 계열의 허용적 교사를 쓰라.

정리

실습 도구로는 distilabel이 이 글의 모든 기법(Self-Instruct, Evol, Magpie, LLM 심사)을 파이프라인 클래스로 제공한다. 한 줄 교훈: 생성기는 쉬운 부분이다 — 다양성 조건화와 검증 기반 필터링이 쓸모 있는 합성 데이터와 모델 붕괴 슬러지를 가른다. 다음 글: 이 데이터를 얹을 학습 방법, LoRA와 PEFT.

— All about SFT 시리즈 ④ / 다음 글: LoRA와 파라미터 효율 파인튜닝

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...