2026년 8월 25일 화요일

All about SFT ⑨ — 추론 모델 SFT: 1,000개로 o1급 추론 만들기

2025년 초, 몇 주 간격으로 나온 논문들이 SFT의 상식을 다시 썼다: 잘 고른 1,000개의 긴 추론 흔적(long chain-of-thought)만으로 32B 모델이 o1-preview급 추론을 한다. ②편의 LIMA("less is more")가 추론의 시대에 속편으로 돌아온 것이다. 이번 글은 그 레시피들이다.

두 개의 체제

  • DeepSeek-R1-Distill (2025) — 출발점. RL로 만든 R1의 추론 흔적 80만 건을 rejection sampling으로 걸러 Qwen/Llama 소형 모델들을 순수 SFT만으로 파인튜닝 → R1-Distill-Qwen-32B가 AIME24 72.6%. 같은 32B에 직접 대규모 RL을 하는 것보다 증류 SFT가 나았다는 보고까지. 32B 이하는 증류부터, RL은 그다음이다.
  • s1 (2025, Stanford) — 극단의 큐레이션: 59K 후보에서 품질·난이도·다양성 3기준으로 정확히 1,000개(s1K)를 골라 Qwen2.5-32B를 H100 16장 26분 SFT. 여기에 "budget forcing"(종료 토큰을 막고 'Wait'를 덧붙여 더 오래 생각하게 하기)으로 추론 시간 스케일링까지. 무작위 59K가 큐레이션된 1K를 간신히 이기는 ablation이 백미다.
  • LIMO (2025, SJTU) — 같은 주에 나온 자매 결과: 817개로 AIME24 63.3%. "LIMO 가설"의 정식화 — 도메인 지식이 사전학습에 이미 있다면, 소수의 '인지 템플릿' 시연으로 정교한 추론을 끌어낼 수 있다. 주의: 강한 32B 베이스라서 통하는 것이다.
  • OpenThoughts (2025, NeurIPS) — 반대편 체제의 정리. 1,000회+ ablation의 결론: 7B급 모델과 넓은 도메인에서는 큐레이션된 증류 데이터를 120만 건까지 늘릴수록 계속 좋아진다. 의외의 발견들: 벤치마크 점수가 더 높은 R1보다 QwQ-32B가 더 좋은 교사였고, 새 문제 추가보다 문제당 16개 답 샘플링이 나았고, 오답 필터링의 효과는 기대보다 작았다.

예산 레시피와 도구

  • Sky-T1 (2025, Berkeley)$450 미만으로 o1-preview급. 교사 생성(QwQ) → 검증 필터(수학 정답 체크, 코드 단위 테스트) → 형식 정규화 → 17K로 SFT. 지저분한 교사 형식이 학생을 측정 가능하게 망친다는 교훈 포함.
  • Bespoke-Stratos (2025) — 같은 17K 프롬프트에서 교사만 QwQ→R1으로 바꾸자 AIME24가 약 20점 상승. 소량 증류에서 교사 선택이 가장 레버리지 큰 손잡이라는 통제 실험.
  • Open R1 (2025, HF) — R1 파이프라인의 완전 공개 재현. 작동하는 하이퍼파라미터(32K 시퀀스, packing)와 OpenR1-Math-220k 등 공개 데이터까지 — 직접 돌려볼 사람의 레퍼런스 코드베이스. 한국어 소개는 파이토치 한국 커뮤니티 글 참고.
  • Demystifying Long CoT (2025, CMU) — 이론적 접착제: long-CoT SFT는 short-CoT보다 높은 천장으로 스케일하고, 이후 RL의 이득을 더 크고 안정적으로 만든다. SFT 품질이 천장을 정하고, RL이 그 천장에 접근한다. 손으로 만든 템플릿보다 교사에서 증류한 흔적이 낫고, 학습 컨텍스트는 16K-32K 토큰을 잡아라.

정리

실무 손잡이 넷: 교사 선택(가장 레버리지 큼, 단 규모가 커지면 순위가 뒤집힐 수 있음) · 난이도 필터(중형 모델이 이미 푸는 문제는 버려라) · 흔적 형식 위생 · 16K-32K 학습 컨텍스트. 한 줄 교훈: 강한 베이스 위에서는, 최고의 교사가 쓴 어렵고 다양한 추론 흔적 1,000개가 평범한 10만 개를 이긴다 — 단 "less is more"는 베이스 모델의 잠재력의 함수이지 보편 법칙이 아니다. 다음 글(완결): 도구 호출과 멀티모달 — SFT의 마지막 두 전선.

— All about SFT 시리즈 ⑨ / 다음 글(완결): 도구 호출·멀티모달 SFT

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...