ChatGPT 같은 대화형 AI는 한 번에 만들어지지 않는다. 거대한 텍스트로 다음 단어 맞히기를 배우는 사전학습(pretraining), 지시문→응답 쌍으로 "지시를 따르는 법"을 배우는 SFT(Supervised Fine-Tuning, 지도 미세조정), 그리고 사람의 선호로 다듬는 선호 최적화(RLHF/DPO)의 3단계다. 이 시리즈는 그 가운데 단계, SFT의 전부를 다룬다. 첫 글은 전체 지도부터.
계보 — base 모델에서 chat 모델까지
- GPT-3 (2020) — SFT 이전의 세계. 다음 단어 예측만 배운 175B 모델은 few-shot 프롬프트로 많은 일을 하지만, 지시를 무시하고 무례하거나 무의미한 이어쓰기를 한다. base 모델은 "텍스트 분포 모방기"이지 비서가 아니다 — 이 간극이 SFT가 발명된 이유다.
- FLAN (2021) — "instruction tuning"이라는 말을 만든 논문. 60여 개 NLP 태스크를 자연어 지시문으로 바꿔 파인튜닝했더니 본 적 없는 태스크의 지시도 따르게 됐다. 핵심 교훈: SFT는 지식을 넣는 게 아니라 일반화된 지시 이행을 여는 열쇠다. 동시대의 T0 (BigScience)는 이것이 11B에서도, 완전 공개 데이터로도 재현됨을 보였다.
- InstructGPT (2022, OpenAI) — 현대 파이프라인의 청사진. ① 라벨러가 쓴 1.3만 개 시연으로 SFT → ② 순위 매긴 비교로 보상 모델 학습 → ③ PPO 강화학습. 결과: 1.3B InstructGPT가 175B GPT-3보다 사람들에게 선호됐다. 규모보다 포스트트레이닝이라는 것을 증명한 순간이자 ChatGPT의 직계 조상.
- Constitutional AI (2022, Anthropic) — 사람 라벨 대신 모델이 스스로 원칙("헌법")에 따라 자기 출력을 비평·수정해 SFT 데이터를 만들고, AI 피드백으로 선호를 학습(RLAIF). 오늘날 지배적인 합성 데이터 파이프라인의 초기 원형.
- Llama 2 (2023, Meta) — 포스트트레이닝을 상세 공개한 첫 프런티어급 오픈 모델. 유명한 발견: 수백만 개의 잡음 섞인 서드파티 데이터보다 고품질 시연 27,540개가 더 나았다 — "Quality is all you need." 이 시리즈 전체를 관통하는 규칙이다.
- Llama 3 (2024, Meta) — 현대 레시피: SFT + rejection sampling + DPO를 여러 라운드 반복, PPO는 안정성 때문에 회피. SFT 믹스 270만 건의 대부분이 보상 모델로 걸러낸 합성 데이터. "단순한 방법 + 더 좋은 데이터"라는 실무 철학의 대표.
- DeepSeek-R1 (2025) — 가장 예리한 자연 실험. 순수 RL만으로도 추론 능력은 생기지만(R1-Zero) 출력이 읽을 수 없게 된다 → 그래서 제품판 R1은 SFT를 두 번 넣는다: RL 전의 콜드스타트 SFT와 RL 후의 rejection-sampling SFT(80만 건). RL이 능력을 만들고, SFT가 형식·가독성·통제력을 입힌다.
- Qwen3 (2025) — SFT가 한 파이프라인에 여러 번 등장하는 시대: 콜드스타트 SFT → 추론 RL → 사고모드 융합 SFT → 일반 RL, 그리고 플래그십의 출력으로 소형 모델을 SFT하는 강→약 증류까지. SFT는 이제 "한 단계"가 아니라 "반복 등장하는 도구"다.
- Tülu 3 (2024, AI2) — 데이터·코드·평가까지 전부 공개된 재현 가능한 최신 레시피(SFT→DPO→검증 가능 보상 RL). 직접 따라 할 수 있는 유일급 자료. 함께 볼 것: 무료 온라인 교과서 RLHF Book — 이 모든 논문을 하나의 파이프라인 서사로 엮어 준다.
정리
합의된 그림: 사전학습이 능력과 지식을 만들고, SFT가 행동과 형식을 가르치고, 선호·RL 단계가 시연만으로 지정할 수 없는 것을 다듬는다. 그리고 2024-2026년의 변화는 SFT가 콜드스타트·증류·모드 융합 등으로 여러 번 재등장한다는 것. 다음 글은 이 시리즈에서 가장 중요한 질문 — SFT는 대체 왜 통하며, 어디까지 통하는가 — 를 다룬다.
— All about SFT 시리즈 ① / 다음 글: SFT는 왜 통하고 어디까지 통하는가
댓글 없음:
댓글 쓰기
국정원의 댓글 공작을 지탄합니다.