2026년 8월 25일 화요일

All about SFT ⑩ (완결) — 도구 호출과 멀티모달 SFT

시리즈의 마지막 글은 SFT의 두 전선이다: 모델이 함수를 호출하게 만드는 것(에이전트의 기초), 그리고 이미지를 이해하게 만드는 것. 둘 다 원리는 같다 — 도구 호출도, 이미지 토큰도 결국 학습 텍스트 안의 토큰일 뿐이라 SFT로 가르칠 수 있다.

도구 호출(Function Calling) SFT

  • 계보Toolformer (2023, Meta): 모델이 스스로 API 호출을 텍스트에 삽입하고 "도움이 된 호출만" 남겨 학습하는 자기지도의 원조. Gorilla (2023, Berkeley): AST 매칭으로 호출 정확도를 재는 평가와, 스키마 문서를 프롬프트에 넣고 학습하는 retriever-aware training. ToolLLM (2023): 실제 API 16,464개로 다단계 호출 궤적 12.6만 개를 합성.
  • 현대의 데이터APIGen/xLAM 60k (2024, Salesforce): 실행 가능한 API 3,673개에서 생성하고 형식 검사→실제 실행→의미 검사의 3단 검증을 통과한 표준 공개 데이터셋. ToolACE (2024, ICLR): 11.3k 큐레이션 샘플로 8B가 GPT-4급 BFCL 점수 — 여기서도 양보다 질이다.
  • 형식과 마스킹 — 업계 기본 직렬화는 Hermes 형식(ChatML 위에 <tool_call> 태그; Qwen 계열이 이대로 출력). 데이터는 {messages, tools}로 두고 chat template가 직렬화하게 하라(공식 한국어 번역 있음: ko/chat_extras). 최다 버그: tool 역할(API 응답)에 loss를 걸어 모델이 API 결과를 환각하도록 가르치는 것 — TRL assistant_only_loss로 assistant 턴만 학습하라. 다단계 에이전트 궤적은 AgentTuning (2023)이 원형: 궤적에 일반 대화 데이터를 ~20/80으로 섞어야 능력 붕괴를 막는다.
  • 평가BFCL이 수용 시험이다. 그 카테고리(단일/다중/병렬/호출 안 해야 할 때 안 하기/멀티턴)가 곧 데이터가 커버해야 할 행동 체크리스트다.

멀티모달(VLM) SFT

  • 계보LLaVA (2023): "이미지판 InstructGPT." 기존 캡션·박스 주석을 GPT-4(텍스트)로 15.8만 개 시각 대화로 변환해 CLIP+프로젝터+LLM을 학습. LLaVA-1.5 (2023): 오늘날의 기본 2단계 레시피 — ① 프로젝터만 정렬 사전학습(~558K 캡션) ② 프로젝터+LLM 지시 SFT(~665K 믹스). ShareGPT4V는 캡션 품질만 올려도 22점이 오른다는 것(시각판 LIMA 교훈), LLaVA-OneVision (2024)은 커리큘럼으로 이미지→멀티이미지→비디오가 전이됨을 보였다.
  • 2026년의 실무 — 커넥터를 처음부터 만드는 사람은 거의 없다. Qwen2.5-VL이나 InternVL을 LoRA로 도메인 SFT하는 것이 표준이고, 동결 결정은 도구의 불리언 플래그가 됐다: vision tower 동결(기본), 프로젝터+LLM 학습, 시각적으로 특이한 도메인(의료·문서·손글씨)만 vision 층 해동. 레시피는 TRL VLM 가이드(이미지 토큰을 loss에서 제외하는 collator가 핵심), Unsloth Vision, LLaMA-Factory 모두 지원.
  • 한국어VARCO-VISION-2.0 (NC AI)이 OneVision 레시피의 한국어 실증이자 한국어 VLM 평가 벤치마크 5종(K-MMBench 등)의 공급원. 데이터는 KoLLaVA(LLaVA 믹스 한국어 이식)와 AI Hub 시각정보 QA(이미지 135만 장, QA 750만 쌍).

시리즈를 마치며

열 편의 줄기를 한 문장으로 압축하면: 사전학습이 능력을 만들고, SFT는 그 능력을 꺼내 쓰는 법 — 형식, 행동, 도구, 모달리티 — 을 가르치며, 그 성패는 알고리즘이 아니라 데이터의 품질·다양성·검증에서 갈린다. 파이프라인의 전체 그림(①)에서 이론과 한계(②), 데이터(③④), 방법(⑤⑥), 그 다음 단계(⑦), 도구와 평가(⑧), 그리고 추론·도구·시각의 최전선(⑨⑩)까지 — 이 지도가 여러분의 첫 파인튜닝, 그리고 열 번째 파인튜닝에도 좌표가 되길 바란다.

— All about SFT 시리즈 ⑩ (완결)

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...