2026년 8월 25일 화요일

sLM 평가 방법론 ⑩ — 합성 데이터와 LLM 심판: 순환 평가의 함정

흔한 유혹: GPT로 한국어 발화를 생성해 테스트셋을 만들고, 채점도 GPT에게 시키는 것. 2026년의 결론부터: "합성/심판 점수 단독"은 어느 심사장에서도 통과하지 못한다. 왜, 그리고 어떻게 고치는지.

LLM 심판 낙관론의 흥망

2023년 MT-Bench 논문의 "GPT-4 심판이 인간과 80%+ 일치"는 영어 개방형 대화 선호 비교의 수치다 — 다른 태스크로 자동 이전되지 않는다. 2024-25년의 수정: Judging the Judges — 퍼센트 일치는 착시이며 우연 보정(Cohen's kappa)으로 보고해야 한다(불균형 인텐트 분류에선 필수). JudgeBench(ICLR 2025) — 정오가 객관적으로 갈리는 쌍에선 GPT-4o도 거의 동전 던지기. JUDGE-BENCH(ACL 2025, 20개 태스크 대규모 비교) — 태스크·모델별 편차가 커서 "다른 태스크에서 잘 맞았으니 내 태스크도"라는 전이 가정 자체가 기각된다. 저자들의 권고: 쓰기 전에 해당 태스크의 인간 라벨과 대조 검증하라.

순환성 — 생성자와 심판을 분리하라

NeurIPS 2024: 모델은 자기 출력을 알아보며, 자기 인식이 강할수록 자기 선호도 강하다(인과 확인). 2025년 확장(Great Models Think Alike): 심판은 자기와 닮은 모델에게도 후하다 — "다른 모델"을 심판으로 써도 같은 계열이면 편향이 남는다. 방법론 한 줄: "발화 생성 모델과 심판 모델은 다른 모델 계열로 분리했다."

합성 데이터의 두 가지 실패 모드

  • 분포 왜곡Li et al. (EMNLP 2023): 태스크의 주관성이 높을수록 합성 데이터 학습 성능이 나빠지고, 합성 발화는 실사용자 발화의 어휘·의미 다양성(롱테일)을 재현하지 못한다. 경계가 모호한 인텐트일수록 합성이 실로그를 대체 못 한다.
  • 라벨 오염Sahu et al. (2022): GPT에게 특정 인텐트의 발화를 시키면 의미적으로 인접한 다른 인텐트의 발화를 생성하는 일이 흔하다 — 요청한 라벨과 실제 라벨이 다른, 합성 테스트셋 자체의 오라벨. 세분화된 인텐트 체계일수록 사람 검수 필수.

고치는 법 — 검증 워크플로

  • 절차 원칙 (Pangakis et al.): 모든 LLM 자동 주석은 인간 라벨 표본에 대한 태스크별 검증을 거친다 — 무작위 표본 뽑아 사람이 라벨링, kappa 보고.
  • 통계 도구AutoEval Done Right(Berkeley): 대량의 심판 점수 + 소량(200~500건)의 인간 라벨을 PPI(prediction-powered inference)로 결합해 비편향 추정치와 신뢰구간을 얻는다. 한계도 인용할 것: 심판이 피평가 모델보다 정확하지 않으면 어떤 보정도 인간 라벨을 절반 이하로 못 줄인다(Dorner, ICLR 2025).
  • 한국어 상한KUDGE(한국 연구진의 이중언어 심판 메타평가): GPT-4o의 한국어 심판 정확도 평균 74.5% — 인간 대체엔 부족. 흥미로운 발견: 한국어 유창성보다 영어 평가 능력이 한국어 심판 성능을 더 잘 예측. 그리고 심판들은 주입된 사실 오류를 대부분 놓친다 — 사실 검증은 심판에게 맡기지 마라. 합성셋의 어휘 다양성은 HRET의 형태소 인지 TTR로 실로그와 비교 가능.

한 줄 처방: 생성자·심판 계열 분리 + 실로그 200~500건 인간 라벨과의 kappa + 합성셋 다양성·커버리지 수치 + (가능하면) PPI 보정 — 이 네 가지가 합성/심판 평가를 논문 증거로 승격시키는 최소 조건이다.

— sLM 평가 방법론 시리즈 ⑩ / 다음 글(완결): 논문 평가 챕터 쓰기 — 심사위원이 재실행할 수 있게

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...