2026년 8월 25일 화요일

sLM 평가 방법론 ④ — 통계적 유의성: 그 0.8%p 차이, 시드 운 아닌가요?

석사논문 심사에서 가장 아픈 질문이 이것이다: "모델 A 91.2, 모델 B 89.8 — 이 차이가 유의합니까?" 이번 편은 그 질문에 인용 하나로 답하는 법이다.

왜 t-검정이 (대부분) 틀렸는가

Dror et al.의 Hitchhiker's Guide(ACL 2018)가 표준 프로토콜이다: 두 시스템은 같은 테스트 문장들에서 평가되므로 반드시 대응(paired) 구조를 써야 하고, 문장별 정오는 베르누이지 정규분포가 아니다 — 그래서 unpaired t-test는 거의 항상 부적합. 이들의 ACL/TACL 조사: 대부분의 논문이 검정을 아예 안 하거나 가정이 깨진 검정을 쓰고 있었다.

두 개의 주력 검정

  • McNemar (Dietterich 1998) — accuracy 비교의 정답. 두 분류기 중 한쪽만 맞힌 문장들(discordant pairs)만으로 검정. 코드 한 줄(statsmodels mcnemar, 불일치 쌍 <25면 exact=True). 같은 논문이 "무작위 분할 반복 + t-검정"이 1종 오류를 크게 부풀림을 보였고, 데이터가 작으면 5x2cv paired t-test를 권한다.
  • Paired bootstrap (Koehn 2004) — macro-F1처럼 문장 단위로 분해 안 되는 지표의 정답. 테스트셋을 1,000~10,000회 복원추출해 매번 두 시스템 점수를 재계산 — p-value뿐 아니라 F1 차이의 신뢰구간까지 나온다(심사위원이 점점 더 요구하는 것).

시드 — 소형 모델 파인튜닝의 최대 잡음원

Reimers & Gurevych(EMNLP 2017, LSTM 5만 회 학습): 시드만 바꿔도 F1이 1점 움직인다 — 같은 아키텍처가 SOTA로도 평범으로도 보인다. Dodge et al. (2020)은 BERT를 수백 번 파인튜닝해 소규모 데이터에서 시드 분산이 최악이고, "여러 시드 중 최고만 고르기"가 논문들의 모델링 기여만큼 크다는 것을 보였다 — 수천 건짜리 한국어 인텐트 데이터 파인튜닝이 정확히 이 최고 분산 구간이다. 처방: 시드 5개 이상, 전부 보고(mean±std), early stopping 규칙 명시. 시드 분포끼리의 비교는 ASO(Almost Stochastic Order)가 설계된 검정이고, deep-significance 패키지가 ASO·부트스트랩·순열검정·Bonferroni를 전부 구현한다.

2026년의 최신 레이어

  • 다중 비교 — 모델 4개 × 테스트셋 3개면 α=0.05로도 가짜 발견 확률이 눈덩이(k=10에서 ~40%). Dror et al. (TACL 2017)의 Holm 보정을 명시 적용.
  • 검정력With Little Power Comes Great Responsibility: NLP 실험 대부분이 저검정력. 테스트셋을 모으기 전에 "2%p 차이를 80% 검정력으로 잡으려면 몇 문장 필요한가"를 계산해 방법론에 쓰면 극히 방어적이다.
  • 소표본 신뢰구간Anthropic의 오차 막대 권고(2024)에 이어, Bowyer et al. (ICML 2025): 테스트 문항이 수백 개 미만이면 CLT 기반 ±1.96·SEM은 불확실성을 크게 과소평가 — Clopper-Pearson 또는 베이지안 구간을 쓰라. 클래스당 30~50개짜리 석사논문 테스트셋이 정확히 이 구간이다. 작은 테스트셋을 약점이 아니라 통계 리터러시의 증명으로 바꿔주는 인용.

한 줄 처방: 시드 5개 + McNemar(exact) + macro-F1 paired bootstrap CI + Holm 보정 + Clopper-Pearson 구간 + 사전 검정력 분석 — 각 선택마다 위 인용 하나면 방어 끝.

— sLM 평가 방법론 시리즈 ④ / 다음 글: sLM에 맞는 벤치마크 — 무작위 추측 바닥을 피하라

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...