2026년 8월 25일 화요일

sLM 평가 방법론 ⑨ — 라벨 품질: "라벨이 맞다는 걸 어떻게 아세요?"

자체 한국어 인텐트 데이터셋을 만들었다면 심사장에서 반드시 나오는 질문이다. 2026년의 답은 2층 구조다: 과정 증거(어노테이터 일치도 + 집계 규칙)와 산출물 증거(사후 알고리즘 감사).

왜 중요한가 — 숫자 세 개

Pervasive Label Errors(NeurIPS 2021): 유명 벤치마크 10개의 테스트셋에 평균 3.3%+ 라벨 오류(ImageNet 검증셋 6%+) — 그리고 라벨을 고치자 모델 순위가 뒤집혔다. 인텐트 특화로는 BANKING77의 ~14%(③편). 테스트셋에 3~14% 노이즈가 있으면 모델 간 몇 점 차이는 해석 불가 — 비교 전에 테스트 스플릿부터 정제할 근거다.

과정 증거 — 일치도와 집계

  • 지표 선택 — 원 퍼센트 일치는 우연 보정이 없어 부적격(Artstein & Poesio, IAA 방법론의 표준 인용). 한국어 인텐트 데이터엔 Krippendorff's α(nominal)가 방어적 선택 — 어노테이터 수가 들쭉날쭉해도, 결측이 있어도 계산된다. 부트스트랩 CI와 함께 보고.
  • 기준 눈높이 — Krippendorff 기준 α ≥ 0.8 신뢰, 0.667~0.8 잠정. 현실 캘리브레이션: KLUE의 전문 관리된 분류 태스크(YNAT)조차 α = 0.713이었다(3인 주석, 2/3 다수결, 불일치 3,355건 폐기라는 프로토콜까지 그대로 미러링할 만한 한국어 템플릿).
  • 집계 — 3인 이상이면 단순 다수결보다 Dawid-Skene(1979, EM으로 어노테이터별 혼동행렬 추정 — 실력 있는 소수 의견이 부주의한 다수를 이길 수 있다)나 분류기 보조판 CROWDLAB(cleanlab 내장). 추정된 어노테이터별 혼동행렬은 가이드라인의 모호한 지점을 드러내는 부산물이다. 일치도만으론 부족하다는 근거는 Passonneau & Carpenter (TACL 2014) — 높은 일치도가 체계적으로 틀린 골드와 공존할 수 있다.

산출물 증거 — 알고리즘 감사

Confident Learning(JAIR 2021 — JMLR로 자주 오인용되니 주의)이 이론, cleanlab이 구현: 내 소형 모델의 5-fold 교차검증 예측 확률을 넣으면 오라벨 후보를 랭킹해준다. 워크플로: 플래그 → 블라인드 인간 재검수 → 플래그율과 확정 오류율 보고. 중요한 숫자: 플래그의 ~51%만 진짜 오류(사람 검증 필수 — 자동 삭제 금지). 보완 신호로 임베딩 기반 아웃라이어 탐지(CLINC 팀의 NAACL 2019 — 단, 아웃라이어 ≠ 오류: 희귀하지만 유효한 발화는 다양성 자산이다). 그리고 반복되는 혼동 쌍은 어노테이터 실수가 아니라 인텐트 체계의 결함으로 취급하라 — 병합하거나 대조 예시로 가이드라인을 벼려라(BANKING77의 14%가 제도화한 교훈).

한국어 공식 기준

NIA/AI Hub의 AI 데이터 품질관리 가이드라인 v4.0(2026-02 개정, 4권 체계): 정부 구축 데이터가 통과해야 하는 의미정확성 표본검사 절차가 정리돼 있다. "NIA 가이드라인의 의미정확성 표본검사 + IAA + confident learning 감사"로 프레이밍하면 국내 심사위원에게 정부 코퍼스급 기준을 충족했음을 보여준다. 보고 체크리스트는 Klie et al.(출판 데이터셋 591개 메타 연구 — 약 30%가 품질 관리 미달) 항목대로: 모집·훈련, 가이드라인 버전, 파일럿, IAA, 조정 규칙, 사후 감사.

한 줄 처방: 3인 라벨 + Dawid-Skene 집계 + α(CI 포함) + 혼동 쌍 표 + cleanlab 감사(플래그율/확정율) — 이 다섯 줄이 "라벨이 맞다는 걸 어떻게 아세요?"의 완전한 답이다.

— sLM 평가 방법론 시리즈 ⑨ / 다음 글: 합성 데이터와 LLM 심판 — 순환 평가의 함정

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...