2026년 8월 25일 화요일

LLM 평가 방법론 ⑪ (완결) — 실무 파이프라인과 한국어 생태계

마지막 편은 "그래서 내일 뭘 돌리면 되나"다. 도구 지형, 제품 평가의 3단계 루프, 그리고 한국어 팀의 2026년 표준 스택.

하네스 지형 2026

  • lm-evaluation-harness (EleutherAI) — 학술 벤치마크의 사실상 표준(60+ 벤치마크, KMMLU 내장). 주의: 버전과 설정을 고정하라 — loglikelihood vs generation, few-shot 포맷만 달라져도 점수가 눈에 띄게 움직인다.
  • Inspect (영국 AISI) — 2026년의 방향: 에이전트·도구 사용·샌드박스 평가. 200+ 벤치마크 구현이 딸려 오고, HF LightEval도 이를 기본 백엔드로 채택 — 하나를 배우면 둘을 커버한다.
  • 지형 변동 — HELM은 2026년 6월 유지보수 모드로("다차원 평가"라는 사고방식만 가져가라), openai/evals 레포는 레거시, 그리고 프롬프트 CI의 표준 promptfoo는 2026년 3월 OpenAI에 인수됐다(오픈소스는 유지) — 제품 평가 툴링이 빅랩으로 흡수되는 신호.

제품 평가 — 벤치마크가 아니라 루프

Hamel Husain의 고전이 정식화한 3단계: Level 1 값싼 단정(assertion) 테스트를 상시 실행 — promptfoo류로 PR마다 골든셋을 돌리는 "프롬프트의 단위 테스트". Level 2 로그 트레이스에 대한 인간 + LLM 심판 평가 — 단, 심판은 인간 라벨로 검증한 후에만 신뢰(⑤편). Level 3 프로덕션 A/B. 사례가 핵심이다: 부동산 어시스턴트 Lucy는 프롬프트 두더지잡기로 정체돼 있다가, 수백 개 단위 테스트 + 합성 입력 + 트레이스 뷰어를 갖추고서야 다시 나아갔다. 운영 도구는 Langfuse(오픈소스·자가 호스팅)/LangSmith/Braintrust. 반복되는 교훈 한 줄: "데이터 보기를 멈추지 마라."

한국어 스택 — 2026년의 정답

  • 지식·문화KMMLU-Redux/Pro(원본 KMMLU의 오류·오염 정리판 + 전문 자격시험판) + HAE-RAE Bench(영어 전이가 안 통하게 설계된 한국 문화·언어 지식).
  • 생성·지시이행KoMT-Bench(LG, MT-Bench 한국화) + IFEval-Ko(IFEval 한국화 — 단위를 리터·원으로, 영어 전용 지시 제거). 참고: 커뮤니티 표준이던 LogicKor는 2024년 10월 동결 — "상위 모델이 변별 안 됨"이라는 공지 자체가 심판 리더보드 포화의 교과서적 사례. 모델 카드의 LogicKor 점수는 낡은 숫자다.
  • 추론HRM8K(한영 병렬 수학 8,011문항). 부산물 발견: 한국어-영어 격차는 추론이 아니라 입력 이해에서 온다 — "영어로 풀고 한국어로 답하기"가 합법적 전략이고, 그래서 평가는 답변 언어 일관성까지 체크해야 한다.
  • 실행 인프라HRET(LREC 2026): 기관마다 프로토콜이 달라 같은 모델 점수가 최대 10%p 벌어진다는 문제의식에서 나온 한국어 표준 하네스. 형태소 인지 지표, 언어 일관성 강제 내장.
  • 심판 검증 — 한국어에 LLM 심판을 쓰기 전 KUDGE로 심판부터 시험하라. 발견 둘: 심판 능력은 한국어 실력보다 영어 평가 능력에서 전이된다(선호 채점은 대체로 OK), 그러나 주입된 사실 오류는 대부분 놓친다(사실 검증은 심판에게 맡기지 마라). Open Ko-LLM Leaderboard는 2026년 현재 사실상 휴면 — 구성 벤치마크를 직접 돌려라.

시리즈를 마치며

열한 편을 한 문장으로: 공개 벤치마크는 모델을 "고르는" 노이지한 신호일 뿐이고(오염·포화·오차 막대), 제품이 되는지는 자기 태스크의 골든셋 + 검증된 심판 + 트레이스 리뷰 + 온라인 피드백 루프만이 말해준다. 평가는 한 번 통과하는 시험이 아니라, 계속 돌아가는 시스템이다.

— LLM 평가 방법론 시리즈 ⑪ (완결)

댓글 없음:

댓글 쓰기

국정원의 댓글 공작을 지탄합니다.

sLM 평가 방법론 ⑪ (완결) — 평가 챕터 쓰기: 심사위원이 재실행할 수 있게

마지막 편의 기준은 하나다: 적대적인 심사위원이 논문만 보고 모든 숫자를 재실행할 수 있는가. 2026년의 평가 보고는 체크리스트 주도·버전 고정이 표준이다. 체크리스트를 뼈대로 쓰라 ACL Responsible NLP 체크리스트 의 A~D절(한...