ORBiS Tree

ORBiS TREE DOCUMENT

연구·평가 →

MMLU

여러 학문 영역의 객관식 문제를 통해 언어 모델의 폭넓은 지식과 문제 해결 능력을 평가하는 벤치마크.

최근 수정 2026.08.29 07:26 출처 1

개요

MMLU(Measuring Massive Multitask Language Understanding)는 언어 모델이 여러 학문·전문 분야에서 얼마나 폭넓게 지식과 문제 해결 능력을 보이는지 평가하기 위해 제안된 벤치마크다.[1]

구성

원 연구는 수학, 역사, 컴퓨터 과학, 법률 등 다양한 영역의 객관식 문제를 사용해 모델을 평가했다.[1] 단일 과제 점수보다 여러 분야에 걸친 성능을 함께 보는 것이 특징이다.

해석 주의

MMLU 점수는 LLM의 전체 능력을 하나의 숫자로 완전히 설명하지 않는다. 학습 데이터 오염, 프롬프트 방식, 추론 설정 같은 조건에 따라 결과가 달라질 수 있으며, HELM처럼 여러 시나리오와 지표를 함께 보는 평가 접근과 보완적으로 이해할 수 있다.

SOURCES

출처

  1. Measuring Massive Multitask Language Understanding Hendrycks et al. / ICLR / arXiv
    원문 보기 ↗