개요
MMLU(Measuring Massive Multitask Language Understanding)는 언어 모델이 여러 학문·전문 분야에서 얼마나 폭넓게 지식과 문제 해결 능력을 보이는지 평가하기 위해 제안된 벤치마크다.[1]
구성
원 연구는 수학, 역사, 컴퓨터 과학, 법률 등 다양한 영역의 객관식 문제를 사용해 모델을 평가했다.[1] 단일 과제 점수보다 여러 분야에 걸친 성능을 함께 보는 것이 특징이다.
해석 주의
SOURCES
출처
-
Measuring Massive Multitask Language Understanding Hendrycks et al. / ICLR / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS