SEARCH
AI 지식 검색
RESULTS
#Benchmark 문서
연구·평가
Benchmark Data Contamination
평가용 벤치마크의 문항이나 정답이 학습 데이터에 포함되어 모델 성능 측정을 왜곡할 수 있는 문제.
개념·기술
Latency and Throughput
AI 서비스에서 한 요청의 응답 시간과 일정 시간 동안 처리할 수 있는 작업량을 구분해 보는 성능 지표.
연구·평가
HELM
언어 모델을 여러 시나리오와 지표로 표준화해 비교하려는 Stanford CRFM의 총체적 평가 프레임워크.
연구·평가
MMLU
여러 학문 영역의 객관식 문제를 통해 언어 모델의 폭넓은 지식과 문제 해결 능력을 평가하는 벤치마크.