ORBiS Tree

SEARCH

AI 지식 검색

RESULTS

#Benchmark 문서

연구·평가

Benchmark Data Contamination

평가용 벤치마크의 문항이나 정답이 학습 데이터에 포함되어 모델 성능 측정을 왜곡할 수 있는 문제.

#Benchmark#Data Contamination#Evaluation#LLM
개념·기술

Latency and Throughput

AI 서비스에서 한 요청의 응답 시간과 일정 시간 동안 처리할 수 있는 작업량을 구분해 보는 성능 지표.

#Benchmark#Inference#Latency#Throughput
연구·평가

HELM

언어 모델을 여러 시나리오와 지표로 표준화해 비교하려는 Stanford CRFM의 총체적 평가 프레임워크.

#Benchmark#Evaluation#Foundation Model#HELM
연구·평가

MMLU

여러 학문 영역의 객관식 문제를 통해 언어 모델의 폭넓은 지식과 문제 해결 능력을 평가하는 벤치마크.

#Benchmark#Evaluation#LLM#MMLU