ORBiS Tree

ORBiS TREE DOCUMENT

연구·평가 →

HELM

언어 모델을 여러 시나리오와 지표로 표준화해 비교하려는 Stanford CRFM의 총체적 평가 프레임워크.

최근 수정 2026.08.29 07:26 출처 1

개요

HELM(Holistic Evaluation of Language Models)은 언어 모델 평가를 더 투명하고 비교 가능하게 만들기 위해 Stanford CRFM 연구진이 제안한 평가 프레임워크다.[1]

평가 철학

HELM은 정확도 하나만 보는 대신 정확도, 보정, 강건성, 공정성, 편향, 독성, 효율 등 여러 지표와 다양한 사용 시나리오를 함께 평가하는 방식을 제안했다.[1] 이는 하나의 벤치마크 점수만으로 모델을 서열화할 때 놓칠 수 있는 절충을 드러내려는 목적이다.

관계

MMLU처럼 특정 능력을 측정하는 벤치마크는 유용하지만, 실제 Foundation Model 평가에서는 어떤 시나리오와 지표를 선택했는지도 결과 해석에 중요하다. HELM은 이런 평가 설계 자체를 체계화하려는 접근으로 볼 수 있다.

SOURCES

출처

  1. 원문 보기 ↗