SEARCH
AI 지식 검색
RESULTS
#Evaluation 문서
연구·평가
Safety Evaluation
AI 시스템이 유해 행동이나 위험한 능력을 보이는 조건을 정의하고 재현 가능한 절차로 측정·검증하는 평가 영역.
연구·평가
Red Teaming
의도적으로 어려운·적대적인 입력과 상황을 만들어 AI 시스템의 실패·유해 행동·취약점을 배포 전후에 찾는 평가 접근법.
연구·평가
Benchmark Data Contamination
평가용 벤치마크의 문항이나 정답이 학습 데이터에 포함되어 모델 성능 측정을 왜곡할 수 있는 문제.
연구·평가
Model Card
모델의 용도, 평가 조건, 성능 특성과 제한사항을 함께 공개하기 위한 구조화된 모델 문서화 방식.
연구·평가
HELM
언어 모델을 여러 시나리오와 지표로 표준화해 비교하려는 Stanford CRFM의 총체적 평가 프레임워크.
연구·평가
MMLU
여러 학문 영역의 객관식 문제를 통해 언어 모델의 폭넓은 지식과 문제 해결 능력을 평가하는 벤치마크.