ORBiS Tree

SEARCH

AI 지식 검색

RESULTS

#Evaluation 문서

연구·평가

Safety Evaluation

AI 시스템이 유해 행동이나 위험한 능력을 보이는 조건을 정의하고 재현 가능한 절차로 측정·검증하는 평가 영역.

#AI Safety#Evaluation#Risk#Safety Evaluation
연구·평가

Red Teaming

의도적으로 어려운·적대적인 입력과 상황을 만들어 AI 시스템의 실패·유해 행동·취약점을 배포 전후에 찾는 평가 접근법.

#Evaluation#LLM#Red Teaming#Safety
연구·평가

Benchmark Data Contamination

평가용 벤치마크의 문항이나 정답이 학습 데이터에 포함되어 모델 성능 측정을 왜곡할 수 있는 문제.

#Benchmark#Data Contamination#Evaluation#LLM
연구·평가

Model Card

모델의 용도, 평가 조건, 성능 특성과 제한사항을 함께 공개하기 위한 구조화된 모델 문서화 방식.

#Documentation#Evaluation#Model Card#Responsible AI
연구·평가

HELM

언어 모델을 여러 시나리오와 지표로 표준화해 비교하려는 Stanford CRFM의 총체적 평가 프레임워크.

#Benchmark#Evaluation#Foundation Model#HELM
연구·평가

MMLU

여러 학문 영역의 객관식 문제를 통해 언어 모델의 폭넓은 지식과 문제 해결 능력을 평가하는 벤치마크.

#Benchmark#Evaluation#LLM#MMLU