ORBiS TREE DOCUMENT
연구·평가 →Safety Evaluation
AI 시스템이 유해 행동이나 위험한 능력을 보이는 조건을 정의하고 재현 가능한 절차로 측정·검증하는 평가 영역.
개요
Safety Evaluation은 AI 시스템이 어떤 조건에서 위험한 행동이나 능력을 보이는지 체계적으로 측정하는 평가 영역이다. 일반적인 정확도나 지식 평가와 달리, 악용 가능성·기만·사이버 능력·자율적 행동처럼 배포 위험과 연결되는 실패 모드를 별도로 정의하고 테스트할 수 있다.[1]
위험 능력 평가의 예
Google DeepMind 연구진은 고성능 모델에 대해 설득과 기만, 사이버 보안, 자기 증식, 자기 추론 등 위험과 관련된 능력을 측정하는 평가 프로그램을 제시하고 Gemini 계열 모델에 시험 적용했다.[1] 이런 평가는 모델이 실제 피해를 일으킬 것이라고 단정하는 도구가 아니라, 위험을 가능하게 하는 능력의 존재 여부와 경향을 조기에 점검하는 수단이다.
다른 평가와의 관계
MMLU나 HELM이 일반적인 능력과 여러 품질 차원을 비교하는 데 초점을 둔다면 Safety Evaluation은 위험 시나리오와 실패 조건을 명시하는 데 초점을 둔다. Red Teaming은 예상하지 못한 실패를 찾는 탐색적 수단으로 결합할 수 있고, 평가 범위·결과·남은 제한은 System Card에 기록해 배포 판단의 근거를 남길 수 있다.
SOURCES
출처
-
Evaluating Frontier Models for Dangerous Capabilities Google DeepMind / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS