ORBiS TREE DOCUMENT
연구·평가 →Benchmark Data Contamination
평가용 벤치마크의 문항이나 정답이 학습 데이터에 포함되어 모델 성능 측정을 왜곡할 수 있는 문제.
개요
Benchmark Data Contamination은 모델을 평가하려고 남겨 둔 벤치마크 데이터의 일부가 사전학습이나 후속 학습 데이터에 포함되는 상황을 뜻한다. 이런 중복이 존재하면 모델이 새로운 문제를 일반화해서 푼 것인지, 학습 중 본 표현을 재현한 것인지 구분하기 어려워져 평가 결과의 해석이 흔들릴 수 있다.[1]
왜 중요한가
MMLU처럼 널리 공개된 평가 세트는 연구와 비교에 유용하지만 공개 기간이 길어질수록 대규모 웹 수집 데이터와 겹칠 가능성을 완전히 배제하기 어렵다. Deng 등은 공개 학습 말뭉치와 평가 세트의 중복을 검색하는 방식과, 비공개 모델에도 적용할 수 있는 테스트셋 슬롯 추정 절차를 제안해 오염 가능성을 조사했다.[1]
완화와 해석
오염 가능성을 줄이려면 평가 데이터의 공개 시점과 학습 데이터의 범위를 기록하고, 중복 검사와 새로운 평가 세트를 함께 사용하며, 단일 점수를 절대적인 능력으로 해석하지 않는 것이 중요하다. Data Provenance은 어떤 데이터가 어디에서 왔고 어떻게 사용되었는지를 추적하는 기반을 제공하고, HELM 같은 다면적 평가 체계는 하나의 벤치마크 점수에 과도하게 의존하는 문제를 줄이는 데 도움을 준다.
SOURCES
출처
-
Investigating Data Contamination in Modern Benchmarks for Large Language Models NAACL / ACL Anthology원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS