ORBiS Tree

ORBiS TREE DOCUMENT

연구·평가 →

Datasheets for Datasets

데이터셋의 동기·구성·수집·전처리·권장 사용과 유지관리 정보를 표준 질문 형태로 기록하는 데이터 문서화 접근법.

최근 수정 2026.08.29 07:56 출처 1

개요

Datasheets for Datasets는 머신러닝 데이터셋을 공개하거나 공유할 때 데이터의 생성 동기, 구성, 수집 과정, 전처리, 배포 조건, 권장 사용과 유지관리 정보를 체계적으로 기록하자는 문서화 접근법이다. Gebru 등은 전자 부품의 데이터시트에서 아이디어를 가져와 데이터셋 제작자가 답할 수 있는 표준 질문 집합을 제안했다.[1]

왜 필요한가

데이터셋 이름과 다운로드 주소만으로는 어떤 집단이나 기간을 포함하는지, 어떤 수집·정제 과정을 거쳤는지, 어떤 용도에는 부적절한지 알기 어렵다. 이런 맥락이 빠지면 모델 성능이나 편향, 법적·윤리적 위험을 재현하고 해석하기도 어려워진다.[1]

다른 문서와의 관계

Datasheet는 데이터 자체의 설명에 초점을 두고, Model Card는 모델의 용도와 평가를, System Card는 실제 시스템 구성과 상호작용을 설명한다. Data Provenance은 데이터의 계보와 출처 추적을 보완하며, 평가 데이터 문서가 충실하면 Benchmark Data Contamination 가능성을 조사할 때도 공개 시점과 구성 정보를 확인하기 쉬워진다.

SOURCES

출처

  1. Datasheets for Datasets Microsoft Research / arXiv
    원문 보기 ↗