ORBiS Tree

ORBiS TREE DOCUMENT

연구·평가 →

Data Provenance

AI 데이터가 어떤 출처에서 만들어지고 어떤 변환·라이선스·사용 과정을 거쳤는지 추적하는 데이터 계보 정보.

최근 수정 2026.08.29 07:56 출처 1

개요

Data Provenance는 데이터가 어디에서 왔는지, 누가 만들거나 수집했는지, 어떤 변환을 거쳤는지, 어떤 라이선스와 조건 아래 배포·사용되었는지를 추적하는 계보 정보를 말한다. AI에서는 학습 데이터의 규모가 커지고 여러 데이터셋이 재가공되면서 출처와 사용 조건을 다시 확인할 수 있는 기록이 특히 중요해졌다.[1]

데이터셋 투명성

Data Provenance Initiative는 대규모 텍스트 데이터셋을 조사해 원천 출처, 제작자, 라이선스 조건과 후속 사용 관계를 추적하는 방법과 공개 컬렉션을 제시했다.[1] 이 작업은 데이터셋 이름만 아는 것과 실제 원천과 허용 조건을 이해하는 것이 다르다는 점을 보여준다.

평가와 문서화

출처 기록은 Benchmark Data Contamination 같은 평가 문제를 조사할 때도 도움이 된다. 또한 Datasheets for Datasets처럼 데이터셋의 구성과 수집 과정, 권장 사용 범위를 문서화하는 방식과 결합하면 모델이나 시스템의 주장에 근거가 되는 데이터 맥락을 더 명확하게 남길 수 있다. Provenance가 있다고 해서 데이터 사용의 적법성이나 품질이 자동으로 보장되는 것은 아니며, 판단에 필요한 추적 가능성을 높이는 기반으로 보는 것이 적절하다.

SOURCES

출처

  1. 원문 보기 ↗