ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

Knowledge Distillation

큰 모델의 출력 분포나 내부 지식을 작은 모델의 학습 신호로 활용해 성능을 이전하는 모델 압축 접근법.

최근 수정 2026.08.29 07:26 출처 1

개요

Knowledge Distillation은 큰 모델이나 여러 모델이 가진 지식을 더 작은 모델에 전달해 계산 비용을 낮추면서 성능을 유지하려는 모델 압축 접근법이다. 대표 연구는 큰 teacher 모델의 부드러운 출력 확률을 student 모델의 학습 신호로 사용하는 방법을 정리했다.[1]

왜 사용하는가

대형 신경망이나 Foundation Model은 높은 성능을 낼 수 있지만 배포 비용이 크다. Distillation은 더 작은 모델이 teacher의 출력 패턴을 학습하도록 해 크기·지연·비용을 줄이는 방향으로 사용될 수 있다.

다른 압축과의 차이

Quantization이 주로 숫자 표현의 정밀도를 낮추는 접근이라면, Knowledge Distillation은 별도의 student 모델을 학습시키는 과정에 초점을 둔다. 두 방법은 목적이 겹치지만 서로 배타적이지 않다.

SOURCES

출처

  1. 원문 보기 ↗