ORBiS TREE DOCUMENT
개념·기술 →Knowledge Distillation
큰 모델의 출력 분포나 내부 지식을 작은 모델의 학습 신호로 활용해 성능을 이전하는 모델 압축 접근법.
개요
Knowledge Distillation은 큰 모델이나 여러 모델이 가진 지식을 더 작은 모델에 전달해 계산 비용을 낮추면서 성능을 유지하려는 모델 압축 접근법이다. 대표 연구는 큰 teacher 모델의 부드러운 출력 확률을 student 모델의 학습 신호로 사용하는 방법을 정리했다.[1]
왜 사용하는가
대형 신경망이나 Foundation Model은 높은 성능을 낼 수 있지만 배포 비용이 크다. Distillation은 더 작은 모델이 teacher의 출력 패턴을 학습하도록 해 크기·지연·비용을 줄이는 방향으로 사용될 수 있다.
다른 압축과의 차이
Quantization이 주로 숫자 표현의 정밀도를 낮추는 접근이라면, Knowledge Distillation은 별도의 student 모델을 학습시키는 과정에 초점을 둔다. 두 방법은 목적이 겹치지만 서로 배타적이지 않다.
SOURCES
출처
-
Distilling the Knowledge in a Neural Network Hinton et al. / arXiv원문 보기 ↗
KNOWLEDGE LINKS