개요
Quantization은 신경망의 가중치나 활성값을 높은 정밀도의 부동소수점 대신 더 적은 비트로 표현해 저장 공간과 계산 비용을 줄이는 기법 계열이다. 낮은 정밀도는 효율을 높일 수 있지만 모델 정확도와 하드웨어 지원 사이의 절충이 필요하다.
대규모 언어 모델
GPTQ 연구는 대형 생성 Transformer의 가중치를 학습 이후 낮은 비트 폭으로 양자화하는 방법을 제안하고, 대규모 모델의 메모리 요구를 크게 낮추면서 성능 저하를 제한하는 문제를 다뤘다.[1]
관계
SOURCES
출처
-
GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers Frantar et al. / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS