ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

Quantization

모델의 가중치나 연산 표현에 더 낮은 정밀도를 사용해 메모리와 계산 비용을 줄이는 모델 압축 기법 계열.

최근 수정 2026.08.29 07:26 출처 1

개요

Quantization은 신경망의 가중치나 활성값을 높은 정밀도의 부동소수점 대신 더 적은 비트로 표현해 저장 공간과 계산 비용을 줄이는 기법 계열이다. 낮은 정밀도는 효율을 높일 수 있지만 모델 정확도와 하드웨어 지원 사이의 절충이 필요하다.

대규모 언어 모델

GPTQ 연구는 대형 생성 Transformer의 가중치를 학습 이후 낮은 비트 폭으로 양자화하는 방법을 제안하고, 대규모 모델의 메모리 요구를 크게 낮추면서 성능 저하를 제한하는 문제를 다뤘다.[1]

관계

Quantization은 LLM을 더 작은 메모리 환경에서 실행하려는 대표적 압축 방법 중 하나다. GPT 같은 모델 계열에도 적용될 수 있지만, 어떤 정밀도와 알고리즘이 적합한지는 모델과 하드웨어에 따라 달라진다.

SOURCES

출처

  1. 원문 보기 ↗