ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

KV Cache

자동회귀 Transformer가 이전 토큰의 key·value 표현을 재사용하기 위해 저장하는 추론 메모리.

최근 수정 2026.08.29 07:31 출처 1

개요

KV Cache는 자동회귀 Transformer가 토큰을 하나씩 생성할 때 이전 토큰에서 계산한 attention의 key와 value 표현을 저장해 다시 사용하는 추론 최적화 방식이다. 이미 처리한 토큰의 표현을 매 생성 단계마다 처음부터 다시 계산하지 않도록 해 반복 계산을 줄인다.

메모리 문제

생성 중 캐시는 입력과 출력 시퀀스가 길어질수록 커지며, 여러 요청을 동시에 처리하면 GPU 메모리의 큰 부분을 차지할 수 있다. PagedAttention 연구는 LLM 서비스에서 KV cache가 동적으로 커지고 줄어드는 특성 때문에 메모리 단편화와 중복이 발생할 수 있음을 지적했다.[1]

서비스와의 관계

효율적인 KV Cache 관리는 Inference의 처리량과 동시 요청 수에 직접적인 영향을 줄 수 있다. 캐시 크기는 모델 구조, 층 수, attention 설계, 정밀도와 Context Window 사용량 등에 따라 달라진다.

SOURCES

출처

  1. 원문 보기 ↗