개요
Context Window는 언어 모델이 한 번의 추론에서 조건으로 사용할 수 있도록 구성하는 토큰 문맥 범위를 뜻한다. 대화 기록, 문서, 지시문, 검색된 자료와 생성 중인 토큰 등이 이 범위 안의 입력으로 들어갈 수 있다.
길이와 비용
더 긴 문맥은 더 많은 정보를 한 번에 제공할 수 있지만 계산량과 메모리 사용도 증가할 수 있다. Llama 2 연구는 이전 세대보다 학습 컨텍스트 길이를 늘려 더 긴 대화 기록과 문서를 처리하는 방향을 평가했다.[1] 긴 입력을 안정적으로 활용하는 능력은 단순히 허용 토큰 수만으로 결정되지 않는다.
관계
문맥은 Tokenization을 거친 토큰 단위로 구성되며, Attention 계산과 KV Cache 메모리 사용에 영향을 준다. 따라서 Context Window의 최대값과 실제로 유용하게 활용할 수 있는 길이는 구분해서 해석하는 것이 좋다.
SOURCES
출처
-
Llama 2: Open Foundation and Fine-Tuned Chat Models Meta AI / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS