개요
Tokenization은 텍스트를 모델이 처리하는 토큰 단위로 나누고 각 토큰을 정수 ID 같은 내부 표현으로 바꾸는 과정이다. 토큰은 반드시 단어나 글자 하나와 일치하지 않으며, 많은 현대 언어 모델은 서브워드 단위를 사용한다.
서브워드 방식
SentencePiece는 입력을 미리 단어 단위로 분리했다고 가정하지 않고 원문 문장에서 직접 서브워드 모델을 학습할 수 있도록 설계된 언어 독립적 토크나이저·디토크나이저다.[1]
LLM과의 관계
LLM은 토큰의 연속을 입력으로 받아 다음 토큰이나 표현을 예측한다. 따라서 같은 문자열이라도 어떤 토크나이저를 쓰는지에 따라 토큰 수와 모델이 보는 단위가 달라질 수 있다.
SOURCES
출처
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS