개요
Attention은 입력의 모든 정보를 하나의 고정 길이 표현으로 압축하는 대신, 현재 출력을 만들 때 입력의 어느 부분이 더 관련 있는지 가중치를 계산해 정보를 결합하는 메커니즘이다. 신경망 기계번역 연구에서는 디코더가 다음 단어를 예측할 때 원문 문장의 관련 위치를 부드럽게 선택하는 방식이 제안됐다.[1]
Transformer에서의 역할
Transformer는 순환 신경망에 의존하지 않고 self-attention을 중심으로 시퀀스 내부의 관계를 계산한다.[2] 이 구조는 현대 LLM의 핵심 기반 중 하나가 됐다.
주의점
Attention은 하나의 단일 알고리즘 이름이라기보다 점수 계산, 정규화, 여러 head 구성 등 다양한 변형을 포함하는 넓은 개념이다.
SOURCES
출처
-
Neural Machine Translation by Jointly Learning to Align and Translate Bahdanau et al. / arXiv원문 보기 ↗
-
Attention Is All You Need Google / NeurIPS / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS