Embedding은 단어, 문장, 문서 같은 대상을 연속적인 숫자 벡터로 표현하는 방법을 뜻한다. 좋은 임베딩 공간에서는 의미나 사용 맥락이 비슷한 대상이 벡터 공간에서도 가까운 위치를 갖도록 학습할 수 있다.
Word2Vec 연구는 대규모 데이터에서 단어의 연속 벡터 표현을 효율적으로 학습하는 신경망 구조를 제안했고, 학습된 벡터가 단어의 구문적·의미적 유사성을 포착할 수 있음을 보였다.[1]
Sentence-BERT 연구는 문장 단위의 의미 벡터를 생성해 코사인 유사도로 빠르게 비교할 수 있는 방식을 제시했다.[2] 오늘날 임베딩은 의미 검색, 군집화, 추천, 중복 탐지와 RAG의 검색 단계 등에 널리 활용된다.
Word2Vec 연구는 대규모 데이터에서 단어의 연속 벡터 표현을 효율적으로 학습하는 신경망 구조를 제안했고, 학습된 벡터가 단어의 구문적·의미적 유사성을 포착할 수 있음을 보였다.[1]
Sentence-BERT 연구는 문장 단위의 의미 벡터를 생성해 코사인 유사도로 빠르게 비교할 수 있는 방식을 제시했다.[2] 오늘날 임베딩은 의미 검색, 군집화, 추천, 중복 탐지와 RAG의 검색 단계 등에 널리 활용된다.
SOURCES
출처
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS