개요
Multimodal AI는 텍스트, 이미지, 오디오, 영상처럼 서로 다른 형태의 데이터를 함께 학습하거나 입력·출력으로 다루는 AI 시스템을 가리키는 넓은 표현이다. 하나의 고정된 아키텍처가 아니라 여러 결합 방식과 학습 목표를 포함한다.
대표적 연구 흐름
CLIP은 대규모 이미지-텍스트 쌍에서 어떤 캡션이 어떤 이미지와 대응하는지 학습해, 자연어를 이용한 이미지 개념의 제로샷 전이를 연구했다.[1] Flamingo는 사전학습된 시각 모델과 언어 모델을 연결해 이미지·영상과 텍스트가 섞인 입력을 처리하는 시각-언어 모델을 제시했다.[2]
관계
멀티모달 시스템의 언어 부분에는 LLM이 사용될 수 있고, 대규모 사전학습 관점에서는 Foundation Model 논의와도 연결된다.
SOURCES
출처
- 원문 보기 ↗
-
Flamingo: a Visual Language Model for Few-Shot Learning DeepMind / arXiv원문 보기 ↗
KNOWLEDGE LINKS
이 문서에서 연결하는 지식
BACKLINKS