ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

Multimodal AI

텍스트·이미지·오디오·영상 등 서로 다른 형태의 정보를 함께 표현하거나 처리하는 AI 접근법.

최근 수정 2026.08.29 06:47 출처 2

개요

Multimodal AI는 텍스트, 이미지, 오디오, 영상처럼 서로 다른 형태의 데이터를 함께 학습하거나 입력·출력으로 다루는 AI 시스템을 가리키는 넓은 표현이다. 하나의 고정된 아키텍처가 아니라 여러 결합 방식과 학습 목표를 포함한다.

대표적 연구 흐름

CLIP은 대규모 이미지-텍스트 쌍에서 어떤 캡션이 어떤 이미지와 대응하는지 학습해, 자연어를 이용한 이미지 개념의 제로샷 전이를 연구했다.[1] Flamingo는 사전학습된 시각 모델과 언어 모델을 연결해 이미지·영상과 텍스트가 섞인 입력을 처리하는 시각-언어 모델을 제시했다.[2]

관계

멀티모달 시스템의 언어 부분에는 LLM이 사용될 수 있고, 대규모 사전학습 관점에서는 Foundation Model 논의와도 연결된다.

SOURCES

출처

  1. 원문 보기 ↗
  2. 원문 보기 ↗