개념
멀티모달(multimodal)은 텍스트뿐 아니라 이미지, 영상, 음성 같은 서로 다른 형태(모달리티)의 데이터를 함께 입력받거나 생성할 수 있는 AI 모델의 특성을 가리킨다. 텍스트만 다루는 LLM과 달리, 멀티모달 모델은 사진을 보고 설명하거나 영상 속 상황을 이해해 질문에 답하는 것처럼 서로 다른 종류의 정보를 하나의 모델 안에서 함께 처리한다.
이런 모델은 대개 이미지나 영상을 텍스트와 같은 표현 공간으로 옮기는 인코더 구조를 통해, 시각 정보와 언어 정보를 함께 참조하며 답을 생성한다. 비전-언어 모델(VLM)이라는 용어도 텍스트와 이미지를 함께 다루는 모델을 가리킬 때 비슷한 의미로 쓰인다.
쓰임새
이미지 설명, 문서·표 이미지 이해, 영상 기반 질의응답, 사진 속 오류나 이상 상황 판별 같은 작업에 쓰인다. 예를 들어 대시캠 영상을 보고 사고 상황을 판단하는 자율주행 분야의 시각 질의응답 벤치마크도 멀티모달 모델의 응용 사례 중 하나다. 관련 연구 사례는 자율주행 AI는 사고 상황을 얼마나 이해할까 글에서 다룬다.
멀티모달 모델은 텍스트 전용 모델보다 다루는 정보의 종류가 많은 만큼, 평가와 안전성 검증도 모달리티별로 따로 확인해야 하는 경우가 많다.