비전 언어 모델
Vision language model
다른 표기: VLM · 멀티모달 모델
이미지와 글을 같은 공간에서 다루는 모델. 사진과 낱말이 서로 얼마나 맞는지 비교할 수 있습니다.
이미지만 보는 모델은 『이것이 무엇인가』를 미리 정해 둔 분류 목록 안에서만 답합니다. 비전 언어 모델은 이미지와 글을 같은 좌표 공간에 놓기 때문에, 새 낱말을 주고 이 사진에 있는지 물어볼 수 있습니다.
교육 자료에서는 어휘를 우리가 정합니다. 그래서 모델이 아는 이름을 받아 적는 방식보다, 우리 낱말 목록을 놓고 사진에 있는지 묻는 방식이 맞습니다. 단어 카드에 그림이 있는 낱말만 아이에게 보여 줄 수 있기 때문입니다.
대표적인 계열로 CLIP 과 SigLIP 이 있습니다. 두 모델 모두 이미지와 글을 함께 학습해 서로 비교할 수 있게 만든 것이 핵심입니다.
- 쓰임검색, 분류, 사진 설명, 사물 찾기.
- 한계낱말이 추상적일수록 판정이 흔들립니다.


