AI · 기술

비전 언어 모델

Vision language model

다른 표기: VLM · 멀티모달 모델

이미지와 글을 같은 공간에서 다루는 모델. 사진과 낱말이 서로 얼마나 맞는지 비교할 수 있습니다.

이미지만 보는 모델은 『이것이 무엇인가』를 미리 정해 둔 분류 목록 안에서만 답합니다. 비전 언어 모델은 이미지와 글을 같은 좌표 공간에 놓기 때문에, 새 낱말을 주고 이 사진에 있는지 물어볼 수 있습니다.

교육 자료에서는 어휘를 우리가 정합니다. 그래서 모델이 아는 이름을 받아 적는 방식보다, 우리 낱말 목록을 놓고 사진에 있는지 묻는 방식이 맞습니다. 단어 카드에 그림이 있는 낱말만 아이에게 보여 줄 수 있기 때문입니다.

대표적인 계열로 CLIP 과 SigLIP 이 있습니다. 두 모델 모두 이미지와 글을 함께 학습해 서로 비교할 수 있게 만든 것이 핵심입니다.

  • 쓰임검색, 분류, 사진 설명, 사물 찾기.
  • 한계낱말이 추상적일수록 판정이 흔들립니다.

관련 용어

출처

  1. Radford, A. et al. (2021). Learning transferable visual models from natural language supervision (CLIP).
  2. Zhai, X. et al. (2023). Sigmoid loss for language image pre training (SigLIP).