Multimodal AI
매일 핵심 AI 뉴스 알림 받기음성·비디오·이미지 등 멀티모달 모델의 발전을 다루는 리서치입니다
멀티모달 AI는 그림을 ‘보는’ 게 아니라 이름을 붙인다 - VLM이 픽셀을 버리고 단어로 도망치는 이유 시각언어모델은 부위에 이름이 붙었을 때 이미지 속 같은 지점을 더 정확히 찾아내고, 이름 없는 도형은 픽셀 대응을 따로 학습시켜야 정확도가 오른다. 음성·비디오·이미지 등 멀티모달 모델의 발전을 다루는 리서치입니다
멀티모달 AI는 그림을 ‘보는’ 게 아니라 이름을 붙인다 - VLM이 픽셀을 버리고 단어로 도망치는 이유 시각언어모델은 부위에 이름이 붙었을 때 이미지 속 같은 지점을 더 정확히 찾아내고, 이름 없는 도형은 픽셀 대응을 따로 학습시켜야 정확도가 오른다.