ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision

Kakao Enterprise · ICML 2021 · 2021 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

무거운 영역 검출·합성곱 시각 임베딩 없이 이미지 패치를 그대로 트랜스포머에 넣는 경량 비전-언어 모델. 시각 임베딩을 대폭 단순화해 수십 배 빠르면서 경쟁력 있는 성능을 낸다.

arXiv
2102.03334
원문
https://arxiv.org/abs/2102.03334

관련 항목

출처 및 검증

마지막 검증일: 2026-07-22

✎ 정보 수정 제안