ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision
Kakao Enterprise · ICML 2021 · 2021 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
무거운 영역 검출·합성곱 시각 임베딩 없이 이미지 패치를 그대로 트랜스포머에 넣는 경량 비전-언어 모델. 시각 임베딩을 대폭 단순화해 수십 배 빠르면서 경쟁력 있는 성능을 낸다.
- arXiv
- 2102.03334
- 원문
- https://arxiv.org/abs/2102.03334
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2102.03334
마지막 검증일: 2026-07-22