Rethinking Spatial Dimensions of Vision Transformers (PiT)
NAVER AI Lab · ICCV 2021 · 2021 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
CNN의 공간 차원 축소 원리를 ViT에 도입해 풀링 기반 토큰 축소를 적용한 Pooling-based Vision Transformer(PiT)를 제안, 성능·효율 개선.
- arXiv
- 2103.16302
- 원문
- https://arxiv.org/abs/2103.16302
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2103.16302
마지막 검증일: 2026-07-22