V-Agent: An Interactive Video Search System Using Vision-Language Models

NCSOFT · arXiv · 2025 · 검토 필요 검토 필요정보 재검토가 필요합니다. 일부 값이 공식 출처로 확인되지 않았습니다.

엔씨소프트의 비전언어모델 기반 대화형 영상 검색 시스템으로, GME-VARCO-VISION-Embedding 멀티모달 임베딩을 활용해 시각·음성 정보를 통합 검색한다.

arXiv
2512.16925
원문
https://arxiv.org/abs/2512.16925

관련 항목

출처 및 검증

마지막 검증일: 2026-07-22

✎ 정보 수정 제안