CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
KAIST · 서울대 · NAVER AI Lab · COLM 2025 · 2025 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
사용자가 상호작용에서 드러내는 맥락적 선호를 추론·적용하는 개인화 정렬 능력을 평가하는 벤치마크(756개 세션). 최신 LLM들이 다중턴 선호 추론에서 큰 한계를 보임을 확인.
- arXiv
- 2508.01674
- 원문
- https://arxiv.org/abs/2508.01674
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2508.01674
마지막 검증일: 2026-07-22