Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
KAIST · ICML · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
예측 보상을 통해 추론 모델의 메타인지 능력을 검증한다.
- arXiv
- 2510.03259
- 원문
- https://arxiv.org/abs/2510.03259
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2510.03259
마지막 검증일: 2026-07-22