Aligning Large Language Models by On-Policy Self-Judgment
NAVER Cloud · KAIST · Yonsei · ACL · 2024 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
보상모델 없이 스스로 심판하며 온-폴리시 정렬하는 SELF-JUDGE.
- arXiv
- 2402.11253
- 원문
- https://arxiv.org/abs/2402.11253
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2402.11253
마지막 검증일: 2026-07-22