Aligning Large Language Models by On-Policy Self-Judgment

NAVER Cloud · KAIST · Yonsei · ACL · 2024 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

보상모델 없이 스스로 심판하며 온-폴리시 정렬하는 SELF-JUDGE.

arXiv
2402.11253
원문
https://arxiv.org/abs/2402.11253

관련 항목

출처 및 검증

마지막 검증일: 2026-07-22

✎ 정보 수정 제안