PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization
KAIST · KENTECH · Findings of EMNLP 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
정책 모델과 참조 모델의 보정된 마진을 온라인 증거로 사용해 각 선호 쌍을 정상·반전·동률 신호로 라우팅하는 PLC-DPO를 제안한다. 57개 데이터셋·모델·벤치마크 조합에서 잡음과 모호한 선호를 구분하면서 기존 DPO보다 높은 평균 승률을 보고한다.
- arXiv
- 2608.30597
- 원문
- https://arxiv.org/abs/2608.30597
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2608.30597
- [github] https://github.com/VennTum99/PLC-DPO
마지막 검증일: 2026-09-01