PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization

KAIST · KENTECH · Findings of EMNLP 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

정책 모델과 참조 모델의 보정된 마진을 온라인 증거로 사용해 각 선호 쌍을 정상·반전·동률 신호로 라우팅하는 PLC-DPO를 제안한다. 57개 데이터셋·모델·벤치마크 조합에서 잡음과 모호한 선호를 구분하면서 기존 DPO보다 높은 평균 승률을 보고한다.

arXiv
2608.30597
원문
https://arxiv.org/abs/2608.30597

관련 항목

출처 및 검증

마지막 검증일: 2026-09-01

✎ 정보 수정 제안