On-Policy Delta Distillation (OPD²)

프레임워크 · 공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

추론 튜닝 교사와 기반 모델의 확률 차이를 학습 신호로 사용하는 NAVER AI Lab의 온폴리시 델타 증류 공식 구현. 수학·과학·코드 및 영어·한국어·일본어 다국어 추론 실험용 학습 레시피와 평가 어댑터를 제공한다.

조직
네이버클라우드
저장소
https://github.com/naver-ai/opd2
주 언어
Python
라이선스
Apache-2.0
Stars
58

출처 및 검증

마지막 검증일: 2026-08-10

✎ 정보 수정 제안