Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective

HodooAI Lab · Seoul National University · arXiv · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

일시정지 토큰을 추론 단계 경계에 두고 손실을 마스킹하는 MBP를 제안한다. 기존 분포의 덮어쓰기를 줄이고 경계 인접 토큰에 다음 단계 정보를 압축해 1B~8B Qwen·Llama 모델에서 수학·코드 추론을 개선하면서 일반 언어 이해 능력을 보존했다고 보고한다.

arXiv
2609.04489
원문
https://arxiv.org/abs/2609.04489

관련 항목

출처 및 검증

마지막 검증일: 2026-09-16

✎ 정보 수정 제안