Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective
HodooAI Lab · Seoul National University · arXiv · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
일시정지 토큰을 추론 단계 경계에 두고 손실을 마스킹하는 MBP를 제안한다. 기존 분포의 덮어쓰기를 줄이고 경계 인접 토큰에 다음 단계 정보를 압축해 1B~8B Qwen·Llama 모델에서 수학·코드 추론을 개선하면서 일반 언어 이해 능력을 보존했다고 보고한다.
- arXiv
- 2609.04489
- 원문
- https://arxiv.org/abs/2609.04489
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2609.04489
- [github] https://github.com/jkpizza/emnlp2026-pause-token-dynamics
마지막 검증일: 2026-09-16