Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
Kakao Corp. · Upstage AI · COLM 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
소형 프록시 모델에서 폭과 토큰 예산을 단계적으로 확장해 대규모 MoE의 최적 학습률을 저비용으로 추정하고, 155B 규모 자체 사전학습 모델에 적용해 전이 가능성을 검증한다.
- arXiv
- 2608.20061
- 원문
- https://arxiv.org/abs/2608.20061
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2608.20061
마지막 검증일: 2026-08-23