Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

Kakao Corp. · Upstage AI · COLM 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

소형 프록시 모델에서 폭과 토큰 예산을 단계적으로 확장해 대규모 MoE의 최적 학습률을 저비용으로 추정하고, 155B 규모 자체 사전학습 모델에 적용해 전이 가능성을 검증한다.

arXiv
2608.20061
원문
https://arxiv.org/abs/2608.20061

관련 항목

출처 및 검증

마지막 검증일: 2026-08-23

✎ 정보 수정 제안