KMMLU: Measuring Massive Multitask Language Understanding in Korean
HAE-RAE · arXiv · 2024 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
45개 주제 35,030개 객관식 문항으로 구성된 한국어 벤치마크로, GPT-4 등 최신 모델도 60%를 넘기지 못함을 보인다.
- arXiv
- 2402.11548
- 원문
- https://arxiv.org/abs/2402.11548
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2402.11548
마지막 검증일: 2026-07-22