KMMLU: Measuring Massive Multitask Language Understanding in Korean

HAE-RAE · arXiv · 2024 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

45개 주제 35,030개 객관식 문항으로 구성된 한국어 벤치마크로, GPT-4 등 최신 모델도 60%를 넘기지 못함을 보인다.

arXiv
2402.11548
원문
https://arxiv.org/abs/2402.11548

관련 항목

출처 및 검증

마지막 검증일: 2026-07-22

✎ 정보 수정 제안