벤치마크 17
한국어 AI 평가 벤치마크.
HAE-RAE Bench
한국어 고유 지식과 문화적 맥락 이해 능력을 평가하는 벤치마크. 어휘·역사·일반 상식·독해 등 4개 영역 6개 태스크로 구성되며, 영어에서 전이…
KLUE (Korean Language Understanding Evaluation)
한국어 자연어이해(NLU) 벤치마크. 주제 분류, 의미 유사도(STS), 자연어추론(NLI), 개체명 인식(NER), 관계 추출, 의존 구문 분…
KMMAU
한국어 음성 전사와 화자 메타데이터를 활용해 SpeechLM의 오디오 이해 능력을 평가하는 한국어 벤치마크.…
KMMLU
인문학부터 STEM까지 45개 과목에 걸친 35,030개 전문가 수준 객관식 문항으로 구성된 한국어 벤치마크. 기존 영어 벤치마크의 번역이 아니…
KMMLU-Pro
한국 국가전문자격 시험 기반의 한국어 전문지식 평가 벤치마크. KMMLU-Redux와 함께 2025년 LG AI연구원이 공개한 전문가급 한국어 …
KMMLU-Redux
기존 KMMLU를 재구성한 벤치마크. 한국 국가기술자격 시험 기반 2,587문항으로 정답 유출·오류·오염을 수작업 검수로 제거해 신뢰성을 높였다…
KMMMU
한국 문화·제도 맥락의 멀티모달 이해를 평가하는 네이티브 한국어 벤치마크. 9개 학문 분야와 9개 시각 유형의 시험 문항 3,466개, 한국 특…
KoBALT
한국어 통사·의미·화용·음운·형태론의 24개 현상을 평가하는 전문가 작성 700문항 벤치마크.…
KoBEST
전문 한국어 언어학자가 설계한 5개 한국어 다운스트림 태스크로 구성된 벤치마크. 고급 한국어 언어 지식을 요구하며, 사람이 직접 주석·검수하여 …
KOFFVQA
한국어 시각언어모델(VLM)을 객관적으로 평가하는 자유형식 VQA 벤치마크. 이미지와 채점 기준이 짝지어진 275개 문항으로 VLM 성능을 세밀…
KOpenAudioBench
공개 음성 질의응답 자료를 한국어로 이전해 SpeechLM의 한국어 듣기·질의응답 성능을 평가하는 벤치마크.…
KorNLI and KorSTS
한국어 자연어추론(NLI)과 의미적 텍스트 유사도(STS)를 위한 벤치마크 데이터셋. Kakao Brain이 공개했으며, 학습셋은 기계번역, 검…
KRETA
15개 영역과 26개 이미지 유형의 한국어 텍스트 중심 VQA 2,577문항으로 시각적 읽기와 다단계 추론을 평가한다.…
KVoiceBench
한국어 음성 질의응답 능력을 평가하도록 공개 영어 SpokenQA 벤치마크를 한국어 음성으로 변환·검수한 벤치마크.…
LogicKor
한국어 언어모델의 다분야 사고력을 측정하는 멀티턴 벤치마크. 추론·수학·글쓰기·코딩·이해·국어(문법) 등 6개 카테고리 42개 멀티턴 프롬프트로…
Open Ko-LLM Leaderboard (Ko-H5)
Upstage와 한국지능정보사회진흥원(NIA)이 2023년 개설한 한국어 LLM 평가 리더보드. 영어 Open LLM Leaderboard를 미…
XL-SafetyBench
한국 등 10개국 언어·문화 기반의 다국어 LLM 안전성·문화 민감성 벤치마크. 약 5,500개 테스트 케이스로 구성. 에임인텔리전스 주도, K…