벤치마크 17

한국어 AI 평가 벤치마크.

HAE-RAE Bench

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 고유 지식과 문화적 맥락 이해 능력을 평가하는 벤치마크. 어휘·역사·일반 상식·독해 등 4개 영역 6개 태스크로 구성되며, 영어에서 전이…

KLUE (Korean Language Understanding Evaluation)

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 자연어이해(NLU) 벤치마크. 주제 분류, 의미 유사도(STS), 자연어추론(NLI), 개체명 인식(NER), 관계 추출, 의존 구문 분…

KMMAU

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 음성 전사와 화자 메타데이터를 활용해 SpeechLM의 오디오 이해 능력을 평가하는 한국어 벤치마크.…

KMMLU

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

인문학부터 STEM까지 45개 과목에 걸친 35,030개 전문가 수준 객관식 문항으로 구성된 한국어 벤치마크. 기존 영어 벤치마크의 번역이 아니…

KMMLU-Pro

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국 국가전문자격 시험 기반의 한국어 전문지식 평가 벤치마크. KMMLU-Redux와 함께 2025년 LG AI연구원이 공개한 전문가급 한국어 …

KMMLU-Redux

korean-understanding
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

기존 KMMLU를 재구성한 벤치마크. 한국 국가기술자격 시험 기반 2,587문항으로 정답 유출·오류·오염을 수작업 검수로 제거해 신뢰성을 높였다…

KMMMU

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 문화·제도 맥락의 멀티모달 이해를 평가하는 네이티브 한국어 벤치마크. 9개 학문 분야와 9개 시각 유형의 시험 문항 3,466개, 한국 특…

KoBALT

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 통사·의미·화용·음운·형태론의 24개 현상을 평가하는 전문가 작성 700문항 벤치마크.…

KoBEST

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전문 한국어 언어학자가 설계한 5개 한국어 다운스트림 태스크로 구성된 벤치마크. 고급 한국어 언어 지식을 요구하며, 사람이 직접 주석·검수하여 …

KOFFVQA

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국어 시각언어모델(VLM)을 객관적으로 평가하는 자유형식 VQA 벤치마크. 이미지와 채점 기준이 짝지어진 275개 문항으로 VLM 성능을 세밀…

KOpenAudioBench

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

공개 음성 질의응답 자료를 한국어로 이전해 SpeechLM의 한국어 듣기·질의응답 성능을 평가하는 벤치마크.…

KorNLI and KorSTS

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 자연어추론(NLI)과 의미적 텍스트 유사도(STS)를 위한 벤치마크 데이터셋. Kakao Brain이 공개했으며, 학습셋은 기계번역, 검…

KRETA

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

15개 영역과 26개 이미지 유형의 한국어 텍스트 중심 VQA 2,577문항으로 시각적 읽기와 다단계 추론을 평가한다.…

KVoiceBench

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 음성 질의응답 능력을 평가하도록 공개 영어 SpokenQA 벤치마크를 한국어 음성으로 변환·검수한 벤치마크.…

LogicKor

math-reasoning
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 언어모델의 다분야 사고력을 측정하는 멀티턴 벤치마크. 추론·수학·글쓰기·코딩·이해·국어(문법) 등 6개 카테고리 42개 멀티턴 프롬프트로…

Open Ko-LLM Leaderboard (Ko-H5)

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Upstage와 한국지능정보사회진흥원(NIA)이 2023년 개설한 한국어 LLM 평가 리더보드. 영어 Open LLM Leaderboard를 미…

XL-SafetyBench

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국 등 10개국 언어·문화 기반의 다국어 LLM 안전성·문화 민감성 벤치마크. 약 5,500개 테스트 케이스로 구성. 에임인텔리전스 주도, K…