벤치마크 29

한국어 AI 평가 벤치마크.

BC Card Finance LLM Benchmark

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

BC카드와 연세대학교 DSL의 산학협력으로 제작된 한국어 금융 LLM 벤치마크. BC카드 FAQ와 일반 금융 영역의 800문항을 참조 답변과 비…

EgoSafetyBench

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

체화형 VLM을 실시간 안전 가드로 평가하는 1인칭 로봇 영상 벤치마크. 가정·공장 환경의 1,200개 시나리오를 0.5초 단위로 주석하고, 실…

HAE-RAE Bench

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 고유 지식과 문화적 맥락 이해 능력을 평가하는 벤치마크. 어휘·역사·일반 상식·독해 등 4개 영역 6개 태스크로 구성되며, 영어에서 전이…

K-BrowseComp

domain-specific
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 웹의 지역·문화·제도 맥락을 바탕으로 검색 에이전트의 다단계 탐색과 병렬 제약 추적을 평가하는 벤치마크. 사람이 작성·검증한 300문항과 …

KLUE (Korean Language Understanding Evaluation)

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 자연어이해(NLU) 벤치마크. 주제 분류, 의미 유사도(STS), 자연어추론(NLI), 개체명 인식(NER), 관계 추출, 의존 구문 분…

KMMAU

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 음성 전사와 화자 메타데이터를 활용해 SpeechLM의 오디오 이해 능력을 평가하는 한국어 벤치마크.…

KMMLU

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

인문학부터 STEM까지 45개 과목에 걸친 35,030개 전문가 수준 객관식 문항으로 구성된 한국어 벤치마크. 기존 영어 벤치마크의 번역이 아니…

KMMLU-Pro

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국 국가전문자격 시험 기반의 한국어 전문지식 평가 벤치마크. KMMLU-Redux와 함께 2025년 LG AI연구원이 공개한 전문가급 한국어 …

KMMLU-Redux

korean-understanding
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

기존 KMMLU를 재구성한 벤치마크. 한국 국가기술자격 시험 기반 2,587문항으로 정답 유출·오류·오염을 수작업 검수로 제거해 신뢰성을 높였다…

KMMMU

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 문화·제도 맥락의 멀티모달 이해를 평가하는 네이티브 한국어 벤치마크. 9개 학문 분야와 9개 시각 유형의 시험 문항 3,466개, 한국 특…

KoALa-Bench

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대규모 오디오 언어모델의 한국어 음성 이해와 음성 입력 충실도를 평가하는 벤치마크. 음성 인식·번역·질의응답·지시 이행과 두 종류의 음성 충실도…

KoBALT

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 통사·의미·화용·음운·형태론의 24개 현상을 평가하는 전문가 작성 700문항 벤치마크.…

KoBEST

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전문 한국어 언어학자가 설계한 5개 한국어 다운스트림 태스크로 구성된 벤치마크. 고급 한국어 언어 지식을 요구하며, 사람이 직접 주석·검수하여 …

KoEVD

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 대화형 AI의 유해성·안전 응답·전략·도구 행동을 단계별로 평가하는 KETI 안전성 벤치마크.…

KOFFVQA

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국어 시각언어모델(VLM)을 객관적으로 평가하는 자유형식 VQA 벤치마크. 이미지와 채점 기준이 짝지어진 275개 문항으로 VLM 성능을 세밀…

KOpenAudioBench

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

공개 음성 질의응답 자료를 한국어로 이전해 SpeechLM의 한국어 듣기·질의응답 성능을 평가하는 벤치마크.…

Korean Contract Derivation Benchmark

domain-specific
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 계약 문서 RAG에서 답을 가리는 관용 표현과 산술 관계 도출 실패를 분리해 측정하는 240문항 평가. 직접 제시(disambiguate…

KorNLI and KorSTS

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 자연어추론(NLI)과 의미적 텍스트 유사도(STS)를 위한 벤치마크 데이터셋. Kakao Brain이 공개했으며, 학습셋은 기계번역, 검…

KoViDoRe

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

표·그림·다단 편집과 여러 페이지의 증거 결합을 포함하는 한국어 시각 문서 검색 벤치마크. 공공 문서 기반의 다양한 질의 유형으로 멀티모달 검색…

KRETA

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

15개 영역과 26개 이미지 유형의 한국어 텍스트 중심 VQA 2,577문항으로 시각적 읽기와 다단계 추론을 평가한다.…

KVoiceBench

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 음성 질의응답 능력을 평가하도록 공개 영어 SpokenQA 벤치마크를 한국어 음성으로 변환·검수한 벤치마크.…

LogicKor

math-reasoning
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 언어모델의 다분야 사고력을 측정하는 멀티턴 벤치마크. 추론·수학·글쓰기·코딩·이해·국어(문법) 등 6개 카테고리 42개 멀티턴 프롬프트로…

NOLLI

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

영어와 한국어 사이의 추론 성능 격차가 어디서 발생하는지 진단하는 난이도 보정 퍼즐 벤치마크. 직접 번역, 한글 자모 기반 문자 체계 변형, 한…

Open Ko-LLM Leaderboard (Ko-H5)

korean-understanding
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Upstage와 한국지능정보사회진흥원(NIA)이 2023년 개설한 한국어 LLM 평가 리더보드. 영어 Open LLM Leaderboard를 미…

Q-CARE

hallucination
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

정답 참조 없이 검색의 질의 커버리지와 생성 답변 주장의 검증 가능성을 평가하는 RAG 벤치마크. 검색기에는 C-Prec@k·C-nDCG@k, …

RouterBench Korean Translation

korean-understanding
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

모델 라우팅 성능을 한국어 프롬프트로 평가할 수 있도록 RouterBench를 번역한 벤치마크. 0-shot·5-shot 조건과 원본의 86개 …

Surromind Korean RAG QA Benchmark

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국어 RAG의 검색 품질(hit@k)과 생성 품질(F1·BERTScore)을 함께 측정하는 벤치마크. 위키백과 기반 1,000개 QA와 1,3…

XL-SafetyBench

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국 등 10개국 언어·문화 기반의 다국어 LLM 안전성·문화 민감성 벤치마크. 약 5,500개 테스트 케이스로 구성. 에임인텔리전스 주도, K…

τ²-bench Korean Translation

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

유통·항공·통신 고객지원 환경에서 한국어 에이전트의 대화와 도구사용을 평가하기 위한 τ²-bench 번역판. 278개 태스크와 1,004개 사용…