벤치마크 29
한국어 AI 평가 벤치마크.
BC Card Finance LLM Benchmark
BC카드와 연세대학교 DSL의 산학협력으로 제작된 한국어 금융 LLM 벤치마크. BC카드 FAQ와 일반 금융 영역의 800문항을 참조 답변과 비…
EgoSafetyBench
체화형 VLM을 실시간 안전 가드로 평가하는 1인칭 로봇 영상 벤치마크. 가정·공장 환경의 1,200개 시나리오를 0.5초 단위로 주석하고, 실…
HAE-RAE Bench
한국어 고유 지식과 문화적 맥락 이해 능력을 평가하는 벤치마크. 어휘·역사·일반 상식·독해 등 4개 영역 6개 태스크로 구성되며, 영어에서 전이…
K-BrowseComp
한국 웹의 지역·문화·제도 맥락을 바탕으로 검색 에이전트의 다단계 탐색과 병렬 제약 추적을 평가하는 벤치마크. 사람이 작성·검증한 300문항과 …
KLUE (Korean Language Understanding Evaluation)
한국어 자연어이해(NLU) 벤치마크. 주제 분류, 의미 유사도(STS), 자연어추론(NLI), 개체명 인식(NER), 관계 추출, 의존 구문 분…
KMMAU
한국어 음성 전사와 화자 메타데이터를 활용해 SpeechLM의 오디오 이해 능력을 평가하는 한국어 벤치마크.…
KMMLU
인문학부터 STEM까지 45개 과목에 걸친 35,030개 전문가 수준 객관식 문항으로 구성된 한국어 벤치마크. 기존 영어 벤치마크의 번역이 아니…
KMMLU-Pro
한국 국가전문자격 시험 기반의 한국어 전문지식 평가 벤치마크. KMMLU-Redux와 함께 2025년 LG AI연구원이 공개한 전문가급 한국어 …
KMMLU-Redux
기존 KMMLU를 재구성한 벤치마크. 한국 국가기술자격 시험 기반 2,587문항으로 정답 유출·오류·오염을 수작업 검수로 제거해 신뢰성을 높였다…
KMMMU
한국 문화·제도 맥락의 멀티모달 이해를 평가하는 네이티브 한국어 벤치마크. 9개 학문 분야와 9개 시각 유형의 시험 문항 3,466개, 한국 특…
KoALa-Bench
대규모 오디오 언어모델의 한국어 음성 이해와 음성 입력 충실도를 평가하는 벤치마크. 음성 인식·번역·질의응답·지시 이행과 두 종류의 음성 충실도…
KoBALT
한국어 통사·의미·화용·음운·형태론의 24개 현상을 평가하는 전문가 작성 700문항 벤치마크.…
KoBEST
전문 한국어 언어학자가 설계한 5개 한국어 다운스트림 태스크로 구성된 벤치마크. 고급 한국어 언어 지식을 요구하며, 사람이 직접 주석·검수하여 …
KoEVD
한국어 대화형 AI의 유해성·안전 응답·전략·도구 행동을 단계별로 평가하는 KETI 안전성 벤치마크.…
KOFFVQA
한국어 시각언어모델(VLM)을 객관적으로 평가하는 자유형식 VQA 벤치마크. 이미지와 채점 기준이 짝지어진 275개 문항으로 VLM 성능을 세밀…
KOpenAudioBench
공개 음성 질의응답 자료를 한국어로 이전해 SpeechLM의 한국어 듣기·질의응답 성능을 평가하는 벤치마크.…
Korean Contract Derivation Benchmark
한국어 계약 문서 RAG에서 답을 가리는 관용 표현과 산술 관계 도출 실패를 분리해 측정하는 240문항 평가. 직접 제시(disambiguate…
KorNLI and KorSTS
한국어 자연어추론(NLI)과 의미적 텍스트 유사도(STS)를 위한 벤치마크 데이터셋. Kakao Brain이 공개했으며, 학습셋은 기계번역, 검…
KoViDoRe
표·그림·다단 편집과 여러 페이지의 증거 결합을 포함하는 한국어 시각 문서 검색 벤치마크. 공공 문서 기반의 다양한 질의 유형으로 멀티모달 검색…
KRETA
15개 영역과 26개 이미지 유형의 한국어 텍스트 중심 VQA 2,577문항으로 시각적 읽기와 다단계 추론을 평가한다.…
KVoiceBench
한국어 음성 질의응답 능력을 평가하도록 공개 영어 SpokenQA 벤치마크를 한국어 음성으로 변환·검수한 벤치마크.…
LogicKor
한국어 언어모델의 다분야 사고력을 측정하는 멀티턴 벤치마크. 추론·수학·글쓰기·코딩·이해·국어(문법) 등 6개 카테고리 42개 멀티턴 프롬프트로…
NOLLI
영어와 한국어 사이의 추론 성능 격차가 어디서 발생하는지 진단하는 난이도 보정 퍼즐 벤치마크. 직접 번역, 한글 자모 기반 문자 체계 변형, 한…
Open Ko-LLM Leaderboard (Ko-H5)
Upstage와 한국지능정보사회진흥원(NIA)이 2023년 개설한 한국어 LLM 평가 리더보드. 영어 Open LLM Leaderboard를 미…
Q-CARE
정답 참조 없이 검색의 질의 커버리지와 생성 답변 주장의 검증 가능성을 평가하는 RAG 벤치마크. 검색기에는 C-Prec@k·C-nDCG@k, …
RouterBench Korean Translation
모델 라우팅 성능을 한국어 프롬프트로 평가할 수 있도록 RouterBench를 번역한 벤치마크. 0-shot·5-shot 조건과 원본의 86개 …
Surromind Korean RAG QA Benchmark
한국어 RAG의 검색 품질(hit@k)과 생성 품질(F1·BERTScore)을 함께 측정하는 벤치마크. 위키백과 기반 1,000개 QA와 1,3…
XL-SafetyBench
한국 등 10개국 언어·문화 기반의 다국어 LLM 안전성·문화 민감성 벤치마크. 약 5,500개 테스트 케이스로 구성. 에임인텔리전스 주도, K…
τ²-bench Korean Translation
유통·항공·통신 고객지원 환경에서 한국어 에이전트의 대화와 도구사용을 평가하기 위한 τ²-bench 번역판. 278개 태스크와 1,004개 사용…