NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap

AIM Intelligence · KT Corp. · Sionic AI · Lablup · Hankuk University of Foreign Studies · HAERAE LAB · arXiv · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

절차적으로 생성한 15개 퍼즐 유형, 25개 태스크, 7,500개 문항으로 영어와 한국어 사이의 추론 성능 격차를 진단한다. 직접 번역 문제에서는 언어 자체의 비용이 크지 않았지만 문자 체계 의존 과제에서는 최대 68.7%p의 격차가 관찰됐으며, 구조적 크기가 실제 난이도를 안정적으로 대변하지 못함을 보였다.

arXiv
2608.04397
원문
https://arxiv.org/abs/2608.04397

관련 항목

출처 및 검증

마지막 검증일: 2026-08-10

✎ 정보 수정 제안