SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

ETRI · Seoul National University · University of Maryland · Amazon Web Services · EMNLP 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Lean 자동정형화 결과가 원문 수학 명제와 의미적으로 일치하는지를 보조 명제의 양방향 함의로 판정하는 SA-Pass를 제안한다. 대학원·연구 수준 8개 분야 178문제로 ShadowBench를 구성했으며, 6개 에이전트 설정의 출력에서 전문가 판단과 98.8% 일치한다고 보고한다.

arXiv
2608.29270
원문
https://arxiv.org/abs/2608.29270

관련 항목

출처 및 검증

마지막 검증일: 2026-09-01

✎ 정보 수정 제안