SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization
ETRI · Seoul National University · University of Maryland · Amazon Web Services · EMNLP 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
Lean 자동정형화 결과가 원문 수학 명제와 의미적으로 일치하는지를 보조 명제의 양방향 함의로 판정하는 SA-Pass를 제안한다. 대학원·연구 수준 8개 분야 178문제로 ShadowBench를 구성했으며, 6개 에이전트 설정의 출력에서 전문가 판단과 98.8% 일치한다고 보고한다.
- arXiv
- 2608.29270
- 원문
- https://arxiv.org/abs/2608.29270
관련 항목
출처 및 검증
- [paper] https://arxiv.org/abs/2608.29270
- [github] https://github.com/ldilab/shadowbench
마지막 검증일: 2026-09-01