Scientific reasoning benchmarks typically evaluate large language models (LLMs) using final-answer accuracy. However, a correct answer does not necessarily d…
机构:阿里
来源:arXiv 2608.02442 | AI4Papers 论文推荐平台