As large language models (LLMs) move from standalone assistants into agentic workflows, evaluation must extend beyond scalar leaderboard accuracy to account …
机构:Los Alamos
来源:arXiv 2610.00954 | AI4Papers 论文推荐平台