arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-04-27 至 2026-04-27 共收录 2
2604.22597 2026-04-27 cs.AI

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

重新思考数学推理评估:一种超越符号刚性的LLM-as-a-Judge框架

Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky

机构 * Tel-Aviv University(特拉维夫大学) Amazon Prime Video(亚马逊Prime视频) Ben-Gurion University(巴内尔·戈里翁大学)

AI总结 本文提出一种稳健灵活的LLM-as-a-Judge框架,用于评估模型生成答案的准确性,超越传统符号数学比较的局限,提升数学推理评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏