arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-17 至 2025-12-17 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2511.01170 2025-12-17 cs.AI 83%

DART: Difficulty-Adaptive Reasoning Truncation for Efficient Large Language Models

DART: 为高效大语言模型的难度自适应推理截断

Ruofan Zhang, Bin Xia, Zhen Cheng, Cairen Jian, Minglun Yang, Ngai Wong, Yuan Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CSE Department, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Research and Development Department, SIMMIR Tech(Simmir科技研发部) School of Information Science and Technology, Xiamen University Tan Kah Kee College(厦门大学信息科学与技术学院) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 DART通过自适应调整推理长度提升大语言模型效率,实现81.2%的推理截断和5.33倍的计算加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13706 2025-12-17 cs.LG cs.CL 82%

Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training

通过混合训练缓解数学推理微调中的灾难性遗忘

John Graham Reynolds

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出混合训练策略,通过交错数学和NLI任务来缓解微调中的灾难性遗忘,同时保持数学性能和NLI准确性。

Comments 11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13978 2025-12-17 cs.AI 79%

Evaluating Frontier LLMs on PhD-Level Mathematical Reasoning: A Benchmark on a Textbook in Theoretical Computer Science about Randomized Algorithms

评估前沿大语言模型在博士级数学推理中的表现:一个关于随机算法理论教材的基准测试

Yang Cao, Yubin Chen, Xuyang Guo, Zhao Song, Song Yue, Jiahao Zhang, Jiale Zhao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了前沿大语言模型在博士级数学推理中的表现,通过随机算法教材的基准测试,发现顶级模型在准确性上表现优异,但可靠性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14237 2025-12-17 cs.CL cs.LG 79%

Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets

向上爬,记忆下降:低成本微调与侧边网络

Estelle Zheng, Nathan Cerisara, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10966 2025-12-17 physics.ed-ph 50%

Can Large Language Models Correctly Interpret Equations with Errors?

大型语言模型能否正确解释有误的方程?

Lachlan McGinness, Peter Baumgartner

专题命中 数学推理 :reasoning(abstract)

AI总结 本文研究了大型语言模型在解析学生输入中存在错误的方程时的准确性,发现开源模型无法达到预期效果,并提出未来改进方向。

Comments Published in Physics Review Physics Education Research here: https://journals.aps.org/prper/abstract/10.1103/v8f8-s11v

Journal ref Phys. Rev. Phys. Educ. Res. 21, 020155 Published 15 December, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2512.11827 2025-12-17 cs.CY cs.AI cs.CV 70%

Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?

利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?

Milad Malekzadeh, Magdalena Biernacka, Elias Willberg, Jussi Torkko, Edyta Łaszkiewicz, Tuuli Toivonen

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14673 2025-12-17 cs.SE 50%

Reconsidering Conversational Norms in LLM Chatbots for Sustainable AI

重新审视LLM聊天机器人中的会话规范以实现可持续AI

Ronnie de Souza Santos, Cleyton Magalhães, Italo Santos

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文探讨了LLM聊天机器人中会话规范对可持续性的影响,指出交互行为、对话模式、用户习惯及上下文积累是影响系统能耗的关键因素,需重新设计交互方式以实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21230 2025-12-17 cs.LO 50%

Kimina Lean Server: A High-Performance Lean Server for Large-Scale Verification

Kimina Lean Server: 一种高性能的大型验证用Lean服务器

Marco Dos Santos, Hugues de Saxcé, Haiming Wang, Ran Wang, Mantas Baksys, Mert Unsal, Junqi Liu, Zhengying Liu, Jia Li

专题命中 代码与定理证明 :verifier(abstract)

AI总结 Kimina Lean Server通过高效的并行处理和缓存机制,提升了大规模验证和数据提取的效率,适用于强化学习管道中的高性能验证任务。

Comments Accepted to the 5th MATH-AI Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2512.14474 2025-12-17 cs.AI 85%

Model-First Reasoning LLM Agents: Reducing Hallucinations through Explicit Problem Modeling

基于模型的推理语言模型代理:通过显式问题建模减少幻觉

Annu Rana, Gaurav Kumar

机构 * Stanford AI Professional Program(斯坦福AI专业项目) IESE EMBA Program(IESE EMBA项目)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于模型的推理方法,通过显式问题建模减少LLM在复杂规划任务中的幻觉和不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14048 2025-12-17 cs.AI 85%

Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation

具有动态路由的意图链式思维提示法用于代码生成

Shen Li, Li Huang, Shaoxiong Zhan, Weifeng Sun, Tao Yin, Zhongxin Liu, Meng Yan

专题命中 逻辑推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 RoutingGen通过动态路由策略优化代码生成,结合少样本提示与结构化推理策略ICoT,提升生成效率与质量。

Comments Accepted at AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12012 2025-12-17 cs.CV cs.AI cs.CL cs.RO 62%

Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus

语义驱动:通过开放词汇锚定和神经符号视觉语言共识民主化长尾数据整理

Antonio Guillen-Perez

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Semantic-Drive通过开放词汇锚定和神经符号视觉语言共识,提升自动驾驶中长尾数据整理的效率与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18054 2025-12-17 cs.IR cs.AI cs.LG 62%

A Knowledge Graph-based Retrieval-Augmented Generation Framework for Algorithm Selection in the Facility Layout Problem

基于知识图谱的检索增强生成框架用于设施布局问题中的算法选择

Nikhil N S, Bilal Muhammed, Soban Babu Beemaraj, Amol Dilip Joshi

机构 * Indian Institute of Science(印度科学学院) TCS Research and Innovation(塔塔咨询公司研究与创新)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于知识图谱的检索增强生成框架,用于自动推荐设施布局问题中的算法选择,通过多维检索机制和大语言模型实现数据驱动的算法推荐。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 10 篇

2509.17116 2025-12-17 cs.AI 83%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14448 2025-12-17 cs.CR cs.AI 79%

Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space

通过隐蔽的风格迁移进行LLM代理的推理风格污染:过程级攻击与运行时监控在RSV空间中

Xingfu Zhou, Pengfei Wang

机构 * college of computer science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出推理风格污染攻击,通过隐蔽方式改变LLM代理的推理风格,导致性能下降并绕过内容过滤,提出运行时监控方法应对该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12791 2025-12-17 cs.MA cs.AI cs.SE 70%

Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems

超越任务完成:评估智能体AI系统的框架

Sreemaee Akshathala, Bassam Adnan, Mahisha Ramesh, Karthik Vaidhyanathan, Basil Muhammed, Kannan Parthasarathy

机构 * SERC, IIIT-Hyderabad(IIIT-海得拉巴的SERC) MontyCloud Inc(MontyCloud公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一个端到端的智能体评估框架,旨在评估智能体AI系统的行为,而不仅仅是任务完成度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13733 2025-12-17 cs.LG cs.AI 62%

Low-Rank Compression of Language Models via Differentiable Rank Selection

通过可微分秩选择实现语言模型的低秩压缩

Sidhant Sundrani, Francesco Tudisco, Pasquale Minervini

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLRC通过可微分方法实现语言模型的低秩压缩,在无需微调的情况下提升压缩率与下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12045 2025-12-17 cs.HC cs.AI 57%

AI as a Teaching Partner: Early Lessons from Classroom Codesign with Secondary Teachers

AI作为教学伙伴:与中学教师课堂共同设计的初步经验

Alex Liu, Lief Esbenshade, Shawon Sarkar, Zewei Tian, Min Sun, Zachary Zhang, Thomas Han, Yulia Lapicus, Kevin He

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究探讨了AI在中学课堂中的应用,通过教师与AI的共同设计,评估AI在教学中的作用及改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14138 2025-12-17 cs.HC cs.AI 57%

LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation

LAPPI:基于LLM的偏好驱动问题实例化交互优化

So Kuroki, Manami Nakagawa, Shigeo Yoshida, Yuki Koyama, Kozuno Tadashi

机构 * Sakana AI University of California, Davis(加州大学戴维斯分校) OMRON SINIC X Corporation(OMRON SINIC X公司) University of Tokyo(东京大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LAPPI通过LLM辅助用户将模糊偏好转化为明确的优化问题,提升终端用户在旅行计划等任务中的问题实例化效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13860 2025-12-17 cs.SE cs.AI 57%

Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors

通过分层大语言模型作为编辑器进行工具调用的验证引导上下文优化

Henger Li, Shuangjie You, Flavio Di Palo, Yiyue Qian, Ayush Jain

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过分层LLM作为编辑器,验证引导上下文优化提升工具调用的准确性和泛化能力。

Comments Accepted by AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13747 2025-12-17 cs.CV cs.AI 57%

Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making

为何文本占上风:视觉可能损害多模态医疗决策制定

Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan

机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) University of Pittsburgh(匹兹堡大学) NC State University(北卡罗来纳州立大学) University of Washington(华盛顿大学) University of Maryland(马里兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。

Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16097 2025-12-17 cs.AI 57%

Developing Large Language Models for Clinical Research Using One Million Clinical Trials

利用一百万项临床试验开发大型语言模型用于临床研究

Zifeng Wang, Jiacheng Lin, Qiao Jin, Junyi Gao, Jathurshan Pradeepkumar, Pengcheng Jiang, Zhiyong Lu, Jimeng Sun

机构 * Usher Institute, Edinburgh Medical School, University of Edinburgh(埃丁堡大学埃丁堡医学院usher研究所) Health Data Research UK(英国健康数据研究) School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算与数据科学学院) Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆内部研究部) Keiji AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TrialPanorama,通过整合一百万项临床试验数据,训练出在八个关键临床研究任务中表现优于通用大语言模型的8B LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14336 2025-12-17 cs.CV 50%

Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure

向量棱柱:通过分层语义结构来动画化向量图形

Jooyeol Yun, Jaegul Choo

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种通过分层语义结构来提升向量图形动画质量的框架,通过统计汇总弱预测来恢复语义,从而提高VLMs动画生成的连贯性和准确性。

Comments yeolj00.github.io/personal-projects/vector-prism

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2412.07148 2025-12-17 cs.CV cs.AI cs.CL cs.LG 82%

MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models

MM-PoE:通过多模态模型的排除过程进行多选推理

Sayak Chakrabarty, Souradip Pal

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14257 2025-12-17 cs.CV 78%

Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs

通过概率图增强视觉编程用于视觉推理

Wentao Wan, Kaiyu Wu, Qingyang Ma, Nan Kang, Yunjie Chen, Liang Lin, Keze Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 通过构建概率图解决视觉编程非可微问题,提升视觉推理任务的性能。

Comments 13 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20047 2025-12-17 cs.CV eess.IV 50%

Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis

Med3DVLM: 一种高效的视觉-语言模型用于3D医学图像分析

Yu Xin, Gorkem Can Ates, Kuang Gong, Wei Shao

机构 * University of Florida(佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Med3DVLM通过三个创新提出,实现了高效的3D医学图像分析,显著提升了图像-文本检索、报告生成和视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 5 篇

2507.14417 2025-12-17 cs.AI cs.CL 84%

Inverse Scaling in Test-Time Compute

测试时计算的反比例关系

Aryo Pradipta Gema, Alexander Hägele, Runjin Chen, Andy Arditi, Jacob Goldman-Wetzler, Kit Fraser-Taliente, Henry Sleight, Linda Petrini, Julian Michael, Beatrice Alex, Pasquale Minervini, Yanda Chen, Joe Benton, Ethan Perez

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,延长大型推理模型的推理时间会降低准确性,揭示了测试时计算与性能之间的反比例关系,并指出需通过多样化评估识别和解决推理中的失败模式。

Comments Published in TMLR (12/2025; Featured Certification; J2C Certification), 78 pages

Journal ref Transactions on Machine Learning Research (TMLR); 12/2025; https://openreview.net/forum?id=NXgyHW1c7M

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13930 2025-12-17 cond-mat.mtrl-sci cs.AI cs.CL cs.LG cs.MA 83%

Hierarchical Multi-agent Large Language Model Reasoning for Autonomous Functional Materials Discovery

分层多智能体大语言模型推理用于自主功能材料发现

Samuel Rothfarb, Megan C. Davis, Ivana Matanovic, Baikun Li, Edward F. Holby, Wilton J. M. Kort-Kamp

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。

Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12492 2025-12-17 cs.CV cs.CL 79%

Adaptive Detector-Verifier Framework for Zero-Shot Polyp Detection in Open-World Settings

面向开放世界设置的零样本息肉检测自适应检测-验证框架

Shengkai Xu, Hsiang Lun Kao, Tianxiang Xu, Honghui Zhang, Junqiao Wang, Runmeng Ding, Guanyu Liu, Tianyu Shi, Zhenyu Yu, Guofeng Pan, Ziqian Bi, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Columbia University(哥伦比亚大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Apon AI and Brain-Computer Engineering Research Institute(Apon人工智能与脑机工程研究院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) Faculty of Applied Science and Engineering, University of Toronto(多伦多大学应用科学与工程学院) Faculty of Computer Science and Information Technology, University of Malaya(马来亚大学计算机科学与信息技术学院) Zhaolong Technology(智龙科技) Purdue University(普渡大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 本文提出AdaptiveDetector,通过自适应阈值调整和成本敏感强化学习,实现开放世界中零样本息肉检测,提升召回率并减少假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14442 2025-12-17 cs.CV cs.RO 78%

A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning

A4-Agent: 一种用于零样本 affordance 推理的代理框架

Zixin Zhang, Kanghao Chen, Hanqing Wang, Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) Knowin

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14082 2025-12-17 cs.CL 57%

A Unified Sparse Attention via Multi-Granularity Compression

一种通过多粒度压缩的统一稀疏注意力机制

Siran Liu, Zane Cao, Yongchao He

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 UniSparse通过多粒度压缩和块级选择,实现高效稀疏注意力机制,提升LLM在长上下文理解和推理中的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏