arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-21 至 2025-11-21 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2506.12115 2025-11-21 cs.CL cs.AI 81%

Eliciting Reasoning in Language Models with Cognitive Tools

通过认知工具激发语言模型的推理能力

Brown Ebouky, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research - Zurich(IBM瑞士研究中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过引入认知工具,提升语言模型在数学推理任务上的性能,探索推理机制并补充训练后方法的作用。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08987 2025-11-21 cs.AI 79%

Towards Efficient Multimodal Unified Reasoning Model via Model Merging

通过模型合并实现高效的多模态统一推理模型

Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。

Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20039 2025-11-21 cs.CL cs.LG 62%

AutoJudge: Judge Decoding Without Manual Annotation

AutoJudge: 无需人工标注的判断解码

Roman Garipov, Fedor Velikonivtsev, Ivan Ermakov, Ruslan Svirschevski, Vage Egiazarian, Max Ryabinin

机构 * HSE University(俄罗斯高等经济学院) Yandex IST Austria(国际应用数学研究所) Together AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 AutoJudge通过任务特定的损失性推测解码加速LLM推理,无需人工标注,实现显著速度提升并牺牲少量准确性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16080 2025-11-21 cs.PL cs.AI cs.LG 62%

Operon: Incremental Construction of Ragged Data via Named Dimensions

Operon:通过命名维度逐步构建不规则数据

Sungbin Moon, Jiho Park, Suyoung Hwang, Donghyun Koh, Seunghyun Moon, Minhyeong Lee

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Operon通过命名维度形式化方法,实现对不规则数据的逐步构建,提升大规模数据处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2511.15715 2025-11-21 cs.AI cs.LG 81%

Graph-Memoized Reasoning: Foundations Structured Workflow Reuse in Intelligent Systems

图记忆推理:智能系统中结构化工作流重用的基础

Yash Raj Singh

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 图记忆推理通过图结构内存实现推理工作流的重用,旨在提升智能系统中的效率与可重复性。

Comments 5 Pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16292 2025-11-21 cs.AI 79%

Distributed Agent Reasoning Across Independent Systems With Strict Data Locality

跨独立系统的分布式代理推理与严格数据本地性

Daniel Vaughan, Kateřina Vaughan

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于自然语言消息的分布式代理推理系统,通过伪匿名令牌和本地数据查询实现跨组织安全合作,验证了去中心化多代理系统的可行性。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16588 2025-11-21 cs.AI cs.LO 57%

Formal Abductive Latent Explanations for Prototype-Based Networks

基于原型网络的正式归纳性隐式解释

Jules Soria, Zakaria Chihani, Julien Girard-Satabin, Alban Grastien, Romain Xu-Darme, Daniela Cancila

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于原型网络的正式归纳性隐式解释方法,通过形式化方法提升模型可解释性,适用于图像分类任务。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2406.13803 2025-11-21 cs.CL 89%

LLMs as Models for Analogical Reasoning

大型语言模型作为类比推理模型

Sam Musker, Alex Duchnowski, Raphaël Millière, Ellie Pavlick

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本文通过设计新的类比推理任务,探讨了大型语言模型在类比推理中的表现,发现其在某些条件下能匹配人类,但对特定变体反应不同,表明LLMs可能在某些领域提供可能的解释,但无法完全替代人类的类比能力。

Comments The title has been changed from Semantic Structure-Mapping in LLM and Human Analogical Reasoning to LLMs as Models for Analogical Reasoning to improve clarity and accuracy

Journal ref Journal of Memory and Language 145 (2025) 104676

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16369 2025-11-21 eess.SP cs.NI 78%

Reasoning Meets Representation: Envisioning Neuro-Symbolic Wireless Foundation Models

推理与表征的结合:展望神经符号无线基础模型

Jaron Fontaine, Mohammad Cheraghinia, John Strassner, Adnan Shahid, Eli De Poorter

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出神经符号无线基础模型,结合神经网络与符号推理,以解决无线通信中的可解释性、鲁棒性和合规性问题,推动6G网络的智能化发展。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI and ML for Next-Generation Wireless Communications and Networking (AI4NextG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15923 2025-11-21 cs.CV 50%

RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification

RB-FT:基于理由的视频分类微调

Meilong Xu, Di Fu, Jiaxing Zhang, Gong Yu, Jiayu Zheng, Xiaoling Hu, Dongdi Zhao, Feiyang Li, Chao Chen, Yong Cao

机构 * Stony Brook University(石溪大学) ByteDance Inc.(字节跳动公司) Harvard Medical School(哈佛医学院)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 RB-FT通过自动生成的理由提升视频分类性能,无需额外标注,有效提升模型对领域特定视频内容的理解能力。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 14 篇

2511.16635 2025-11-21 cs.CV cs.CL 87%

SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction

SurvAgent: 基于层次化CoT增强的案例库与二元多智能体系统用于多模态生存预测

Guolin Huang, Wenting Chen, Jiaqi Yang, Xinheng Lyu, Xiaoling Luo, Sen Yang, Xiaohan Xing, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) Ant Group(蚂蚁集团)

专题命中 规划推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 SurvAgent通过层次化CoT增强的多智能体系统,整合多模态数据,提升生存预测的可解释性与准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16333 2025-11-21 cs.LG 83%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06190 2025-11-21 cs.CL 83%

Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning

基于置信度的分步模型路由用于高效推理

Sangmook Lee, Dohyung Kim, Hyukhun Koh, Nakyeong Yang, Kyomin Jung

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 STEER通过利用模型内部置信度实现高效的模型路由,减少推理成本并提升准确性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08546 2025-11-21 cs.RO 82%

Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback

通过闭环状态反馈接地LLMs用于机器人任务规划

Vineet Bhat, Ali Umut Kaypak, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出BrainBody-LLM方法,通过闭环反馈机制提升LLMs在机器人任务规划中的鲁棒性,实现在复杂任务中的显著性能提升。

Comments Preprint version. Accepted full paper available here: https://advanced.onlinelibrary.wiley.com/doi/10.1002/adrr.202500072

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07686 2025-11-21 cs.RO 78%

Risk Map As Middleware: Towards Interpretable Cooperative End-to-end Autonomous Driving for Risk-Aware Planning

风险地图作为中间件:迈向风险感知的可解释协作端到端自动驾驶

Mingyue Lei, Zewei Zhou, Hongchen Li, Jiaqi Ma, Jia Hu

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education, Tongji University(教育部道路与交通工程重点实验室,同济大学) UCLA Mobility Lab, University of California, Los Angeles(加州大学洛杉矶分校UCLA移动实验室)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出RiskMM框架,通过风险地图中间件提升自动驾驶的可解释性和风险感知规划能力。

Comments IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00588 2025-11-21 cs.LG cs.AI cs.CY 73%

Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation

诊断人工智能手术决策支持中的幻觉风险:一种用于序列验证的连续框架

Dong Chen, Yanzhe Wei, Zonglin He, Guan-Ming Kuang, Canhua Ye, Meiru An, Huili Peng, Yong Hu, Huiren Tao, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院转化医学中心) Department of Orthopaedics & Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院骨科与创伤外科部)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于评估人工智能手术决策支持系统幻觉风险的连续框架,通过多维度测试揭示模型在复杂性下的脆弱性,并强调了增强推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11277 2025-11-21 cs.AI cs.MA 70%

Taming Uncertainty via Automation: Observing, Analyzing, and Optimizing Agentic AI Systems

通过自动化控制不确定性:观察、分析和优化代理AI系统

Dany Moshkovich, Sergey Zeltyn

机构 * IBM Research(IBM研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AgentOps框架,通过自动化管理代理AI系统的不确定性,实现安全、适应性和有效性的运营。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04420 2025-11-21 cs.LG cs.AI cs.CL 67%

KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference

KVTuner: 一种面向层间敏感性的混合精度KV缓存量化方法,用于高效且接近无损的LLM推理

Xing Li, Zeyu Xing, Yiming Li, Linping Qu, Hui-Ling Zhen, Wulong Liu, Yiwu Yao, Sinno Jialin Pan, Mingxuan Yuan

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong(香港中文大学) Huawei Computing Product Line(华为计算产品线)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTuner通过多目标优化实现高效且接近无损的LLM推理,适用于不同模型和约束条件。

Comments Accepted by ICML25. Code: https://github.com/cmd2001/KVTuner

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02054 2025-11-21 cs.RO cs.AI cs.CV cs.LG 62%

RAPID: Robust and Agile Planner Using Inverse Reinforcement Learning for Vision-Based Drone Navigation

RAPID: 基于逆强化学习的鲁棒且敏捷规划器用于基于视觉的无人机导航

Minwoo Kim, Geunsik Bae, Jinwoo Lee, Woojae Shin, Changseung Kim, Myong-Yol Choi, Heejung Shin, Hyondong Oh

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于逆强化学习的无人机高速视觉导航规划器,通过减少环境交互和提升鲁棒性,实现复杂环境中的敏捷飞行。

Comments 18 pages, 11 figures, 58 references, and appendix is included

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06017 2025-11-21 cs.CL 57%

AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search

AgentSwift: 通过价值引导的分层搜索高效设计LLM代理

Yu Li, Lehui Li, Zhihao Wu, Qingmin Liao, Jianye Hao, Kun Shao, Fengli Xu, Yong Li

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 AgentSwift通过价值引导的分层搜索高效设计LLM代理,实现8.34%的性能提升。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16005 2025-11-21 cs.SE cs.AI 57%

InfCode-C++: Intent-Guided Semantic Retrieval and AST-Structured Search for C++ Issue Resolution

InfCode-C++: 基于意图的语义检索与AST结构化搜索用于C++问题解决

Qingao Dong, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 INFCODE-C++ 是首个针对 C++ 的自主系统,通过结合语义代码意图检索和 AST 结构查询,实现端到端的问题解决,其性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16243 2025-11-21 cs.CY 50%

An Agent-Based Simulation of Regularity-Driven Student Attrition: How Institutional Time-to-Live Constraints Create a Dropout Trap in Higher Education

基于常规驱动的学生流失的代理模拟:机构时间到寿命限制如何在高等教育中创造辍学陷阱

H. R. Paz

专题命中 规划推理 :planning(abstract)

AI总结 本文通过代理模拟揭示了行政时间限制如何导致学生辍学,指出规范机制比单纯学术失败更驱动辍学,挑战了行政结构的中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15852 2025-11-21 cs.SE 50%

AI-Enabled Orchestration of Event-Driven Business Processes in Workday ERP for Healthcare Enterprises

基于人工智能的事件驱动业务流程编排在Workday ERP中的应用

Monu Sharma

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出基于人工智能的事件驱动编排框架,用于提升Workday ERP在医疗行业中的流程效率、成本可见性和决策准确性。

Comments 10 Pages, 6 figures , 2 Tables

Journal ref https://www.ijcnis.org/index.php/ijcnis/article/view/8639,2025 , 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13910 2025-11-21 cs.HC cs.ET 50%

Enhancing Decision Support in Construction through Industrial AI

通过工业AI增强建筑决策支持

Parul Khanna, Sameer Prabhu, Ramin Karim, Phillip Tretten

专题命中 规划推理 :planning(abstract)

AI总结 本研究通过探索建筑行业AI解决方案的关键因素,旨在提升决策支持、可使用性和AI解决方案的采用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2511.14210 2025-11-21 cs.CV cs.AI cs.LG 81%

Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution

Orion:一个多模态感知、高级视觉推理与执行的统一视觉代理

N Dinesh Reddy, Dylan Snyder, Lona Kiragu, Mirajul Mohin, Shahrear Bin Amin, Sudeep Pillai

机构 * VLM Run Research(VLM Run研究)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Orion通过整合视觉推理与工具增强执行,实现了多模态感知、高级视觉推理与执行的统一,提升多步骤视觉智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 79%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16430 2025-11-21 cs.CV cs.LG 57%

Graph Neural Networks for Surgical Scene Segmentation

用于手术场景分割的图神经网络

Yihan Li, Nikhil Churamani, Maria Robu, Imanol Luengo, Danail Stoyanov

机构 * Medtronic Digital Technologies(梅奥医疗数字技术公司) UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于图神经网络的手术场景分割方法,结合视觉Transformer和图结构建模,提升分割精度与解剖一致性。

Comments 12 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 10 篇

2511.07979 2025-11-21 cs.AI 88%

Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models

对多步骤法律推理进行基准测试并分析思维链效应在大型语言模型中的表现

Wenhan Yu, Xinbo Lin, Lanxin Ni, Jinhua Cheng, Lei Sha

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) KoGuan School of Law, Shanghai Jiao Tong University, Shanghai, China(上海交通大学KoGuan法学院) School of Criminal Law, China University of Political Science and Law, Beijing, China(中国政法大学刑事法律学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 本文提出MSLR数据集,用于评估大型语言模型在多步骤法律推理中的表现,并通过实验展示自主生成的思维链提示提升了推理质量。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19753 2025-11-21 cs.CL 83%

CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question Answering

CoTKR: 基于链式推理的增强型知识重写用于复杂知识图谱问答

Yike Wu, Yi Huang, Nan Hu, Yuncheng Hua, Guilin Qi, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University) Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室) China Mobile Research Institute(中国移动研究院) Monash University(墨尔本大学) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 CoTKR通过链式推理增强知识重写方法,提升复杂知识图谱问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16331 2025-11-21 cs.CL 79%

Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement

将自我修正纳入大语言模型推理强化

Jiashu Yao, Heyan Huang, Shuang Zeng, Chuwei Luo, WangJie You, Jie Tang, Qingsong Liu, Yuhang Guo, Yangyang Kang

机构 * ByteDance China(字节跳动中国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出自我修正框架,通过重写推理文本提升大语言模型的内部推理质量,实验表明其在准确性与推理长度权衡上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏