arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-10 至 2025-12-10 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2512.05033 2025-12-10 cs.CL cs.AI cs.LG 82%

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

套利:通过优势感知投机实现高效推理

Monishwaran Maheswaran, Rishabh Tiwari, Yuezhou Hu, Kerem Dilmen, Coleman Hooper, Haocheng Xi, Nicholas Lee, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * UC Berkeley(伯克利大学) Apple(苹果公司) ICSI(信息与计算科学研究所) LBNL(劳伦斯伯克利国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Arbitrage通过动态路由机制提升步骤级投机生成的效率和准确性,减少推理延迟。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17114 2025-12-10 cs.AI 79%

Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models

数学证明作为检验标准:揭示先进大推理模型的失败模式

Dadi Guo, Jiayu Liu, Zhiyuan Fan, Zhitao He, Haoran Li, Yuxin Li, Yumeng Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过引入RFMDataset揭示大推理模型在数学证明中的失败模式,发现其在严谨性和正确性上的不足,需进一步提升逻辑训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07871 2025-12-10 quant-ph cs.AI 79%

Quantum Circuit Reasoning Models: A Variational Framework for Differentiable Logical Inference

量子电路推理模型:一种用于可微逻辑推理的变分框架

Andrew Kiruluta

机构 * UC Berkeley, School of Information(伯克利大学信息学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 量子电路推理模型通过变分框架实现可微逻辑推理,将量子力学操作映射到推理原语,用于科学、生物医学和化学领域的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03817 2025-12-10 cs.AI cs.MA 57%

Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning

学习 deliberation:基于多智能体强化学习的元策略协作用于代理语言模型

Wei Yang, Jesse Thomason

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出元策略推理框架MPDF,结合SoftRankPO算法,通过学习动态推理策略提升多智能体LLM在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2512.08026 2025-12-10 cs.AI 79%

Toward an AI Reasoning-Enabled System for Patient-Clinical Trial Matching

迈向基于AI推理的患者-临床试验匹配系统

Caroline N. Leach, Mitchell A. Klusty, Samuel E. Armstrong, Justine C. Pickarski, Kristen L. Hankins, Emily B. Collier, Maya Shah, Aaron D. Mullen, V. K. Cody Bumgardner

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于AI推理的患者-临床试验匹配系统,通过结构化评估和可解释推理链,提升匹配效率与安全性。

Comments 10 pages, 2 figures, submitted to AMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11180 2025-12-10 cs.SE cs.AI cs.ET cs.SY eess.SY 57%

Beyond Formal Semantics for Capabilities and Skills: Model Context Protocol in Manufacturing

超越能力与技能的形式语义:制造业中的模型上下文协议

Luis Miguel Vieira da Silva, Aljosha Köcher, Felix Gehlhoff

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出基于模型上下文协议(MCP)的制造业能力与技能建模方法,通过标准化接口实现与LLM的高效交互,提升工业自动化灵活性。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 1 篇

2502.15365 2025-12-10 cs.HC cs.AI cs.CL cs.CY 73%

Identifying Features that Shape Perceived Consciousness in Large Language Model-based AI: A Quantitative Study of Human Responses

识别塑造大语言模型基AI中感知意识的特征:人类反应的定量研究

Bongsu Kang, Jundong Kim, Tae-Rim Yun, Hyojin Bae, Chang-Eop Kim

机构 * Department of Physiology Gachon University College of Korean Medicine(生理学系高丽大学医学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析人类对AI意识感知的特征,揭示了元认知自我反思和情绪表达对意识感知的影响,同时指出知识过度强调会降低感知意识。

Comments 11 pages, 3 figures, 4 tables

Journal ref Computers in Human Behavior Reports, Volume 21 (2026) 100901

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 13 篇

2512.08300 2025-12-10 cs.AI 85%

rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection

rSIM: 通过强化策略注入激励大语言模型的推理能力

Sijia Chen, Baochun Li, Di Niu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Toronto(多伦多大学) University of Alberta(阿尔伯塔大学)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.AI

AI总结 rSIM通过强化策略注入机制,使LLM具备推理能力,并在实验中显著提升模型性能。

Comments 14 pages, 6 figures. Accepted to the ACL ARR July

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08480 2025-12-10 cs.CL 83%

Soft Inductive Bias Approach via Explicit Reasoning Perspectives in Inappropriate Utterance Detection Using Large Language Models

通过显式推理视角的软归纳偏见方法用于大型语言模型中的不当言论检测

Ju-Young Kim, Ji-Hong Park, Se-Yeon Lee, Sujin Park, Gun-Woo Kim

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究提出一种通过显式推理视角的软归纳偏见方法,用于提升大型语言模型在不当言论检测中的准确性和一致性。

Comments in Korean language, Published in the Proceedings of the 37th Annual Conference on Human and Language Technology, 2025, pp. 714-719. (English translation assisted by GPT)

Journal ref Proceedings of the 37th Annual Conference on Human and Language Technology, 2025, pp. 714-719

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08169 2025-12-10 cs.CR cs.AI 83%

Information-Dense Reasoning for Efficient and Auditable Security Alert Triage

信息密集推理用于高效且可审计的安全警报分拣

Guangze Zhao, Yongzheng Zhang, Changbo Tian, Dan Xie, Hongri Liu, Bailing Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) CHANG AN communication technology Co., Ltd.(CHANG AN通信技术有限公司) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Industrial Network Security(山东省工业网络信息安全重点实验室)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 AIDR通过混合云边框架和信息密度优化,实现高效且可审计的安全警报分拣,减少40.6%的延迟并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08659 2025-12-10 cs.CL cs.LG 62%

An Agentic AI System for Multi-Framework Communication Coding

多框架通信编码的代理AI系统

Bohao Yang, Rui Yang, Joshua M. Biro, Haoyuan Wang, Jessica L. Handley, Brianna Richardson, Sophia Bessias, Nicoleta Economou-Zavlanos, Armando D. Bedoya, Monica Agrawal, Michael M. Zavlanos, Anand Chowdhury, Raj M. Ratwani, Kai Sun, Kathryn I. Pollak, Michael J. Pencina, Chuan Hong

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出MOSAIC系统,通过多代理架构实现多框架临床沟通编码,达到高F1得分,尤其在患者行为识别上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08286 2025-12-10 cs.SE cs.AI cs.LG 62%

Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework

通过SolidGPT赋能智能应用开发:一种边缘-云混合AI代理框架

Liao Hu, Qiteng Wu, Ruoyu Qi

机构 * University of Illinois, Chicago, USA(伊利诺伊大学芝加哥分校) North Carolina State University, North Carolina, USA(北卡罗来纳州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SolidGPT是一种结合边缘计算与云计算的AI代理框架,通过交互式代码查询、自动化项目生成和人机协作提升开发者生产力,适用于智能移动和软件工程领域。

Journal ref Advances in Engineering Innovation 16.7 (2025): 86-92

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08596 2025-12-10 cs.CY cs.AI 57%

Examining Student Interactions with a Pedagogical AI-Assistant for Essay Writing and their Impact on Students Writing Quality

考察学生与教学型AI助手在议论文写作中的互动及其对学生写作质量的影响

Wicaksono Febriantoro, Qi Zhou, Wannapon Suraworachet, Sahan Bulathwela, Andrea Gauthier, Eva Millan, Mutlu Cukurova

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究探讨学生与教学型AI助手在议论文写作中的互动及其对写作质量的影响,发现主动写作和反馈共享更有效,建议教师鼓励学生主动参与并优化AI系统设计。

Comments 17 pages, 3 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08536 2025-12-10 cs.AI 57%

Principles2Plan: LLM-Guided System for Operationalising Ethical Principles into Plans

Principles2Plan: 伦理原则引导的计划系统

Tammy Zhong, Yang Song, Maurice Pagnucco

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 Principles2Plan通过人机协作生成基于伦理原则的可操作规则,提升自动规划的伦理实用性

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08145 2025-12-10 cs.RO cs.AI 57%

Chat with UAV -- Human-UAV Interaction Based on Large Language Models

与无人机对话——基于大语言模型的人机交互

Haoran Wang, Zhuohang Chen, Guang Li, Bo Ma, Chuanghuang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的双智能体HUI框架,通过任务规划和执行智能体提升无人机交互的个性化和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08131 2025-12-10 cs.CL 57%

Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward

语言模型中用于强化学习的通用对抗后缀

Sampriti Soor, Suklav Ghosh, Arijit Sur

机构 * Center for Intelligent Cyber Physical Systems, Indian Institute of Technology Guwahati, India(智能网络物理系统中心,印度理工学院古瓦哈提) Department of Computer Science and Engineering, Indian Institute of Technology Guwahati, India(计算机科学与工程系,印度理工学院古瓦哈提)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的通用对抗后缀生成方法,通过校准交叉熵提升迁移性,并在多个NLP数据集上验证了其有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07094 2025-12-10 cs.AI 57%

VIGIL: A Reflective Runtime for Self-Healing Agents

VIGIL:一种用于自愈代理的反射性运行时

Christopher Cruz

机构 * Christopher Cruz

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 VIGIL是一种反射性运行时,通过自我诊断和修复机制提升代理系统的可靠性和自我维护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04207 2025-12-10 cs.AI 57%

Orchestrator Multi-Agent Clinical Decision Support System for Secondary Headache Diagnosis in Primary Care

协调多代理临床决策支持系统用于初级医疗二次头痛诊断

Xizhi Wu, Nelly Estefanie Garduno-Rapp, Justin F Rousseau, Mounika Thakkallapally, Hang Zhang, Yuelyu Ji, Shyam Visweswaran, Yifan Peng, Yanshan Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于多代理架构的临床决策支持系统,通过协调机制提升继发性头痛诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02581 2025-12-10 cond-mat.mtrl-sci cs.LG 57%

Automated Construction of Artificial Lattice Structures with Designer Electronic States

自动化构建人工晶格结构以实现设计电子态

Ganesh Narasimha, Mykola Telychko, Wooin Yang, Arthur P. Baddorf, P. Ganesh, An-Ping Li, Rama Vasudevan

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于强化学习的自动化方法,用于在铜基底上操控CO分子构建人工晶格,实现原子级精确的电子态设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08179 2025-12-10 q-fin.ST cs.AI 57%

RAG-IT: Retrieval-Augmented Instruction Tuning for Automated Financial Analysis -- A Case Study for the Semiconductor Sector

RAG-IT:基于检索的指令微调用于自动化财务分析——半导体行业案例研究

Hai-Thien To, Tien-Cuong Bui, Van-Duc Le

机构 * University of Transport Technology(运输技术大学) Arontier Co., Ltd.(阿隆蒂尔公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 RAG-IT通过检索增强和指令微调,提升LLM在半导体行业财务分析中的性能,实现与商业系统相当的财务报告生成能力。

Comments We updated title, abstract and added more details in experiment section. We also updated the list of authors

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2512.08860 2025-12-10 cs.CV 78%

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性

Amit Bendkhale

机构 * Amit Bendkhale(独立研究者)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。

Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08889 2025-12-10 cs.CV cs.AI 77%

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

无标签,无问题:利用多模态验证器训练视觉推理器

Damiano Marsili, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。

Comments Project webpage: https://glab-caltech.github.io/valor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO 67%

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07845 2025-12-10 cs.SD cs.AI eess.AS 57%

AudioScene: Integrating Object-Event Audio into 3D Scenes

AudioScene: 将对象事件音频整合到3D场景中

Shuaihang Yuan, Congcong Wen, Muhammad Shafique, Anthony Tzes, Yi Fang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2512.00831 2025-12-10 cs.LG 83%

ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning

ReJump:一种用于分析和改进LLM推理的树跳表示

Yuchen Zeng, Shuibai Zhang, Wonjun Kang, Shutong Wu, Lynnix Zou, Ying Fan, Heeju Kim, Ziqian Lin, Jungtaek Kim, Hyung Il Koo, Dimitris Papailiopoulos, Kangwook Lee

机构 * UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) FuriosaAI Seoul National University(首尔国立大学) KRAFTON

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.LG

AI总结 ReJump通过树跳表示分析和改进LLM推理,揭示不同任务下的推理行为差异及学习策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08079 2025-12-10 cs.IR 50%

Leveraging Machine Learning and Large Language Models for Automated Image Clustering and Description in Legal Discovery

利用机器学习和大语言模型实现法律发现中的自动化图像聚类与描述

Qiang Mao, Fusheng Wei, Robert Neary, Charles Wang, Han Qin, Jianping Zhang, Nathaniel Huber-Fliflet

专题命中 测试时计算 :chain-of-thought(abstract)

AI总结 本文提出利用机器学习和大语言模型实现法律发现中自动化图像聚类与描述,通过比较不同采样策略、提示技术和生成方法,提升大规模图像数据处理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 5 篇

2511.10240 2025-12-10 cs.AI cs.CL 81%

ProgRAG: Hallucination-Resistant Progressive Retrieval and Reasoning over Knowledge Graphs

ProgRAG: 一种抗幻觉的逐步检索和知识图谱推理框架

Minbae Park, Hyemin Yang, Jeonghyun Kim, Kunsoo Park, Hyunjoon Kim

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ProgRAG通过分解复杂问题并逐步扩展推理路径,提升知识图谱问答的可靠性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08645 2025-12-10 cs.CV 75%

Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation

图像生成链:迈向可监控和可控的图像生成

Young Kyung Kim, Oded Schlesinger, Yuzhou Zhao, J. Matias Di Martino, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Universidad Católica del Uruguay(乌拉圭天主教大学) Apple(苹果公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 CoIG框架通过将图像生成过程分解为可监控的步骤,提升图像生成的可控性和可解释性。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17923 2025-12-10 cs.LG cs.AI 62%

Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning

奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习

Jingyu Xing, Chenwei Tang, Xinyu Liu, Deng Xiong, Shudong Huang, Wei Ju, Jiancheng Lv, Ziyue Qiao

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Great Bay University(大湾大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06301 2025-12-10 cs.AI 57%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏