arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-04 至 2025-12-04 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2512.03176 2025-12-04 cs.LG cs.AI 84%

Plantain: Plan-Answer Interleaved Reasoning

Plantain: 计划-答案交错推理

Anthony Liang, Jonathan Berant, Adam Fisch, Abhimanyu Goyal, Kalpesh Krishna, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Plantain通过计划-思考-回答的交错推理方式,提升数学推理和编码任务的性能,同时减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03759 2025-12-04 cs.CL cs.AI cs.LG 75%

Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective

从序列层面视角出发的扩散大语言模型原理化强化学习

Jingyang Ou, Jiaqi Han, Minkai Xu, Shaoxuan Xu, Jianwen Xie, Stefano Ermon, Yi Wu, Chongxuan Li

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) Stanford University(斯坦福大学) Lambda, Inc(Lambda公司) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ESPO,一种基于序列级优化的原理化强化学习框架,用于提升扩散大语言模型的生成能力,通过ELBO作为似然代理,显著优于token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07506 2025-12-04 cs.DC cs.AI cs.CL cs.LG cs.SE 67%

Astra: A Multi-Agent System for GPU Kernel Performance Optimization

Astra:一种用于GPU内核性能优化的多智能体系统

Anjiang Wei, Tianran Sun, Yogesh Seenichamy, Hang Song, Anne Ouyang, Azalia Mirhoseini, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

专题命中 数学推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Astra是首个基于LLM的多智能体系统,用于优化GPU内核性能,通过协作生成高效内核并实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03442 2025-12-04 cs.CL 57%

PretrainZero: Reinforcement Active Pretraining

PretrainZero:强化主动预训练

Xingrun Xing, Zhiyuan Fan, Jie Lou, Guoqi Li, Jiajun Zhang, Debing Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaohongshu Inc.(小红书公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PretrainZero通过主动预训练和自监督学习方法,提升通用推理能力,并在多个基准测试中取得显著成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2512.03635 2025-12-04 cs.LO cs.SE 50%

Formal Analysis of the Sigmoid Function and Formal Proof of the Universal Approximation Theorem

对Sigmoid函数的正式分析及通用逼近定理的正式证明

Dustin Bryant, Jim Woodcock, Simon Foster

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。

Comments 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2512.03360 2025-12-04 cs.CL 88%

From Hypothesis to Premises: LLM-based Backward Logical Reasoning with Selective Symbolic Translation

从假设到前提:基于大语言模型的反向逻辑推理与选择性符号翻译

Qingchuan Li, Mingyue Cheng, Zirui Liu, Daoyu Wang, Yuting Zeng, Tongxuan Liu

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本文提出HBLR框架,通过结合自信符号翻译与假设驱动反向推理,提升逻辑推理的准确性和效率。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03272 2025-12-04 cs.AI 83%

When Do Symbolic Solvers Enhance Reasoning in Large Language Models?

符号求解器在大语言模型中增强推理何时有效?

Zhiyuan He, Dingmin Wang

机构 * University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究符号求解器如何在大语言模型中增强推理,发现其在需要有限隐式推理但具有充足搜索空间的问题中表现优异,尤其在约束满足问题中提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03421 2025-12-04 cs.SE 50%

Exploring the Potential and Limitations of Large Language Models for Novice Program Fault Localization

探索大型语言模型在初级程序员故障定位中的潜力与局限性

Hexiang Xu, Hengyuan Liu, Yonghao Wu, Xiaolan Kang, Xiang Chen, Yong Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文评估了LLM在初级程序员故障定位中的性能,发现高级模型在准确性上表现优异,但存在推理过度和计算成本高等问题。

Comments The paper has been accepted for publication in The Journal of Systems & Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03126 2025-12-04 cs.CV 50%

Hierarchical Process Reward Models are Symbolic Vision Learners

层次化过程奖励模型是符号视觉学习者

Shan Zhang, Aotian Chen, Kai Zou, Jindong Gu, Yuan Xue, Anton van den Hengel

机构 * Adelaide AIML(阿德莱德AIML) Ohio State University(俄亥俄州立大学) University of Oxford(牛津大学) Data61 CSIRO(澳大利亚国立科研组织)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种层次化过程奖励模型,通过符号学习提升图表重建、感知和推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 17 篇

2506.05745 2025-12-04 cs.AI cs.LG 88%

SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models

SPRINT: 使推理模型能够实现交错规划与并行执行

Emil Biju, Shayan Talaei, Zhemin Huang, Mohammadreza Pourreza, Azalia Mirhoseini, Amin Saberi

机构 * Stanford University(斯坦福大学) Microsoft(微软) Google(谷歌)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI、cs.LG

AI总结 SPRINT通过动态识别并利用并行化机会,使推理模型在复杂任务中提升效率,减少序列token生成量。

Comments Published at NeurIPS 2025. Emil Biju, Shayan Talaei, and Zhemin Huang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18098 2025-12-04 cs.CL cs.AI 84%

Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL

无需搜索的规划:通过离线目标条件强化学习精炼前沿大语言模型

Joey Hong, Anca Dragan, Sergey Levine

机构 * UC Berkeley(伯克利大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过目标条件价值函数引导LLM推理,实现高效多轮交互规划,优于传统RL微调和提示方法。

Comments Published at NeurIPS 2025; 18 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03955 2025-12-04 cs.AI cs.ET 79%

Benchmark for Planning and Control with Large Language Model Agents: Blocksworld with Model Context Protocol

基于大语言模型代理的规划与控制基准:带有模型上下文协议的积木世界

Niklas Jobs, Luis Miguel Vieira da Silva, Jayanth Somashekaraiah, Maximilian Weigand, David Kube, Felix Gehlhoff

机构 * Institute of Automation Technology, Helmut Schmidt University / University of the Federal Armed Forces Hamburg, Germany(自动化技术研究所,海姆·施密特大学/联邦武装部队大学汉堡,德国) Siemens AG, Nuremberg, Germany(西门子股份公司,纽伦堡,德国)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一个基于大语言模型的规划与控制基准,通过积木世界问题和模型上下文协议,提供五个复杂度类别以评估不同代理架构的性能。

Comments This work has been submitted to IFAC for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03756 2025-12-04 cs.RO 78%

Prediction-Driven Motion Planning: Route Integration Strategies in Attention-Based Prediction Models

基于预测的运动规划:注意力预测模型中的路线整合策略

Marlon Steiner, Royden Wagner, Ömer Sahin Tas, Christoph Stiller

机构 * Institute of Measurement and Control Systems, Karlsruhe Institute of Technology (KIT)(测量与控制系统研究所,卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(信息技术研究所以)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于注意力机制的运动预测模型,通过整合导航信息提升预测与规划任务的性能。

Comments In Proceedings of the IEEE International Conference on Intelligent Transportation Systems (ITSC), Gold Coast, AUSTRALIA, 18-21 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03065 2025-12-04 cs.LG cs.AI cs.MA 73%

Optimizing Life Sciences Agents in Real-Time using Reinforcement Learning

利用强化学习实时优化生命科学代理

Nihir Chadderwala

机构 * Nihir Chadderwala(独立研究者)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种结合AWS Strands Agents与汤普森采样上下文带障的框架,通过用户反馈实时优化生命科学代理的决策策略,提升用户满意度15-30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03913 2025-12-04 cs.RO cs.AI 70%

Hierarchical Vision Language Action Model Using Success and Failure Demonstrations

基于成功与失败示范的分层视觉语言行动模型

Jeongeun Park, Jihwan Yoon, Byungwoo Jeon, Juhan Park, Jinwoo Shin, Namhoon Cho, Kyungjae Lee, Sangdoo Yun, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kim Jaechul Graduate School of AI, KAIST(金在拙人工智能研究生院,韩国科学技术院) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Departmnet of Statistics, Korea University(韩国大学统计系) NAVER AI Lab(NAVER人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 VINE通过分层强化学习框架,利用失败数据提升视觉语言行动模型的鲁棒性和执行能力。

Comments https://vine-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03560 2025-12-04 cs.AI cs.MA 70%

Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks

原因-计划-行动:一种监督ReAct执行器的推理-规划器用于复杂企业任务

Gianni Molinari, Fabio Ciravegna

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 RP-ReAct通过分离战略规划与低层执行,提升企业复杂任务处理的可靠性和效率。

Comments 11 pages, 1 figure, 2 tables, Workshop AAAI 2026 agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03111 2025-12-04 cs.CR 67%

Les Dissonances: Cross-Tool Harvesting and Polluting in Pool-of-Tools Empowered LLM Agents

Les Dissonances:池中工具赋能LLM代理中的跨工具采集与污染

Zichuan Li, Jian Cui, Xiaojing Liao, Luyi Xing

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出了一种新型威胁XTHP,揭示了LLM代理中多工具整合带来的安全风险,并通过Chord工具验证了75%的现实世界工具存在此漏洞。

Comments Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05826 2025-12-04 cs.CV cs.AI cs.LG 62%

From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing

从像素到 prose:推进遥感多模态语言模型

Xintian Sun, Benji Peng, Charles Zhang, Fei Jin, Qian Niu, Junyu Liu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Ming Liu, Xinyuan Song, Yichao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校) Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Purdue University(普渡大学) Emory University(埃默里大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了多模态语言模型在遥感中的应用,分析了其技术基础、挑战及未来发展方向,强调了其在环境监测和灾害响应中的重要作用。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR 57%

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09245 2025-12-04 cs.AI 57%

Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search

木星:通过笔记本和推理时的价值引导搜索增强大语言模型的数据分析能力

Shuocheng Li, Yihao Liu, Silin Du, Wenxuan Zeng, Zhe Xu, Mengyu Zhou, Yeye He, Haoyu Dong, Shi Han, Dongmei Zhang

机构 * Microsoft(微软)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Jupiter通过将数据分析建模为搜索问题,并结合价值模型和节点访问次数,提升大语言模型在多步推理和工具使用方面的性能。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03549 2025-12-04 cs.AI 57%

PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks

PARC:一种自主自反思编码代理,用于稳健执行长周期任务

Yuki Orimo, Iori Kurata, Hodaka Mori, Ryuhei Okuno, Ryohto Sawada, Daisuke Okanohara

机构 * PARC

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 PARC是一种自主自反思编码代理,通过自我评估和反馈机制实现长周期任务的稳健执行,展示了AI在自主科学分析中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03293 2025-12-04 cs.AI q-bio.NC 57%

Prior preferences in active inference agents: soft, hard, and goal shaping

主动推断代理中的先验偏好:软、硬和目标塑造

Filippo Torresan, Ryota Kanai, Manuel Baltieri

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了主动推断代理中偏好分布的定义方式,探讨了硬/软目标和目标塑造对导航任务性能的影响。

Comments 41 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00882 2025-12-04 cs.CV cs.AI 57%

Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints

看、复述、然后回答:通过自动生成的知识提示提升VLM性能

Xisheng Feng

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过自动生成的知识提示提升VLM性能,采用模块化设计减少幻觉,实现精准农业中杂草识别准确率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03722 2025-12-04 cs.NI 50%

Tutorial on Large Language Model-Enhanced Reinforcement Learning for Wireless Networks

无线网络中增强型强化学习教程:大型语言模型

Lingyi Cai, Wenjie Fu, Yuxi Huang, Ruichen Zhang, Yinqiu Liu, Jiawen Kang, Zehui Xiong, Tao Jiang, Dusit Niyato, Xianbin Wang, Shiwen Mao, Xuemin Shen

专题命中 规划推理 :reasoning(abstract)

AI总结 本文介绍了利用大型语言模型增强无线网络强化学习的方法,涵盖分类框架、角色功能及应用场景,探讨未来发展方向。

Comments 30 pages, 12 figures, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 50%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 规划推理 :planning(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03166 2025-12-04 cs.RO cs.CV 50%

Multi-Agent Reinforcement Learning and Real-Time Decision-Making in Robotic Soccer for Virtual Environments

多智能体强化学习与虚拟环境中的实时决策在机器人足球中的应用

Aya Taourirte, Md Sohag Mia

机构 * Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种统一的多智能体强化学习框架,通过分层强化学习和均值场理论,提升了机器人足球中的实时决策与协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 7 篇

2512.03284 2025-12-04 cs.CV 67%

SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding

SpatialReasoner: 大规模3D场景理解中的主动感知

Hongpei Zheng, Shijie Li, Yanran Li, Hujun Yin

机构 * University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(信息与通信研究 institute(I2R),A*STAR,新加坡) University of Bedfordshire(贝德福德郡大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 SpatialReasoner通过主动感知框架实现大规模3D场景理解,采用两阶段训练策略在H$^2$U3D数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03087 2025-12-04 cs.MM cs.AI 57%

When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI

当有害内容被伪装时:通过CamHarmTI揭示LVLMs的感知失败

Yanhui Li, Qi Zhou, Zhihong Xu, Huizhong Guo, Wenhai Wang, Dongxia Wang

机构 * Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CamHarmTI基准,揭示LVLMs在识别伪装有害内容时的感知不足,并通过微调提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03939 2025-12-04 cs.CV cs.RO 50%

MUT3R: Motion-aware Updating Transformer for Dynamic 3D Reconstruction

MUT3R:面向动态3D重建的运动感知更新Transformer

Guole Shen, Tianchen Deng, Xingrui Qin, Nailin Wang, Jianyu Wang, Yanbo Wang, Yongtao Chen, Hesheng Wang, Jingchuan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MUT3R通过利用预训练Transformer的运动线索,在无需训练的情况下抑制动态内容,提升动态场景下的3D重建时间一致性和姿态鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05661 2025-12-04 cs.CV 50%

Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation

基于语言的面向对象两阶段方法用于场景图预见

Xiaomeng Zhu, Changwei Wang, Haozhe Wang, Xinyu Liu, Fangzhen Lin

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。

详情

展开后加载摘要…

URL PDF HTML 收藏