arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 14 篇

2602.00675 2026-02-03 cs.RO cs.HC 78%

Factored Reasoning with Inner Speech and Persistent Memory for Evidence-Grounded Human-Robot Interaction

基于内部言语和持久记忆的因子推理用于证据导向的人机交互

Valerio Belcamino, Mariya Kilina, Alessandro Carfì, Valeria Seidita, Fulvio Mastrogiovanni, Antonio Chella

机构 * Department of Engineering, University of Palermo(帕尔米罗大学工程系) TheEngineRoom, Department of Informatics Bioengineering, Robotics and System Engineering(TheEngineRoom,信息生物工程、机器人与系统工程系)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 JANUS 通过因子推理实现证据导向的人机交互,结合内部言语和持久记忆模块,提升机器人辅助系统的可扩展性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00997 2026-02-03 cs.AI cs.CL cs.LG 75%

Error Taxonomy-Guided Prompt Optimization

误差分类引导的提示优化

Mayank Singh, Vikas Yadav, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ETGPO通过自顶向下方法,利用误差分类指导提示优化,提升模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00632 2026-02-03 cs.IR 75%

Towards Sample-Efficient and Stable Reinforcement Learning for LLM-based Recommendation

面向LLM推荐的高效稳定强化学习

Hongxun Ding, Keqin Bao, Jizhi Zhang, Yi Fang, Wenxin Xu, Fuli Feng, Xiangnan He

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出RISER框架,通过强化学习提升LLM推荐的效率和稳定性,有效解决样本效率低和训练不稳定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01335 2026-02-03 cs.CV cs.AI 74%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Juan Cao, Lin Gao, Chunyu Wang, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02366 2026-02-03 cs.LG cs.AI 62%

ReasonCACHE: Teaching LLMs To Reason Without Weight Updates

ReasonCACHE: 教授大语言模型进行推理而不进行权重更新

Sharut Gupta, Phillip Isola, Stefanie Jegelka, David Lopez-Paz, Kartik Ahuja, Mark Ibrahim, Mohammad Pezeshki

机构 * FAIR at Meta(Meta 的 FAIR) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReasonCACHE通过前缀微调实现无需权重更新的推理学习,在效率和表现上超越传统ICL和IWL方法。

Comments 26 pages, 17 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01171 2026-02-03 cs.AI cs.CL cs.LO 62%

ASP-Bench: From Natural Language to Logic Programs

ASP-Bench: 从自然语言到逻辑程序

Stefan Szeider

机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ASP-Bench通过自然语言到逻辑程序的转换基准,评估了基于ReAct框架的代理方法,揭示了建模难度的多维因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02029 2026-02-03 cs.AI cs.SE 57%

Canonical Intermediate Representation for LLM-based optimization problem formulation and code generation

基于LLM的优化问题建模与代码生成的规范中间表示

Zhongyuan Lyu, Shuoyu Hu, Lujie Liu, Hongxia Yang, Ming LI

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出规范中间表示(CIR)以提升LLM在复杂运营规则下的优化问题建模与代码生成能力,通过多智能体框架实现高精度建模。

Comments 41 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01561 2026-02-03 cs.CV cs.AI 57%

Multimodal UNcommonsense: From Odd to Ordinary and Ordinary to Odd

多模态UNcommonsense:从奇特到普通和从普通到奇特

Yejin Son, Saejin Kim, Dongjun Min, Younjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 多模态UNcommonsense通过R-ICL框架提升模型在非典型场景下的推理能力,实现从奇特到普通和从普通到奇特的转换。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10520 2026-02-03 cs.AI cs.CY 57%

Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment

与规范性单一体制代理告别:GRACE:一种基于原因的神经符号架构,用于安全和道德的人工智能对齐

Felix Jahn, Yannic Muskalla, Lisa Dargasz, Patrick Schramowski, Kevin Baum

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Center for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) Saarland Informatics Campus(萨尔州信息学校区) Computer Science Department, TU Darmstadt(图宾根大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 GRACE是一种基于原因的神经符号架构,用于安全和道德的人工智能对齐,通过分离规范性推理与工具性决策,确保AI代理的行为符合道德规范。

Comments 10 pages, 4 figures, accepted at 2nd Annual Conference of the International Association for Safe & Ethical AI (IASEAI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01630 2026-02-03 cs.CV 50%

Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks

世界模型的研究并非仅仅是将世界知识注入特定任务

Bohan Zeng, Kaixin Zhu, Daili Hua, Bozhou Li, Chengzhuo Tong, Yuran Wang, Xinyi Huang, Yifan Dai, Zixiang Zhang, Yifan Yang, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Tianyi Bai, Hongcheng Gao, Junbo Niu, Yang Shi, Xinlong Chen, Yue Ding, Minglei Shi, Kai Zeng, Yiwen Tang, Yuanxing Zhang, Pengfei Wan, Xintao Wang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出统一的世界模型设计规范,强调其应整合交互、感知、符号推理和空间表示,以实现更通用和稳健的世界模型。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 52 篇

2602.00929 2026-02-03 cs.AI 83%

Learning Abstractions for Hierarchical Planning in Program-Synthesis Agents

在程序合成代理中学习层次规划的抽象

Zergham Ahmed, Kazuki Irie, Joshua B. Tenenbaum, Christopher J. Bates, Samuel J. Gershman

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) Institute for Human and Machine Cognition(人机认知研究院) Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University, Cambridge, MA, USA(哈佛大学马萨诸塞州剑桥市自然与人工智能研究学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 TheoryCoder-2通过主动学习可重用的抽象,提升了程序合成代理在复杂任务中的样本效率和泛化能力。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17605 2026-02-03 cs.RO cs.AI 83%

Unified Task and Motion Planning using Object-centric Abstractions of Motion Constraints

基于运动约束对象中心抽象的统一任务与运动规划

Alejandro Agostini, Justus Piater

机构 * Department of Computer Science, University of Innsbruck(因斯布鲁克大学计算机科学系)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于对象中心抽象的统一任务与运动规划方法,利用现成AI启发式搜索生成物理可行计划,无需复杂几何推理。

Comments This version corrects notation in Eqs. (7) and (8) and includes minor changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00566 2026-02-03 cs.RO 82%

UniMotion: A Unified Motion Framework for Simulation, Prediction and Planning

UniMotion: 一种用于仿真、预测和规划的统一运动框架

Nan Song, Junzhe Jiang, Jingyu Li, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) University of Surrey(Surrey大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 UniMotion提出了一种统一的运动框架,通过共享结构和定制化训练策略,同时支持运动仿真、预测和规划,实现高效的任务整合和泛化能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01797 2026-02-03 cs.AI 79%

ORCH: many analyses, one merge-a deterministic multi-agent orchestrator for discrete-choice reasoning with EMA-guided routing

ORCH: 多种分析,一个合并——一种确定性多智能体协调器,用于离散选择推理的EMA引导路由

Hanlin Zhou, Huah Yong Chan

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ORCH是一种确定性多智能体协调器,通过EMA引导路由实现离散选择推理的可控、可解释和部署就绪的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00951 2026-02-03 cs.AI 79%

R-HTN: Rebellious Online HTN Planning for Safety and Game AI

R-HTN:安全与游戏AI中的反叛在线HTN规划

Hector Munoz-Avila, David W. Aha, Paola Rizzo

机构 * Computer Science \& Engineering, Lehigh University Bethlehem, PA 18015-3084 USA Navy Center for Applied Research in AI Naval Research Laboratory

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 R-HTN是一种用于安全与游戏AI的在线HTN规划算法,通过反叛机制在遵循指令的情况下实现任务目标。

Journal ref The Annual Conference on Advances in Cognitive Systems (ACS-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00195 2026-02-03 cs.LG 79%

FastTTS: Accelerating Test-Time Scaling for Edge LLM Reasoning

FastTTS: 加速边缘LLM推理的测试时扩展

Hao Mark Chen, Zhiwen Mo, Guanxi Lu, Shuang Liang, Lingxiao Ma, Wayne Luk, Hongxiang Fan

机构 * Imperial College London(帝国学院伦敦) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FastTTS通过三种新方法提升边缘LLM推理效率,实现与云模型相当的准确性和延迟,减少38%-68%的延迟。

Comments Accepted at ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00357 2026-02-03 cs.LG 79%

Planning with Language and Generative Models: Toward General Reward-Guided Wireless Network Design

基于语言和生成模型的规划:迈向通用奖励引导的无线网络设计

Chenyang Yuan, Xiaoyuan Cheng

机构 * University of Sheffield(谢菲尔德大学) University College London(伦敦大学学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出基于统一奖励函数的扩散生成模型,用于高效解决室内无线网络接入点部署问题,通过大规模数据训练提升泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01756 2026-02-03 cs.CV 78%

Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation

Mind-Brush: 将代理认知搜索与推理整合到图像生成中

Jun He, Junyan Ye, Zilong Huang, Dongzhi Jiang, Chenjue Zhang, Leqi Zhu, Renrui Zhang, Xiang Zhang, Weijia Li

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 Mind-Brush通过整合代理认知搜索与推理,提升图像生成模型对复杂知识推理和动态适应能力,实现性能显著跃升。

Comments 36 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01261 2026-02-03 eess.SY cs.SY 78%

Scientific Machine Learning for Resilient EV-Grid Planning and Decision Support Under Extreme Events

极端事件下面向韧性电动汽车-电网规划与决策支持的科学机器学习

Yifan Wang

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出一种科学机器学习框架,通过物理信息知识传递提升电动汽车-电网在极端事件下的韧性,减少积压并限制电网压力。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00941 2026-02-03 cs.NI 78%

LMTE: Putting the "Reasoning" into WAN Traffic Engineering with Language Models

LMTE:利用语言模型进行WAN流量工程中的推理

Xinyu Yuan, Yan Qiao, Zonghui Wang, Meng Li, Wenzhi Chen

专题命中 规划推理 :reasoning(title,abstract)

AI总结 LMTE利用语言模型进行WAN流量工程,通过高效多模态对齐和轻量级配置生成,实现更高效的流量规划和优化。

Comments Accepted as a conference paper at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01222 2026-02-03 cs.AI 77%

FutureMind: Equipping Small Language Models with Strategic Thinking-Pattern Priors via Adaptive Knowledge Distillation

FutureMind: 通过自适应知识蒸馏为小型语言模型配备战略思维模式先验

Shaoxiong Yang, Junting Li, Mengyuan Zhang, Chao Li, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 FutureMind通过自适应知识蒸馏为小型语言模型配备战略思维模式先验,提升其在复杂任务中的推理与检索能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00331 2026-02-03 cs.LG physics.ao-ph 74%

Prototype-based Explainable Neural Networks with Channel-specific Reasoning for Geospatial Learning Tasks

基于通道特定推理的原型可解释神经网络用于地理空间学习任务

Anushka Narayanan, Karianne J. Bergen

机构 * Department of Earth, Environmental and Planetary Sciences(地球、环境与行星科学系) Data Science Institute(数据科学研究所) Department of Computer Science(计算机科学系)

专题命中 规划推理 :reasoning(title);分类 cs.LG

AI总结 本研究提出了一种针对多通道地理空间数据的原型可解释神经网络方法,通过通道特定推理提升模型透明度和可信度。

Comments submitted to Environmental Data Science (preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 73%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19875 2026-02-03 cs.CL cs.AI 73%

Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention

Stream: 通过稀疏注意力扩展机械可解释性以分析LLM中的长上下文

J Rosser, José Luis Redondo García, Gustavo Penha, Konstantina Palla, Hugues Bouchard

机构 * University of Oxford(牛津大学) Spotify Spain(Spotify西班牙分公司) Spotify Netherlands(Spotify荷兰分公司) Spotify UK(Spotify英国分公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Stream通过稀疏注意力技术实现LLM长上下文的高效可解释性分析,显著减少内存消耗并提升推理轨迹追踪能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15519 2026-02-03 cs.AI 70%

TransportAgents: a multi-agents LLM framework for traffic accident severity prediction

TransportAgents: 一种用于交通事故严重性预测的多智能体LLM框架

Zhichao Yang, Jiashu He, Jinxuan Fan, Cirillo Cinzia

机构 * Civil and Environmental Engineering, University of Maryland(大学环境工程系,马里兰州大学) Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 TransportAgents通过多智能体框架提升交通事故严重性预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08366 2026-02-03 cs.AI 70%

Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making

双声道反思:基于LLM的智能体决策的共适应双策略框架

Wentao Zhang, Qunbo Wang, BoXuan Zhao, Tao Zhang, Junsheng Wu, Hongping Gan, Ling Dai, Shizhuang Deng, Shuntong Sun, Yang Liu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DuSAR通过双策略共适应推理框架,无需演示或微调即可在模拟和真实环境中实现优于现有方法的性能,同时减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01725 2026-02-03 cs.CL cs.AI cs.LG 67%

SafePred: A Predictive Guardrail for Computer-Using Agents via World Models

SafePred: 通过世界模型为计算机使用代理构建一种预测性防护措施

Yurun Chen, Zeyi Liao, Ping Yin, Taotao Xie, Keting Yin, Shengyu Zhang

机构 * Zhejiang University, China(浙江大学) The Ohio State University, USA(俄亥俄州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SafePred通过世界模型预测未来风险,构建风险到决策的循环,提升计算机使用代理的安全性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01226 2026-02-03 cs.RO cs.HC 67%

SkySim: A ROS2-based Simulation Environment for Natural Language Control of Drone Swarms using Large Language Models

SkySim: 一种基于ROS2的无人机群自然语言控制仿真环境

Aditya Shibu, Marah Saleh, Mohamed Al-Musleh, Nidhal Abdulaziz

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 SkySim通过基于ROS2的仿真框架,利用大型语言模型实现无人机群的自然语言控制,结合人工势场算法确保安全执行,验证了空间推理精度和实时碰撞避免能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22431 2026-02-03 cs.SE 67%

TreeMind: Automatically Reproducing Android Bug Reports via LLM-empowered Monte Carlo Tree Search

TreeMind: 通过LLM赋能的蒙特卡洛树搜索自动重现Android bug报告

Zhengyu Chen, Zhaoyi Meng, Wenxiang Zhao, Wansen Wang, Wenchao Huang, Jie Cui, Hong Zhong, Yan Xiong

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 TreeMind结合LLM与MCTS算法,通过语义推理和反馈导航,高效重现Android bug报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02486 2026-02-03 cs.CL cs.AI 62%

RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents

RE-TRAC: 递归轨迹压缩用于深度搜索代理

Jialiang Zhu, Gongrui Zhang, Xiaolong Ma, Lin Xu, Miaosen Zhang, Ruiqi Yang, Song Wang, Kai Qiu, Zhirong Wu, Qi Dai, Ruichun Ma, Bei Liu, Yifan Yang, Chong Luo, Zhengyuan Yang, Linjie Li, Lijuan Wang, Weizhu Chen, Xin Geng, Baining Guo

机构 * Southeast University(东南大学) Waseda University(早稻田大学) Tsinghua University(清华大学) Brown University(布朗大学) Zhejiang University(浙江大学) Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Re-TRAC通过递归轨迹压缩提升深度搜索代理的效率,实现跨轨迹探索与全局规划,显著优于ReAct框架。

详情

展开后加载摘要…

URL PDF HTML 收藏