arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-27 至 2025-11-27 共收录 70 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2508.12398 2025-11-27 cs.CR cs.AI cs.CL 62%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21610 2025-11-27 cs.CL 57%

Auxiliary Metrics Help Decoding Skill Neurons in the Wild

辅助度量帮助解码野生中的技能神经元

Yixiu Zhao, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种方法,通过辅助度量解码技能神经元,验证了其在多种任务中的有效性。

Comments 7 pages, 7 figures. Includes additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

2311.07850 2025-11-27 cs.CL cs.AI cs.DB cs.LG 67%

Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQA

自带知识图谱:零样本知识图谱问答的自监督程序合成

Dhruv Agarwal, Rajarshi Das, Sopan Khosla, Rashmi Gangadharaiah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) AWS AI Labs(AWS人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21050 2025-11-27 cs.LG cs.AI stat.ML 62%

Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs

打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏

Dongkyu Derek Cho, Huan Song, Arijit Ghosh Chowdhury, Haotian An, Yawei Wang, Rohit Thekkanal, Negin Sokhandan, Sharlina Keshava, Hannah Marlowe

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。

Comments AAAI-26 Workshop on Post-AI Formal Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2025-11-27 cs.LG 57%

Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Jalaj Bhandari, Yukai Yang, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18509 2025-11-27 cs.PL 50%

Higher-Order Behavioural Conformances via Fibrations

通过纤维化实现更高阶的行为一致性

Henning Urbat

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出了一种统一的范畴方法,通过纤维化实现高阶语言的行为一致性,证明了最大行为一致性在一般条件下的合同性质。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2505.12307 2025-11-27 cs.CV cs.CL 90%

LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?

LogicOCR: 大型多模态模型在文本丰富的图像上逻辑推理是否表现优异?

Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang, Juhua Liu, Bo Du

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心、人工智能研究院、多媒体与网络通信工程湖北省重点实验室、武汉大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 LogicOCR通过构建包含生成和现实图像问题的基准测试,评估大型多模态模型在文本丰富图像上的逻辑推理能力,并提出TextCue方法提升模型对关键文本区域的感知。

Comments GitHub: https://github.com/MiliLab/LogicOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15703 2025-11-27 cs.CV cs.AI cs.CL 73%

Think Visually, Reason Textually: Vision-Language Synergy in ARC

视觉优先,文本推理:ARC中的视觉-语言协同

Beichen Zhang, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉-语言协同推理和模态切换自我纠正策略,通过结合视觉抽象与语言推理提升ARC-AGI任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 17 篇

2511.21591 2025-11-27 cs.AI 85%

On the Limits of Innate Planning in Large Language Models

大语言模型中内生规划的极限

Charles Schepanowski, Charles Ling

机构 * Western University(温斯洛大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究发现大语言模型在无外部工具的情况下,规划和状态推理能力有限,主要问题在于内部状态表示脆弱和启发式规划能力不足。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21460 2025-11-27 cs.AI 83%

MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning

MADRA:多智能体辩论用于风险感知的具身规划

Junjian Wang, Lidan Zhao, Xi Sheryl Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences, Nanjing(中国科学院大学南京校区)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 MADRA通过多智能体辩论和分层认知框架,在安全性和效率上超越现有方法,实现高安全任务拒绝率和低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08532 2025-11-27 cs.AI 83%

Safe and Economical UAV Trajectory Planning in Low-Altitude Airspace: A Hybrid DRL-LLM Approach with Compliance Awareness

低空经济环境下安全且经济的无人机轨迹规划:一种融合DRL与LLM的混合方法与合规意识

Yanwei Gong, Junchao Fan, Ruichen Zhang, Dusit Niyato, Yingying Yao, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University, P.R. China(北京智能交通安全与隐私北京市重点实验室,北京交通大学,中国) School of Computer Science and Engineering, Nanyang Technological University, Singapore(计算机科学与工程学院,南洋理工大学,新加坡)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出一种融合深度强化学习与大型语言模型的无人机轨迹规划方法,以实现安全、合规且经济的路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19516 2025-11-27 cs.CV 78%

Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning

连接点:通过代理推理实现无需训练的视觉接地

Liqin Luo, Guangyao Chen, Xiawu Zheng, Yongxing Dai, Yixiong Zou, Yonghong Tian

专题命中 规划推理 :reasoning(title,abstract)

AI总结 GroundingAgent通过代理推理实现无需微调的视觉接地,达到65.1%的零样本准确率,并在选择阶段实现90%的准确率,展示了LLM推理能力的重要性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20720 2025-11-27 cs.CV cs.AI cs.LG cs.RO 73%

DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving

DeeAD: 视觉-语言动作的动态早期退出以实现高效的自动驾驶

Haibo HU, Lianming Huang, Nan Guan, Chun Jason Xue

机构 * City University of Hongkong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 DeeAD通过动态早期退出机制提升自动驾驶中视觉-语言动作模型的效率,实现28%的变换器层稀疏性和29%的延迟减少,同时保持规划质量和安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20693 2025-11-27 cs.AI cs.MA 70%

$A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators

$A^2Flow$:通过自适应抽象运算符自动化代理工作流生成

Mingming Zhao, Xiaokang Wei, Yuanqi Shao, Kaiwen Zhou, Lin Yang, Siwei Rao, Junhui Zhan, Zhitang Chen

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 $A^2Flow$通过自适应抽象运算符实现代理工作流的自动化生成,提升性能并降低资源消耗。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07858 2025-11-27 cs.AI cs.LG 62%

Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models

Augur:通过大型语言模型建模时间序列中的协变量因果关联

Zhiqing Cui, Binwu Wang, Qingxiang Liu, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang, Yang Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Augur通过大型语言模型建模时间序列中的协变量因果关联,提升预测准确性并实现透明的因果推理。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20940 2025-11-27 cs.CL 57%

Chatty-KG: A Multi-Agent AI System for On-Demand Conversational Question Answering over Knowledge Graphs

Chatty-KG:一种用于基于知识图谱的按需对话问答的多智能体AI系统

Reham Omar, Abdelghny Orogat, Ibrahim Abdelaziz, Omij Mangukiya, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科德大学) IBM Research(IBM研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Chatty-KG通过多智能体系统实现基于知识图谱的对话问答,结合RAG检索与结构化执行,提升多轮问答的准确性和效率。

Comments This paper is accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20695 2025-11-27 cs.AI cs.CY physics.med-ph 57%

A Brief History of Digital Twin Technology

数字孪生技术简史

Yunqi Zhang, Kuangyu Shi, Biao Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 数字孪生技术通过整合医疗数据和模型,推动医疗从反应性向预测性和个性化转变,面临互操作性、隐私和模型精度等挑战。

Comments 21 pages, 1 figure, 1 table

Journal ref PET Clin. 2026 Jan;21(1):143-151. Epub 2025 Oct 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20656 2025-11-27 cs.HC cs.AI 57%

Context-Aware Visual Prompting: Automating Geospatial Web Dashboards with Large Language Models and Agent Self-Validation for Decision Support

基于上下文的视觉提示:利用大语言模型和代理自我验证自动化地理空间网络看板

Haowen Xu, Jose Tupayachi, Xiao-Ying Yu

机构 * Computational Urban Sciences Group, Oak Ridge National Laboratory(计算城市科学组,橡树岭国家实验室) Materials Science and Technology Division, Oak Ridge National Laboratory(材料科学与技术 division,橡树岭国家实验室) Industrial and Systems Engineering, The University of Tennessee, Knoxville(工业与系统工程,田纳西大学, Knoxville)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型和代理自我验证的地理空间看板自动化框架,通过上下文感知视觉提示提升风险分析和决策支持的可视化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19933 2025-11-27 cs.AI 57%

Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications

LLM系统中的故障模式:可靠AI应用的系统级分类

Vaishali Vinay

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LLM系统中十五种隐含故障模式的分类,分析评估与监控的差距,并提出构建可靠、可维护且成本敏感的LLM系统的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01658 2025-11-27 cs.CL 57%

A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency

对大型语言模型推理引擎的综述:优化与效率的视角

Sihyeong Park, Sungryeol Jeon, Chaelyn Lee, Seokhun Jeon, Byung-Soo Kim, Jemin Lee

机构 * Korea Electronics Technology Institute(韩国电子技术研究所) Electronics and Telecommunications Research Institute(电子电信研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型推理引擎的优化与效率,评估了25种开源和商用引擎,探讨了其设计目标及生态系统成熟度,并提供未来研究方向和公开存储库。

Comments Under review; 106 pages; 46 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21484 2025-11-27 physics.med-ph 50%

A Dynamic Anti-Equinus Orthosis with Electromyography Sensor for Neuromuscular Rehabilitation

一种配备肌电传感器的动态抗跟腱症矫形器用于神经肌肉康复

Manuel Terradillos Perea, Olga Alonso Gonzalez, Cristina Soguero Ruiz, David Gutierrez

专题命中 规划推理 :planning(abstract)

AI总结 EquiSay是一种配备肌电传感器的动态抗跟腱症矫形器,通过弹性张力系统和EMG传感器改善足部姿势与运动,同时利用U-Net模型生成合成信号并自动校准阈值,提升康复效果与临床应用价值。

Comments in Spanish language, Prototype development and evaluation study. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21037 2025-11-27 cs.HC 50%

LOOM: Personalized Learning Informed by Daily LLM Conversations Toward Long-Term Mastery via a Dynamic Learner Memory Graph

LOOM:通过动态学习者记忆图实现每日LLM对话指导的个性化学习以实现长期掌握

Justin Cui, Kevin Pu, Tovi Grossman

专题命中 规划推理 :planning(abstract)

AI总结 LOOM通过动态学习者记忆图分析每日LLM对话,生成个性化学习材料以实现长期掌握,兼顾连续性和主动性,提升学习者持续进步与即时相关性的平衡。

Comments Accepted to the PerFM Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 50%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06374 2025-11-27 cs.MA cs.RO 50%

MAPF-HD: Multi-Agent Path Finding in High-Density Environments

MAPF-HD:高密度环境中的多智能体路径规划

Hiroya Makino, Seigo Ito

机构 * Toyota Central R&D Labs., Inc.(丰田中央研究实验室)

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出MAPF-HD框架,通过分阶段无智能体交换方法高效解决高密度环境下的多智能体路径规划问题。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12376 2025-11-27 cs.MA 50%

MARPF: Multi-Agent and Multi-Rack Path Finding

MARPF:多智能体和多层路径寻找

Hiroya Makino, Yoshihiro Ohama, Seigo Ito

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出MARPF方法,通过整数线性规划解决多智能体在无通道环境中运输货架的问题,优化路径以避免碰撞并重新定位障碍物。

Comments 7 pages, 10 figures, IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 5 篇

2509.12718 2025-11-27 cs.CV 82%

EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer

EvoEmpirBench: 基于智能体经验的动态空间推理

Pukun Zhao, Longxiang Wang, Miaowei Wang, Chen Chen, Fanqing Zhou, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东金融学院) Chongqing University(重庆大学) University of Edinburgh(爱丁堡大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 EvoEmpirBench通过动态空间基准评估模型在部分可观测和动态环境下的空间推理与记忆能力,揭示主流模型的限制并提供未来研究平台。

Comments Accepted by AAAI 2026, 29 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20726 2025-11-27 cs.LG cs.AI 62%

Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge

从风险学习:利用先验知识的LLM引导的安全关键场景生成

Yuhang Wang, Heye Huang, Zhenhua Xu, Kailai Sun, Baoshen Guo, Jinhua Zhao

机构 * Chinese Academy of Sciences, China(中国科学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM和CVAE生成安全关键场景的方法,通过知识驱动优化提升自动驾驶系统在罕见高风险事件下的鲁棒性与可控性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 50%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 50%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20784 2025-11-27 cs.CV 50%

One Patch is All You Need: Joint Surface Material Reconstruction and Classification from Minimal Visual Cues

一个补丁就够了:从最小的视觉线索联合表面材料重建与分类

Sindhuja Penchala, Gavin Money, Gabriel Marques, Samuel Wood, Jessica Kirschman, Travis Atkison, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SMARC通过单个补丁实现表面材料重建与分类,以应对稀疏视觉输入下的挑战,取得最佳性能。

Comments 9 pages,3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏