arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-26 至 2025-11-26 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2511.19648 2025-11-26 cs.CL cs.AI 84%

Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search

通过LLM规划和嵌入引导搜索实现高效的多跳知识图谱问答

Manil Shrestha, Edward Kim

机构 * Department of Computer Science, Drexel University, Philadelphia, PA, USA(计算机科学系,德雷塞尔大学,费城,宾夕法尼亚州,美国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种混合算法,通过LLM规划和嵌入引导搜索实现高效且可验证的多跳知识图谱问答,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19912 2025-11-26 cs.CV cs.RO 82%

Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving

Reasoning-VLA: 一种用于自动驾驶的快速且通用的视觉-语言-动作推理模型

Dapeng Zhang, Zhenlong Yuan, Zhangquan Chen, Chih-Ting Liao, Yinda Chen, Fei Shen, Qingguo Zhou, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 Reasoning-VLA通过引入可学习的动作查询和链式思维推理的数据格式,实现了在自动驾驶中快速且通用的视觉-语言-动作推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16274 2025-11-26 cs.LG cs.AI cs.DC cs.PF 81%

STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning

STAlloc:通过时空规划提升大规模模型训练的内存效率

Zixiao Huang, Junhao Hu, Hao Lin, Chunyang Zhu, Yueran Tang, Quanlu Zhang, Zhen Guo, Zhenhua Li, Shengen Yan, Zhenhua Zhu, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 STAlloc通过结合离线规划与在线分配,有效减少大规模模型训练中的内存碎片化,提升训练效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10037 2025-11-26 cs.AI 79%

Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning

超越ReAct:一种以规划为中心的框架,用于复杂工具增强的大语言模型推理

Xiaolong Wei, Yuehu Dong, Xingliang Wang, Xingyu Zhang, Zhejun Zhao, Dongdong Shen, Long Xia, Dawei Yin

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 本文提出了一种以规划为中心的框架,通过全局DAG规划和两阶段训练方法,提升复杂工具增强LLM的推理能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02966 2025-11-26 cs.CV cs.AI 77%

KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models

KEPT: 基于视觉-语言模型的连续驾驶帧轨迹预测增强方法

Yujin Wang, Tianyi Wang, Quanfeng Liu, Wenxian Fan, Junfeng Jiao, Christian Claudel, Yunbing Yan, Bingzhao Gao, Jianqiang Wang, Hong Chen

专题命中 规划推理 :chain-of-thought(abstract);CoT(abstract);planning(abstract);分类 cs.AI

AI总结 KEPT 通过知识增强的视觉-语言模型,利用时间频率-空间融合编码器和检索增强生成流水线,提升自动驾驶中轨迹预测的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18428 2025-11-26 cs.AI cs.CL 73%

Multi-Modal Data Exploration via Language Agents

通过语言代理进行多模态数据探索

Farhad Nooralahzadeh, Yi Zhang, Jonathan Furst, Kurt Stockinger

机构 * Zurich University of Applied Sciences(瑞士应用科学大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M$^2$EX系统,通过语言代理实现多模态数据探索,优于现有系统在准确性和性能指标上

Comments Accepted to the IJCNLP AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17967 2025-11-26 cs.LG cs.AI cs.CV 73%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19691 2025-11-26 cs.RO 71%

Multi-Agent gatekeeper: Safe Flight Planning and Formation Control for Urban Air Mobility

多智能体守门人:面向城市空中交通的安全飞行规划与编队控制

Thomas Marshall Vielmetti, Devansh R Agrawal, Dimitra Panagou

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Robotics(机器人学系) Department of Robotics and Department of Aerospace Engineering(机器人学系和航空航天工程系)

专题命中 规划推理 :planning(title)

AI总结 多智能体守门人框架通过安全轨迹备份和碰撞避免算法,实现城市空中交通中的安全飞行规划与编队控制。

Comments 13 pages, 4 figures, to appear AIAA SciTech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02630 2025-11-26 cs.CR cs.AI 70%

AI Agents Under Threat: A Survey of Key Security Challenges and Future Pathways

AI代理面临威胁:关键安全挑战与未来路径的综述

Zehang Deng, Yongjian Guo, Changzhou Han, Wanlun Ma, Junwu Xiong, Sheng Wen, Yang Xiang

机构 * Swinburne University of Technology(斯威本理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了AI代理面临的关键安全挑战,分析了四个关键知识缺口,并探讨了未来安全防护的发展路径。

Comments Submitted to ACM Computing Survey

Journal ref ACM Computing Surveys, Vol. 57, No. 7, Article 182 (July 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20315 2025-11-26 cs.LG cs.AI cs.CL 67%

Geometry of Decision Making in Language Models

语言模型中决策机制的几何学

Abhinav Joshi, Divyanshu Bhatt, Ashutosh Modi

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过分析语言模型中隐藏表示的内在维度,揭示了模型如何通过低维流形结构实现多选问答任务中的决策过程,提供了语言模型泛化和推理机制的几何学视角。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20048 2025-11-26 cs.AI cs.LG cs.PF 62%

Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design

通过基于猜测的算法-系统联合设计降低LLM搜索代理的延迟

Zixiao Huang, Wen Zeng, Tianyu Fu, Tengxuan Liu, Yizhou Sun, Ke Hong, Xinhao Yang, Chengchun Liu, Yan Li, Quanlu Zhang, Guohao Dai, Zhenhua Zhu, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence Lenovo(联想) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SPAgent通过基于猜测的算法-系统联合设计框架,减少LLM搜索代理的延迟,实现端到端加速并保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20590 2025-11-26 cs.MA cs.AI cs.SE 57%

EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids

EnergyTwin: 一种用于模拟和协调能源微电网的多智能体系统

Jakub Muszyński, Ignacy Walużenicz, Patryk Zan, Zofia Wrona, Maria Ganzha, Marcin Paprzycki, Costin Bădică

机构 * Warsaw University of Technology(华沙技术大学) Systems research Institute Polish Academy of Sciences(波兰科学院系统研究 institute) University of Technology and Arts(技术与艺术大学) University of Craiova(克劳日瓦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 EnergyTwin是一种基于智能体的微电网模拟环境,结合物理建模与预测驱动的滚动时间规划,用于提升微电网的韧性和能源自给率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20284 2025-11-26 cs.CR cs.AI 57%

Can LLMs Make (Personalized) Access Control Decisions?

LLMs能否做出(个性化)访问控制决策?

Friederike Groschupp, Daniele Lain, Aritra Dhar, Lara Magdalena Lazier, Srdjan Čapkun

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Computing Systems Lab, Huawei Technologies Switzerland AG(华为技术瑞士有限公司计算系统实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLMs在访问控制决策中的应用,发现其能有效反映用户偏好,但个性化可能影响安全实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19644 2025-11-26 cs.CR cs.AI 57%

IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response

IRSDA:面向企业入侵响应的智能体协调框架

Damodar Panigrahi, Raj Patel, Shaswata Mitra, Sudip Mittal, Shahram Rahimi

机构 * Mississippi State University(密苏里州立大学) The University of Alabama(阿拉巴马大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 IRSDA是一种基于智能体的入侵响应框架,结合自适应计算与知识引导循环,实现自动化防御和政策合规性,提升企业网络安全响应效率与可解释性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04042 2025-11-26 cs.RO cs.AI 57%

An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue

基于大语言模型的灾难搜索救援中人-群智能协同认知框架

Kailun Ji, Xiaoyu Hu, Xinyu Zhang, Jun Chen

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子工程学院,西北工业大学) Chongqing Institute for Brain and Intelligence, Guangyang Bay Laboratory(脑科学与智能研究院,广阳湾实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的LLM-CRF系统,通过自然交互捕捉意图并实现任务规划,显著提升灾难救援任务效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23053 2025-11-26 cs.LG cs.DC 57%

AirFed: A Federated Graph-Enhanced Multi-Agent Reinforcement Learning Framework for Multi-UAV Cooperative Mobile Edge Computing

AirFed: 一种基于联邦图增强的多智能体强化学习框架,用于多无人机协同移动边缘计算

Zhiyu Wang, Suman Raj, Rajkumar Buyya

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 AirFed通过联邦图增强的多智能体强化学习框架,解决多无人机协同移动边缘计算中的轨迹规划、任务卸载和资源分配问题,实现高效知识共享和显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12051 2025-11-26 cs.CL 57%

MedS$^3$: Towards Medical Slow Thinking with Self-Evolved Soft Dual-sided Process Supervision

MedS$^3$: 向医疗慢思考迈进的自演化软双过程监督

Shuyang Jiang, Yusheng Liao, Zhe Chen, Ya Zhang, Yanfeng Wang, Yu Wang

机构 * footnotemark: 1 Corresponding Authors(通讯作者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 MedS3通过自演化框架和软双过程奖励模型,提升医疗领域小模型的推理能力,实验显示其在准确率上优于现有最佳模型。

Comments 20 pages;Accepted as a Main paper at AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19580 2025-11-26 cs.CY cs.AI cs.HC 57%

Towards Synergistic Teacher-AI Interactions with Generative Artificial Intelligence

迈向生成人工智能的协同教师-人工智能互动

Mutlu Cukurova, Wannapon Suraworachet, Qi Zhou, Sahan Bulathwela

机构 * UCL Knowledge Lab(伦敦大学学院知识实验室) Institute of Education(教育研究所) University College London(伦敦大学学院) UCL Centre for Artificial Intelligence(伦敦大学人工智能中心) Department of Computer Science(计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出教师与生成人工智能协同的五个层次,探讨如何通过协作决策提升教师与AI的共同能力,以实现教育中的伦理和实践协同。

Comments 18 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏