arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-09 至 2025-12-09 共收录 62 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 62 篇

2511.01912 2025-12-09 cs.MA cs.AI cs.LG 92%

EvoMem: Improving Multi-Agent Planning with Dual-Evolving Memory

EvoMem:通过双进化记忆提升多智能体规划

Wenzhe Fan, Ning Yan, Masood Mortazavi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Futurewei Technologies(未来科技)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 EvoMem通过双进化记忆机制提升多智能体规划,利用约束记忆和查询反馈记忆模块优化约束跟踪与错误修正,实现旅行、会议和日历任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07132 2025-12-09 cs.CL cs.AI cs.CV 88%

DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning

利用多智能体分歧进行多模态推理中的工具招募

Nithin Sivakumaran, Justin Chih-Yao Chen, David Wan, Yue Zhang, Jaehong Yoon, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

AI总结 DART通过多智能体分歧识别有用视觉工具,提升多模态推理中的工具调用效果。

Comments Code: https://github.com/nsivaku/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20616 2025-12-09 cs.LG cs.SY eess.SY 87%

Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning

通过单次强化学习训练多轮任务规划的LLM代理

Hanjiang Hu, Changliu Liu, Na Li, Yebin Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 规划决策 :planning(title,abstract);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 本文通过单次强化学习训练LLM代理进行多轮任务规划,利用GRPO实现高效策略优化,实验显示其在复杂任务规划中的表现优于大参数基线模型。

Comments Accepted by IEEE Control Systems Letters (L-CSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22601 2025-12-09 cs.LG cs.AI cs.CL cs.CV cs.MA 87%

Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning

学习绳索,然后信任胜利:基于渐进探索的自我模仿用于代理强化学习

Yulei Qin, Xiaoyu Tan, Zhengbao He, Gang Li, Haojia Lin, Zongyi Li, Zihan Xu, Yuchen Shi, Siqi Cai, Renting Rui, Shaofei Cai, Yuzheng Cai, Xuan Zhang, Sheng Ye, Ke Li, Xing Sun

机构 * Tencent(腾讯)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SPEAR通过渐进探索与自我模仿提升代理强化学习性能,有效提升多个任务的成功率,具有良好的可扩展性。

Comments 45 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01132 2025-12-09 cs.LG cs.AI cs.CL 85%

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

多轮代理强化学习实践指南

Ruiyi Wang, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06449 2025-12-09 cs.LG cs.AI 84%

FLEX: Continuous Agent Evolution via Forward Learning from Experience

FLEX: 通过经验向前学习实现连续智能体进化

Zhicheng Cai, Xinyuan Guo, Yu Pei, Jiangtao Feng, Jinsong Su, Jiangjie Chen, Ya-Qin Zhang, Wei-Ying Ma, Mingxuan Wang, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) ByteDance Seed(字节跳动种子) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Informatics, Xiamen University(厦门大学信息学院) SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR实验室和字节跳动种子)

专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 FLEX通过经验向前学习实现LLM智能体的持续进化,提升数学推理、化学逆合成和蛋白质预测性能,并揭示经验增长的扩展规律和跨智能体的经验继承现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07533 2025-12-09 cs.CR cs.AI 83%

VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection

VulnLLM-R:基于代理架构的专用推理LLM用于漏洞检测

Yuzhou Nie, Hongwei Li, Chengquan Guo, Ruizhe Jiang, Zhun Wang, Bo Li, Dawn Song, Wenbo Guo

机构 * Department of Computer Science, University of California, Santa Barbara, CA, USA(加州大学圣芭芭拉分校计算机科学系) Department of Computer Science, University of Chicago, Chicago, IL, USA(芝加哥大学计算机科学系) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系) Department of Computer Science, University of Illinois Urbana-Champaign, Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 规划决策 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 VulnLLM-R通过专用推理模型和代理架构,在漏洞检测中实现高效准确的AI驱动检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10320 2025-12-09 cs.RO cs.AI 83%

MeshA*: Efficient Path Planning With Motion Primitives

MeshA*:基于运动原语的高效路径规划

Marat Agranovskiy, Konstantin Yakovlev

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 MeshA*通过在网格单元格上搜索并拟合运动原语序列,实现高效路径规划,同时保证完整性和最优性,运行时间显著优于传统方法。

Comments Accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02395 2025-12-09 cs.CV 82%

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

Skywork-R1V4:通过图像与深度研究交织思考实现代理多模态智能

Yifan Zhang, Liang Hu, Haofeng Sun, Peiyu Wang, Yichen Wei, Shukang Yin, Jiangbo Pei, Wei Shen, Peng Xia, Yi Peng, Tianyidan Xie, Eric Li, Yang Liu, Xuchen Song, Yahui Zhou

机构 * Skywork AI

专题命中 规划决策 :agentic(title,abstract);planning(abstract)

AI总结 Skywork-R1V4通过交织推理实现多模态代理智能,仅用监督学习在少数据上训练,超越现有模型在多个基准测试中的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06131 2025-12-09 cs.RO 82%

LOG-Nav: Efficient Layout-Aware Object-Goal Navigation with Hierarchical Planning

LOG-Nav: 面向复杂多房间室内环境的高效布局感知物体目标导航方法

Jiawei Hou, Yuting Xiao, Xiangyang Xue, Taiping Zeng

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 LOG-Nav通过层次化规划和大语言模型智能体实现高效布局感知导航,实验显示其在复杂室内环境中的导航成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20993 2025-12-09 cs.LG cs.AI 81%

Subgoal Graph-Augmented Planning for LLM-Guided Open-World Reinforcement Learning

子目标图增强的规划用于LLM引导的开放世界强化学习

Shanwei Fan, Bin Zhang, Zhiwei Xu, Yingxuan Teng, Siqi Dai, Lin Cheng, Guoliang Fan

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SGA-ACR框架,通过整合环境特定的子目标图和多LLM规划流程,解决LLM在开放世界强化学习中的规划-执行对齐问题,提升子目标的可行性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06595 2025-12-09 cs.MA cs.AI 80%

ChargingBoul: A Competitive Negotiating Agent with Novel Opponent Modeling

ChargingBoul:一种具有新颖对手建模的竞争性谈判代理

Joe Shymanski

机构 * Joe Shymanski(独立研究者)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ChargingBoul通过平衡让步与对手建模,在自动化谈判竞赛中取得优异成绩,展示了其在多策略对手环境中的高效谈判能力。

Comments 10 pages, 3 figures. Describes the ChargingBoul negotiating agent submitted to ANAC 2022. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06431 2025-12-09 cs.AI cs.CY 79%

Smart Spatial Planning in Egypt: An Algorithm-Driven Approach to Public Service Evaluation in Qena City

埃及智能空间规划:一种算法驱动的公共服务评估方法(以季纳市为例)

Mohamed Shamroukh, Mohamed Alkhuzamy Aziz

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出了一种基于Voronoi图的智能算法,用于评估埃及季纳市公共服务覆盖情况,发现市中心服务密度高,郊区覆盖低,模型为数据驱动的城市规划提供可复制的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05982 2025-12-09 physics.soc-ph cs.AI cs.MA 79%

FlockVote: LLM-Empowered Agent-Based Modeling for Simulating U.S. Presidential Elections

FlockVote: 基于大语言模型的智能体建模用于模拟美国总统选举

Lingfeng Zhou, Yi Xu, Zhenyu Wang, Dequan Wang

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 FlockVote利用大语言模型构建智能体建模框架,用于模拟美国总统选举,实现高保真度的社会模拟与可解释性研究。

Comments Published as a conference paper at ICAIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04702 2025-12-09 cs.SE 79%

POLARIS: Is Multi-Agentic Reasoning the Next Wave in Engineering Self-Adaptive Systems?

POLARIS:多智能体推理是否是工程自适应系统下一波浪潮?

Divyansh Pandey, Vyakhya Gupta, Prakhar Singhal, Karthik Vaidhyanathan

专题命中 规划决策 :agentic(title,abstract);分类 cs.SE

AI总结 POLARIS通过多智能体推理框架提升自适应系统在复杂环境中的适应能力与预测性能。

Comments Accepted as a short paper at SEAMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03557 2025-12-09 math.OC 78%

Parameter Optimization in Trajectory Planning via Differentiable Convex Programming

通过可微凸规划进行轨迹规划中的参数优化

Ziqi Xu, Lin Cheng, Di Wu, Shengping Gong

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种可微顺序凸规划框架,通过端到端参数优化提升轨迹规划的数值性能和设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06517 2025-12-09 cs.RO 78%

Vision-Guided Grasp Planning for Prosthetic Hands in Unstructured Environments

面向无结构环境的假手视觉引导抓取规划

Shifa Sulaiman, Akash Bachhar, Ming Shen, Simon Bøgh

机构 * Control and Automation Section, Department of Electronics Systems, Aalborg University, Denmark(奥尔堡大学电子系统系自动化与自动化部门) Department of Mechanical Engineering, National Institute of Technology,Durgapur, India(印度德里加尔帕国家理工学院机械工程系) The Technical Faculty of IT(信息技术技术学院) Millimeter-Wave Systems, Department of Electronics Systems, Aalborg University, Denmark(毫米波系统,电子系统系,奥尔堡大学,丹麦)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种基于视觉引导的假手抓取算法,通过整合感知、规划和控制,实现灵活的抓取操作,并在仿真和实验中验证其在无结构环境中的适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23228 2025-12-09 eess.SY cs.RO cs.SY 78%

Energy-Aware Lane Planning for Connected Electric Vehicles in Urban Traffic: Design and Vehicle-in-the-Loop Validation

面向城市交通的连接电动车辆能耗感知车道规划:设计与车辆在环验证

Hansung Kim, Eric Yongkeun Choi, Eunhyek Joa, Hotae Lee, Linda Lim, Scott Moura, Francesco Borrelli

机构 * Department of Mechanical Engineering, UC Berkeley(机械工程系,伯克利大学) Department of Civil Engineering, UC Berkeley(土木工程系,伯克利大学) Zoox, Inc.(Zoox公司)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于V2I通信的能耗感知运动规划框架,通过联合优化纵向速度和横向车道变更决策,实现城市交通中能耗降低24%的显著效果。

Comments Accepted at 2025 IEEE Conference on Decision and Control (CDC25')

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14910 2025-12-09 cs.RO cs.MA math.OC 78%

Kinodynamic Motion Planning for Collaborative Object Transportation by Multiple Mobile Manipulators

多移动机械臂协同物体运输的运动规划

Keshab Patra, Arpita Sinha, Anirban Guha

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种多移动机械臂协同运输物体的运动规划方法,通过全局路径规划和局部在线轨迹生成,结合运动动力学约束和障碍物处理,实现高效协同运输。

Comments Video: https://youtu.be/LhE_HcK4g-s

Journal ref J. Mechanisms Robotics. Dec 2025, 17(12)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23255 2025-12-09 eess.SY cs.SY 75%

Iterative VCG-based Mechanism Fosters Cooperation in Multi-Regional Network Design

迭代基于VCG的机制促进多区域网络设计中的合作

Mingjia He, Yannik Werner, Andrea Censi, Emilio Frazzoli, Gioele Zardini

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出一种迭代基于VCG的机制,用于多区域网络设计,促进子网络运营商之间的合作,提升整体网络效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11551 2025-12-09 cs.AI cs.CL 73%

Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping

对 Machiavellian 代理进行对齐:通过测试时策略塑造实现行为引导

Dena Mujtaba, Brian Hu, Anthony Hoogs, Arslan Basharat

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种测试时策略塑造方法,通过模型引导的策略调整,解决预训练代理在复杂环境中的伦理对齐问题,实现奖励最大化与伦理约束的平衡。

Comments Accepted to AAAI 2026 AI Alignment Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06373 2025-12-09 cs.CV 71%

VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning

VG-Refiner: 通过代理强化学习实现工具精细化的指称 grounded 推理

Yuji Wang, Wenlong Liu, Jingxuan Niu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 规划决策 :agentic(title)

AI总结 VG-Refiner通过代理强化学习实现工具精细化的指称 grounded 推理,引入两阶段思考-重新思考机制和细化奖励,提升指称和推理接地任务的准确性和修正能力。

Comments The project page is [this url](https://github.com/VoyageWang/VG-Refiner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01888 2025-12-09 cs.LG cs.CR cs.MA 70%

Optimizing Day-Ahead Energy Trading with Proximal Policy Optimization and Blockchain

通过近端策略优化与区块链优化日前能源交易

Navneet Verma, Ying Xie

机构 * Kennesaw State University(肯纳邦大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出结合PPO与区块链的框架,用于优化日前能源市场中prosumers的自动化交易策略,实现供需平衡与电网韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06573 2025-12-09 cs.AI cs.MA 70%

The Effect of Belief Boxes and Open-mindedness on Persuasion

信念盒子和开放心态对说服力的影响

Onur Bilgin, Abdullah As Sami, Sriram Sai Vujjini, John Licato

机构 * Advancing Machine and Human Reasoning (AMHR) Lab, University of South Florida(先进机器与人类推理实验室,佛罗里达州立大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究探讨信念盒子和开放心态对智能体说服力的影响,发现开放心态影响信念变化的接受度,而信念陈述影响对对立观点的抵抗能力。

Comments Accepted at the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06250 2025-12-09 cs.LG 70%

Learning When to Switch: Adaptive Policy Selection via Reinforcement Learning

学习何时切换:通过强化学习实现自适应策略选择

Chris Tava

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 该研究通过强化学习实现自主代理在不同导航策略间的自适应切换,提升复杂任务性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07819 2025-12-09 cs.RO 67%

Efficient and Compliant Control Framework for Versatile Human-Humanoid Collaborative Transportation

高效且合规的协作运输人机协作控制框架

Shubham S. Kumbhar, Abhijeet M. Kulkarni, Panagiotis Artemiadis

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文提出了一种高效且合规的协作运输人机协作控制框架,通过交互线性倒立摆和动态可行步态计划实现人形机器人与人类的协同运输任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07646 2025-12-09 math.OC 67%

Energy-Aware Aggregation of Input Data for the Optimisation of Heat Supply of Municipal Districts

面向市政供暖优化的输入数据节能聚合

Patrik Schönfeldt, Elif Turhan

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出了一种基于地理位置和能源性能指标的建筑分组方法,以提高市政供热优化的计算效率和准确性。

Comments 25 pages, 13 figures (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07528 2025-12-09 cs.LG cs.AI 62%

Model-Based Reinforcement Learning Under Confounding

基于模型的强化学习中的混杂问题

Nishanth Venkatesh, Andreas A. Malikopoulos

机构 * Department of Systems Engineering, Cornell University(系统工程系,康奈尔大学) School of Civil and Environmental Engineering, Cornell University(土木与环境工程学院,康奈尔大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于模型的强化学习方法,解决上下文不可观测导致的混杂问题,通过近似离策略评估和行为平均转移模型,实现一致的MDP构造和因果熵框架整合。

Comments 9 pages, 2 figures - decompressed draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07314 2025-12-09 cs.AI cs.LG 62%

M-STAR: Multi-Scale Spatiotemporal Autoregression for Human Mobility Modeling

M-STAR:多尺度时空自回归模型用于人类移动性建模

Yuxiao Luo, Songming Zhang, Sijie Ruan, Siran Chen, Kang Liu, Yang Xu, Yu Zheng, Ling Yin

机构 * Department of Land Surveying and Geo-informatics, The Hong Kong Polytechnic University(土地测量与地理信息学系,香港理工大学) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(计算机科学与控制工程学院,深圳先进技术大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 M-STAR通过多尺度时空自回归模型提升人类移动性长期轨迹生成的保真度和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06259 2025-12-09 cs.SD cs.AI cs.LG 62%

Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling

谁会登顶排行榜?通过适应性融合模态专家和时间参与建模的多模态音乐流行度预测

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 GAMENet通过融合多模态数据和时间参与建模,提升了音乐流行度预测的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏