arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-17 至 2026-02-17 共收录 211 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 86 篇

2412.13474 2026-02-17 cs.RO cs.SY eess.SY 78%

Planning Human-Robot Co-manipulation with Human Motor Control Objectives and Multi-component Reaching Strategies

基于人类运动控制目标和多组件抓取策略的人机协同规划

Kevin Haninger, Luka Peternel

机构 * Department of Automation, Fraunhofer IPK(自动化系,弗劳恩霍夫IPK研究所)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于人类运动控制模型和多组件抓取策略的人机协同规划方法,以实现更自然的人机交互。

Comments 10 Pages

Journal ref IEEE Robotics and Automation Letters, Volume 10, Issue 2, February 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00866 2026-02-17 stat.ME math.ST stat.AP stat.TH 78%

Planning for gold: Hypothesis screening with split samples for valid powerful testing in matched observational studies

为黄金规划:通过分割样本进行假设筛查,以在匹配观察研究中实现有效且有力的检验

William Bekerman, Abhinandan Dalal, Carlo del Ninno, Dylan S. Small

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种通过分割样本进行假设筛选的方法,以在匹配观察研究中实现有效且有力的检验,以应对未测量混杂因素的影响。

Comments To be published in Biometrika

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13457 2026-02-17 cs.RO 78%

Inferring Turn-Rate-Limited Engagement Zones with Sacrificial Agents for Safe Trajectory Planning

利用牺牲代理推断受限转弯率的接触区域以实现安全轨迹规划

Grant Stagg, Cameron K. Peterson

机构 * Brigham Young University

专题命中 规划决策 :planning(title);agent(abstract)

AI总结 本文通过牺牲代理推断受限转弯率的接触区域,利用几何启发式和贝叶斯方法优化轨迹选择,实现安全高效的轨迹规划。

Comments Submitted to the Journal of Aerospace Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13802 2026-02-17 cs.LG 77%

Cast-R1: Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting

Cast-R1:学习工具增强的序列决策策略用于时间序列预测

Xiaoyu Tao, Mingyue Cheng, Chuang Jiang, Tian Gao, Huanjian Zhang, Yaguo Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划决策 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 Cast-R1通过工具增强的代理工作流程,学习序列决策策略以提升时间序列预测的准确性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14526 2026-02-17 cs.RO cs.AI cs.LG 73%

TWISTED-RL: Hierarchical Skilled Agents for Knot-Tying without Human Demonstrations

TWISTED-RL:无人类示范的分层技能代理用于打结

Guy Freund, Tom Jurgenson, Matan Sudry, Erez Karpas

机构 * Reichman University(雷赫曼大学) Technion – Israel Institute of Technology(技术学院——以色列理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 TWISTED-RL通过强化学习和拓扑动作实现无示范的复杂打结任务,提升泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13210 2026-02-17 cs.NI cs.AI cs.LG 73%

Large Language Model (LLM)-enabled Reinforcement Learning for Wireless Network Optimization

基于大语言模型的强化学习用于无线网络优化

Jie Zheng, Ruichen Zhang, Dusit Niyato, Haijun Zhang, Jiacheng Wang, Hongyang Du, Jiawen Kang, Zehui Xiong

机构 * State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer Science, Northwest University(高级网络与智能信息服务省-市联合工程与研究中心,计算机科学学院,西北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Artificial Intelligence, University of Science and Technology Beijing(人工智能研究院,北京科技大学) Department of Electrical and Electronic Engineering, the University of Hong Kong(电子与电气工程系,香港大学) Automation of School, Guangdong University of Technology(自动化学院,广东工业大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型增强强化学习,以优化6G无线网络,通过多智能体强化学习框架提升网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05152 2026-02-17 math.OC 71%

Extreme-Scale EV Charging Infrastructure Planning for Last-Mile Delivery Using High-Performance Parallel Computing

面向最后一公里配送的极端规模电动汽车充电基础设施规划:利用高性能并行计算

Waquar Kaleem, Taner Cokyasar, Jeffrey Larson, Omer Verbas, Tanveer Hossain Bhuiyan, Anirudh Subramanyam

专题命中 规划决策 :planning(title)

AI总结 本文提出了一种基于高性能并行计算的框架,用于解决极端规模电动汽车充电基础设施规划问题,通过分解和并行化方法高效处理大规模优化问题。

Journal ref Transportation Research Part B: Methodological, 205, 103403, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10285 2026-02-17 cs.RO 71%

Adaptive Time Step Flow Matching for Autonomous Driving Motion Planning

自适应时间步长流匹配用于自动驾驶运动规划

Ananya Trivedi, Anjian Li, Mohamed Elnoor, Yusuf Umut Ciftci, Avinash Singh, Jovin D'sa, Sangjae Bae, David Isele, Taskin Padir, Faizan M. Tariq

机构 * HRI Honda Research Institute(本田研究院) Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学) Stanford University(斯坦福大学)

专题命中 规划决策 :planning(title)

AI总结 本文提出了一种基于条件流匹配的自适应时间步长框架,用于实时自动驾驶轨迹规划,通过在线调整推理步骤数和轨迹后处理提升性能。

Comments Accepted to Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14691 2026-02-17 cs.AI 70%

Removing Planner Bias in Goal Recognition Through Multi-Plan Dataset Generation

通过多计划数据集生成去除规划者偏见在目标识别中的影响

Mustafa F. Abdelwahed, Felipe Meneguzzi Kin Max Piamolini Gusmao, Joan Espasa

专题命中 规划决策 :autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出通过多计划数据集生成减少规划偏见,引入版本覆盖分数度量目标识别器的鲁棒性。

Journal ref PlanSig 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14166 2026-02-17 cs.CR cs.AI 70%

IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol

IntentMiner: 通过模型上下文协议中的工具调用分析进行意图倒置攻击

Yunhao Yao, Zhiqiang Wang, Haoran Cheng, Yihang Cheng, Haohua Du, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 规划决策 :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 IntentMiner通过分析模型上下文协议中的工具调用,揭示了意图倒置攻击的机制,实现了超过85%的语义对齐,挑战了AI代理的隐私基础。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14083 2026-02-17 cs.AI 70%

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

Plan-MCTS:网页导航中的计划探索用于动作利用

Weiming Zhang, Jihong Wang, Jiamu Zhou, Qingyao Li, Xinbei Ma, Congmin Zheng, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 规划决策 :autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14003 2026-02-17 cs.AI 70%

Prompt-Driven Low-Altitude Edge Intelligence: Modular Agents and Generative Reasoning

基于提示的低空边缘智能:模块化代理与生成推理

Jiahao You, Ziye Jia, Chao Dong, Qihui Wu

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出P2AECF框架,通过模块化代理和生成推理实现灵活、高效和适应的低空边缘智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13574 2026-02-17 cs.SE cs.CR 70%

Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation

面向执行状态的LLM推理用于自动化漏洞证明生成

Haoyu Li, Xijia Che, Yanhao Wang, Xiaojing Liao, Luyi Xing

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。

Comments Version 1.0 (13 pages, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13332 2026-02-17 cs.CV cs.AI 70%

MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

MedScope:通过粗到细的工具调用激励“通过视频思考”以进行临床推理

Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院) Fudan University, Shanghai, China(复旦大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)

专题命中 规划决策 :AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 MedScope通过粗到细的工具调用机制,提升临床视频推理的准确性与可信度,实现基于时间局部化视觉证据的医疗AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13324 2026-02-17 cs.CV cs.AI cs.RO 70%

Synthesizing the Kill Chain: A Zero-Shot Framework for Target Verification and Tactical Reasoning on the Edge

构建杀伤链:一种零样本框架,用于边缘节点上的目标验证和战术推理

Jesse Barkley, Abraham George, Amir Barati Farimani

机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 规划决策 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种零样本框架,通过边缘设备实现目标验证和战术推理,验证了分层架构在动态军事环境中的有效性。

Comments 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13309 2026-02-17 cs.MA cs.AI 70%

Adaptive Value Decomposition: Coordinating a Varying Number of Agents in Urban Systems

自适应价值分解:协调城市系统中变化数量的智能体

Yexin Li, Jinjin Guo, Haoyu Zhang, Yuhan Zhao, Yiwen Sun, Zihao Jiao

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(人工智能通用基础理论国家重点实验室) Beijing Technology and Business University(北京科技与商业大学) Peking University(北京大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 自适应价值分解通过动态调整智能体数量和缓解动作同质化,提升城市系统中多智能体协调效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14153 2026-02-17 cs.CV 67%

ARport: An Augmented Reality System for Markerless Image-Guided Port Placement in Robotic Surgery

ARport:一种用于无标记图像引导腹腔镜器械放置的增强现实系统

Zheng Han, Zixin Yang, Yonghao Long, Lin Zhang, Peter Kazanzides, Qi Dou

机构 * Cornerstone Robotics Ltd.(Cornerstone Robotics有限公司)

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 ARport是一种无标记增强现实系统,用于在患者身体表面直观指导腹腔镜器械的术前规划与术中放置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06130 2026-02-17 cs.LG cs.AI cs.CL 67%

Self-Improving World Modelling with Latent Actions

具有潜在动作的自我改进世界建模

Yifu Qiu, Zheng Zhao, Waylon Li, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * University of Edinburgh(爱丁堡大学) Nvidia Research(Nvidia研究) University of Groningen(格罗宁根大学) University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SWIRL通过将动作视为潜在变量,结合前向世界建模和逆动态建模,实现了对LLM和VLM的自我改进世界建模,在多个基准测试中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18299 2026-02-17 cs.HC 67%

Comparing Fabrication Workflows in CAD to Support Design Reasoning

在CAD中比较制造流程以支持设计推理

Shuo Feng, Xuening Wang, Yifan, Shan, Krista U Singh, Bo Liu, Amritansh Kwatra, Ritik Batra, Tobias M Weinberg, Thijs Roumen

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出CAMeleon界面,通过比较不同制造流程帮助用户探索和做出更明智的设计决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14795 2026-02-17 cs.AI cs.LG 62%

Return of the Schema: Building Complete Datasets for Machine Learning and Reasoning on Knowledge Graphs

模式的回归:为机器学习和知识图谱推理构建完整数据集

Ivan Diliso, Roberto Barile, Claudia d'Amato, Nicola Fanizzi

机构 * Dipartimento di Informatica -- University of Bari Aldo Moro, Italy(巴里阿尔多·莫罗大学计算机系) CILA -- University of Bari Aldo Moro, Italy(巴里阿尔多·莫罗大学计算机系)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种工作流,用于提取包含模式和基础事实的完整数据集,以支持机器学习和知识图谱推理,并提供了相关工具和数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04942 2026-02-17 cs.LG cs.AI 62%

Privileged Information Distillation for Language Models

特权信息蒸馏用于语言模型

Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste, Laurent Charlin, Massimo Caccia

机构 * McGill University(麦吉尔大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出π-Distill和OPSD两种方法,通过特权信息蒸馏提升语言模型在复杂代理环境中的表现,优于传统监督微调加强化学习的方法。

Comments Abstract border should have been purple

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20802 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning via Self-Distillation

通过自我蒸馏进行强化学习

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) MIT(麻省理工学院) Stanford(斯坦福大学)

专题命中 规划决策 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 通过自我蒸馏策略优化(SDPO)提升强化学习在可验证环境中的样本效率和准确性,利用自身反馈改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14252 2026-02-17 cs.AI cs.LG cs.RO 62%

GRAIL: Goal Recognition Alignment through Imitation Learning

GRAIL:通过模仿学习进行目标识别对齐

Osher Elhadad, Felipe Meneguzzi, Reuth Mirsky

机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, Aberdeen University(阿伯丁大学计算机科学系) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 GRAIL通过模仿学习和逆强化学习,从演示轨迹中学习目标导向策略,提高目标识别的准确性和鲁棒性。

Comments Accepted for publication at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14216 2026-02-17 cs.CY cs.AI cs.CL 62%

Reasoning Language Models for complex assessments tasks: Evaluating parental cooperation from child protection case reports

用于复杂评估任务的推理语言模型:从儿童保护案件报告中评估父母合作

Dragan Stoll, Brian E. Perron, Zia Qi, Selina Steinmann, Nicole F. Eicher, Andreas Jud

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了推理语言模型在评估儿童保护案件中父母合作方面的有效性,发现模型在母亲合作评估上表现更佳,但对父亲合作的评估准确性较低,提示需关注性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13949 2026-02-17 cs.LG cs.AI 62%

Experiential Reinforcement Learning

经验强化学习

Taiwei Shi, Sihao Chen, Bowen Jiang, Linxin Song, Longqi Yang, Jieyu Zhao

机构 * University of Southern California(南加州大学) Microsoft(微软公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 经验强化学习通过显式经验-反思-巩固循环提升语言模型在稀疏奖励环境中的学习效率和性能。

Comments 26 pages, 9 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13865 2026-02-17 cs.AI cs.LG cs.RO 62%

Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay

通过 hindsight 经验回放实现稀疏奖励下的选项学习

Gabriel Romio, Mateus Begnini Melchiades, Bruno Castro da Silva, Gabriel de Oliveira Ramos

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出2HER方法,通过双目标重新标记策略提升稀疏奖励多目标任务中的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06964 2026-02-17 cs.CL cs.LG 62%

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

通过奖励加权微调实现离线强化学习用于对话优化

Subhojyoti Mukherjee, Viet Dac Lai, Raghavendra Addanki, Ryan Rossi, Seunghyun Yoon, Trung Bui, Anup Rao, Jayakumar Subramanian, Branislav Kveton

机构 * Adobe Research(Adobe研究院)

专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过奖励加权微调实现离线强化学习,用于对话优化,相比传统方法在奖励和语言质量上取得显著提升。

Comments Advances in Neural Information Processing Systems 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 62%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13262 2026-02-17 cs.AI cs.CL 62%

General learned delegation by clones

通过克隆实现通用学习委托

Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

机构 * Qiuzhen College, Tsinghua University(清华大学齐振学院) Pattern Recognition Center, WeChat AI, Tencent Inc(微信AI模式识别中心,腾讯公司)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 SELFCEST通过代理强化学习实现通用学习委托,利用克隆技术在不同并行上下文中分配资源,提升数学推理和长上下文问答任务的准确性与效率。

Comments Code available at https://github.com/SuffixAutomata/SELFCEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13230 2026-02-17 cs.AI cs.LG 62%

Intelligence as Trajectory-Dominant Pareto Optimization

智能作为轨迹主导的帕累托优化

Truong Xuan Khanh, Truong Quynh Hoa

机构 * H&K Research Studio, Clevix LLC(H&K研究室,Clevix LLC)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出轨迹主导的帕累托优化,通过轨迹层面的多目标权衡解决智能优化中的长周期发展约束问题。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏