arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35728 篇

2605.21665 2026-05-22 cs.MA cs.AI 79%

Planning, Scheduling, and Behavior in EV Charging Systems: A Critical Survey and Trilemma Framework

电动汽车充电系统中的规划、调度与行为:一项批判性综述与三重困境框架

Peiyan Xiao, Yuheng Li, Ayan Mukhopadhyay, Sai Krishna Ghanta, Sabur Baidya, Yanhai Xiong

机构 * The College of William \& Mary, Williamsburg, VA, USA University of Georgia, Athens, GA, USA University of Louisville, Louisville, KY, USA

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文综述了电动汽车充电系统中规划、调度和行为三个层面的研究,提出了三重困境框架,揭示了在追求高保真度时面临的可计算性与现实整合之间的权衡问题。

Comments Review article; 56 pages excluding references; 1 figure and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20172 2026-05-20 cs.LO cs.AI 79%

Long-term Power Grid Planning via Answer Set Programming

通过答案集编程进行长期电力网络规划

Antonio Ielo, Francesco Doria, Sandra Castellanos-Paez, Marco Maratea, Francesco Percassi, Mauro Vallati

机构 * University of Calabria, Italy(意大利卡拉布里亚大学) University of Huddersfield, UK(英国赫德瑟菲尔德大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于答案集编程的自动化和优化长期电力网络规划方法,以解决可持续性目标、需求模式和城市化趋势等复杂问题。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15435 2026-05-20 cs.CV cs.AI cs.MA 79%

ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models

ORCA:一种用于视觉语言模型幻觉和对抗鲁棒性的代理推理框架

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(佛罗里达大学) United States Military Academy(美国军事学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ORCA框架,通过推理时的结构化推理和小规模视觉模型,提升预训练视觉语言模型的事实准确性与对抗鲁棒性,并在幻觉基准和对抗扰动测试中取得显著提升。

Comments Accepted at the ACM International Conference on Cloud and Big Data Computing (ICCBDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19562 2026-05-20 cs.RO cs.LG math.OC 79%

Learning-Accelerated Optimization-based Trajectory Planning for Cooperative Aerial-Ground Handover Missions

基于学习的优化轨迹规划用于协作的空中-地面切换任务

Jingshan Chen, Bochen Yu, Henrik Ebel, Peter Eberhard

机构 * Institute of Engineering and Computational Mechanics, University of Stuttgart, 70569 Stuttgart, Germany(工程与计算力学研究所,斯图加特大学,德国斯图加特70569) Mechanical Engineering, LUT University, 53850 Lappeenranta, Finland(机械工程,卢蒂大学,芬兰拉佩恩兰塔53850)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出了一种结合学习的轨迹规划框架,用于协同无人 aerial 和 ground 车辆的切换任务,通过使用解耦的编码器-解码器 LSTM 网络生成协调的切换轨迹预测,从而加速优化过程,实现更快的收敛和更高的优化成功率。

Comments Preprint of a contribution accepted for publication in the RoManSy 2026 Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18674 2026-05-19 cs.AI 79%

Efficient Lookahead Encoding and Abstracted Width for Learning General Policies in Classical Planning

高效前瞻编码与抽象宽度用于经典规划中学习通用策略

Michael Aichmüller, Simon Ståhlberg, Martin Funkquist, Hector Geffner

机构 * RWTH Aachen University(亚琛RWTH大学) Linköping University(林雪平大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种高效的方法,通过整体编码和抽象宽度来提升经典规划中学习通用策略的效率和可扩展性,解决了传统方法在计算成本和表达能力上的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17815 2026-05-19 cs.RO cs.AI 79%

Virtues of Ordered Chaos: Planning with Topple Actions in Tabletop Stack Rearrangement

秩序之中的混沌:在桌面堆叠重构中使用Topple动作的规划

Hao Lu, Rahul Shome

机构 * School of Computing at the Australian National University(澳大利亚国立大学计算学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文研究了桌面环境中堆叠重构任务,通过引入更丰富的非抓取聚合动作(特别是从堆叠中倒落物体到桌面的Topple动作)来增强任务规划领域。核心方法是提出一种新的Topple聚合工具,将候选任务计划计算转化为 Pebble Motion 问题变体,从而在IsaacSim物理模拟中验证了其效果,展示了在执行速度上的显著优势。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17556 2026-05-19 cs.RO cs.AI 79%

Visual Sculpting: Visually-Aligned Planning Representations for Long-Horizon Robot Clay Sculpting

视觉雕刻:用于长周期机器人泥塑的视觉对齐规划表示

Peter Schaldenbrand, Jean Oh

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种视觉对齐的规划表示方法,用于长周期机器人泥塑任务,通过捕捉光照和纹理特征,提高了对可变形材料动态的建模能力,并展示了在不同可变形材料和末端执行器下的性能。

Comments 8 pages, 14 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17058 2026-05-19 cs.LG 79%

Learning Multi-Timescale Abstractions for Hierarchical Combinatorial Planning

学习多时间尺度抽象以进行分层组合规划

Vivienne Huiling Wang, Tinghuai Wang, Joni Pajarinen

机构 * Department of Electrical Engineering(电气工程系) Automation, Aalto University, Finland(自动化,艾尔沃斯大学,芬兰)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于模型的分层框架,用于解决序列随机组合决策问题,通过多时间尺度目标结构化潜在动态,实现高效的前瞻规划,并联合学习子目标条件预算策略以支持上下文感知的资源分配。

Comments 34 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06799 2026-05-19 cs.ET cs.AI 79%

LSDTs: LLM-Augmented Semantic Digital Twins for Adaptive Knowledge-Intensive Infrastructure Planning

LSDTs: 基于大语言模型的语义数字孪生用于自适应知识密集型基础设施规划

Naiyi Li, Zihui Ma, Runlong Yu, Lingyao Li

机构 * Department of Civil & Environmental Engineering, University of Maryland, College Park(大学公园马里兰大学土木与环境工程系) Center for Urban Science and Progress, New York University(纽约大学城市科学与进步中心) Department of Computer Science, University of Alabama(阿拉巴马大学计算机科学系) School of Information, University of South Florida(佛罗里达州立大学信息学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出LSDTs框架,利用大语言模型从非结构化文档中提取规划知识并构建形式本体,通过语义层提升数字孪生在复杂规划场景中的适应性与仿真精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15120 2026-05-18 cs.RO cs.AI cs.CV 79%

CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning

CLOVER:端到端自动驾驶规划的闭环价值估计与排序

Sining Ang, Yuguang Yang, Canyu Chen, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Electronic Information Engineering, Beihang University(北航电子信息技术学院) National College for Excellent Engineers, Beihang University(北航卓越工程师学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 CLOVER通过闭环价值估计与排序框架,解决端到端自动驾驶规划中训练与评估不匹配的问题,通过生成器和评分器的轻量级架构提升规划器性能,实现更准确的候选轨迹排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08964 2026-05-18 cs.LG 79%

T2T-LA: A Topology-to-Topology LLM Agent for Graph Learning with Neither Feature Access nor Task Knowledge

T2T-LA:一种用于图学习的拓扑到拓扑LLM代理,无需特征访问或任务知识

Yongyu Wang

机构 * MTU(MTU大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.LG

AI总结 本文提出T2T-LA,一种无需特征访问或任务知识的拓扑到拓扑LLM代理,通过学习失败拓扑与评分之间的关系,实现图学习中的拓扑推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15203 2026-05-18 cs.IR cs.AI cs.MA 79%

Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation

Agent4POI: 基于代理的上下文条件化 affordance 推理用于多模态兴趣点推荐

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Yongchao Liu, Xingjun Ma, Zhu Sun

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本理工大学) Southeast University(东南大学) Chengdu University of Information Technology(成都信息工程大学) Fudan University(复旦大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 Agent4POI 提出一种新的兴趣点推荐框架,通过在推荐时生成上下文条件化的多模态表示,而非依赖静态兴趣点嵌入。该方法通过代理生成动态 affordance 查询并执行跨模态推理,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08512 2026-05-15 cs.LG 79%

MoMo: Conditioned Contrastive Representation Learning for Preference-Modulated Planning

MoMo:基于偏好调节的对比表征学习用于偏好调节规划

Yusuf Syed, Viraj Parimi, Brian Williams

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 MoMo通过特征线性调制和低秩神经调制,实现基于偏好调节的对比表征学习,使规划保守性在推理时可连续调节,提升时间与偏好一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12784 2026-05-15 cs.LG cs.NE q-bio.QM 79%

ToolMol: Evolutionary Agentic Framework for Multi-objective Drug Discovery

ToolMol:多目标药物发现的进化代理框架

Andrew Y. Zhou, Sharvaree Vadgama, Sumanth Varambally, Peter Eckmann, Michael K. Gilson, Rose Yu

机构 * Department of Computer Science(计算机科学系) Skaggs School of Pharmacy(斯卡格斯药学院) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 ToolMol结合多目标遗传算法与代理LLM操作符,通过迭代更新配体群体,实现多目标属性优化,发现具有更强预测结合亲和力的药物候选物。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19973 2026-05-15 cs.NI cs.AI 79%

A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks

面向6G自主网络的智能偏差教程

Hatim Chergui, Farhad Rezazadeh, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Hostelworld Group(Hostelworld集团) Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚)) Khalifa University of Science and Technology(卡里玛大学) ISI/ATH University of Patras(帕特拉大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文探讨了在6G自主网络中因人类设计引入的认知偏差问题,通过两个案例展示如何利用智能体AI缓解锚定偏差和时间偏差,提升网络管理和边缘计算的效率与节能效果。

Comments 26 pages, 18 figures, 4 tables, link to source code available. Accepted at IEEE OJCOMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04646 2026-05-15 cs.RO cs.LG 79%

ActivePusher: Active Learning and Planning with Residual Physics for Nonprehensile Manipulation

ActivePusher: 基于残差物理的主动学习与规划用于非抓取操作

Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯特理工学院(WPI))

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出ActivePusher框架,结合残差物理模型与不确定性主动学习,提升非抓取操作的数据效率和规划成功率。

Comments Accepted by the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13702 2026-05-14 cs.AI 79%

Adaptive mine planning under geological uncertainty: A POMDP framework for sequential decision-making

在地质不确定性下的自适应采矿规划:一个用于序列决策的POMDP框架

Hamza Khalifi, Jef Caers, Yassine Taha, Mostafa Benzaazoua, Abdellatif Elghali

机构 * Geology & Sustainable Mining Institute (GSMI), University Mohammed VI Polytechnic (UM6P)(地质与可持续采矿研究所(GSMI),穆罕默德六世理工学院(UM6P)) Department of Earth and Planetary Sciences, Stanford University(地球与行星科学系,斯坦福大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出将采矿调度建模为部分可观测马尔可夫决策过程,通过混合SA-POMDP架构实现自适应决策,减少预期现实差距并提升净现值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.03496 2026-05-14 cs.AI cs.LO cs.RO 79%

Human Robot Collaborative Assembly Planning: An Answer Set Programming Approach

人类机器人协作装配规划:一种答案集编程方法

Momina Rizwan, Volkan Patoglu, Esra Erdem

机构 * Faculty of Engineering and Natural Sciences, Sabancı University, Istanbul, Turkey(工程与自然科学学院,萨班奇大学,伊斯坦布尔,土耳其)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于答案集编程的协作装配规划方法,结合常识推理和丰富的沟通动作,用于处理不确定性和确保安全协作。

Comments 36th International Conference on Logic Programming (ICLP 2020), University Of Calabria, Rende (CS), Italy, September 2020, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00745 2026-05-14 cs.AI cs.LO cs.RO 79%

A Formal Framework for Robot Construction Problems: A Hybrid Planning Approach

机器人构建问题的正式框架:一种混合规划方法

Faseeh Ahmad, Esra Erdem, Volkan Patoglu

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于答案集编程的混合规划框架,用于解决机器人构建问题,确保结构稳定性、支撑性和任务顺序,通过基准实例验证了方法的有效性。

Comments 8 pages (double-column), 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13037 2026-05-14 cs.AI 79%

MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

MAP:一种用于长周期交互代理推理的先映射再行动范式

Yuxin Liu, Ziang Ye, Yueqing Sun, Mingye Zhu, Jinwei Xiao, Zhuowen Han, Qi GU, Xunliang Cai, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 规划决策 :agent(title);planning(abstract);分类 cs.AI

AI总结 本文提出MAP范式,通过先构建环境认知再执行任务,解决交互代理中环境感知延迟问题,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26839 2026-05-14 cs.LG cs.CV 79%

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

从像素到BFS:高迷宫精度并不意味着视觉规划

Alberto G. Rodriguez Salgado

机构 * Independent Researcher(独立研究者)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。

Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08411 2026-05-14 cs.AI cs.RO 79%

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

棱柱世界模型:学习组合动力学以在混合系统中规划

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) NLCo Lab, Beijing Institute for General Artificial Intelligence(北大师范学院实验室,北京人工智能研究院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出Prismatic World Model,通过分解混合动力学为可组合的原始构件,解决机器人领域中基于模型的规划问题,提升轨迹优化算法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 79%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 79%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11117 2026-05-13 cs.LG cs.MA math.PR 79%

GRAFT-ATHENA: Self-Improving Agentic Teams for Autonomous Discovery and Evolutionary Numerical Algorithms

GRAFT-ATHENA:自我改进的代理团队用于自主发现和进化数值算法

Juan Diego Toscano, Zhaojie Chai, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 GRAFT-ATHENA通过自我改进的代理团队,在自主发现和进化数值算法中实现跨领域的方法积累与能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10754 2026-05-12 cs.AI 79%

The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents

代理行为的代理使用:代理循证学是基础代理的缺失科学

Xinrun Wang, Chang Yang, He Zhao, Zhuoyi Lin, Shuyue Hu

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息通信研究院,科技研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出代理循证学作为基础代理的理论基础,通过将经典循证学定律映射到代理设计原则,提出可靠性、持续运行和自我改进三大工程需求,以指导复杂任务中的代理设计与部署。

Comments Preliminary Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI 79%

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 79%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :autonomous agent(title,abstract);分类 cs.CL

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 79%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09638 2026-05-12 cs.LG 79%

Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning

Plan2Cleanse:通过深度强化学习中的蒙特卡洛规划实现测试时后门防御

Sze-Ann Chen, Zhi-Yi Chin, Kui-Yuan Chen, Chi-Yu Li, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出Plan2Cleanse框架,利用蒙特卡洛树搜索在无需重新训练的情况下检测和缓解强化学习中的后门攻击,通过在MuJoCo、O-RAN和Atari环境中测试,显著提升了后门检测成功率和对抗性环境中的胜率。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏