arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-25 至 2026-02-25 共收录 107 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 8 篇

2602.20867 2026-02-25 cs.CR cs.AI cs.CE cs.ET 89%

SoK: Agentic Skills -- Beyond Tool Use in LLM Agents

SoK: 代理技能——超越LLM代理中的工具使用

Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu

机构 * University of Technology Sydney(悉尼科技大学) CSIRO Data61(CSIRO数据61)

专题命中 工具调用 :agentic(title,abstract);tool use(title);agent(abstract);autonomous agent(abstract)

AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20739 2026-02-25 cs.AI cs.CV 83%

PyVision-RL: Forging Open Agentic Vision Models via RL

通过强化学习构建开放代理视觉模型:PyVision-RL

Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

机构 * Shanghai AI Lab(上海人工智能实验室) Rice University(里士满大学) Shanda AI Research, Tokyo(上海沙达人工智能研究东京)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI

AI总结 PyVision-RL通过强化学习框架解决多模态代理的交互崩溃问题,结合回放策略和累积奖励提升多轮推理能力,实现高效视频理解与处理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03022 2026-02-25 cs.AI 83%

STAR: Similarity-guided Teacher-Assisted Refinement for Super-Tiny Function Calling Models

STAR: 基于相似性引导的教师辅助细化方法用于超小功能调用模型

Jiliang Ni, Jiachen Pu, Zhongyi Yang, Jingfeng Luo, Conggang Hu

机构 * Algorithm Platform Team, AI Hardware Division, Alibaba(阿里巴巴人工智能硬件事业部算法平台团队)

专题命中 工具调用 :function calling(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 STAR通过约束知识蒸馏和基于相似性的强化学习,有效将大语言模型能力转移到超小模型,实现复杂功能调用任务的高性能表现。

Comments The paper has been accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24694 2026-02-25 cs.CL cs.AI 81%

Repurposing Synthetic Data for Fine-grained Search Agent Supervision

将合成数据重新利用于细粒度搜索代理的监督

Yida Zhao, Kuan Li, Xixi Wu, Liwen Zhang, Dingchu Zhang, Baixuan Li, Maojia Song, Zhuo Chen, Chenxi Wang, Xinyu Wang, Kewei Tu, Pengjun Xie, Jingren Zhou, Yong Jiang

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Shanghai Engineering Research Center of Intelligent Vision and Imaging(智能视觉与成像上海工程研究中心) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出E-GRPO框架,通过利用训练中被丢弃的实体信息,提升搜索代理的细粒度学习和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14281 2026-02-25 cs.CR cs.CL 77%

MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents

MCPShield: 一种用于模型上下文协议代理自适应信任校准的安全认知层

Zhenhong Zhou, Yuanhe Zhang, Hongwei Cai, Moayad Aloqaily, Ouns Bouachir, Linsey Pang, Prakhar Mehrotra, Kun Wang, Qingsong Wen

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 MCPShield通过元数据引导探测和历史轨迹推理,提升代理在调用MCP工具时的安全性,有效防御MCP攻击。

Comments 21 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20809 2026-02-25 cs.LG cs.AI 62%

Regret-Guided Search Control for Efficient Learning in AlphaZero

基于遗憾的搜索控制用于AlphaZero中的高效学习

Yun-Jui Tsai, Wei-Yu Chen, Yan-Ru Ju, Yu-Hung Chang, Ti-Rong Wu

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(National Yang Ming Chiao Tung University) Institute of Information Science, Academia Sinica, Taiwan(Academia Sinica) College of Computing, Georgia Institute of Technology(Georgia Institute of Technology)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 RGSC通过学习识别高遗憾状态,提升AlphaZero的搜索效率和鲁棒性,显著提高围棋等游戏的性能。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15796 2026-02-25 cs.LG cs.AI q-bio.BM 62%

Monte Carlo Tree Diffusion with Multiple Experts for Protein Design

结合多专家的蒙特卡洛树扩散用于蛋白质设计

Xuefeng Liu, Mingxuan Cao, Songhao Jiang, Xiao Luo, Xiaotian Duan, Mengdi Wang, Tobin R. Sosnick, Jinbo Xu, Rick Stevens

机构 * University of Chicago(芝加哥大学) Data Science Institute(数据科学研究所) Department of Biochemistry and Molecular Biology(生物化学与分子生物学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Argonne National Laboratory(阿贡国家实验室) Princeton University(普林斯顿大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 MCTD-ME通过结合多专家的蒙特卡洛树扩散方法,提升蛋白质设计任务的性能,特别是在反向折叠、折叠和条件设计挑战中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21041 2026-02-25 cs.GT cs.MA 50%

Stability Under Valuation Updates in Coalition Formation

联盟形成中估值更新下的稳定性

Fabian Frank, Matija Novaković, René Romen

专题命中 工具调用 :agent(abstract)

AI总结 本文研究了在代理人估值变化下联盟形成中的稳定性问题,证明了多种稳定性概念下的NP完全性,并提出了在受限对称估值下的多项式时间算法以保证长期更新中的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 37 篇

2602.20196 2026-02-25 cs.CR cs.AI 88%

OpenPort Protocol: A Security Governance Specification for AI Agent Tool Access

OpenPort 协议:AI 代理工具访问的安全治理规范

Genliang Zhu, Chu Wang, Ziyuan Wang, Zhida Li, Qiang Li

机构 * Accentrust Georgia Institute of Technology(阿肯色州立大学) Accentrust University of Illinois Urbana-Champaign(阿肯色州立大学) Duke University(杜克大学) New York Institute of Technology-Vancouver(纽约理工学院-温哥华分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 OpenPort 协议通过安全治理规范实现AI代理工具访问的可控性和安全性,提供风险门控生命周期、授权模型和审计机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01856 2026-02-25 eess.SY cs.SY 88%

Hierarchical Multi-Agent MCTS for Safety-Critical Coordination in Mixed-Autonomy Roundabouts

分层多智能体MCTS用于混合自主性环形路口的安全协调

Zhihao Lin, Jianglin Lan, Shuo Liu, Zhen Tian, Dezong Zhao, Chongfeng Wei

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract)

AI总结 本文提出了一种分层多智能体MCTS框架,用于混合自主性环形路口的安全协调,通过车道特定不确定性模型和安全意识修剪,有效降低轨迹偏移和PET违规率。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15763 2026-02-25 cs.LG cs.CL 84%

GLM-5: from Vibe Coding to Agentic Engineering

GLM-5:从振动编码到代理工程

GLM-5-Team, :, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin Chen, Da Yin, Chendi Ge, Chenghua Huang, Chengxing Xie, Chenzheng Zhu, Congfeng Yin, Cunxiang Wang, Gengzheng Pan, Hao Zeng, Haoke Zhang, Haoran Wang, Huilong Chen, Jiajie Zhang, Jian Jiao, Jiaqi Guo, Jingsen Wang, Jingzhao Du, Jinzhu Wu, Kedong Wang, Lei Li, Lin Fan, Lucen Zhong, Mingdao Liu, Mingming Zhao, Pengfan Du, Qian Dong, Rui Lu, Shuang-Li, Shulin Cao, Song Liu, Ting Jiang, Xiaodong Chen, Xiaohan Zhang, Xuancheng Huang, Xuezhen Dong, Yabo Xu, Yao Wei, Yifan An, Yilin Niu, Yitong Zhu, Yuanhao Wen, Yukuo Cen, Yushi Bai, Zhongpei Qiao, Zihan Wang, Zikang Wang, Zilin Zhu, Ziqiang Liu, Zixuan Li, Bojie Wang, Bosi Wen, Can Huang, Changpeng Cai, Chao Yu, Chen Li, Chengwei Hu, Chenhui Zhang, Dan Zhang, Daoyan Lin, Dayong Yang, Di Wang, Ding Ai, Erle Zhu, Fangzhou Yi, Feiyu Chen, Guohong Wen, Hailong Sun, Haisha Zhao, Haiyi Hu, Hanchen Zhang, Hanrui Liu, Hanyu Zhang, Hao Peng, Hao Tai, Haobo Zhang, He Liu, Hongwei Wang, Hongxi Yan, Hongyu Ge, Huan Liu, Huanpeng Chu, Jia'ni Zhao, Jiachen Wang, Jiajing Zhao, Jiamin Ren, Jiapeng Wang, Jiaxin Zhang, Jiayi Gui, Jiayue Zhao, Jijie Li, Jing An, Jing Li, Jingwei Yuan, Jinhua Du, Jinxin Liu, Junkai Zhi, Junwen Duan, Kaiyue Zhou, Kangjian Wei, Ke Wang, Keyun Luo, Laiqiang Zhang, Leigang Sha, Liang Xu, Lindong Wu, Lintao Ding, Lu Chen, Minghao Li, Nianyi Lin, Pan Ta, Qiang Zou, Rongjun Song, Ruiqi Yang, Shangqing Tu, Shangtong Yang, Shaoxiang Wu, Shengyan Zhang, Shijie Li, Shuang Li, Shuyi Fan, Wei Qin, Wei Tian, Weining Zhang, Wenbo Yu, Wenjie Liang, Xiang Kuang, Xiangmeng Cheng, Xiangyang Li, Xiaoquan Yan, Xiaowei Hu, Xiaoying Ling, Xing Fan, Xingye Xia, Xinyuan Zhang, Xinze Zhang, Xirui Pan, Xu Zou, Xunkai Zhang, Yadi Liu, Yandong Wu, Yanfu Li, Yidong Wang, Yifan Zhu, Yijun Tan, Yilin Zhou, Yiming Pan, Ying Zhang, Yinpei Su, Yipeng Geng, Yong Yan, Yonglin Tan, Yuean Bi, Yuhan Shen, Yuhao Yang, Yujiang Li, Yunan Liu, Yunqing Wang, Yuntao Li, Yurong Wu, Yutao Zhang, Yuxi Duan, Yuxuan Zhang, Zezhen Liu, Zhengtao Jiang, Zhenhe Yan, Zheyu Zhang, Zhixiang Wei, Zhuo Chen, Zhuoer Feng, Zijun Yao, Ziwei Chai, Ziyuan Wang, Zuzhou Zhang, Bin Xu, Minlie Huang, Hongning Wang, Juanzi Li, Yuxiao Dong, Jie Tang

机构 * GLM-5 Team(GLM-5团队) Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 GLM-5通过异步强化学习和DSA技术实现高效训练与推理,展现卓越的软件工程能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23502 2026-02-25 cs.NI 82%

Hierarchical Decision Mamba Meets Agentic AI: A Novel Approach for RAN Slicing in 6G

分层决策Mamba遇见代理AI:一种用于6G RAN切片的新方法

Md Arafat Habib, Medhat Elsayed, Majid Bavand, Pedro Enrique Iturria Rivera, Yigit Ozcan, Melike Erol-Kantarci

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 本文提出了一种基于分层决策Mamba和大型语言模型的代理AI框架,用于6G RAN切片,通过整合自然语言理解与协调决策,提升切片性能。

Comments Accepted for publication in IEEE Networking Letters (Author's copy). Copyright belongs to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20528 2026-02-25 cs.CL cs.LG 81%

Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning

停止-思考-自动回归:结合潜在扩散规划的语言建模

Justin Lovelace, Christian Belardi, Sofian Zalouk, Adhitya Polavaram, Srivatsa Kundurthy, Kilian Q. Weinberger

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL、cs.LG

AI总结 STAR-LDM通过引入思考阶段的潜在扩散规划,实现了更高效的全局规划和生成,显著提升了语言理解和叙事连贯性任务的表现。

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20422 2026-02-25 cs.AI cs.LG 81%

Diffusion Modulation via Environment Mechanism Modeling for Planning

通过环境机制建模进行扩散调制用于规划

Hanping Zhang, Yuhong Guo

机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过环境机制建模的扩散调制方法提升了离线强化学习中轨迹生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO 81%

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21174 2026-02-25 cs.RO cs.AI 79%

Efficient Hierarchical Any-Angle Path Planning on Multi-Resolution 3D Grids

高效多分辨率3D网格上的分层任意角度路径规划

Victor Reijgwart, Cesar Cadena, Roland Siegwart, Lionel Ott

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多分辨率表示的高效任意角度路径规划方法,兼顾最优性和完备性,克服了传统搜索方法的计算瓶颈,实验表明其在真实和合成环境中的优越性能。

Comments 12 pages, 9 figures, 4 tables, accepted to RSS 2025, code is open-source: https://github.com/ethz-asl/wavestar

Journal ref Proceedings of Robotics: Science and Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20810 2026-02-25 cs.AI 79%

POMDPPlanners: Open-Source Package for POMDP Planning

POMDPPlanners:用于POMDP规划的开源包

Yaacov Pariente, Vadim Indelman

机构 * Faculty of Mathematics Technion - Israel Institute of Technology(数学系技术学院 - 以色列理工学院) Stephen B. Klein Faculty of Aerospace Engineering Faculty of Data and Decision Sciences Technion - Israel Institute of Technology(Stephen B. Klein航空航天工程系数据与决策科学系技术学院 - 以色列理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 POMDPPlanners是一个开源工具包,提供先进的POMDP规划算法、安全关键环境、自动超参数优化和并行模拟功能,用于支持不确定性决策下的可扩展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13932 2026-02-25 cs.RO 78%

Joint Task Assistance Planning via Nested Branch and Bound (Extended Version)

通过嵌套分支限界法进行联合任务协助规划(扩展版)

Omer Daube, Oren Salzman

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出嵌套分支限界法解决机器人联合任务协助规划问题,通过分层探索路径空间,实现高效计算并显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08054 2026-02-25 cs.RO 78%

A Novel Semi-Coupled Hierarchical Motion Planning Framework for Cooperative Transportation of Multiple Mobile Manipulators

一种用于多移动机械臂协作运输的新型半耦合分层运动规划框架

Heng Zhang, Haoyi Song, Wenhang Liu, Xinjun Sheng, Zhenhua Xiong, Xiangyang Zhu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai, China(机械工程学院,上海交通大学,上海,中国)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种新型半耦合分层框架,用于解决多移动机械臂协作运输中的运动规划问题,通过集中层和分层层的协同优化,提升了任务执行的成功率和效率。

Comments 21 pages, 9 figures

Journal ref Robotica 43 (2025) 4302-4324

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20476 2026-02-25 cs.CV 78%

SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens

SceMoS:通过基于几何的令牌规划进行场景感知的3D人体运动合成

Anindita Ghosh, Vladislav Golyanik, Taku Komura, Philipp Slusallek, Christian Theobalt, Rishabh Dabral

机构 * DFKI(德累斯顿人工智能研究所) MPI for Informatics(信息研究所) Saarland Informatics Campus(萨尔州信息校园) University of Hong Kong(香港大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 SceMoS通过基于几何的令牌规划,利用2D场景表示实现高效且逼真的3D人体运动合成,减少50%以上可训练参数,提升物理真实性和接触精度。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21136 2026-02-25 cs.HC cs.AI cs.CY 77%

SparkMe: Adaptive Semi-Structured Interviewing for Qualitative Insight Discovery

SparkMe: 适应性半结构化访谈用于定性洞察发现

David Anugraha, Vishakh Padmakumar, Diyi Yang

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SparkMe通过多智能体LLM实现适应性半结构化访谈,提升访谈效用并挖掘更丰富的职业特定洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18639 2026-02-25 cs.LG math.OC 74%

Learning Invariant Visual Representations for Planning with Joint-Embedding Predictive World Models

学习具有联合嵌入预测的世界模型以实现规划

Leonardo F. Toso, Davit Shadunts, Yunyang Lu, Nihal Sharma, Donglin Zhan, Nam H. Nguyen, James Anderson

机构 * Department of Electrical Engineering, Columbia University, New York, USA.(电气工程系,哥伦比亚大学,纽约,美国)

专题命中 规划决策 :planning(title);分类 cs.LG

AI总结 本文提出了一种联合嵌入预测世界模型,通过引入双模拟编码器增强对慢特征的鲁棒性,提升在减少潜在空间中的导航任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20297 2026-02-25 stat.ML cs.LG 70%

Gap-Dependent Bounds for Nearly Minimax Optimal Reinforcement Learning with Linear Function Approximation

与间隙相关的性能保证:具有线性函数逼近的近似最小最大最优强化学习

Haochen Zhang, Zhong Zheng, Lingzhou Xue

机构 * Department of Statistics, The Pennsylvania State University(统计学系,宾夕法尼亚州立大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出了一种具有线性函数逼近的多智能体强化学习算法,通过改进的间隙依赖后悔界实现了高效的并行探索和加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18337 2026-02-25 cs.CL 70%

Towards Efficient Agents: A Co-Design of Inference Architecture and System

迈向高效代理:推理架构与系统的一体化设计

Weizhe Lin, Hui-Ling Zhen, Shuai Yang, Xian Wang, Renxi Liu, Hanting Chen, Wangze Zhang, Chuansai Zhou, Yiming Li, Chen Chen, Xing Li, Zhiyuan Yang, Xiaosong Li, Xianzhi Yu, Zhenhua Dong, Mingxuan Yuan, Yunhe Wang

机构 * Huawei(华为)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出AgentInfer框架,通过整合推理架构与系统设计,提升代理的效率与稳定性,减少无效token消耗,实现速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21161 2026-02-25 cs.RO 67%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 67%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20517 2026-02-25 cs.AI cs.CL cs.LG 67%

Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination

内部言语作为行为引导:为人类-人工智能协调的可操控模仿

Rakshit Trivedi, Kartik Sharma, David C Parkes

机构 * Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 MIMIC通过语言作为内部表示,利用视觉语言模型和扩散策略实现人类-人工智能协调中的行为引导与多样化的模仿控制。

Comments Spotlight paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04867 2026-02-25 cs.AI cs.HC cs.LG cs.RO 62%

Sensory-Motor Control with Large Language Models via Iterative Policy Refinement

通过迭代策略优化实现大语言模型的感官-运动控制

Jônata Tyska Carvalho, Stefano Nolfi

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学) Institute of Cognitive Sciences and Technologies (ISTC-CNR)(认知科学与技术研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过迭代策略优化,利用大语言模型控制具身代理,结合符号知识与子符号感官运动数据实现高效控制。

Comments Final version of the article accepted for publication on Scientific Reports. 29 pages (13 pages are from appendix), 8 figures, 2 tables, code for experiments replication and supplementary material provided at https://github.com/jtyska/llm-robotics-article/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16613 2026-02-25 cs.LG cs.AI 62%

Safe Reinforcement Learning for Real-World Engine Control

用于现实世界发动机控制的安全强化学习

Julian Bedei, Lucas Koch, Kevin Badalian, Alexander Winkler, Patrick Schaber, Jakob Andert

机构 * Teaching and Research Area Mechatronics in Mobile Propulsion(移动传动机械研究与教学领域) RWTH Aachen University(亚琛工业大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种安全强化学习方法,用于在高热效率和低排放的HCCI模式下实现发动机控制,通过实时安全监控和实验验证,有效解决了传统控制方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20643 2026-02-25 cs.LG cs.AI 62%

TrajGPT-R: Generating Urban Mobility Trajectory with Reinforcement Learning-Enhanced Generative Pre-trained Transformer

TrajGPT-R: 基于强化学习增强的生成式预训练变换器生成城市移动轨迹

Jiawei Wang, Chuang Yang, Jiawei Yong, Xiaohang Xu, Hongjun Wang, Noboru Koshizuka, Shintaro Fukushima, Ryosuke Shibasaki, Renhe Jiang

机构 * The University of Tokyo(东京大学) Toyota Motor Corporation(丰田汽车公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TrajGPT-R通过强化学习增强的生成式预训练变换器生成城市移动轨迹,提升了轨迹生成的可靠性和多样性,为交通管理和城市规划提供支持。

Comments TrajGPT-R is a Reinforcement Learning-Enhanced Generative Pre-trained Transformer for Mobility Trajectory Generation

详情

展开后加载摘要…

URL PDF HTML 收藏