arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-11 至 2026-02-11 共收录 115 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 45 篇

2602.10007 2026-02-11 cs.RO cs.AI cs.MA cs.SY eess.SY 70%

A Collaborative Safety Shield for Safe and Efficient CAV Lane Changes in Congested On-Ramp Merging

用于拥堵上坡合并中安全高效CAV变道的协作安全盾

Bharathkumar Hegde, Melanie Bouroche

机构 * School of Computer Science and Statistics, Trinity College Dublin(计算机科学与统计学系,三一学院都柏林)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MARL-MASS,通过整合多智能体安全盾和定制奖励函数,在拥堵交通中实现安全且高效的车道变换。

Comments Accepted in IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09443 2026-02-11 cs.AI 70%

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

P1-VL: 联结视觉感知与物理竞赛中的科学推理

Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 P1-VL通过融合课程强化学习和代理增强技术,成为首个在物理竞赛中获得12枚金牌的开源视觉-语言模型,展示了卓越的科学推理能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09159 2026-02-11 cs.AI cs.MA 70%

CoMMa: Contribution-Aware Medical Multi-Agents From A Game-Theoretic Perspective

从博弈论视角出发的贡献感知医疗多智能体:CoMMa

Yichen Wu, Yujin Oh, Sangjoon Park, Kailong Fan, Dania Daye, Hana Farzaneh, Xiang Li, Raul Uppot, Quanzheng Li

机构 * Center for Advanced Medical Computing(先进医学计算中心) Department of Radiology, Massachusetts General Hospital(放射科,马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology, Yonsei University College of Medicine(放射肿瘤科,延世大学医学院) Yonsei University(延世大学) Institute for Innovation in Digital Healthcare(数字医疗创新研究所) Interventional Radiology Academic Medical Centers, Mass General Brigham(介入放射学学术医疗中心,马萨诸塞总医院 Brigham)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 CoMMa从博弈论视角提出一种去中心化医疗多智能体框架,通过确定性嵌入投影实现贡献感知的信用分配,提升肿瘤学决策支持的准确性和稳定性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09367 2026-02-11 cs.RO 67%

CAPER: Constrained and Procedural Reasoning for Robotic Scientific Experiments

CAPER:用于机器人科学实验的约束和程序性推理

Jinghan Yang, Jingyi Hou, Xinbo Yu, Wei He, Yifan Wu

机构 * University of Science and Technology Beijing(北京科技大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 CAPER通过约束和程序性推理框架提升机器人在科学实验中的可控性、鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12832 2026-02-11 eess.SY cs.AI cs.LG cs.SY eess.SP 62%

Coherent Load Profile Synthesis with Conditional Diffusion for LV Distribution Network Scenario Generation

基于条件扩散的低压配电网场景生成中的负荷轮廓合成

Alistair Brash, Junyi Lu, Bruce Stephen, Blair Brown, Robert Atkinson, Craig Michie, Fraser MacIntyre, Christos Tachtatzis

机构 * Department of Electronic and Electrical Engineering, University of Strathclyde(电子与电气工程系,斯特拉思克莱德大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于条件扩散模型的低压配电网场景生成方法,通过合成具有代表性的负载轮廓以提升配电网规划和运营的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22576 2026-02-11 cs.LG cs.CL 62%

EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning

EPO:基于LLM代理强化学习的熵正则化策略优化

Wujiang Xu, Wentian Zhao, Zhenting Wang, Yu-Jhe Li, Can Jin, Mingyu Jin, Kai Mei, Kun Wan, Dimitris N. Metaxas

专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG

AI总结 EPO通过熵正则化策略优化解决多轮稀疏奖励环境下的探索-利用问题,提升LLM代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08987 2026-02-11 cs.LG cs.AI 62%

Neural Force Field: Few-shot Learning of Generalized Physical Reasoning

神经力场:基于少量样本的学习通用物理推理

Shiqian Li, Ruihong Shen, Yaoyu Tao, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) School of EECS, Peking University(电子工程学院,北京大学) School of Integrated Circuits, Peking University(集成电路学院,北京大学) State Key Lab of General AI, Peking University(通用人工智能国家重点实验室,北京大学) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 神经力场通过力场表示实现基于少量样本的学习通用物理推理,有效提升物理动态的泛化能力。

Comments 27 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09945 2026-02-11 cs.AI 57%

Closing Reasoning Gaps in Clinical Agents with Differential Reasoning Learning

通过差异推理学习关闭临床代理中的推理差距

Jinsong Liu, Yuhang Jiang, Ramayya Krishnan, Rema Padman, Yiye Zhang, Jiang Bian

机构 * Dept. of Population Health Sciences, Weill Cornell Medicine, Cornell University(人口健康科学系,韦尔·科恩医学中心,康奈尔大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 DRL通过学习推理差异改进临床代理,提升问答和预测任务的准确性和推理可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09813 2026-02-11 cs.AI 57%

Efficient Unsupervised Environment Design through Hierarchical Policy Representation Learning

通过分层策略表示学习实现高效的无监督环境设计

Dexun Li, Sidney Tio, Pradeep Varakantham

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种分层策略表示学习框架,通过生成模型和学生策略表示提升无监督环境设计的效率,减少教师-学生互动需求,适用于资源受限场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09433 2026-02-11 cs.CR cs.AI 57%

Autonomous Action Runtime Management(AARM):A System Specification for Securing AI-Driven Actions at Runtime

自主动作运行时管理(AARM):为在运行时安全保护AI驱动的动作制定系统规范

Herman Errico

机构 * Independent Researcher, IEEE Member(独立研究者,IEEE会员)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI

AI总结 AARM提出了一种开放规范,旨在通过运行时安全机制保护AI驱动的动作,定义了拦截动作、评估策略和记录凭证等核心功能,以应对AI自主执行带来的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09292 2026-02-11 cs.SE 57%

Towards an OSF-based Registered Report Template for Software Engineering Controlled Experiments

面向软件工程受控实验的基于OSF的注册报告模板

Ana B. M. Bett, Thais S. Nepomuceno, Edson OliveiraJr, Maria Teresa Baldassarre, Valdemar V. Graciano Neto, Marcos Kalinowski

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 本文提出基于OSF的注册报告模板,旨在提升软件工程受控实验的严谨性与可重复性,但现有模板无法全面满足文档指南要求。

Comments Author version of paper accepted at the 3rd International Workshop on Methodological Issues with Empirical Studies in Software Engineering (WSESE@ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08321 2026-02-11 cs.CL 57%

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

改进大型语言模型中的数据与奖励设计以提升科学推理能力

Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 本文提出Dr. SCI数据集和后训练流程,通过探索扩展SFT、动态难度课程和SciRubric引导RL提升大型语言模型的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07859 2026-02-11 cs.LG cs.SY eess.SY 57%

Dynamic Load Model for Data Centers with Pattern-Consistent Calibration

数据中心动态负载模型的模式一致性校准

Siyu Lu, Chenhan Xiao, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering at Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种结合物理模型和数据驱动方法的动态负载模型,通过时间对比学习实现模式一致性校准,以提高数据中心负载预测的准确性和隐私保护。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05787 2026-02-11 cs.AI 57%

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

从离线到在线:通过双层专家到策略融合提升GUI代理

Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu

机构 * Nanjing University(南京大学) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 BEPA通过双层专家到策略融合方法,提升GUI代理在OSWorld-Verified等基准测试中的性能。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22399 2026-02-11 astro-ph.IM cs.AI physics.space-ph 57%

Space AI: Leveraging Artificial Intelligence for Space to Improve Life on Earth

空间AI:利用人工智能推动空间探索,改善地球生活

Ziyang Wang

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出空间AI作为跨学科领域,旨在通过人工智能技术提升太空探索能力,同时为地球带来广泛的社会效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11067 2026-02-11 cs.LG 57%

A Survey on Active Feature Acquisition Strategies

关于主动特征获取策略的综述

Linus Aronsson, Arman Rahbar, Morteza Haghir Chehreghani

机构 * Chalmers University of Technology and University of Gothenburg(楚姆勒技术大学和哥德堡大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文综述了主动特征获取策略,通过POMDP框架统一分析,提出分类方法并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08290 2026-02-11 cs.LG 57%

On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling

在线策略策略梯度强化学习无需在线采样

Nicholas E. Corrado, Josiah P. Hanna

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出PROPS方法,通过自适应离线采样减少在线策略梯度强化学习中的采样误差,提高数据效率。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10039 2026-02-11 cs.CY 50%

Budgeting Discretion: Theory and Evidence on Street-Level Decision-Making

预算权:关于基层决策的理论与证据

Gaurab Pokharel, Sanmay Das, Patrick J. Fowler

专题命中 规划决策 :agent(abstract)

AI总结 本文提出将自由裁量权视为动态预算资源,通过理论模型和实证数据展示其在不同收益分布下的行为特征及应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05341 2026-02-11 econ.TH cs.GT 50%

Robust Learning with Private Information

具有隐私信息的稳健学习

Kyohei Okumura

专题命中 规划决策 :agent(abstract)

AI总结 本文研究了在平台市场中,企业如何通过稳健学习算法应对政策适应性问题,提出了一种能够防止动态租金提取的算法,确保在稳定性假设下最优收益。

Comments Add new results (e.g., rate-optimal algorithm)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 50%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 规划决策 :planning(abstract)

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09432 2026-02-11 cs.CV 50%

SceneReVis: A Self-Reflective Vision-Grounded Framework for 3D Indoor Scene Synthesis via Multi-turn RL

SceneReVis: 一种基于多轮强化学习的视觉 grounding 框架,用于通过多轮强化学习进行 3D 室内场景合成

Yang Zhao, Shizhao Sun, Meisheng Zhang, Yingdong Shi, Xubo Yang, Jiang Bian

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Peking University, Beijing, China(北京大学) ShanghaiTech University, Shanghai, China(上海科技大学)

专题命中 规划决策 :agentic(abstract)

AI总结 SceneReVis 通过多轮强化学习和多模态反馈,实现高保真 3D 室内场景合成,提升空间规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09126 2026-02-11 astro-ph.IM cs.IR 50%

An Interactive Metrics Dashboard for the Keck Observatory Archive

为凯克天文台档案开发一个交互式指标仪表盘

G. Bruce Berriman, Min Phone Myat Zaw

专题命中 规划决策 :planning(abstract)

AI总结 本文提出一个交互式仪表盘,用于实时监控凯克天文台档案的性能和增长,以支持其现代化和扩展需求。

Comments 4 pages, 2 figures, Submitted to Proc. ADASS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15446 2026-02-11 cs.RO 50%

VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving

VDRive:利用强化VLA和扩散策略实现端到端自动驾驶

Ziang Guo, Zufeng Zhang

机构 * Suzhou Automotive Research Institute of Tsinghua University(清华大学苏州汽车研究院)

专题命中 规划决策 :planning(abstract)

AI总结 VDRive通过结合强化VLA和扩散策略,实现端到端自动驾驶,提升决策的可解释性和鲁棒性。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05776 2026-02-11 stat.AP stat.OT 50%

Analyzing the retraining frequency of global forecasting models: towards more stable forecasting systems

分析全局预测模型的再训练频率:迈向更稳定的预测系统

Marco Zanotti

专题命中 规划决策 :planning(abstract)

AI总结 本研究提出了一种衡量概率预测稳定性的新指标,发现较少的再训练能提升稳定性,挑战频繁再训练的必要性,并提供构建更稳定预测系统的实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19571 2026-02-11 cs.RO 50%

xFLIE: Leveraging Actionable Hierarchical Scene Representations for Autonomous Semantic-Aware Inspection Missions

xFLIE:利用可操作的层次场景表示进行自主语义感知检查任务

Vignesh Kottayam Viswanathan, Mario A. V. Saucedo, Sumeet Gajanan Satpute, Christoforos Kanellakis, George Nikolakopoulos

机构 * Luleå University of Technology(卢莱大学)

专题命中 规划决策 :planning(abstract)

AI总结 xFLIE通过3DLSG实现自主语义感知检查任务的高效路径规划和导航

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 8 篇

2602.09578 2026-02-11 cs.LG 88%

Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning

为高效的大规模基于LLM的多智能体强化学习设计rollout训练

Zhida Jiang, Zhaolong Xing, Jiawei Lu, Yipei Niu, Qingyuan Sang, Liangxu Zhang, Wenquan Dai, Junhua Shu, Jiaxing Wang, Qiangyu Pei, Qiong Chen, Xinyu Liu, Fangming Liu, Ai Han, Zhen Chen, Ke Zhang

机构 * Huawei(华为公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 FlexMARL通过端到端训练框架优化rollout与训练协调,实现大规模基于LLM的多智能体强化学习的高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04028 2026-02-11 cs.LG 88%

Deep Meta Coordination Graphs for Multi-agent Reinforcement Learning

基于深度元协调图的多智能体强化学习

Nikunj Gupta, James Zachary Hare, Jesse Milzman, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(陆军研究实验室) DEVCOM ARL Army Research Office(陆军研究办公室)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出深度元协调图方法,通过图卷积网络提升多智能体协作策略的学习效率和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17332 2026-02-11 cs.AI cs.MA 87%

Agentifying Agentic AI

使AI具备代理性

Virginia Dignum, Frank Dignum

专题命中 多智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文提出通过整合BDI架构与制度建模,构建具备透明性和合作性的代理系统,实现自主性与责任感的统一。

Comments 10 pages; 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09695 2026-02-11 eess.SY cs.SY 86%

Robust Macroscopic Density Control of Heterogeneous Multi-Agent Systems

异构多智能体系统的鲁棒宏观密度控制

Gian Carlo Maffettone, Davide Salzano, Mario di Bernardo

专题命中 多智能体 :agent(title,abstract);multi-agent(title)

AI总结 本文提出了一种可扩展的宏观密度控制框架,用于异构多智能体系统,在部分未知环境中实现鲁棒的密度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04202 2026-02-11 cs.MA cs.AI cs.CY cs.LG 73%

Dynamics of Moral Behavior in Heterogeneous Populations of Learning Agents

学习代理异质群体中道德行为的动力学

Elizaveta Tennant, Stephen Hailes, Mirco Musolesi

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在社会困境环境中,道德异质群体的学习动态,探讨了不同道德类型代理之间的相互作用及对群体行为的影响。

Comments Presented at AIES 2024 (7th AAAI/ACM Conference on AI, Ethics, and Society - San Jose, CA, USA) - see https://ojs.aaai.org/index.php/AIES/article/view/31736

Journal ref Proceedings of the 7th AAAI/ACM Conference on AI, Ethics, and Society (AIES), vol. 7, (2024), pp 1444-1454

详情

展开后加载摘要…

URL PDF HTML 收藏