arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-02 至 2026-06-02 共收录 425 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 74 篇

2510.12624 2026-06-02 cs.LG cs.AI 62%

Learning-To-Measure: In-Context Active Feature Acquisition

学习测量:上下文主动特征获取

Yuta Kobayashi, Zilin Jing, Jiayu Yao, Hongseok Namkoong, Shalmali Joshi

机构 * University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出 Learning-to-Measure (L2M) 方法,通过不确定性量化与条件互信息引导的贪婪特征获取,在上下文学习中解决元主动特征获取问题,无需针对每个任务重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL 62%

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02536 2026-06-02 cs.AI 57%

Tracking the Behavioral Trajectories of Adapting Agents

追踪自适应智能体的行为轨迹

Jonah Leshin, Manish Shah, Ian Timmis

机构 * University of Birmingham(伯明翰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种通过文本嵌入空间中的方向定义智能体特质的方法,训练线性模型对技能文件差异进行评分,实现高准确率的行为特质分类与排序。

Comments 5 pages, 1 figure. To appear at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02016 2026-06-02 cs.LG 57%

Evaluating Real-World Generalizability of Algorithm Selection Models

评估算法选择模型的现实世界泛化能力

Gjorgjina Cenikj, Jakub Kudela, Eva Tuba, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan Institute(计算机系统部门,约泽夫·斯蒂芬研究所) Brno University of Technology(布拉格技术大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 通过跨基准测试系统评估算法选择模型在合成与现实优化问题上的泛化能力,分析其迁移性能并指出在特定领域应用中的挑战。

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01815 2026-06-02 cs.CL 57%

CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation

CRAB-Bench:在复杂任务依赖和人类对齐用户模拟下评估LLM智能体

Danqing Wang, Akshay Sivaraman, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出CRAB-Bench和RUSE框架,通过约束图生成复杂任务依赖和基于人类行为研究的用户模拟,评估LLM智能体在真实服务场景中的表现,发现最佳模型仅达61%通过率,用户模拟导致性能下降高达57%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01703 2026-06-02 cs.SD cs.AI cs.CV 57%

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

JenBridge: 跨场景转换的自适应长视频配乐

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang

机构 * Jen Music AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01363 2026-06-02 cs.LG cs.SY eess.SY 57%

All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning

所有模型都是错的,知道哪里有用:强化学习中的模型不确定性

Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele, Friedrich Solowjow, Sebastian Trimpe

机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) Robotics Institute Germany (RIG)(德国机器人研究所) Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01229 2026-06-02 cs.AI 57%

Application of Algorithms in Energy-Efficient Design Platforms for Green Building

算法在绿色建筑节能设计平台中的应用

Na Yu, Fu Wenli, Guo Fei

机构 * First Highway Engineering Co., Ltd.(第一公路工程有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种结合BIM、传感器数据和进化多目标优化的算法平台,通过动态能耗仿真降低建筑能耗29.3%,并验证了其可扩展性和技术可行性。

Comments 9 pages, 4 figures.2026 International Conference on Big Data Applications in Education and Engineering (ICBDAEE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00059 2026-06-02 cs.RO cs.LG 57%

Reinforcement Learning for Optimal Experiment Design in Parameter Identification of Mechatronic Systems

机电系统参数辨识中最优实验设计的强化学习方法

Julian Langschwert, Georg Schaefer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Josef Ressel Centre for Intelligent and Secure Industrial Automation, Salzburg University of Applied Sciences, Salzburg, Austria(约瑟夫·雷斯尔智能与安全工业自动化中心,萨尔茨堡应用技术大学,萨尔茨堡,奥地利) Paris Lodron University of Salzburg, Salzburg, Austria(萨尔茨堡巴黎洛登伦大学,萨尔茨堡,奥地利)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种强化学习智能体,通过奖励塑形自主满足安全约束,为Quanser Aero 2测试平台学习最优激励信号,在三个辨识参数上均达到竞争性估计精度,且安全违规率仅0.75%。

Comments Accepted at DEXA AI4IP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00051 2026-06-02 cs.CY cs.AI 57%

Business Utility of Large Language Models as Exploratory Data Analysis Agents

大型语言模型作为探索性数据分析代理的商业实用性

Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski, Szymon Betlewski, Cezary Depta, Szymon Janowski, Jarosław Kochanowicz, Jan Kanty Milczek

机构 * deepsense.ai SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) Google(谷歌)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00047 2026-06-02 cs.CY cs.AI 57%

Comprehensive AI governance requires addressing non-model gains

全面的人工智能治理需要解决非模型增益问题

Arthur Goemans, Dan Altman, Noemi Dreksler, Jonas Freund, Milan Gandhi, Zhengdong Wang, Sarah Cogan, Sebastien Krier, Demetra Brady, Lewis Ho, Allan Dafoe

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Open Philanthropy(开放哲学基金会)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出非模型增益的概念,包括推理增益、系统增益和资产增益,并论证这些增益会削弱以模型为中心的治理有效性,进而提出超越模型层面的治理方法。

Comments This paper has been accepted to ICML 2026 (Position paper track): https://openreview.net/forum?id=V3O1sHpKxX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30000 2026-06-02 cs.AI 57%

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation

Cookie-Bench: 面向网页生成的连续屏幕按键交互评估

Haoyue Yang, Zhangxiao Shen, Fan Ding, Hangting Lou, Yifeng Kou, Haoqing Yu, Jingyao Li, Zhengfan Wu, Siqi Bao, Jing Liu, Hua Wu

机构 * Baidu Inc.(百度公司) Beijing, China(中国北京)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种无参考、自主驱动且整体推理的网页生成评估框架Cookie-Bench,通过元认知监控分阶段收集证据并评分,与专家评分高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14771 2026-06-02 cs.AI 57%

OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence

OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场

Peigen Liu, Rui Ding, Yuren Mao, Ziyan Jiang, Yuxiang Ye, Yunjun Gao, Ying Zhang, Renjie Sun, Longbin Lai, Zhengping Qian

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Alibaba Cloud(阿里云)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00986 2026-06-02 cs.CL 57%

ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents

ADRA-Bank:面向学术深度研究智能体的模块化基准

Zhihan Guo, Feiyang Xu, Yifan Li, Muzhi Li, Shuai Zou, Jiele Wu, Han Shi, Haoli Bai, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) National University of Singapore, Singapore, Singapore(新加坡国立大学) Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) Independent(独立)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00481 2026-06-02 cs.NI cs.AI cs.HC cs.MM cs.PF 57%

Make a Video Call with LLM: A Measurement Campaign over Six Mainstream Apps

用LLM进行视频通话:对六个主流应用的测量活动

Jiayang Xu, Xiangjie Huang, Zijie Li, Antariksh Verma, Zili Meng

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文通过自定义测试平台和在线平台,从质量、延迟、内部机制和系统开销四个维度对六个主流AI视频聊天应用进行基准测试,发现AI视频通话的网络延迟影响小于人类视频通话,AI代理能力对用户体验影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02233 2026-06-02 cs.GT 50%

Optimizing the Envy Cycle Elimination Algorithm

优化嫉妒循环消除算法

Karen Frilya Celine, Warut Suksompong

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究通过启发式策略优化嫉妒循环消除算法,以在保持EF1公平性的同时提高社会福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02095 2026-06-02 cs.GT econ.TH 50%

Testing Decision Makers without Counterfactuals

无需反事实的决策者测试

Yakov Babichenko

专题命中 Agent评测 :agent(abstract)

AI总结 研究在bandit环境下,外部观察者如何仅基于观测到的决策、建议和臂实现来识别更知情的主体,并探讨了评分测试的存在性及其与福利最大化之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01247 2026-06-02 cs.CV 50%

Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?

看向哪里:基础模型能否通过主动探索达到目标视角?

Liyang Li, Muzhi Zhu, Zhiyue Zhao, Hengyu Zhao, Ke Liu, Linhao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出目标视角复现(TVR)任务及TVRBench基准,通过分析现有模型瓶颈并构建统一后训练框架,将9B开源模型成功率提升至50%以上。

Comments Project page: https://github.com/aim-uofa/TVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01142 2026-06-02 cs.GT cs.DS 50%

Repeated Descent: A Framework for Online Budget-Feasible Auctions

重复下降:在线预算可行拍卖的框架

Andreas Charalampopoulos, Dimitris Fotakis, Thanos Tolias

专题命中 Agent评测 :agent(abstract)

AI总结 提出基于自适应线性定价的确定性框架Repeated Descent,用于在线预算可行拍卖,在秘书到达和子模估值下实现1046-竞争比,并首次对非单调子模估值获得常数竞争比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00676 2026-06-02 cs.CV 50%

A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation

基于EuroCrops驱动的Sentinel-2作物分割的建模与评估框架

Alexandra Nicoleta Scarlat, Ioana Cristina Plajer, Alexandra Baicoianu

机构 * Transilvania University of Braşov(布拉索夫瓦拉米亚大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 提出一个可配置的流水线,利用EuroCrops标注和Sentinel-2影像生成语义分割数据集,并训练U-Net模型评估其在域内和域外数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00654 2026-06-02 cs.CR 50%

The Invitation Trap: Proactive Availability Backdoor in LLMs via Conversational Induction

邀请陷阱:通过对话诱导实现LLMs的主动可用性后门

He Wang, Jun Feng, Hong Sun, Pengfei Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 提出主动可用性后门(PAB)范式,利用LLMs的助人性通过主动社会工程诱导用户执行触发植入查询,实现高攻击性、精确性和隐蔽性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00630 2026-06-02 cs.CV stat.ML 50%

A Systematic Benchmark of Intraoperative Ultrasound-to-MR Synthesis for Brain Tumour Surgery

脑肿瘤手术中术中超声到MR合成的系统基准测试

Olga Esteban-Sinovas, Santiago Cepeda, Ignacio Arrese, Rosario Sarabia

机构 * Department of Neurosurgery, Neurovascular Unit Río Hortega University Hospital(里奥霍尔特ega大学医院神经外科部门,神经血管单元) Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC)(生物医学成像与计算分析专项组(GEIBAC)) Instituto de Investigación Biosanitaria de Valladolid (IBioVALL)(瓦尔拉多利德生物医学研究 institute(IBioVALL))

专题命中 Agent评测 :planning(abstract)

AI总结 针对脑肿瘤手术中术中超声(ioUS)到MR图像合成问题,本研究在公共ReMIND数据集上系统比较了6种生成器、4种推理模式和2种目标,结合图像保真度指标和下游分割评估,发现感知质量(LPIPS)与下游效用最相关,而SSIM与效用负相关,SynDiff-2.5D在下游分割中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00430 2026-06-02 physics.soc-ph cs.CY cs.DB 50%

SF-LIFE: A Large-Scale Simulated Movement Dataset for the San Francisco Bay Area

SF-LIFE:旧金山湾区大规模模拟移动数据集

Chanuka Algama, Taylor Anderson, Henrique Ferraz de Arruda, Andrew Crooks, Nathan Holt, Erfan Hosseini Sereshgi, John Hunter, Hamdi Kavak, Lance Kennedy, Yueyang Liu, Dieter Pfoser, Sandro Martinelli Reia, Doug Taylor, Mauryan Uppalapati, Boyu Wang, Carola Wenk, Andreas Züfle

专题命中 Agent评测 :agent(abstract)

AI总结 为加速交通、移动性和机器学习研究,我们构建了SF-LIFE数据集,包含50万模拟智能体在旧金山湾区70天内以1Hz频率记录的完整、无噪声、多模态轨迹,并提供交通模式标签、降采样版本、活动信息、人口统计数据和OSM路网建筑数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00061 2026-06-02 q-fin.ST q-fin.TR 50%

Reflexivity as Prompt: Does Awareness of Self-Reinforcing Market Dynamics Improve LLMs as Financial Market Forecasters?

反身性作为提示:对自我强化市场动态的认知是否提高了LLM作为金融市场预测者的表现?

Eugene Park

专题命中 Agent评测 :agent(abstract)

AI总结 研究在繁荣-萧条市场周期中,逐步引入索罗斯反身性理论时,前沿大语言模型作为金融预测者的行为变化,通过方向性预测准确率和夏普比率评估,发现反身性认知在不同模型和上下文窗口中产生不同的预测改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26102 2026-06-02 cs.CV 50%

InstructSAM: Segment Any Instance with Any Instructions

InstructSAM: 根据任意指令分割任意实例

Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 提出InstructSAM框架,通过将指令驱动实例分割建模为集合结构查询预测问题,并设计显式推理到实例查询接口,结合视觉语言模型和SAM3实现单次前向传播中的多实例分割。

Comments 19 pages, 8 figures, code: https://github.com/DCDmllm/InstructSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09967 2026-06-02 econ.TH q-fin.RM 50%

Incentive Pareto Efficiency in Monopoly Insurance Markets with Adverse Selection

逆向选择下垄断保险市场的激励帕累托效率

Maria Andraos, Mario Ghossoub

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究隐藏信息下的垄断保险市场,证明满足激励相容和个体理性约束的社会福利最大化合同菜单是激励有效的,并在Yaari对偶效用下给出半显式刻画。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10112 2026-06-02 econ.TH 50%

Power and Freedom in Mechanisms

机制中的权力与自由

Christian Basteck, Ulysse Lojkine

专题命中 Agent评测 :agent(abstract)

AI总结 本文在防策略机制中衡量代理人影响,将影响分为自由(对自身结果)和权力(对他人结果),并利用自由最大化刻画约束有效机制,应用于分配规则分析,得到顶级交易循环规则和双极序列独裁的新特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06182 2026-06-02 cs.RO cs.SY eess.SY 50%

Situation-Aware Interactive MPC Switching for Autonomous Driving

自动驾驶中的情境感知交互式MPC切换

Shuhao Qi, Qiling Aori, Luyao Zhang, Mircea Lazar, Sofie Haesaert

机构 * Eindhoven University of Technology(埃因霍温理工大学) Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract)

AI总结 针对自动驾驶中交互场景的挑战,提出一种基于神经网络的分类器,根据情境需求在不同MPC控制器间切换,以平衡性能和计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11791 2026-06-02 cs.GT cs.SY eess.SY 50%

Robustness of Incentive Mechanisms Against System Misspecification in Congestion Games

拥塞博弈中激励机制对系统误设的鲁棒性

Chih-Yuan Chiu, Bryce L. Ferguson

专题命中 Agent评测 :agent(abstract)

AI总结 研究系统参数误设对原子拥塞博弈中通行费设计的影响,证明轻微误设下设计的通行费不会引入新的纳什均衡,并给出了最坏情况下的性能下降上界。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 6 篇

2606.02484 2026-06-02 cs.AI cs.LG 81%

Iteris: Agentic Research Loops for Computational Mathematics

Iteris: 计算数学的智能体研究循环

Leheng Chen, Zihao Liu, Wanyi He, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心和新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾研究院先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Iteris智能体研究系统,通过数值实验、构造和证明草稿解决计算数学中的两个开放问题,经专家验证后获得可验证结果。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏