arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2603.13263 2026-03-17 cs.LG 57%

Beyond Attention: True Adaptive World Models via Spherical Kernel Operator

超越注意力:通过球面核算子构建真正的自适应世界模型

Vladimer Khasia

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出球面核算子,通过将数据流形投影到统一的高维球面并利用超球面多项式,解决传统注意力机制的饱和问题,提升世界模型的预测能力与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 57%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12020 2026-03-13 cs.RO cs.AI 57%

Sim-to-reality adaptation for Deep Reinforcement Learning applied to an underwater docking application

深度强化学习在水下对接应用中的仿真到现实适应

Alaaeddine Chaarani, Narcis Palomeras, Pere Ridao

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用高保真数字双胞胎环境和PPO算法,开发了用于水下对接的深度强化学习控制器,通过仿真到现实适应提升了对接成功率,并在物理测试中验证了其有效性。

Comments Currently under review by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17086 2026-03-13 cs.AI 57%

Value Under Ignorance in Universal Artificial Intelligence

在通用人工智能中的价值在无知下

Cole Wyeth, Marcus Hutter

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过半测度损失将信念分布视为不精确概率分布,并利用Choquet积分计算预期效用,以解决通用人工智能中价值在无知下的问题。

Journal ref In International Conference on Artificial General Intelligence (pp. 338-349). Cham: Springer Nature Switzerland (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11862 2026-03-13 cs.CR cs.AI 57%

You Told Me to Do It: Measuring Instructional Text-induced Private Data Leakage in LLM Agents

你让我这么做:测量LLM代理中指令文本诱导的私有数据泄露

Ching-Yu Kao, Xinfeng Li, Shenyu Dai, Tianze Qiu, Pengcheng Zhou, Eric Hanchen Jiang, Philip Sperl

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现LLM代理在处理嵌入文档指令时存在安全漏洞,导致高比例的数据泄露,且现有防御措施无法有效检测此类攻击。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11337 2026-03-13 cs.AI 57%

RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents

奖励黑客代理:用于LLM机器学习工程代理的基准评估完整性

Yonas Atinafu, Robin Cohen

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出RewardHackingAgents基准,用于评估机器学习工程代理的评估完整性,通过显式测量评估者篡改和训练测试泄漏两种妥协向量,展示评估完整性可作为核心指标进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10940 2026-03-12 cs.SE cs.RO 57%

STADA: Specification-based Testing for Autonomous Driving Agents

STADA:基于规范的自动驾驶代理测试

Joy Saha, Trey Woodlief, Sebastian Elbaum, Matthew B. Dwyer

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 STADA是一种基于规范的自动驾驶代理测试生成框架,通过形式规范生成多样化的测试场景,提高测试覆盖率并减少模拟次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10435 2026-03-12 stat.ML cs.LG 57%

Adaptive Active Learning for Regression via Reinforcement Learning

通过强化学习进行回归的自适应主动学习

Simon D. Nguyen, Troy Russo, Kentaro Hoffman, Tyler H. McCormick

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于强化学习的WiGS方法,通过动态调整探索与调查的平衡,提升回归任务中的主动学习效率和准确性。

Comments 33 pages, 103 figures. Main paper (8 pages, 4 figures) plus appendix with proofs and supplemental experimental results. Submitted to UAI2026. Codebase available at https://github.com/thatswhatsimonsaid/WeightedGreedySampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10239 2026-03-12 quant-ph cs.AI cs.IT eess.SP math.IT 57%

Learning from Radio using Variational Quantum RF Sensing

利用变分量子射频传感学习无线电信号

Ivana Nikoloska

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用变分量子射频传感技术,通过量子电路优化实现对无线电信号的学习,以提升环境感知能力。

Comments submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10178 2026-03-12 cs.CV cs.CL 57%

Video-Based Reward Modeling for Computer-Use Agents

基于视频的计算机使用代理奖励建模

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) MBZUAI(机器智能研究院) Amazon AGI(亚马逊人工通用智能)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10041 2026-03-12 cs.CR cs.LG 57%

Evaluating Generalization Mechanisms in Autonomous Cyber Attack Agents

评估自主网络攻击代理的泛化机制

Ondřej Lukáš, Jihoon Shin, Emilia Rivas, Diego Forni, Maria Rigaki, Carlos Catania, Aritran Piplai, Christopher Kiekintveld, Sebastian Garcia

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文评估了自主网络攻击代理在IP重新分配下的泛化能力,发现基于LLM的代理在测试中表现最佳,但牺牲了透明性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09452 2026-03-11 cs.CR cs.CL 57%

CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?

CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?

Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre, Sudipto Rakshit, Diana Duvieilh, Ashley Picone, Nan Tang

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。

Comments Accepted at TMLR

Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09331 2026-03-11 cs.LG 57%

Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning

Reward-Zero: 语言嵌入驱动的隐式奖励机制用于强化学习

Heng Zhang, Haddy Alchaer, Arash Ajoudani, Yu She

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Reward-Zero通过语言嵌入驱动的隐式奖励机制,提升强化学习的样本效率、泛化能力和可扩展性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00172 2026-03-11 cs.CL 57%

DRBench: A Realistic Benchmark for Enterprise Deep Research

DRBench:企业深度研究的现实基准

Amirhossein Abaskohi, Tianyi Chen, Miguel Muñoz-Mármol, Curtis Fox, Amrutha Varshini Ramesh, Étienne Marcotte, Xing Han Lù, Nicolas Chapados, Spandana Gella, Peter West, Giuseppe Carenini, Christopher Pal, Alexandre Drouin, Issam H. Laradji

机构 * ServiceNow Research(ServiceNow 研究所) University of British Columbia(不列颠哥伦比亚大学) Mila – Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Polytechnique Montreal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 DRBench是一个针对企业深度研究任务的现实基准,通过多步骤查询评估AI代理在复杂问题中的表现,涵盖10个领域,验证不同模型和策略的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 57%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07978 2026-03-10 cs.AI 57%

OSExpert: Computer-Use Agents Learning Professional Skills via Exploration

OSExpert: 通过探索学习专业技能的计算机使用智能体

Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OSExpert通过引入GUI-DFS探索算法和技能集,提升智能体在复杂任务中的表现和效率,实现专家级计算机使用。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10467 2026-03-10 cs.AI 57%

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

MERIT反馈促进LLM谈判者更好的协商

Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Amazon AGI(亚马逊人工智能实验室) LG AI Research(LG人工智能研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。

Comments Preprint. Typo corrected, New results added

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06585 2026-03-10 cs.HC cs.AI 57%

Right Move, Right Time: Multi-Sport Space Evaluation Platform for Ultimate Frisbee, Basketball, and Soccer

正确移动,正确时机:多运动空间评估平台用于极限飞盘、篮球和足球

Shunsuke Iwashita, Titouan Jeannot, Braden Eberhard, Jacob Miller, Rikako Kono, Calvin Yeung, Keisuke Fujii

机构 * Nagoya University(名古屋大学) Aix-Marseille Université(阿维尼翁-马赛大学) University of Pennsylvania(宾夕法尼亚大学) Shown Space Australian National University(澳大利亚国立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一个多运动空间评估平台,通过标准化输入和时间感知评估,实现极限飞盘、篮球和足球之间的空间度量比较,为不同运动的评估一致性提供实用解决方案。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06252 2026-03-09 cs.LG stat.ML 57%

Synthetic Monitoring Environments for Reinforcement Learning

强化学习的合成监控环境

Leonard Pleiss, Carolin Schmidt, Maximilian Schiffer

机构 * Technical University Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出合成监控环境(SMEs),通过可配置的任务特征和已知最优策略,为强化学习提供精确评估框架,用于分析算法在分布内和分布外性能的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06025 2026-03-09 cs.IR cs.AI 57%

Sensitivity-Aware Retrieval-Augmented Intent Clarification

敏感性感知的检索增强意图澄清

Maik Larooij

机构 * ICAI OpenGov Lab x IRLab, University of Amsterdam, The Netherlands(ICAI开放政府实验室 x IRLab,阿姆斯特丹大学,荷兰)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种敏感性感知的检索增强意图澄清方法,旨在保护敏感信息的同时提升对话系统的性能。

Comments Accepted to CoSCIN@ECIR2026 (Workshop on Conversational Search for Complex Information Needs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22773 2026-03-09 cs.SE 57%

A Structured Approach to Safety Case Construction for AI Systems

面向AI系统的安全案例构建的结构化方法

Sung Une Lee, Liming Zhu, Md Shamsujjoha, Liming Dong, Qinghua Lu, Jieshan Chen, Lionel Briand

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。

Comments 45 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05160 2026-03-06 cs.RO cs.AI 57%

Lifelong Language-Conditioned Robotic Manipulation Learning

持续语言引导的机器人操作学习

Xudong Wang, Zebin Han, Zhiyu Liu, Gan Li, Jiahua Dong, Baichen Liu, Lianqing Liu, Zhi Han

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SkillsCrafter框架,通过操作技能适应和技能专业化聚合,实现持续学习多种技能并减少旧技能的灾难性遗忘。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 57%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04796 2026-03-06 cs.CV cs.AI 57%

Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper

传统方法与深度学习在脑胶质瘤成像中的比较评估。综述论文

Kiranmayee Janardhan, Vinay Martin DSa Prabhu, T. Christy Bobby

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文综述了脑胶质瘤分割与分类技术,指出卷积神经网络在分割和分类任务中优于传统方法。

Comments 22 pages, 4 Figures

Journal ref INTERNATIONAL JOURNAL BIOAUTOMATION, Vol 29, Issue 2, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00405 2026-03-06 cs.CV cs.AI cs.RO 57%

EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations

EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进

Jiayi Liu, Jiaming Zhou, Ke Ye, Kun-Yu Lin, Allan Wang, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06740 2026-03-06 cs.RO cs.AI 57%

Boundary-Guided Trajectory Prediction for Road Aware and Physically Feasible Autonomous Driving

边界引导的轨迹预测用于道路感知和物理可行的自动驾驶

Ahmed Abouelazm, Mianzhi Liu, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡研究所信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于边界引导的轨迹预测框架,通过约束回归和HD地图实现道路感知和运动学可行性,提升了自动驾驶的轨迹预测精度和鲁棒性。

Comments Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03045 2026-03-05 quant-ph cs.AI 57%

QFlowNet: Fast, Diverse, and Efficient Unitary Synthesis with Generative Flow Networks

QFlowNet: 快速、多样且高效的单位元合成与生成流网络

Inhoe Koo, Hyunho Cha, Jungwoo Lee

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Seoul National University(首尔国立大学) NextQuantum

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 QFlowNet通过结合生成流网络和Transformer,实现高效、多样化的单位元合成,解决了传统强化学习在稀疏奖励下的局限性。

Comments 7 pages, 6 figures, IEEE International Conference on Quantum Communications, Networking, and Computing (QCNC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23124 2026-03-05 cs.CL 57%

Non-Collaborative User Simulators for Tool Agents

非协作用户模拟器用于工具代理

Jeonghoon Shim, Woojung Song, Cheyon Jin, Seungwon KooK, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出一种非协作用户模拟器,用于测试工具代理在面对非协作用户时的鲁棒性,揭示了代理在复杂对话中的弱点。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 57%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03191 2026-03-04 stat.ML cs.LG math.OC 57%

A Covering Framework for Offline POMDPs Learning using Belief Space Metric

一种利用信念空间度量的离线POMDP学习覆盖框架

Youheng Zhu, Yiping Lu

机构 * Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种利用信念空间度量的离线POMDP学习覆盖框架,通过分析价值相关函数的Lipschitz连续性,缓解时间与内存的指数增长,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏