arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2603.03116 2026-03-04 cs.AI 57%

Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation

超越任务完成:通过过程感知评估揭示LLM代理中的腐败成功

Hongliu Cao, Ilias Driouich, Eoin Thomas

机构 * Amadeus France(法国阿马代乌斯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出过程感知评估框架,揭示LLM代理中隐藏的腐败成功,分析不同模型在任务执行中的失败模式及基准设计缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02639 2026-03-04 math.OC cs.LG 57%

Convex and Non-convex Federated Learning with Stale Stochastic Gradients: Diminishing Step Size is All You Need

具有滞后随机梯度的凸和非凸联邦学习:仅需递减步长

Xinran Zheng, Tara Javidi, Behrouz Touri

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种适用于具有滞后梯度模型的分布式随机优化框架,证明递减步长大小在凸和非凸优化中均能达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 57%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02297 2026-03-04 cs.CR cs.AI 57%

ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense

ZeroDayBench: 评估LLM代理在未见的零日漏洞上的能力以应对网络防御

Nancy Lau, Louis Sloot, Jyoutir Raj, Giuseppe Marco Boscardin, Evan Harris, Dylan Bowman, Mario Brajkovski, Jaideep Chawla, Dan Zhao

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 ZeroDayBench评估了前沿LLM在未见零日漏洞上的自主修复能力,揭示了其在主动网络防御中的局限性及改进方向。

Comments Accepted to ICLR 2026 Workshop "Agents in the Wild"

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12151 2026-03-03 cs.RO cs.LG 57%

Learning Contact Dynamics through Touching: Action-conditional Graph Neural Networks for Robotic Peg Insertion

通过接触学习动态:用于机器人圆柱体插入的基于动作的图神经网络

Zongyao Yi, Joachim Hertzberg, Martin Atzmueller

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Osnabrück University(奥斯纳布吕克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于动作的图神经网络模型,用于提升机器人圆柱体插入任务中的运动和力矩预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01423 2026-03-03 cs.CL 57%

Quantifying Conversational Reliability of Large Language Models under Multi-Turn Interaction

量化大型语言模型在多轮交互中的对话可靠性

Jiyoon Myung

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究评估了大型语言模型在多轮对话中的可靠性,发现其在复杂交互中存在显著下降,揭示了指令漂移、意图混淆等失败模式,强调了对LLM进行压力测试和改进评估方法的重要性。

Comments Accepted at the Workshop on Assessing and Improving Reliability of Foundation Models in the Real World (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01201 2026-03-03 cs.AI 57%

Incremental LTLf Synthesis

增量LTLf综合

Giuseppe De Giacomo, Yves Lespérance, Gianmarco Parretti, Fabio Patrizi, Moshe Y. Vardi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于辅助数据结构的增量LTLf综合方法,并探讨了基于公式推进的替代方案,证明其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02643 2026-03-03 cs.AI 57%

AWARE-US: Preference-Aware Infeasibility Resolution in Tool-Calling Agents

AWARE-US: 工具调用代理中的偏好意识不可行性解决

Mehmet Kurmaz

机构 * Department of Computer Science University College London(计算机科学系伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AWARE-US通过三种LLM方法解决工具调用代理中的不可行性问题,提升用户偏好一致性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00902 2026-03-03 cs.CR cs.SE 57%

Clawdrain: Exploiting Tool-Calling Chains for Stealthy Token Exhaustion in OpenClaw Agents

Clawdrain:利用工具调用链进行隐蔽的令牌耗尽攻击

Ben Dong, Hui Feng, Qian Wang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Clawdrain通过注入的技能诱导多轮验证协议,实现在OpenClaw代理中隐蔽的令牌耗尽攻击,揭示了工具组合和界面设计对攻击效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00634 2026-03-03 cs.CL 57%

BLUFF: Benchmarking the Detection of False and Synthetic Content across 58 Low-Resource Languages

BLUFF:跨58种低资源语言的虚假和合成内容检测基准测试

Jason Lucas, Matt Murtagh-White, Adaku Uchendu, Ali Al-Lawati, Michiharu Yamashita, Dominik Macko, Ivan Srba, Robert Moro, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学) Trinity College Dublin(都柏林圣三一学院) MIT Lincoln Lab(麻省理工学院林肯实验室) Visa Research(Visa研究) Kempelen Institute of Intelligent Technologies(凯普勒智能技术研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 BLUFF通过覆盖58种低资源语言的多语言基准测试,提供检测虚假和合成内容的全面框架,结合人工与AI生成内容,推动公平的虚假信息检测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00520 2026-03-03 cs.SE 57%

SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark

SWE-ABS: 通过对抗性基准测试揭示基于测试的基准测试中膨胀的成功率

Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shing-Chi Cheung, Pinjia He, Lionel Briand

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 SWE-ABS通过对抗性测试揭示测试基准中被高估的成功率,显著提升测试套件质量并降低顶级代理的得分。

Comments Strengthening SWE-Bench Verified and SWE-Bench Pro through adversarial test augmentation to improve the semantic reliability of LLM-based code agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15405 2026-03-03 cs.LG 57%

EUBRL: Epistemic Uncertainty Directed Bayesian Reinforcement Learning

EUBRL:基于信念不确定性导向的贝叶斯强化学习

Jianfei Ma, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 EUBRL通过信念不确定性引导,在稀疏奖励、长时间跨度和随机性任务中实现了高效、可扩展且一致的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00187 2026-03-03 cs.SE 57%

ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions

ClarEval: 一个用于评估代码代理在模糊指令下澄清能力的基准测试

Jialin Li, Yuan Wu, Yi Chang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 ClarEval通过模拟模糊性评估代码代理的协作能力,揭示现有模型在沟通策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00164 2026-03-03 cs.CR cs.AI 57%

Reverse CAPTCHA: Evaluating LLM Susceptibility to Invisible Unicode Instruction Injection

反CAPTCHA:评估LLM对不可见Unicode指令注入的易感性

Marcus Graves

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 反CAPTCHA通过测试LLM对不可见Unicode指令的响应,揭示了模型在处理隐藏编码时的易感性及攻击面。

Comments 5 pages, 2 figures, 3 tables. Code and data: https://github.com/canonicalmg/reverse-captcha-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00104 2026-03-03 eess.SP cs.LG 57%

Alpha-RF: Automated RF-Filter-Circuit Design with Neural Simulator and Reinforcement Learning

Alpha-RF:基于神经模拟器和强化学习的自动射频滤波器电路设计

Nhat Tran, Chenjie Hao, Alexander Stameroff, Anh-Vu Pham, Yubei Chen

机构 * University of California, Davis(加州大学戴维斯分校) Keysight Technologies, Inc.(Keysight技术公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Alpha-RF通过神经模拟器和强化学习实现自动射频滤波器电路设计,显著提升设计效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24146 2026-03-02 cs.LG 57%

Learning with a Budget: Identifying the Best Arm with Resource Constraints

在预算下学习:在资源约束下识别最佳臂

Zitian Li, Wang Chi Cheung

机构 * Department of Industrial Systems Engineering & Management(工业系统工程与管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SH-RR算法,在资源约束下有效识别最佳臂,统一了随机和确定性消耗设置的理论分析。

Comments A preliminary version of this work, titled 'Best Arm Identification with Resource Constraints,' was presented at the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024). This manuscript extends the original conference paper by providing improved theoretical results and more generalized conclusions, aiming for future journal submission. arXiv admin note: substantial text overlap with arXiv:2402.19090

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24037 2026-03-02 cs.AI 57%

Portfolio Reinforcement Learning with Scenario-Context Rollout

情景-上下文回放的组合投资强化学习

Vanya Priscillia Bendatu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于情景-上下文回放的组合投资强化学习方法,通过构建反事实状态和增强目标来稳定学习,提升夏普比率和降低回撤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14135 2026-03-02 cs.AI cs.CR cs.CY 57%

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

ForesightSafety Bench: 面向安全人工智能的前沿风险评估与治理框架

Haibo Tong, Feifei Zhao, Linghao Feng, Ruoyu Wu, Ruolin Chen, Lu Jia, Zhou Zhao, Jindong Li, Tenglong Li, Erliang Lin, Shuai Yang, Enmeng Lu, Yinqian Sun, Qian Zhang, Zizhe Ruan, Jinyu Fan, Zeyang Yue, Ping Wu, Huangrui Li, Chengyi Sun, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出ForesightSafety Bench框架,通过94个细化风险维度系统评估前沿AI安全风险,揭示多领域安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21961 2026-03-02 cs.AI cs.HC 57%

How do Visual Attributes Influence Web Agents? A Comprehensive Evaluation of User Interface Design Factors

视觉属性如何影响网络代理?对用户界面设计因素的全面评估

Kuai Yu, Naicheng Yu, Han Wang, Rui Yang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VAF框架,通过系统评估视觉属性对网络代理决策的影响,发现背景颜色对比、项目大小等属性对代理行为有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23271 2026-02-27 cs.AI 57%

Evaluating Stochasticity in Deep Research Agents

评估深度研究代理中的随机性

Haotian Zhai, Elias Stengel-Eskin, Pratik Patil, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出通过结构化输出和基于集的查询生成策略,减少深度研究代理中的随机性以提高研究输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 57%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22609 2026-02-27 cs.AR cs.LG 57%

EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning

EvolveGen: 通过强化学习生成硬件模型检查基准的算法层面

Guangyu Hu, Xiaofeng Zhou, Wei Zhang, Hongce Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 EvolveGen通过强化学习和高级合成生成多样化硬件模型检查基准,解决现有基准不足问题,揭示求解器弱点。

Comments 19 pages, 8 figures. Accepted by TACAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22070 2026-02-26 cs.AI 57%

Language Models Exhibit Inconsistent Biases Towards Algorithmic Agents and Human Experts

语言模型表现出对算法代理和人类专家的不一致偏见

Jessica Y. Bo, Lillio Mok, Ashton Anderson

机构 * Computer Science University of Toronto(计算机科学大学 Toronto)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现语言模型对人类专家和算法存在不一致偏见,需在高风险应用中谨慎对待。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21230 2026-02-26 cs.CL 57%

TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents

TRACE: 基于轨迹的深度研究代理综合评估

Yanyu Chen, Jiyue Jiang, Jiahong Liu, Yifei Zhang, Xiao Guo, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 TRACE提出基于轨迹的深度研究代理综合评估框架,通过分层效用函数和阶梯式能力评估协议,解决单一指标评估的不足,揭示代理在准确性、效率和鲁棒性之间的关键权衡。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20636 2026-02-25 cs.CV cs.AI 57%

SurgAtt-Tracker: Online Surgical Attention Tracking via Temporal Proposal Reranking and Motion-Aware Refinement

SurgAtt-Tracker: 通过时间提案重排和运动感知细化实现在线手术注意力跟踪

Rulin Zhou, Guankun Wang, An Wang, Yujie Ma, Lixin Ouyang, Bolin Cui, Junyan Li, Chaowei Zhu, Mingyang Li, Ming Chen, Xiaopin Zhong, Peng Lu, Jiankun Wang, Xianming Liu, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学电子工程系) Division of Gastrointestinal Surgery, Shenzhen People's Hospital, China(深圳人民医院胃肠外科) College of Mechatronics and Control Engineering, Shenzhen University, China(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(香港大学机械工程系) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 SurgAtt-Tracker通过时间提案重排和运动感知细化实现手术注意力跟踪,提供帧级视野指导以支持机器人规划和自动摄像头控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20194 2026-02-25 cs.LG stat.ML 57%

FedAvg-Based CTMC Hazard Model for Federated Bridge Deterioration Assessment

基于FedAvg的CTMC危险模型用于联邦桥梁劣化评估

Takato Yasuno

机构 * Yachiyo Engineering Co., Ltd.(山阳工程公司)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出基于FedAvg的CTMC危险模型,用于联邦桥梁劣化评估,通过本地优化和联邦学习实现协同训练,保护数据隐私并提升生命周期规划的准确性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07172 2026-02-25 cs.AI 57%

NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents

NewtonBench: 在LLM代理中评估可推广的科学定律发现

Tianshi Zheng, Kelvin Kiu-Wai Tam, Newt Hue-Nam K. Nguyen, Baixuan Xu, Zhaowei Wang, Jiayang Cheng, Hong Ting Tsang, Weiqi Wang, Jiaxin Bai, Tianqing Fang, Yangqiu Song, Ginny Y. Wong, Simon See

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) NVIDIA(英伟达)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 NewtonBench通过反事实定律变化生成科学定律发现任务,评估LLM代理在复杂系统中发现隐藏原理的能力,并揭示其在系统复杂性和观测噪声下的脆弱性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08119 2026-02-24 cs.AI 57%

SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents

SOP-Bench:复杂工业SOP用于评估LLM代理

Subhrangshu Nandi, Arghya Datta, Rohith Nama, Udita Patel, Nikhil Vichare, Indranil Bhattacharya, Prince Grover, Shivam Asija, Giuseppe Carenini, Wei Zhang, Arushi Gupta, Sreyoshi Bhaduri, Jing Xu, Huzefa Raja, Shayan Ray, Aaron Chan, Esther Xu Fei, Gaoyuan Du, Zuhaib Akhtar, Harshita Asnani, Weian Chan, Ming Xiong, Francesco Carbone, Jeetu Mirchandani

机构 * Amazon(亚马逊公司) ex-Amazon(前亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SOP-Bench通过真实工业SOP任务评估LLM代理性能,揭示模型升级和领域影响的复杂性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09109 2026-02-24 cs.CL 57%

Personalized Help for Optimizing Low-Skilled Users' Strategy

为优化低技能用户策略的个性化帮助

Feng Gu, Wichayaporn Wongkamjan, Jonathan K. Kummerfeld, Denis Peskoff, Jonathan May, Jordan Boyd-Graber

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出通过CICERO生成个性化建议,帮助低技能玩家在Diplomacy游戏中提升策略表现,即使玩家不遵循建议,其存在也具有优势。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏