arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-04 至 2026-03-04 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2512.09882 2026-03-04 cs.AI cs.CR cs.CY 85%

Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing

将AI代理与网络安全专家在真实世界渗透测试中进行比较

Justin W. Lin, Eliot Krzysztof Jones, Donovan Julian Jasper, Ethan Jun-shen Ho, Anna Wu, Arnold Tianyi Yang, Neil Perry, Andy Zou, Matt Fredrikson, J. Zico Kolter, Percy Liang, Dan Boneh, Daniel E. Ho

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文比较了AI代理与网络安全专家在真实世界渗透测试中的表现,发现ARTEMIS在技术深度和提交质量上接近最强人类参与者,但在误报率和GUI任务上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02798 2026-03-04 cs.AI cs.CL 84%

Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification

基于指南的证据积累用于高风险代理验证

Yichi Zhang, Nabeel Seedat, Yinpeng Dong, Peng Cui, Jun Zhu, Mihaela van de Schaar

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Thomson Reuters Foundational Research(汤姆森路透基础研究)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 GLEAN通过基于指南的证据积累框架,提升高风险代理决策的验证可靠性,实验显示其在AUROC和Brier分数减少方面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23141 2026-03-04 cs.CV 82%

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent: 解锁地球观测的全貌与潜力

Peilin Feng, Zhutao Lv, Junyan Ye, Xiaolei Wang, Xinjie Huo, Jinhua Yu, Wanghan Xu, Wenlong Zhang, Lei Bai, Conghui He, Weijia Li

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02345 2026-03-04 cs.SE cs.AI cs.MA 79%

RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection

RIVA: 利用LLM代理进行可靠的配置漂移检测

Sami Abuzakuk, Lucas Crijns, Anne-Marie Kermarrec, Rafael Pires, Martijn de Vos

机构 * EPFL(瑞士洛桑联邦理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 RIVA通过多代理系统和交叉验证技术,提高在工具响应错误时的IaC验证可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03142 2026-03-04 cs.CL cs.AI 76%

APRES: An Agentic Paper Revision and Evaluation System

APRES:一种代理论文修订与评估系统

Bingchen Zhao, Jenny Zhang, Chenxi Whitehouse, Minqi Jiang, Michael Shvartsman, Abhishek Charnalia, Despoina Magka, Tatiana Shavrina, Derek Dunfield, Oisin Mac Aodha, Yoram Bachrach

机构 * Meta Superintelligence Labs(Meta 超智能实验室) University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL

AI总结 APRES利用大型语言模型改进论文质量,通过评估标准提升引用预测,79%的专家更喜欢修订后的论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11663 2026-03-04 cs.RO cs.AI cs.CV 70%

ConEQsA: Concurrent and Asynchronous Embodied Questions Scheduling and Answering

ConEQsA:并发与异步具身问题调度与回答

Haisheng Wang, Dong Liu, Weiming Zhi

机构 * Software Engineering Institute, East China Normal University(东华大学软件工程学院) Department of Computer Science, Yale University(耶鲁大学计算机科学系) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 ConEQsA通过并发与异步机制提升具身问题回答的效率与响应能力

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02955 2026-03-04 cs.HC 67%

Changing Pedagogical Paradigms: Integrating Generative AI in Mathematics to Enhance Digital Literacy through 'Mathematical Battles with AI'

改变教学范式:将生成式AI融入数学以通过‘与AI的数学战斗’提升数字素养

Maria Moskalenko, Alexander Trifanov, Roman Popkov, Arina Tabieva, Maria Smirnova, Konstantin Pravdin, Daniil Bakalin

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出通过与AI的数学战斗竞赛,利用生成式AI提升学生数字素养和验证能力,改变传统数学教育中的AI应用范式。

Comments Submitted for the conference ICCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02983 2026-03-04 cs.CR cs.AI cs.CL 62%

Contextualized Privacy Defense for LLM Agents

上下文化隐私防御用于大语言模型代理

Yule Wen, Yanzhe Zhang, Jianxun Lian, Xiaoyuan Yi, Xing Xie, Diyi Yang

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学) Microsoft(微软)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出上下文化防御指导(CDI),通过强化学习优化框架,在大语言模型代理执行中主动塑造隐私保护与有用性之间的平衡。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02222 2026-03-04 cs.LG cs.AI 62%

MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation

MedCalc-Bench 并未衡量你所想的:一项基准审计与开放书考试的案例

Artus Krohn-Grimberghe

机构 * MedCalc

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 MedCalc-Bench的基准审计揭示其主要衡量公式记忆和算术精度,而非临床推理,通过开放书提示显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18560 2026-03-04 cs.SE cs.AI 62%

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

WebDevJudge: 评估 (M)LLMs 作为 Web 开发质量的批评者

Chunyang Li, Yilun Zheng, Xinting Huang, Tianqing Fang, Jiahao Xu, Lihui Chen, Yangqiu Song, Han Hu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 WebDevJudge 提出了一种评估 LLM 作为 Web 开发质量批评者的基准,揭示了 LLM 与人类专家之间的显著差距,指出了模型在功能等价性识别、任务可行性验证和偏见缓解方面的根本性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03191 2026-03-04 stat.ML cs.LG math.OC 57%

A Covering Framework for Offline POMDPs Learning using Belief Space Metric

一种利用信念空间度量的离线POMDP学习覆盖框架

Youheng Zhu, Yiping Lu

机构 * Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种利用信念空间度量的离线POMDP学习覆盖框架,通过分析价值相关函数的Lipschitz连续性,缓解时间与内存的指数增长,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03116 2026-03-04 cs.AI 57%

Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation

超越任务完成:通过过程感知评估揭示LLM代理中的腐败成功

Hongliu Cao, Ilias Driouich, Eoin Thomas

机构 * Amadeus France(法国阿马代乌斯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出过程感知评估框架,揭示LLM代理中隐藏的腐败成功,分析不同模型在任务执行中的失败模式及基准设计缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02639 2026-03-04 math.OC cs.LG 57%

Convex and Non-convex Federated Learning with Stale Stochastic Gradients: Diminishing Step Size is All You Need

具有滞后随机梯度的凸和非凸联邦学习:仅需递减步长

Xinran Zheng, Tara Javidi, Behrouz Touri

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种适用于具有滞后梯度模型的分布式随机优化框架,证明递减步长大小在凸和非凸优化中均能达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 57%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02297 2026-03-04 cs.CR cs.AI 57%

ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense

ZeroDayBench: 评估LLM代理在未见的零日漏洞上的能力以应对网络防御

Nancy Lau, Louis Sloot, Jyoutir Raj, Giuseppe Marco Boscardin, Evan Harris, Dylan Bowman, Mario Brajkovski, Jaideep Chawla, Dan Zhao

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 ZeroDayBench评估了前沿LLM在未见零日漏洞上的自主修复能力,揭示了其在主动网络防御中的局限性及改进方向。

Comments Accepted to ICLR 2026 Workshop "Agents in the Wild"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03016 2026-03-04 cs.GT 50%

Single-Sample Bilateral Trade with a Broker

单样本双边交易与经纪人

MohammadTaghi Hajiaghayi, Gary Peng, Suho Shin

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了单样本双边交易中经纪人的影响,提出机制在标准假设下实现对最优交易收益和社会福利的常数因子近似,并与无经纪人的结果形成对比。

Comments Appeared in WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01036 2026-03-04 cond-mat.soft cond-mat.stat-mech physics.comp-ph 50%

Emergent Rotational Order and Re-entrant Global Order of Vicsek Agents in a Complex Noise Environment

涌现的旋转秩序与复杂噪声环境中的重新进入全局秩序的维克塞克代理

Mohd Yasir Khan

专题命中 Agent评测 :agent(abstract)

AI总结 研究复杂噪声环境中维克塞克代理的集体行为,发现旋转秩序和全局秩序的非单调变化及环境异质性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16858 2026-03-04 cs.RO 50%

Towards an Adaptive Social Game-Playing Robot: An Offline Reinforcement Learning-Based Framework

迈向自适应社交游戏机器人:一种基于离线强化学习的框架

Soon Jynn Chu, Raju Gottumukkala, Alan Barhorst

机构 * Department of Mechanical Engineering, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校机械工程系)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于离线强化学习的自适应社交游戏机器人框架,通过整合多模态情绪识别与自适应响应,提升机器人在游戏场景中对用户情绪的适应能力。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏