arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-03 至 2026-03-03 共收录 299 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 64 篇

2509.12151 2026-03-03 cs.RO cs.LG 57%

Learning Contact Dynamics through Touching: Action-conditional Graph Neural Networks for Robotic Peg Insertion

通过接触学习动态:用于机器人圆柱体插入的基于动作的图神经网络

Zongyao Yi, Joachim Hertzberg, Martin Atzmueller

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Osnabrück University(奥斯纳布吕克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于动作的图神经网络模型,用于提升机器人圆柱体插入任务中的运动和力矩预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-03-03 cs.IR cs.AI cs.CV cs.MM 57%

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01423 2026-03-03 cs.CL 57%

Quantifying Conversational Reliability of Large Language Models under Multi-Turn Interaction

量化大型语言模型在多轮交互中的对话可靠性

Jiyoon Myung

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究评估了大型语言模型在多轮对话中的可靠性,发现其在复杂交互中存在显著下降,揭示了指令漂移、意图混淆等失败模式,强调了对LLM进行压力测试和改进评估方法的重要性。

Comments Accepted at the Workshop on Assessing and Improving Reliability of Foundation Models in the Real World (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01201 2026-03-03 cs.AI 57%

Incremental LTLf Synthesis

增量LTLf综合

Giuseppe De Giacomo, Yves Lespérance, Gianmarco Parretti, Fabio Patrizi, Moshe Y. Vardi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于辅助数据结构的增量LTLf综合方法,并探讨了基于公式推进的替代方案,证明其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02643 2026-03-03 cs.AI 57%

AWARE-US: Preference-Aware Infeasibility Resolution in Tool-Calling Agents

AWARE-US: 工具调用代理中的偏好意识不可行性解决

Mehmet Kurmaz

机构 * Department of Computer Science University College London(计算机科学系伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AWARE-US通过三种LLM方法解决工具调用代理中的不可行性问题,提升用户偏好一致性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00902 2026-03-03 cs.CR cs.SE 57%

Clawdrain: Exploiting Tool-Calling Chains for Stealthy Token Exhaustion in OpenClaw Agents

Clawdrain:利用工具调用链进行隐蔽的令牌耗尽攻击

Ben Dong, Hui Feng, Qian Wang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Clawdrain通过注入的技能诱导多轮验证协议,实现在OpenClaw代理中隐蔽的令牌耗尽攻击,揭示了工具组合和界面设计对攻击效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00634 2026-03-03 cs.CL 57%

BLUFF: Benchmarking the Detection of False and Synthetic Content across 58 Low-Resource Languages

BLUFF:跨58种低资源语言的虚假和合成内容检测基准测试

Jason Lucas, Matt Murtagh-White, Adaku Uchendu, Ali Al-Lawati, Michiharu Yamashita, Dominik Macko, Ivan Srba, Robert Moro, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学) Trinity College Dublin(都柏林圣三一学院) MIT Lincoln Lab(麻省理工学院林肯实验室) Visa Research(Visa研究) Kempelen Institute of Intelligent Technologies(凯普勒智能技术研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 BLUFF通过覆盖58种低资源语言的多语言基准测试,提供检测虚假和合成内容的全面框架,结合人工与AI生成内容,推动公平的虚假信息检测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00520 2026-03-03 cs.SE 57%

SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark

SWE-ABS: 通过对抗性基准测试揭示基于测试的基准测试中膨胀的成功率

Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shing-Chi Cheung, Pinjia He, Lionel Briand

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 SWE-ABS通过对抗性测试揭示测试基准中被高估的成功率,显著提升测试套件质量并降低顶级代理的得分。

Comments Strengthening SWE-Bench Verified and SWE-Bench Pro through adversarial test augmentation to improve the semantic reliability of LLM-based code agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15405 2026-03-03 cs.LG 57%

EUBRL: Epistemic Uncertainty Directed Bayesian Reinforcement Learning

EUBRL:基于信念不确定性导向的贝叶斯强化学习

Jianfei Ma, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 EUBRL通过信念不确定性引导,在稀疏奖励、长时间跨度和随机性任务中实现了高效、可扩展且一致的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00187 2026-03-03 cs.SE 57%

ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions

ClarEval: 一个用于评估代码代理在模糊指令下澄清能力的基准测试

Jialin Li, Yuan Wu, Yi Chang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 ClarEval通过模拟模糊性评估代码代理的协作能力,揭示现有模型在沟通策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00164 2026-03-03 cs.CR cs.AI 57%

Reverse CAPTCHA: Evaluating LLM Susceptibility to Invisible Unicode Instruction Injection

反CAPTCHA:评估LLM对不可见Unicode指令注入的易感性

Marcus Graves

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 反CAPTCHA通过测试LLM对不可见Unicode指令的响应,揭示了模型在处理隐藏编码时的易感性及攻击面。

Comments 5 pages, 2 figures, 3 tables. Code and data: https://github.com/canonicalmg/reverse-captcha-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00104 2026-03-03 eess.SP cs.LG 57%

Alpha-RF: Automated RF-Filter-Circuit Design with Neural Simulator and Reinforcement Learning

Alpha-RF:基于神经模拟器和强化学习的自动射频滤波器电路设计

Nhat Tran, Chenjie Hao, Alexander Stameroff, Anh-Vu Pham, Yubei Chen

机构 * University of California, Davis(加州大学戴维斯分校) Keysight Technologies, Inc.(Keysight技术公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 Alpha-RF通过神经模拟器和强化学习实现自动射频滤波器电路设计,显著提升设计效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02086 2026-03-03 math.NA cs.NA 50%

Reinforcement Learning-Based Filters for Convection-Dominated Flows: Reference-Free and Reference-Guided Training

基于强化学习的对流主导流体滤波器:无参考和参考引导训练

Anna Ivagnes, Maria Strazzullo, Gianluigi Rozza

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于强化学习的滤波策略,通过动态调整滤波参数以提高湍流模拟的稳定性和准确性,无参考方法在性能上与有参考方法相当,显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02034 2026-03-03 quant-ph gr-qc 50%

Decoherence and entropy production due to quantum fluctuations of spacetime

量子时空波动导致的退相干与熵产

Thiago H. Moreira

专题命中 Agent评测 :agent(abstract)

AI总结 本研究探讨了量子时空波动如何通过引力子导致微观系统退相干和熵产,揭示了引力与量子系统相互作用的普遍性机制。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01701 2026-03-03 q-bio.PE cs.MA 50%

A speciation simulation that partly passes open-endedness tests

一种部分通过开放性测试的物种模拟

Théo de Pinho, Lana Sinapayen

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了ToLSim在开放性进化测试中的表现,发现其在基因层面表现出无界进化活动,但整体上未能通过开放性测试。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01480 2026-03-03 cs.RO 50%

Towards Robot Skill Learning and Adaptation with Gaussian Processes

基于高斯过程的机器人技能学习与适应

A K M Nadimul Haque, Fouad Sukkar, Sheila Sujipto, Cedric Le Gentil, Marc G. Carmichael, Teresa Vidal-Calleja

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于高斯过程的机器人技能适应框架,通过优化、行为克隆和强化学习方法,在模拟和硬件上实现高成功率和运动学轮廓保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01294 2026-03-03 cs.RO 50%

Spherical Latent Motion Prior for Physics-Based Simulated Humanoid Control

球形潜在动作先验用于基于物理的人形机器人控制

Jing Tan, Weisheng Xu, Xiangrui Jiang, Jiaxi Zhang, Kun Yang, Kai Wu, Jiaqi Xiong, Shiting Chen, Yangfan Li, Yixiao Feng, Yuetong Fang, Yujia Zou, Yiqun Song, Renjing Xu

机构 * The Hong Kong University of Science(香港科学与技术大学) University of Oxford, Oxford, United Kingdom(牛津大学)

专题命中 Agent评测 :agent(abstract)

AI总结 SLMP通过两阶段方法学习动作先验,利用蒸馏、判别器和语义一致性约束构建结构化潜在空间,实现稳定随机采样和物理合理的行为生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01216 2026-03-03 eess.SP cs.IT math.IT 50%

Multifold Confidence Intervals in Collaborative Mean Estimation (ColME) Using Sample Statistics

在协同均值估计(ColME)中使用样本统计量的多折置信区间

Nikola Stankovic

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于样本均值、方差和峰度的多折置信区间方法,用于解决异构环境中个性化协同均值估计问题。

Comments 16 pages, 20 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01108 2026-03-03 cs.CV 50%

GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation

GroundedSurg: 一种多手术流程的语言条件手术工具分割基准

Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir

机构 * King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院) Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院) The University of Queensland(昆士兰大学) Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)

专题命中 Agent评测 :workflow(abstract)

AI总结 GroundedSurg提出了一种多手术流程的语言条件手术工具分割基准,通过实例级接地和空间注释评估视觉-语言模型在临床真实场景中的性能。

Comments https://github.com/gaash-lab/GroundedSurg

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07367 2026-03-03 cs.SD 50%

FOCAL: A Novel Benchmarking Technique for Multi-modal Agents

FOCAL:多模态代理的新型基准测试技术

Anupam Purwar, Aditya Choudhary

专题命中 Agent评测 :agent(abstract)

AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。

Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15952 2026-03-03 math.AP 50%

A First-Order Mean-Field Game on a Bounded Domain with Mixed Boundary Conditions

一个带有混合边界条件的有界域上的第一阶均场博弈

AbdulRahman M. Alharbi, Yuri Ashrafyan, Diogo Gomes

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个带有混合边界条件的第一阶均场博弈模型,用于准确捕捉人群运动中的入口-出口动态,并证明了解的存在性和唯一性。

Comments 36 pages, 4 figures

Journal ref Appl Math Optim 93, 40 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00628 2026-03-03 cs.RO 50%

Validation of Space Robotics in Underwater Environments via Disturbance Robustness Equivalency

通过扰动鲁棒性等效性验证水下环境中的空间机器人

Joris Verhagen, Elias Krantz, Chelsea Sidrane, David Dörner, Nicola De Carli, Pedro Roque, Huina Mao, Gunnar Tibert, Ivan Stenius, Christer Fuglesang, Dimos Dimarogonas, Jana Tumova

机构 * Division of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院) School of Engineering Sciences, KTH Royal Institute of Technology(工程科学学院,皇家理工学院) Division of Decision and Control Systems, KTH Royal Institute of Technology(决策与控制系统 division,皇家理工学院) Department of Mechanical and Civil Engineering, California Institute of Technology(机械与土木工程 department,加州理工学院)

专题命中 Agent评测 :planning(abstract)

AI总结 通过水下环境验证空间机器人在微重力下的扰动鲁棒性等效性

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00411 2026-03-03 cs.GT 50%

Existence and Computation of Fair Allocations under Constraints

在约束条件下公平分配的存在性与计算性

Siddharth Barman, Ioannis Caragiannis, Sudarshan Shyam

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在预算约束下公平分配的问题,证明了可行公平分配的存在性,并探讨了其计算性和与帕累托最优性的兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22627 2026-03-03 math.DS math.OC math.PR 50%

Anchoring and Mixed-Norm Contractions in Averaging-Learning Dynamics

锚定与混合范数收缩在平均学习动力学中

Ionel Popescu, Jeven Syatriadi, Tushar Vaidya

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种混合范数框架,用于分析在间歇性连通性下平均学习动力学的收敛性,通过聚合学习质量与影响扩散的相互作用实现两步收缩。

Comments 38 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV 50%

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

专题命中 Agent评测 :agent(abstract)

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2603.01339 2026-03-03 stat.ML cs.LG 57%

Causal Effects with Unobserved Unit Types in Interacting Human-AI Systems

交互人类-人工智能系统中未观察到的单元类型因果效应

William Overman, Sadegh Shirani, Mohsen Bayati

专题命中 其他Agent :AI agent(abstract);分类 cs.LG

AI总结 研究提出在未观察单元类型和交互网络的情况下,通过因果信息传递框架估计人类特定因果效应的方法,并在模拟平台验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09085 2026-03-03 cs.HC cs.AI cs.CY 57%

Mental Models of Autonomy and Sentience Shape Reactions to AI

自主性与意识的内心模型影响对AI的反应

Janet V. T. Pauketat, Daniel B. Shank, Aikaterina Manoli, Jacy Reese Anthis

机构 * Sentience Institute(意识研究所) Missouri University of Science and Technology(密苏里科技大学) Max Planck Institute for Human Cognitive and Brain Sciences(人类认知与脑科学Max Planck研究所) Stanford University(斯坦福大学) University of Chicago(芝加哥大学)

专题命中 其他Agent :AI agent(abstract);分类 cs.AI

AI总结 研究探讨自主性与意识的内心模型如何影响人类对AI的反应,发现意识比自主性更能引发道德考虑,而自主性则增加威胁感知。

Comments Published at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17702 2026-03-03 cs.CV cs.AI 57%

Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计

Xueyang Li, Jiahao Li, Yu Song, Yunzhong Lou, Xiangdong Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 其他Agent :AI agent(abstract);分类 cs.AI

AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。

Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16409 2026-03-03 cs.DB 50%

Gen-DBA: Generative Database Agents

Gen-DBA:生成数据库代理

Yeasir Rayhan, Walid G. Aref

专题命中 其他Agent :agentic(abstract)

AI总结 Gen-DBA是一种具有代理能力的通用基础模型,旨在通过统一的机器学习方法解决数据库优化中的多样化需求和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏