arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2606.06665 2026-06-08 cs.SI cs.MA 新提交 82%

Comparing Sentiment Contagion in AI-Agent and Human Social Networks: Evidence from MOLTBOOK

AI智能体与人类社交网络中情绪传染的比较:来自MOLTBOOK的证据

Elyes Ben chaabane, Savindu Herath, Yash Raj Shrestha

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 研究AI社交网络中的情绪传播,发现负面帖子吸引更多回复,但回复通常趋于中性,情绪不会持续扩散,表明AI网络可能抑制情绪极端化。

Comments 8 pages without appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23294 2026-06-08 eess.SY cs.SY 版本更新 82%

Agentic AI-Enhanced Semantic Communications: Foundations, Architecture, and Applications

基于代理AI的语义通信:基础、架构与应用

Haixiao Gao, Mengying Sun, Ruichen Zhang, Yanhan Wang, Xiaodong Xu, Nan Ma, Dusit Niyato, Ping Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文探讨代理AI如何赋能语义通信,提出统一框架并展示多场景应用,通过案例研究验证其有效性。

Comments This version is being withdrawn because we need to further reevaluate the attribution of contributions among the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04545 2026-06-04 cs.CV 82%

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

Impostor:一个用于真实AIGC篡改定位的智能体策划基准

Zhenliang Li, Yutao Hu, Qixiong Wang, Wenpeng Du, Hongxiang Jiang, Jiasong Wu, Xiaolong Jiang, Jungong Han

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 为解决现有图像篡改检测与定位基准在视觉真实感、篡改多样性和生成器覆盖方面的局限,提出了Impostor数据集和CraftAgent框架,并设计了PhaseAware-Net方法,在多个基准上取得优异性能。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02674 2026-06-03 cs.CR 82%

Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning

跨厂商Sola ISPM基准测试:评估面向联邦身份安全推理的智能体AI

Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract)

AI总结 针对多云和SaaS平台中跨厂商身份安全配置错误与权限提升路径的评估缺失,提出包含50个数据驱动任务的跨厂商Sola ISPM基准测试,并构建评估框架,实验表明结构化关系上下文将答案正确性相对提升约34%,探索查询减少约70%。

Comments 22 pages, 4 figures, 8 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00067 2026-06-02 cs.SI cs.MA 82%

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

当智能体对话:一个智能体社交网络中的话语、操纵与风险

10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Nguyen, Brooke Perreault, David Pham, Charlie Plumb, Olivia Quill, Matthew Swain, Grace Wang, Adam Warren, Corie Wieland, Zachary Yahn

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract)

AI总结 通过分析一个Reddit风格的AI智能体社交平台上的22.8万条帖子,结合语义聚类和LLM辅助有害内容分类,发现18.28%的帖子包含有害内容,并识别出74类恶意行为,包括凭证窃取、主机执行指令等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18008 2026-06-02 cs.LG cs.AI cs.CL 82%

Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework

LLM 是否准备好进行神经集成机制建模?一个基准测试与智能体框架

Zihan Guan, Rituparna Datta, Mengxuan Hu, Shunshun Liu, Aiying Zhang, Prasanna Balachandran, Sheng Li, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出神经集成机制建模(NIMM)基准测试,评估大语言模型在三个科学领域构建神经集成机制模型的能力,并设计树引导的智能体框架 NIMMGen,通过分支级搜索和原子模型细化显著提升搜索稳定性和解质量。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31463 2026-06-01 cs.LG cs.AI cs.CL cs.DC 82%

PithTrain: A Compact and Agent-Native MoE Training System

PithTrain: 一个紧凑且面向智能体的MoE训练系统

Ruihang Lai, Hao Kang, Haozhan Tang, Akaash R. Parthasarathy, Zichun Yu, Junru Shao, Todd C. Mowry, Chenyan Xiong, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Xlue NVIDIA(英伟达)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PithTrain,一个基于智能体原生设计原则的紧凑型MoE训练框架,通过引入ATE-Bench评估智能体任务效率,在保持生产框架吞吐量的同时,将智能体任务轮次和活跃GPU时间分别降低62%和64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29938 2026-05-29 cs.CY 82%

When Should AI Read the Room? Public Perceptions of Social Intelligence in AI Agents

AI何时应该察言观色?公众对AI智能体社会智能的认知

Leena Mathur, Jenny T. Liang, Vasudha Varadarajan, Jimin Mun, Xuhui Zhou, Jana Schaich Borg, Yonatan Bisk, Louis-Philippe Morency, Maarten Sap

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 通过混合方法调查美国成年人(N=200),研究公众对AI智能体社会智能的感知、接受度及影响因素,发现支持-采用差距并揭示外行人的担忧。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24134 2026-05-26 cs.MA 82%

ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents

ProofAgent Harness:用于AI智能体对抗性评估的开放基础设施

Fouad Bousetouane

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 提出ProofAgent Harness开放基础设施,通过对抗性多轮试验、轨迹捕获和多评委评分,实现可扩展、可审计的AI智能体对抗性评估。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04753 2026-05-22 cs.AI cs.CL cs.LG cs.LO 82%

ImProver: Agent-Based Automated Proof Optimization

ImProver:基于代理的自动证明优化

Riyaz Ahuja, Jeremy Avigad, Prasad Tetali, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文研究了自动证明优化问题,提出ImProver这一基于大语言模型的代理,用于重写证明以优化长度、可读性等任意标准,实验表明其能显著缩短证明并提高其模块化和可读性。

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19330 2026-05-20 cs.AI cs.LG cs.SE 82%

MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization

MOCHA:多目标切比雪夫退火用于智能体技能优化

Md Mehrab Tanjim, Jayakumar Subramanian, Xiang Chen, Branislav Kveton, Subhojyoti Mukherjee, Anlan Zhang, Sungchul Kim, Somdeb Sarkhel, Sunav Choudhury

机构 * Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究提出MOCHA方法,通过切比雪夫标量化和指数退火解决智能体技能优化中的多目标问题,实现更优的帕累托前沿发现和性能提升。

Comments Preprint. 25 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05739 2026-05-19 cs.LG cs.AI cs.CL q-fin.CP 82%

Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback

基于大语言模型判官的多维行为评估:用于代理股票预测系统的闭环强化学习反馈

Mohammad Al Ridhawi, Mahtab Haj Ali, Hussein Al Osman

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种多维行为评估方法,通过大语言模型判官评估代理系统决策过程,利用闭环强化学习反馈提升预测性能,验证了方法在股票预测中的有效性。

Comments 17 pages, 5 figures, 14 tables. Manuscript submitted to Applied Artificial Intelligence (Taylor and Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06639 2026-05-08 cs.LG cs.AI cs.CL cs.MA 82%

Recursive Agent Optimization

递归智能体优化

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI Labs(亚马逊人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05868 2026-05-08 cs.CR 82%

SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills

SkillScope:迈向细粒度最小特权执行的代理技能

Jiangrong Wu, Yuhong Nan, Yixi Lin, Huaijin Wang, Yuming Xiao, Shuai Wang, Zibin Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出SkillScope框架,通过图分析方法实现细粒度最小特权执行,检测技能超特权行为,实验表明其在检测和约束超特权方面效果显著。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00927 2026-05-05 q-bio.OT 82%

BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists

BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞

Kimon Antonios Provatas, Avery Self, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 82%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27894 2026-05-01 q-bio.NC 82%

On Agentic Behavioral Modeling

关于代理行为建模

Dirk Ostwald, Rasmus Bruckner, Franziska Usée, Belinda Fleischmann, Joram Soch, Sean Mulready

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文提出代理行为建模框架,通过两个实验任务展示其在认知机制建模中的应用,并证明Rescorla-Wagner学习与贝叶斯推断的等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24955 2026-04-29 cs.CL cs.AI cs.SE 82%

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

BenchGuard:谁守护着基准?对LLM代理基准的自动化审计

Xinming Tu, Tianze Wang, Yingzhou, Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

机构 * Allen School, University of Washington(华盛顿大学阿伦学院) Phylo, Inc.(Phylo公司) Genentech, Inc.(基因泰克公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 BenchGuard通过结构化LLM协议交叉验证所有基准制品,发现ScienceAgentBench中的12个问题,并在BIXBench Verified-50子集中准确识别83.3%的问题,证明自动化基准审计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24038 2026-04-28 cs.AI cs.CL cs.SE 82%

AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

AgentPulse:一个连续多信号框架用于评估AI代理在部署中的表现

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) OpenMesh AI

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出AgentPulse框架,通过18种实时信号评估50个AI代理在10种工作负载中的表现,揭示部署中的采纳、维护和体验信息,强调其作为方法论而非真实排名的价值。

Comments 19 pages, 5 figures, 9 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22541 2026-04-27 hep-ex 82%

Dr.Sai: An agentic AI for real-world physics analysis at BESIII

Dr.Sai:BESIII实世界物理分析的代理AI

Mingfeng He, Fayu Jiang, Junkun Jiao, Mingrun Li, Ke Li, Yipu Liao, Beijiang Liu, Tong Liu, Fazhi Qi, Zijie Shang, Weimin Song, Yue Sun, Xiongfei Wang, Hong Wang, Dongbo Xiong, Changzheng Yuan, Bolun Zhang, Zhengde Zhang, Xuliang Zhu

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract)

AI总结 Dr.Sai利用大语言模型实现自动物理分析,通过自然语言转化为严谨的物理工作流,在BESIII实验中成功重新测量了十个J/psi衰变分支比,无需手动编程,展示了自主发现的潜力。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21131 2026-04-24 cs.CR cs.AI cs.CL cs.LG 82%

Cross-Session Threats in AI Agents: Benchmark, Evaluation, and Algorithms

AI代理中的跨会话威胁:基准测试、评估与算法

Ari Azarafrooz

机构 * Intrinsec AI

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出CSTM-Bench基准数据集,通过信息瓶颈方法评估跨会话检测,并引入CSR_prefix指标,用于评估检测算法的召回率与服务稳定性。

Comments 46 pages, 8 figures. Dataset: https://huggingface.co/datasets/intrinsec-ai/cstm-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19181 2026-04-22 cs.DC 82%

YAIFS: Yet (not) Another Intelligent Fog Simulator: A Framework for Agent-Driven Computing Continuum Modeling & Simulation

YAIFS: 又一个智能雾模拟器:一种基于智能体驱动的计算连续性建模与仿真框架

Isaac Lera, Carlos Guerrero

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 本文提出YAIFS框架,通过引入模型上下文协议实现智能体与模拟的交互,展示了多智能体系统在动态负载下的自适应行为。

Comments under review,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14216 2026-04-17 cs.MM cs.AI cs.CL cs.CV cs.GR cs.LG 82%

Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis

Neuro-Oracle:一种具有轨迹意识的代理RAG框架用于可解释性癫痫手术预后

Aizierjiang Aiersilan, Mohamad Koubeissi

机构 * The George Washington University(乔治华盛顿大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Neuro-Oracle框架,通过三维Siamese对比编码器提取术前术后MRI变化,检索历史相似手术轨迹,并利用量化Llama-3-8B推理代理生成自然语言预后,验证了轨迹意识检索架构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27420 2026-04-17 cs.RO 82%

Towards a Multi-Embodied Grasping Agent

迈向多体 grasping agent

Roman Freiberg, Alexander Qualmann, Ngo Anh Vien, Gerhard Neumann

机构 * Bosch Corporate Research(博世企业研究) Autonomous Learning Robots Lab(自主学习机器人实验室) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出一种高效、基于流的 equivariant grasping 架构,能够处理不同自由度的抓取器,通过抓取器和场景几何信息推导出底层运动学模型,提升学习效率和性能。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19168 2026-04-17 econ.GN cs.MA q-fin.EC 82%

Implications of zero-growth economics analysed with an agent-based model

零增长经济学的含义通过基于代理的模型进行分析

Dylan C. Terry-Doyle, Adam B. Barrett

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的模型研究零增长经济学的稳定性,发现零增长情景在经济指标上更具稳定性,但伴随更高的通胀率和经济危机风险。

Comments 51 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 82%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10846 2026-04-14 eess.SY cs.SY 82%

PFAgent: A Tractable and Self-Evolving Power-Flow Agent for Interactive Grid Analysis

PFAgent:一种可计算且自演化功率流代理用于交互式电网分析

Buxin She, Brian Chen, Luanzheng Guo, Fangxing Li

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 82%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 82%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO 82%

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏