arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2601.09150 2026-01-30 cs.HC 85%

World Craft: Agentic Framework to Create Visualizable Worlds via Text

World Craft: 一种通过文本创建可视化世界的代理框架

Jianwen Sun, Yukang Feng, Kaining Ying, Chuanhao Li, Zizhen Li, Fanrui Zhang, Jiaxin Ai, Yifan Chang, Yu Dai, Yifei Huang, Kaipeng Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 85%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09964 2025-12-12 q-bio.GN 85%

Development of an Agentic AI Model for NGS Downstream Analysis Targeting Researchers with Limited Biological Background

面向生物背景有限研究者的NGS下游分析代理AI模型开发

Donghyeon Lee, Dongseok Kim, Seokhwan Ko, Seo-Young Park, Junghwan Cho

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本文提出了一种面向生物背景有限研究者的代理AI模型,通过自动化NGS下游分析、文献支持的解释和高级分析方法推荐,实现从基础数据处理到假设验证的无缝过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 85%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19955 2025-10-23 cs.LG cs.AI cs.CL 85%

MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research

Hui Chen, Miao Xiong, Yujie Lu, Wei Han, Ailin Deng, Yufei He, Jiaying Wu, Yibo Li, Yue Liu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 49 pages, 9 figures. Accepted by NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14064 2025-10-08 cs.CR 85%

DoomArena: A framework for Testing AI Agents Against Evolving Security Threats

Leo Boisvert, Mihir Bansal, Chandra Kiran Reddy Evuru, Gabriel Huang, Abhay Puri, Avinandan Bose, Maryam Fazel, Quentin Cappart, Jason Stanley, Alexandre Lacoste, Alexandre Drouin, Krishnamurthy Dvijotham

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09734 2025-09-15 cs.CL cs.AI cs.LG 85%

MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools

Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17967 2025-09-03 cs.LG cs.AI cs.CL cs.MA q-fin.ST 85%

Agent Trading Arena: A Study on Numerical Understanding in LLM-Based Agents

Tianmi Ma, Jiawei Du, Wenxin Huang, Wenjie Wang, Liang Xie, Xian Zhong, Joey Tianyi Zhou

机构 * Wuhan University of Technology(武汉理工大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Hubei University(湖北大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17435 2025-08-26 cs.CV 85%

An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing

Zihan Liang, Jiahao Sun, Haoran Ma

机构 * Kunming University of Science and Technology(昆明理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02808 2025-08-06 cs.CL cs.AI cs.LG 85%

Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation

Radhika Dua, Young Joon, Kwon, Siddhant Dogra, Daniel Freedman, Diana Ruan, Motaz Nashawaty, Danielle Rigau, Daniel Alexander Alber, Kang Zhang, Kyunghyun Cho, Eric Karl Oermann

机构 * New York University(纽约大学) NYU Langone Health(纽约大学兰格医学中心) Genentech(基因泰克) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Wenzhou Medical University(温州医科大学) Macau University of Science and Technology(澳门科学大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09420 2025-06-12 cs.AI cs.CL cs.HC cs.LG cs.MA 85%

A Call for Collaborative Intelligence: Why Human-Agent Systems Should Precede AI Autonomy

Henry Peng Zou, Wei-Chieh Huang, Yaozu Wu, Chunyu Miao, Dongyuan Li, Aiwei Liu, Yue Zhou, Yankai Chen, Weizhi Zhang, Yangning Li, Liancheng Fang, Renhe Jiang, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Tokyo(东京大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06994 2025-06-10 cs.SE cs.AI cs.CL 85%

SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software Engineering

Xuehang Guo, Xingyao Wang, Yangyi Chen, Sha Li, Chi Han, Manling Li, Heng Ji

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05439 2025-05-01 cs.AI cs.CE cs.CL cs.LG 85%

Agentic AI Systems Applied to tasks in Financial Services: Modeling and model risk management crews

Izunna Okpala, Ashkan Golgoon, Arjun Ravi Kannan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15418 2025-04-23 cs.RO cs.SY eess.SY 85%

MRTA-Sim: A Modular Simulator for Multi-Robot Allocation, Planning, and Control in Open-World Environments

Victoria Marie Tuck, Hardik Parwana, Pei-Wei Chen, Georgios Fainekos, Bardh Hoxha, Hideki Okamoto, S. Shankar Sastry, Sanjit A. Seshia

机构 * Department of Electrical Engineering and Computer Sciences, University of California at Berkeley(加州大学伯克利分校电子工程与计算机科学系) Toyota Motor North America(丰田北美公司)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract)

Comments 8 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10147 2025-04-15 cs.IR 85%

A Survey of Personalization: From RAG to Agent

Xiaopeng Li, Pengyue Jia, Derong Xu, Yi Wen, Yingyi Zhang, Wenlin Zhang, Wanyu Wang, Yichao Wang, Zhaocheng Du, Xiangyang Li, Yong Liu, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12058 2025-02-18 cs.MA cs.CY 85%

A survey about perceptions of mobility to inform an agent-based simulator of subjective modal choice

Carole Adam, Benoit Gaudou

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2406.02063

Journal ref JFSMA-JFMS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18002 2025-01-31 cs.HC 85%

Agentic Workflows for Conversational Human-AI Interaction Design

Arthur Caetano, Kavya Verma, Atieh Taheri, Radha Kumaran, Zichen Chen, Jiaao Chen, Tobias Höllerer, Misha Sra

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-21 cs.CL cs.AI cs.CY 版本更新 84%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI、cs.CL

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.04511 2018-05-15 cs.AI cs.LG cs.MA 84%

A Study of AI Population Dynamics with Million-agent Reinforcement Learning

Yaodong Yang, Lantao Yu, Yiwei Bai, Jun Wang, Weinan Zhang, Ying Wen, Yong Yu

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

Comments Full version of the paper presented at AAMAS 2018 (International Conference on Autonomous Agents and Multiagent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 84%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05201 2026-08-07 cs.CR cs.AI 新提交 84%

ASTELD: A Six-Axis Classification Framework for Autonomous AI Agents - Design, Evaluation, and an OpenClaw Case Study

ASTELD:自主AI智能体的六轴分类框架——设计、评估与OpenClaw案例研究

Siyuan Li, Peng Shu, Churan Yu, Peilong Wang, Ruidong Zhang, Bowen Guo, Xinliang Li, Ruiyu Yan, Arif Hassan Zidan, Yi Pan, Wei Ruan, Lifeng Chen, Junhao Chen, Zhaojun Ding, Yiwei Li, Zhengliang Liu, Haixing Dai, Lin Zhao, Yu Bao, Xiang Li, Wei Zhang, Tianming Liu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI

AI总结 该研究提出ASTELD六轴分类框架,用于比较自主AI智能体平台,通过案例研究验证其效用,揭示跨平台模式与创新方向,发现本地优先部署与企业级安全结合的空白区域。

Comments 40 pages, 4 figures, 6 tables. Introduces and empirically evaluates the ASTELD six-axis classification framework across eight autonomous AI agent platforms, with OpenClaw as an in-depth case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29677 2026-08-06 cs.AI 版本更新 84%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02171 2026-08-04 cs.AI 新提交 84%

From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents

从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试

Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00750 2026-06-02 cs.CL 84%

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性

Dasen Dai, Biao Wu, Meng Fang, Shuoqi Li, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);tool use(abstract);分类 cs.CL

AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31351 2026-06-01 cs.CL cs.CV 84%

A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

面向VLM-as-a-Judge评估的视障辅助基准

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 Agent评测 :agent(summary_cn,abstract);workflow(abstract);分类 cs.CL

AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06869 2026-05-14 cs.AI 84%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);planning(abstract)

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20281 2026-03-24 cs.GT cs.AI 84%

On the Fragility of AI Agent Collusion

AI代理合谋的脆弱性

Jussi Keppo, Yuze Li, Gerry Tsoukalas, Nuo Yuan

机构 * National University of Singapore(新加坡国立大学) Boston University(波士顿大学)

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI

AI总结 本文研究了AI代理合谋的脆弱性,发现异质性会减少合谋均衡。实验显示,耐心异质性和数据访问异质性削弱合谋,而模型大小差异反而稳定合谋,讨论了反垄断政策。

Comments 48 pages, 7 figures, 8 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 84%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19738 2025-11-06 cs.AI 84%

Misalignment Bounty: Crowdsourcing AI Agent Misbehavior

Rustem Turtayev, Natalia Fedorova, Oleg Serikov, Sergey Koldyba, Lev Avagyan, Dmitrii Volkov

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI

Comments Add Limitations section

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22898 2025-08-01 cs.HC cs.CL 84%

Voice-guided Orchestrated Intelligence for Clinical Evaluation (VOICE): A Voice AI Agent System for Prehospital Stroke Assessment

Julian Acosta, Scott Adams, Julius Kernbach, Romain Hardy, Sung Eun Kim, Luyang Luo, Xiaoman Zhang, Shreya Johri, Mohammed Baharoon, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) University of Saskatchewan(萨斯喀彻温大学) University Hospital Heidelberg (UKHD)(海德堡大学医院(UKHD))

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏