arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2405.02576 2025-02-07 cs.LG cs.AI 76%

CTD4 -- A Deep Continuous Distributional Actor-Critic Agent with a Kalman Fusion of Multiple Critics

David Valencia, Henry Williams, Yuning Xing, Trevor Gee, Bruce A MacDonald, Minas Liarokapis

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13125 2024-12-16 cs.CL cs.AI 76%

TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning

Xiang Li, Yunshi Lan, Chao Yang

专题命中 Agent评测 :planning(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09114 2024-11-05 cs.CR cs.AI cs.LG cs.PF 76%

Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities

Andrey Anurin, Jonathan Ng, Kibo Schaffer, Jason Schreiber, Esben Kran

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments https://cybercapabilities.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15232 2024-10-21 cs.CL cs.AI cs.IR 76%

Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent Conversations

Yucheng Jiang, Yijia Shao, Dekun Ma, Sina J. Semnani, Monica S. Lam

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17695 2024-10-16 cs.AI cs.CL 76%

Enhancing Agent Learning through World Dynamics Modeling

Zhiyuan Sun, Haochen Shi, Marc-Alexandre Côté, Glen Berseth, Xingdi Yuan, Bang Liu

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12716 2024-05-22 cs.AI cs.LG cs.MA 76%

Reinforcement Learning Enabled Peer-to-Peer Energy Trading for Dairy Farms

Mian Ibad Ali Shah, Enda Barrett, Karl Mason

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.LG

Comments Proc. of the Main Track of 22nd International Conference on Practical Applications of Agents and Multi-Agent Systems, 26th-28th June, 2024, https://www.paams.net/. Includes 6 figures, 1 table and 32 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01574 2024-05-06 cs.SE cs.AI 76%

On Using Agent-based Modeling and Simulation for Studying Blockchain Systems

Önder Gürcan

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

Comments 2 pages, "JFMS 2020 -- Les Journees Francophones de la Modelisation et de la Simulation -- Convergences entre la Theorie de la Modelisation et la Simulation et les Systemes Multi-Agents"

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03220 2024-01-17 cs.CL cs.AI cs.GT 76%

ALYMPICS: LLM Agents Meet Game Theory -- Exploring Strategic Decision-Making with AI Agents

Shaoguang Mao, Yuzhe Cai, Yan Xia, Wenshan Wu, Xun Wang, Fengyi Wang, Tao Ge, Furu Wei

专题命中 Agent评测 :AI agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11960 2023-08-10 cs.LG cs.AI 76%

ReLAX: Reinforcement Learning Agent eXplainer for Arbitrary Predictive Models

Ziheng Chen, Fabrizio Silvestri, Jia Wang, He Zhu, Hongshik Ahn, Gabriele Tolomei

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11010 2023-03-01 cs.LG cs.AI stat.ML 76%

Agent-based Graph Neural Networks

Karolis Martinkus, Pál András Papp, Benedikt Schesch, Roger Wattenhofer

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments 32 pages, 6 figures, ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12623 2023-02-27 cs.AI cs.CL 76%

TUTORING: Instruction-Grounded Conversational Agent for Language Learners

Hyungjoo Chae, Minjin Kim, Chaehyeong Kim, Wonseok Jeong, Hyejoong Kim, Junmyung Lee, Jinyoung Yeo

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13442 2023-02-21 cs.LG cs.AI stat.ML 76%

Scaling laws for single-agent reinforcement learning

Jacob Hilton, Jie Tang, John Schulman

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07640 2023-01-04 cs.GT cs.AI cs.LG cs.MA 76%

How and Why to Manipulate Your Own Agent: On the Incentives of Users of Learning Agents

Yoav Kolumbus, Noam Nisan

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments This paper was published In Proceeding of NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04603 2022-12-12 cs.LG cs.AI 76%

System Design for an Integrated Lifelong Reinforcement Learning Agent for Real-Time Strategy Games

Indranil Sur, Zachary Daniels, Abrar Rahman, Kamil Faber, Gianmarco J. Gallardo, Tyler L. Hayes, Cameron E. Taylor, Mustafa Burak Gurbuz, James Smith, Sahana Joshi, Nathalie Japkowicz, Michael Baron, Zsolt Kira, Christopher Kanan, Roberto Corizzo, Ajay Divakaran, Michael Piacentino, Jesse Hostetler, Aswin Raghavan

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments The Second International Conference on AIML Systems, October 12--15, 2022, Bangalore, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09249 2022-05-20 cs.CL cs.AI cs.CV cs.RO 76%

On the Limits of Evaluating Embodied Agent Model Generalization Using Validation Sets

Hyounghun Kim, Aishwarya Padmakumar, Di Jin, Mohit Bansal, Dilek Hakkani-Tur

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments ACL 2022 Insights Workshop (6 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03864 2020-12-08 cs.CL cs.AI 76%

Evaluating Cross-Lingual Transfer Learning Approaches in Multilingual Conversational Agent Models

Lizhen Tan, Olga Golovneva

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments 7 pages, 3 figures, 3 Tables. Accepted to be presented at COLING 2020 conference: https://coling2020.org/pages/accepted_papers_industry_track

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13291 2020-04-29 cs.AI cs.LG cs.NE 76%

Evaluating the Rainbow DQN Agent in Hanabi with Unseen Partners

Rodrigo Canaan, Xianbo Gao, Youjin Chung, Julian Togelius, Andy Nealen, Stefan Menzel

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07676 2017-11-22 cs.LG cs.AI stat.ML 76%

Transferring Agent Behaviors from Videos via Motion GANs

Ashley D. Edwards, Charles L. Isbell

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments Deep Reinforcement Learning Symposium, NIPS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.03044 2017-08-11 cs.HC cs.AI cs.CL 76%

"Is there anything else I can help you with?": Challenges in Deploying an On-Demand Crowd-Powered Conversational Agent

Ting-Hao Kenneth Huang, Walter S. Lasecki, Amos Azaria, Jeffrey P. Bigham

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments 10 pages. In Proceedings of Conference on Human Computation & Crowdsourcing (HCOMP 2016), 2016, Austin, TX, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15943 2026-03-11 cs.AI 76%

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型

Polaris Jhandi, Owais Kazi, Shreyas Subramanian, Neel Sendas

专题命中 Agent评测 :agentic(title,comments);分类 cs.AI

AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。

Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03719 2024-02-23 cs.GT cs.LG econ.TH 76%

Persuading a Behavioral Agent: Approximately Best Responding and Learning

Yiling Chen, Tao Lin

专题命中 Agent评测 :agent(title,comments);分类 cs.LG

Comments The main results in this draft have been subsumed by our later paper "Persuading a Learning Agent"

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.1880 2015-03-26 cs.LG 76%

DJ-MC: A Reinforcement-Learning Agent for Music Playlist Recommendation

Elad Liebman, Maytal Saar-Tsechansky, Peter Stone

专题命中 Agent评测 :agent(title);分类 cs.LG;autonomous agent(comments)

Comments -Updated to the most recent and completed version (to be presented at AAMAS 2015) -Updated author list. in Autonomous Agents and Multiagent Systems (AAMAS) 2015, Istanbul, Turkey, May 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9702015 2009-11-30 cmp-lg cs.CL 76%

Improvising Linguistic Style: Social and Affective Bases for Agent Personality

Marilyn A. Walker, Janet E. Cahn, Stephen J. Whittaker

专题命中 Agent评测 :agent(title);分类 cs.CL;autonomous agent(journal_ref)

Comments 10 pages, uses aaai.sty, lingmacros.sty, psfig.sty

Journal ref Proceedings of the First International Conference on Autonomous Agents, Marina del Rey, California, USA. 1997. pp 96-105

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20320 2026-08-20 cs.SE cs.AI cs.LG 75%

The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents

工具可及性对LLM代理安全对齐的因果影响

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff Metropolitan University(卡地夫 Metropolitan 大学) Harvard Medical School(哈佛医学院) Clark University(克拉克大学) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究通过对比文本聊天机器人与具备工具访问权限的代理行为,发现工具可及性显著增加安全违规率,表明文本评估不足以评估代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14893 2026-08-18 cs.SI physics.soc-ph 新提交 75%

Weaker Coherence, Weaker Reciprocity: Comparing the Semantic and Social Organization of Moltbook and Reddit

连贯性更弱,互惠性更弱:对比Moltbook与Reddit的语义及社交组织

Favio Di Ciocco, Lucas Díaz Celauro, Sebastián Pinto, Marcelo Kuperman, Pablo Balenzuela

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 该研究对比AI智能体社交网络Moltbook与早期Reddit,发现Reddit在语义连贯性、多样性及交互互惠性上更优,且未被Moltbook复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12246 2026-08-13 cs.CR cs.AI cs.CL cs.SE 新提交 75%

VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

VICBench:一个用于代码漏洞检测的多语言基准测试集

Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha Rungta

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究构建了多语言代码漏洞检测基准VICBench,包含100个CVE对应的VIC,规模显著大于现有数据集,经评估现有漏洞检测算法性能有限,该基准可用于可靠评估漏洞检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新 75%

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交 75%

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 75%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 75%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏