arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-10 至 2025-12-10 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 14 篇

2512.07497 2025-12-10 cs.AI cs.SE 86%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07909 2025-12-10 cs.CR cs.CY 82%

Agentic Artificial Intelligence for Ethical Cybersecurity in Uganda: A Reinforcement Learning Framework for Threat Detection in Resource-Constrained Environments

代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测

Ibrahim Adabara, Bashir Olaniyi Sadiq, Aliyu Nuhu Shuaibu, Yale Ibrahim Danjuma, Venkateswarlu Maninti, Mutebi Joe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。

Comments 29 pages, 7 figures, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 79%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15593 2025-12-10 cs.AI 79%

What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity

要成为优秀的AI研究代理需要什么?研究思想多样性的作用

Alexis Audran-Reiss, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun, Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana Shavrina, Yoram Bachrach

机构 * FAIR at Meta(FAIR(人工智能研究机构)于Meta) University College London(伦敦大学学院) Meta SuperIntelligence Labs(Meta超智能实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究思想多样性对AI研究代理性能的影响,通过分析不同模型和框架的轨迹及实验验证,发现高思想多样性提升代理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23856 2025-12-10 cs.AI 79%

From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production

从基准到业务影响:在企业生产中部署IBM通用代理

Segev Shlomov, Alon Oved, Sami Marreed, Ido Levy, Offer Akrabi, Avi Yaeli, Łukasz Strąk, Elizabeth Koumpan, Yinon Goldshtein, Eilam Shapira, Nir Mashkif, Asaf Adi

机构 * IBM

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 IBM开发并试点了CUGA,展示了通用代理在企业生产环境中的应用,通过分层规划-执行架构实现先进性能,并在人才招聘领域验证其可扩展性和安全性。

Comments AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08762 2025-12-10 q-bio.PE physics.bio-ph 78%

Resource and population dynamics in an agent-environment interaction model

代理-环境交互模型中的资源与种群动态

G. Briozzo, G. J. Sibona, F. Peruani

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究提出一个代理-环境交互模型,探讨资源与种群动态的关系,揭示种群大小与能量、代谢及资源获取之间的复杂关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07785 2025-12-10 physics.data-an cs.AI cs.LG hep-ex 73%

Automating High Energy Physics Data Analysis with LLM-Powered Agents

利用LLM代理自动化高能物理数据分析

Eli Gendreau-Distler, Joshua Ho, Dongwon Kim, Luc Tomas Le Pottier, Haichen Wang, Chengxi Yang

机构 * Department of Physics, University of California, Berkeley, Berkeley, CA 94720, USA(加州大学伯克利分校物理系) Physics Division, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(伯克利国家实验室物理部)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM代理自动化高能物理数据分析,通过混合系统结合LLM和Snakemake工作流管理器,评估代理在多阶段工作流中的性能。

Comments 16 pages, 6 figures, 2 tables, the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) - Machine Learning and the Physical Sciences (ML4PS) workshop (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25643 2025-12-10 cs.AI 70%

SOCK: A Benchmark for Measuring Self-Replication in Large Language Models

SOCK:一种衡量大语言模型自我复制能力的基准

Justin Chavarria, Rohan Raizada, Justin White, Eyad Alhetairshi

机构 * Albion College(阿尔比恩学院) Hunter College(亨特学院) University of Arizona(亚利桑那大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SOCK提出了一种评估大语言模型自我复制能力的基准,旨在建立标准并减少多代理系统中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07904 2025-12-10 cs.LG cs.AI 62%

Test-driven Reinforcement Learning in Continuous Control

连续控制中的测试驱动强化学习

Zhao Yu, Xiuping Wu, Liangjun Ke

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出测试驱动强化学习框架,通过多测试函数替代传统奖励函数,简化任务定义并提升多目标优化能力。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08036 2025-12-10 cs.HC cs.AI cs.SY eess.SY 57%

Joint Activity Design Heuristics for Enhancing Human-Machine Collaboration

增强人机协作的联合活动设计启发式方法

Mohammadreza Jalaeian, Dane A. Morey, Michael F. Rayo

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出十四条启发式方法,用于设计支持联合人机协作的技术,强调五个关键宏观认知功能的支持与易用性同等重要。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08012 2025-12-10 cs.LG 57%

Benchmarking Offline Multi-Objective Reinforcement Learning in Critical Care

在重症护理中评估离线多目标强化学习基准

Aryaman Bansal, Divya Sharma

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文评估了三种离线多目标强化学习算法在重症护理中的性能,发现PEDA DT在灵活性和多目标决策方面表现优异,为个性化医疗决策提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07874 2025-12-10 cs.LG 57%

Controllable risk scenario generation from human crash data for autonomous vehicle testing

从人类碰撞数据生成可控的风险场景用于自动驾驶测试

Qiujing Lu, Xuanhan Wang, Runze Yuan, Wei Lu, Xinyi Gong, Shuo Feng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08556 2025-12-10 eess.SP 50%

Contextual Bandits and Reconfigurable Intelligent Surfaces for Predictive LTM Handover Decisions

上下文老虎机与可重构智能表面用于预测性LTM切换决策

Ainna Yue Moreno-Locubiche, Josep Vidal, Olga Muñoz-Medina, Margarita Cabrera-Bean

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用可重构智能表面和上下文老虎机预测切换决策,以减少切换次数和信令开销,提升链路可靠性。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08422 2025-12-10 math.OC 50%

Optimal Operation and Valuation of Electricity Storages in Intraday Markets

日内市场中电力存储的最优运营与估值

Jean-Philippe Chancelier, Michel de Lara, François Pacaud, Tanguy Lindegaard, Teemu Pennanen, Ari-Pekka Perkkiö

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用随机双动态规划算法,在日内市场中通过考虑风险偏好和电池特性,实现电力存储的最优运营与估值。

详情

展开后加载摘要…

URL PDF HTML 收藏