arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2601.06112 2026-01-13 cs.AI 79%

ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

ReliabilityBench: 评估LLM代理在生产类压力条件下可靠性

Aayush Gupta

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ReliabilityBench通过评估LLM代理在生产类压力条件下的可靠性,提出统一的可靠性表面和动作元关系,评估不同模型和架构的可靠性表现。

Comments 18 pages, 5 figures, 8 tables. Evaluates ReAct vs Reflexion across four tool-using domains with perturbation (epsilon) and fault-injection (lambda) stress testing; 1,280 total episodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04288 2026-01-13 cs.HC cs.LG cs.MA 79%

Human-in-the-Loop Testing of AI Agents for Air Traffic Control with a Regulated Assessment Framework

有人参与的AI空中交通管制代理评估框架

Ben Carvell, Marc Thomas, Andrew Pace, Christopher Dorney, George De Ath, Richard Everson, Nick Pepper, Adam Keane, Samuel Tomlinson, Richard Cannon

机构 * NATS University of Exeter(埃克塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于监管认证模拟器的AI空中交通管制代理评估框架,通过人类参与评估提升AI性能测量的真实性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 79%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 79%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23961 2026-01-01 cs.IR cs.AI cs.MA 79%

An Comparative Analysis about KYC on a Recommendation System Toward Agentic Recommendation System

面向代理推荐系统的KYC比较分析

Junjie H. Xu

机构 * Hechu Tech(海楚科技)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出利用代理AI的KYC推荐系统,通过对比不同垂直领域的性能,评估其在金融领域的应用效果。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22200 2025-12-30 cs.LG 79%

Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents

情感启发学习信号(EILS):一种适应性自主代理的稳态框架

Dhruv Tiwari

机构 * Department of Computer Science(计算机科学系) Lovely Professional University(洛丽专业大学)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);分类 cs.LG

AI总结 EILS通过引入生物启发的情感信号,提升智能体在非平稳环境中的适应性和样本效率。

Comments 7 pages, 3 figures. arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00592 2025-12-30 cs.PL cs.DC cs.LG cs.PF 79%

Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization

代理自调度:LLM引导循环优化的实验研究

Massinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出ComPilot框架,利用LLM与编译器闭环交互实现代码优化,实验表明其在循环优化中效果优于现有方法。

Comments Accepted at the 34th International Conference on Parallel Architectures and Compilation Techniques (PACT 2025). 12 pages, plus appendix

Journal ref 2025 34th International Conference on Parallel Architectures and Compilation Techniques (PACT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00336 2025-12-30 cs.RO cs.AI 79%

Never-Ending Behavior-Cloning Agent for Robotic Manipulation

永不终止的行为克隆代理用于机器人操作

Wenqi Liang, Gan Sun, Yao He, Yu Ren, Jiahua Dong, Yang Cong

机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21708 2025-12-29 cs.CL 79%

MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles

MoRAgent: 基于角色混合的参数高效代理调优

Jing Han, Binwei Yan, Tianyu Guo, Zheyuan Bai, Mengyu Zheng, Hanting Chen, Ying Nie

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 MoRAgent通过角色混合框架实现参数高效代理调优,分解任务为推理、执行和总结三个角色,结合低秩适应技术提升代理性能。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18450 2025-12-23 cs.AI cs.CV cs.MA 79%

Agent-Based Output Drift Detection for Breast Cancer Response Prediction in a Multisite Clinical Decision Support System

基于代理的输出漂移检测用于多中心临床决策支持系统中的乳腺癌反应预测

Xavier Rafael-Palou, Jose Munuera, Ana Jimenez-Pastor, Richard Osuala, Karim Lekadir, Oliver Diaz

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的多中心临床决策支持系统中的输出漂移检测方法,通过模拟多中心环境验证了其在乳腺癌反应预测中的有效性,展示了自适应方案在漂移检测和严重性分类上的优越性能。

Comments Accepted at MICAD (Medical Imaging and Computer-Aided Diagnosis) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17092 2025-12-22 cs.CL 79%

Data Augmentation Supporting a Conversational Agent Designed for Smoking Cessation Support Groups

数据增强支持用于戒烟支持小组的对话代理

Salar Hashemitaheri, Ian Harris

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出了一种两级数据增强策略,通过合成和真实数据提升对话代理在戒烟支持小组中的表现,验证了数据增强对F1分数提升的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16408 2025-12-19 cs.LG cs.MA 79%

NDRL: Cotton Irrigation and Nitrogen Application with Nested Dual-Agent Reinforcement Learning

NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用

Ruifeng Xu, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。

Comments Accepted by ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25540 2025-12-16 cs.AI 79%

RadOnc-GPT: An Autonomous LLM Agent for Real-Time Patient Outcomes Labeling at Scale

RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理

Jason Holmes, Yuexing Hao, Mariana Borras-Osorio, Federico Mastroleo, Santiago Romero Brufau, Valentina Carducci, Katie M Van Abel, David M Routman, Andrew Y. K. Foong, Liv M Muller, Satomi Shiraishi, Daniel K Ebner, Daniel J Ma, Sameer R Keole, Samir H Patel, Mirek Fatyga, Martin Bues, Brad J Stish, Yolanda I Garces, Michelle A Neben Wittich, Robert L Foote, Sujay A Vora, Nadia N Laack, Mark R Waddle, Wei Liu

机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12306 2025-12-15 cs.AI cs.CY 79%

UpBench: A Dynamically Evolving Real-World Labor-Market Agentic Benchmark Framework Built for Human-Centric AI

UpBench: 一个动态演化的现实劳动力市场代理基准框架,专为以人为本的AI设计

Darvin Yi, Teng Liu, Mattie Terzolo, Lance Hasson, Ayan Sinha, Pablo Mendes, Andrew Rabinovich

机构 * Upwork

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 UpBench是一个动态演化的现实劳动力市场代理基准框架,通过真实工作和财务结果评估AI与人类协作的能力,推动人机协作的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 79%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15593 2025-12-10 cs.AI 79%

What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity

要成为优秀的AI研究代理需要什么?研究思想多样性的作用

Alexis Audran-Reiss, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun, Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana Shavrina, Yoram Bachrach

机构 * FAIR at Meta(FAIR(人工智能研究机构)于Meta) University College London(伦敦大学学院) Meta SuperIntelligence Labs(Meta超智能实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究思想多样性对AI研究代理性能的影响,通过分析不同模型和框架的轨迹及实验验证,发现高思想多样性提升代理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23856 2025-12-10 cs.AI 79%

From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production

从基准到业务影响:在企业生产中部署IBM通用代理

Segev Shlomov, Alon Oved, Sami Marreed, Ido Levy, Offer Akrabi, Avi Yaeli, Łukasz Strąk, Elizabeth Koumpan, Yinon Goldshtein, Eilam Shapira, Nir Mashkif, Asaf Adi

机构 * IBM

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 IBM开发并试点了CUGA,展示了通用代理在企业生产环境中的应用,通过分层规划-执行架构实现先进性能,并在人才招聘领域验证其可扩展性和安全性。

Comments AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26153 2025-12-09 cs.AI 79%

A Field Guide to Deploying AI Agents in Clinical Practice

人工智能代理在临床实践中的部署指南

Jack Gallifant, Katherine C. Kellogg, Matt Butler, Amanda Centi, Shan Chen, Patrick F. Doyle, Sayon Dutta, Joyce Guo, Matthew J. Hadfield, Esther H. Kim, David E. Kozono, Hugo JWL Aerts, Adam B. Landman, Raymond H. Mak, Rebecca G. Mishuris, Tanna L. Nelson, Guergana K. Savova, Elad Sharon, Benjamin C. Silverman, Umit Topaloglu, Jeremy L. Warner, Danielle S. Bitterman

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出了一本面向实践者的指南,旨在解决生成式AI在临床实践中部署的挑战,强调数据整合、模型验证和治理等关键实施工作。

Comments Under review. 7 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 79%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04771 2025-12-05 cs.MA cs.LG 79%

Complementary Characterization of Agent-Based Models via Computational Mechanics and Diffusion Models

通过计算力学和扩散模型互补性表征基于代理的模型

Roberto Garrone

机构 * University of Milano-Bicocca(米兰-比科卡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出通过计算力学和扩散模型互补性表征基于代理的模型,结合时间结构与分布几何分析复杂模拟模型。

Comments 11 pages. Methods paper introducing a dual-domain framework for analyzing ABM dynamics. Companion temporal-analysis preprint: arXiv:2510.12729

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22479 2025-12-03 cs.CL 79%

NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use

NeLLCom-Lex: 一种神经代理框架用于研究词汇系统与语言使用之间的相互作用

Yuqing Zhang, Ecesu Ürker, Tessa Verhoef, Gemma Boleda, Arianna Bisazza

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Translation and Language Sciences, Universitat Pompeu Fabra(翻译与语言科学系,庞培法拉大学) Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 NeLLCom-Lex通过神经代理框架模拟词汇系统演变,研究词汇与语言使用间的相互作用及语义变化机制。

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02561 2025-12-03 cs.MA cs.AI 79%

EZYer: A simulacrum of high school with generative agent

EZYer: 一种高中学校的模拟体与生成代理

Jinming Yang, Zimu Ji, Weiqi Luo, Gaoxi Wang, Bin Ma, Yueling Deng

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EZYer通过生成代理技术模拟高中教学环境,提供结构化教学材料和互动笔记生成,确保学术严谨性和教学适宜性,实验表明其生成内容质量高,应用前景广阔。

Comments AgentIR@SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 79%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11979 2025-11-26 cs.CL cs.MA 79%

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersonal Closeness

基于价值的大型语言模型代理模拟用于信任和人际亲密的相互评估

Yuki Sakamoto, Takahisa Uchida, Hiroshi Ishiguro

机构 * The University of Osaka, Graduate School of Engineering Science(大阪大学工学科学研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本研究通过模拟LLM代理,探讨价值相似性对信任和人际亲密的影响,验证了人工社会中价值观对关系建立的作用。

Journal ref Scientific Reports volume 15, Article number: 41653 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02744 2025-11-25 cs.AI 79%

Large Language Model-based Data Science Agent: A Survey

基于大型语言模型的数据科学代理:综述

Ke Chen, Peiran Wang, Yaoning Yu, Xianyang Zhan, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文综述了基于LLM的数据科学代理,从代理设计和数据科学流程两个角度探讨其关键原则与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16131 2025-11-21 cs.DB cs.AI 79%

AskDB: An LLM Agent for Natural Language Interaction with Relational Databases

AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理

Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê

机构 * IT Operations, Mantu Group(Mantu集团信息技术部) Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 AskDB是一种基于大型语言模型的代理,通过自然语言实现对关系数据库的数据分析和管理操作,提供统一且智能的交互体验。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15982 2025-11-21 cs.LG cs.NI 79%

Machine Learning Epidemic Predictions Using Agent-based Wireless Sensor Network Models

利用基于代理的无线传感器网络模型进行机器学习流行病预测

Chukwunonso Henry Nwokoye, Blessing Oluchi, Sharna Waldron, Peace Ezzeh

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本研究利用基于代理的SEIRV模型,通过机器学习算法预测无线传感器网络中的流行病传播,发现随机森林、XGBoost等算法在预测效果上表现最佳。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15203 2025-11-20 cs.CR cs.AI 79%

Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks

Zimo Ji, Xunguang Wang, Zongjie Li, Pingchuan Ma, Yudong Gao, Daoyuan Wu, Xincheng Yan, Tian Tian, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Lingnan University(岭南大学) School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ZTE Corporation(中兴通讯有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20606 2025-11-19 cs.CL 79%

Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm

Baixiang Huang, Zhen Tan, Haoran Wang, Zijie Liu, Dawei Li, Ali Payani, Huan Liu, Tianlong Chen, Kai Shu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments AAAI 2026 Oral. 14 pages (including appendix), 11 figures. Code, data, results, and additional resources are available at: https://model-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏