arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-05 至 2026-02-05 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15 篇

2602.04813 2026-02-05 cs.AI cs.CY 85%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG 84%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 83%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 Agent评测 :agent(title);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 79%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04192 2026-02-05 cs.MA cs.AI 70%

Cooperative Flexibility Exchange: Fair and Comfort-Aware Decentralized Resource Allocation

协作灵活性交换:公平且舒适的去中心化资源分配

Rabiya Khalid, Evangelos Pournaras

机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于多智能体协调的去中心化需求侧管理系统,通过引入槽交换机制提升消费者舒适度与公平性,实现高效且公平的能源管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02515 2026-02-05 cs.AI cs.CL cs.LG 67%

CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection

CreditAudit: 2维度用于LLM评估与选择

Yiliang Song, Hongjun An, Jiangong Xiao, Haofei Zhao, Jiawei Shao, Xuelong Li

机构 * Northwestern Polytechnical University Institute of Artificial Intelligence (TeleAI), China Telecom(西北工业大学人工智能研究所(TeleAI),中国电信) Dalian Maritime University Institute of Artificial Intelligence (TeleAI), China Telecom(大连海事大学人工智能研究所(TeleAI),中国电信) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Guangxi Normal University Institute of Artificial Intelligence (TeleAI), China Telecom(广西师范大学人工智能研究所(TeleAI),中国电信)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 CreditAudit 通过 2D 信用评级框架,提供基于稳定性风险的 LLM 部署评估方法,支持更精确的模型选择与分层部署。

Comments Second update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04868 2026-02-05 cs.LG cs.AI 62%

CRoSS: A Continual Robotic Simulation Suite for Scalable Reinforcement Learning with High Task Diversity and Realistic Physics Simulation

CRoSS:一种用于可扩展强化学习的连续机器人仿真套件,具有高任务多样性和真实物理仿真

Yannick Denker, Alexander Gepperth

机构 * Department of Computer Science(计算机科学系) Fulda University of Applied Sciences(弗鲁达应用科学大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 CRoSS是一种用于连续强化学习的机器人仿真套件,通过高任务多样性和真实物理仿真,提供可扩展且可重复的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11589 2026-02-05 cs.SE cs.AI cs.IR 62%

CoSQA+: Pioneering the Multi-Choice Code Search Benchmark with Test-Driven Agents

CoSQA+: 以测试驱动代理开创多选代码搜索基准

Jing Gong, Yanghui Wu, Linxi Liang, Yanlin Wang, Jiachi Chen, Mingwei Liu, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 CoSQA+通过测试驱动代理开创多选代码搜索基准,利用高质查询与多个合适代码配对,提升代码搜索准确率至93.9%。

Comments Accepted to TSE 2025. We provide the code and data at https://github.com/DeepSoftwareAnalytics/CoSQA_Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00810 2026-02-05 cs.AI cs.CL 62%

Bootstrapping Cognitive Agents with a Large Language Model

通过大语言模型提升认知代理

Feiyu Zhu, Reid Simmons

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过大语言模型提升认知代理,结合两者优势以提高效率和领域适应性。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 38(1), 655-663 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04449 2026-02-05 cs.SE 57%

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

基准中有什么?SWE-Bench在自动程序修复中的案例

Matias Martinez, Xavier Franch

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文研究了SWE-Bench排行榜上的提交来源、LLM使用情况及行业参与度,揭示了专有LLM在自动程序修复中的主导地位。

Comments Accepted in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP'26). https://doi.org/10.1145/3786583.3786904

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03954 2026-02-05 stat.ML cs.LG stat.CO stat.ME 57%

Learning Multi-type heterogeneous interacting particle systems

学习多类型异质相互作用粒子系统

Quanjun Lang, Xiong Wang, Fei Lu, Mauro Maggioni

机构 * Department of Mathematics, Duke University(杜克大学数学系) School of Mathematics, Sun Yat-sen University(中山大学数学学院) Department of Mathematics, Johns Hopkins University(约翰霍普金斯大学数学系) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种三阶段方法,用于从多轨迹数据中联合推断异质相互作用粒子系统的网络拓扑、多类型交互核和潜在类型分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13171 2026-02-05 physics.space-ph 50%

Hybrid Active-Passive Galactic Cosmic Ray Simulator: in-silico design and optimization

混合主动-被动银河宇宙射线模拟器:计算机仿真设计与优化

Luca Lunati, Enrico Pierobon, Uli Weber, Tim Wagner, Tabea Pfuhl, Marco Durante, Christoph Schuy

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出了一种混合主动-被动银河宇宙射线模拟器,用于更真实地模拟空间辐射环境,以提升深空任务的风险评估和防护措施评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02826 2026-02-05 physics.hist-ph quant-ph 50%

Algorithmic idealism: what should you believe to experience next?

算法理想主义:你应当相信什么以体验下一步?

Markus P. Mueller

专题命中 Agent评测 :agent(abstract)

AI总结 算法理想主义提出应相信什么以体验下一步,通过重新诠释量子理论解决物理学中的核心谜团。

Comments 32 pages, 2 figures. V2: several clarifications and minor corrections

Journal ref Found. Phys. 56, 11 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03995 2026-02-05 econ.TH cs.CY cs.GT 50%

Dynamic Matching Under Patience Imbalance

有耐心不平衡下的动态匹配

Zhiyuan Chen, Rui, Chen, Ming Hu, Yun Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 研究在有耐心不平衡的双侧平台中,通过调整匹配收益分配,实现去中心化系统与集中化最优的匹配策略,分析不同耐心水平下的社会福利影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11103 2026-02-05 cs.HC 50%

AI Twin: Enhancing ESL Speaking Practice through AI Self-Clones of a Better Me

AI Twin: 通过AI自我克隆的更好我提升英语口语练习

Minju Park, Seunghyun Lee, Juhwan Ma, Dongwook Yoon

专题命中 Agent评测 :agent(abstract)

AI总结 AI Twin通过AI自我克隆提升ESL口语练习,利用隐含反馈增强学习者动机与语言流畅性。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏