arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2403.09442 2025-12-04 cs.SE cs.AI 62%

LLM-based agents for automating the enhancement of user story quality: An early report

基于大型语言模型的代理用于自动化提升用户故事质量:早期报告

Zheying Zhang, Maruf Rayhan, Tomas Herda, Manuel Goisauf, Pekka Abrahamsson

机构 * Princeton University, Princeton NJ 08544, USA, , WWW home page: http://users/ iekeland/web/welcome.html Universit\' e de Paris-Sud, Laboratoire d'Analyse Num\' e rique, B\ a timent 425, F-91405 Orsay Cedex, France

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究利用大型语言模型开发代理系统,旨在提升用户故事质量,展示了人工智能在敏捷开发中的应用潜力和实际效果。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03089 2025-12-04 cs.CR cs.AI cs.CY cs.LG 62%

Password-Activated Shutdown Protocols for Misaligned Frontier Agents

密码激活的停机协议用于对齐不一致的前沿代理

Kai Williams, Rohan Subramani, Francis Rhys Ward

机构 * MATS

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 密码激活停机协议通过在接收到密码时安全停机,降低前沿AI对齐不一致带来的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24091 2025-12-04 cs.SE cs.AI cs.PF 62%

PerfBench: Can Agents Resolve Real-World Performance Bugs?

PerfBench: 代理能否解决现实中的性能缺陷?

Spandan Garg, Roshanak Zilouchian Moghaddam, Neel Sundaresan

机构 * Microsoft Corporation(微软公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 PerfBench通过引入新的基准测试,评估代理解决性能缺陷的能力,发现现有代理在性能优化任务上表现不佳,但通过改进工具和指导可提升至20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02810 2025-12-03 cs.RO cs.AI cs.LG 62%

Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms

具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试

Shyam prasad reddy Kaitha, Hongrui Yu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02214 2025-12-03 cs.LG cs.AI 62%

Improved Training Mechanism for Reinforcement Learning via Online Model Selection

通过在线模型选择改进强化学习的训练机制

Aida Afshar, Aldo Pacchiano

机构 * Boston University(波士顿大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过在线模型选择改进强化学习训练,提升效率和性能,探讨了资源分配、非平稳动态适应及训练稳定性等理论问题,并通过实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01507 2025-12-02 cs.AI cs.LG 62%

SynthStrategy: Extracting and Formalizing Latent Strategic Insights from LLMs in Organic Chemistry

SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察

Daniel Armstrong, Zlatko Jončev, Andres M Bran, Philippe Schwaller

机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01396 2025-12-02 cs.SE cs.CL cs.CR 62%

BackportBench: A Multilingual Benchmark for Automated Backporting of Patches

BackportBench: 一种多语言的自动化补丁回退基准测试

Zhiqing Zhong, Jiaming Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.SE

AI总结 BackportBench是一个多语言基准测试,用于评估自动化补丁回退技术,展示了代理方法在处理复杂补丁回退任务中的优越性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00586 2025-12-02 cs.LG cs.CL q-bio.QM 62%

Statistical NLP for Optimization of Clinical Trial Success Prediction in Pharmaceutical R&D

统计自然语言处理用于药理研发中临床试验成功预测的优化

Michael R. Doane

专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文利用统计自然语言处理技术开发了基于BioBERT的模型,以优化神经科学领域临床试验成功预测,提升研发决策效率。

Comments Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10674 2025-12-01 cs.CL cs.AI cs.DB 62%

Continual Learning of Domain Knowledge from Human Feedback in Text-to-SQL

从人类反馈中持续学习领域知识的文本到SQL

Thomas Cook, Kelly Patel, Sivapriya Vellaichamy, Udari Madhushani Sehwag, Saba Rahimi, Zhen Zeng, Sumitra Ganesh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种通过人类反馈持续学习领域知识的文本到SQL框架,通过记忆增强的代理提升查询准确性与错误减少。

Comments 34 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 62%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 Agent评测 :function calling(abstract);分类 cs.AI、cs.CL

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10157 2025-12-01 cs.AI cs.CL 62%

One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence

一个患者,许多情境:通过情境智能扩展医疗AI

Michelle M. Li, Ben Y. Reis, Adam Rodman, Tianxi Cai, Noa Dagan, Ran D. Balicer, Joseph Loscalzo, Isaac S. Kohane, Marinka Zitnik

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18958 2025-11-26 cs.LG cs.AI 62%

Learning to Compress Graphs via Dual Agents for Consistent Topological Robustness Evaluation

通过双智能体学习压缩图以实现一致的拓扑鲁棒性评估

Qisen Chai, Yansong Wang, Junjie Huang, Tao Jia

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Cutter通过双智能体强化学习框架,实现图压缩以保持拓扑结构和鲁棒性,提升评估效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19107 2025-11-25 cs.LG cs.AI cs.GT stat.ML 62%

The Core in Max-Loss Non-Centroid Clustering Can Be Empty

最大损失非质心聚类中的核心可能为空

Robert Bredereck, Eva Deltl, Leon Kellerhals, Jannik Peters

机构 * TU Clausthal(图鲁斯大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究证明在最大损失目标下非质心聚类中核心可能为空,并给出了相关理论界和构造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09711 2025-11-25 cs.CL cs.AI 62%

PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry

PsychiatryBench: 一个面向心理治疗的多任务基准测试

Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 PsychiatryBench通过权威教科书和病例书构建多任务基准,评估LLMs在心理治疗中的临床一致性与安全性,揭示模型在多轮随访等任务中的不足,推动专门调优和更严谨的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07777 2025-11-25 cs.CL cs.AI 62%

Drift No More? Context Equilibria in Multi-Turn LLM Interactions

多轮交互中不再漂移:多轮LLM交互中的上下文均衡

Vardhan Dongre, Ryan A. Rossi, Viet Dac Lai, David Seunghyun Yoon, Dilek Hakkani-Tür, Trung Bui

机构 * Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出了一种动态框架,通过KL散度和递归模型解释多轮交互中的上下文漂移,展示可控干预能有效减少漂移,表明漂移是可控均衡现象而非必然衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16683 2025-11-24 cs.CL cs.AI 62%

How Well Do LLMs Understand Tunisian Arabic?

LLMs对突尼斯阿拉伯语的理解程度如何?

Mohamed Mahdi

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究通过构建包含突尼斯阿拉伯语、标准阿拉伯语和英语的平行数据集,评估了多种LLMs在转写、翻译和情感分析任务上的表现,揭示了模型在理解突尼斯方言方面的差异与局限,强调了在AI系统中纳入低资源语言的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00133 2025-11-24 cs.NI cs.AI cs.LG 62%

A Reinforcement Learning-Based Telematic Routing Protocol for the Internet of Underwater Things

基于强化学习的水下物联网远程路由协议

Mohammadhossein Homaei, Mehran Tarif, Agustin Di Bartolo, Victor Gonzalez Morales, Mar Avila Vegas

机构 * University of Extremadura(埃斯特拉曼杜拉大学) University of Verona(威尼斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于强化学习的水下物联网远程路由协议RL-RPL-UA,通过动态目标函数优化网络性能,实验显示其在数据包交付率、能耗和网络寿命方面均优于传统方法。

Comments 8 Pages, 10 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16593 2025-11-21 cs.SE cs.AI cs.CV cs.RO 62%

Green Resilience of Cyber-Physical Systems: Doctoral Dissertation

物理信息系统的绿色韧性:博士论文

Diaeddin Rimawi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究提出GResilience框架,通过多目标优化、博弈论和强化学习优化OL-CAIS的绿色恢复,减少能源影响并维持性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16483 2025-11-21 cs.LG cs.AI cs.MA 62%

Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense

基于大型语言模型的深度强化学习驱动自主网络防御的奖励设计

Sayak Mukherjee, Samrat Chatterjee, Emilie Purvine, Ted Fujimoto, Tegan Emerson

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大型语言模型设计奖励,以提升深度强化学习在自主网络防御中的效果。

Comments Accepted in the AAAI-26 Workshop on Artificial Intelligence for Cyber Security (AICS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02712 2025-11-18 cs.LG cs.AI q-bio.MN 62%

Graph Neural Network-Based Reinforcement Learning for Controlling Biological Networks - the GATTACA Framework

Andrzej Mizera, Jakub Zarzycki

机构 * Faculty of Mathematics, Informatics and Mechanics, University of Warsaw(数学、信息学与力学学院,华沙大学) IDEAS Research Institute(IDEAS研究机构) IDEAS NCBR Sp. z o.o.(IDEAS NCBR公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10282 2025-11-14 cs.LG cs.AI 62%

Torch-Uncertainty: A Deep Learning Framework for Uncertainty Quantification

Adrien Lafage, Olivier Laurent, Firas Gabetni, Gianni Franchi

机构 * U2IS, ENSTA, Institut Polytechnique de Paris(U2IS、ENSTA、巴黎理工学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19319 2025-11-14 cs.CL cs.AI 62%

FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering

Gyubok Lee, Elea Bach, Eric Yang, Tom Pollard, Alistair Johnson, Edward Choi, Yugang jia, Jong Ha Lee

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) Verily Life Sciences(Verily 生物科技) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09895 2025-11-14 cs.LG cs.AI 62%

Simulator and Experience Enhanced Diffusion Model for Comprehensive ECG Generation

Xiaoda Wang, Kaiqiao Han, Yuhao Xu, Xiao Luo, Yizhou Sun, Wei Wang, Carl Yang

机构 * Emory University(埃默里大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09727 2025-11-14 cs.RO cs.AI cs.LG 62%

Baby Sophia: A Developmental Approach to Self-Exploration through Self-Touch and Hand Regard

Stelios Zarifis, Ioannis Chalkiadakis, Artemis Chardouveli, Vasiliki Moutzouri, Aggelos Sotirchos, Katerina Papadimitriou, Panagiotis Filntisis, Niki Efthymiou, Petros Maragos, Katerina Pastra

机构 * Robotics Institute, Athena Research Center(机器人研究所,阿提卡研究中心) HERON – Hellenic Robotics Center of Excellence(HERON – 希腊机器人 excellence 中心) Institute for Language and Speech Processing, Athena Research Center(语言和语音处理研究所,阿提卡研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08835 2025-11-13 cs.CL cs.AI 62%

Beyond Task-Oriented and Chitchat Dialogues: Proactive and Transition-Aware Conversational Agents

Yejin Yoon, Yuri Son, Namyoung So, Minseo Kim, Minsoo Cho, Chanhee Park, Seungshin Lee, Taeuk Kim

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

Comments accepted to EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08598 2025-11-13 cs.CL cs.AI 62%

OKBench: Democratizing LLM Evaluation with Fully Automated, On-Demand, Open Knowledge Benchmarking

Yanhong Li, Tianyang Xu, Kenan Tang, Karen Livescu, David McAllester, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) TTI-Chicago(芝加哥技术研究所) UC Santa Barbara(圣巴巴拉大学) Stony Brook University(石溪大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08587 2025-11-13 cs.CY cs.AI cs.CL 62%

Conversational Agents for Building Energy Efficiency -- Advising Housing Cooperatives in Stockholm on Reducing Energy Consumption

Shadaab Ghani, Anne Håkansson, Oleksii Pasichnyi, Hossein Shahrokni

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05542 2025-11-11 q-bio.NC cs.AI cs.CV cs.LG 62%

ConnectomeBench: Can LLMs Proofread the Connectome?

Jeff Brown, Andrew Kirjner, Annika Vivekananthan, Ed Boyden

机构 * MIT(麻省理工学院) HHMI(霍华德·休斯医学研究所) McGovern Institute(麦戈文研究所) MIT Departments of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.LG

Comments To appear in NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00616 2025-11-10 cs.LG cs.AI cs.HC 62%

TimeCopilot

Azul Garza, Renée Rosillo

机构 * San Francisco, CA, USA(美国加州旧金山)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03279 2025-11-10 cs.LG cs.AI stat.ML 62%

Conformal Information Pursuit for Interactively Guiding Large Language Models

Kwan Ho Ryan Chan, Yuyan Ge, Edgar Dobriban, Hamed Hassani, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏