arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-05 至 2025-12-05 共收录 66 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 11 篇

2512.04691 2025-12-05 cs.AI cs.CL cs.MA 90%

Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective

迈向伦理化的大型语言模型多智能体系统:从机制可解释性视角出发

Jae Hee Lee, Anne Lauscher, Stefano V. Albrecht

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文从机制可解释性视角出发,提出确保大型语言模型多智能体系统伦理行为的研究议程,聚焦于伦理评估框架、内部机制解析及参数高效对齐技术。

Comments Accepted to LaMAS 2026@AAAI'26 (https://sites.google.com/view/lamas2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16708 2025-12-05 cs.SE cs.AI cs.MA 88%

Multi-Agent Code Verification via Information Theory

通过信息论的多智能体代码验证

Shreshth Rajan

机构 * Noumenon Labs(诺默恩实验室) Harvard University(哈佛大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.SE

AI总结 通过信息论构建多智能体系统,有效检测代码错误,准确率达79.3%,运行效率高。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04918 2025-12-05 cs.LG 88%

Multi-Agent Reinforcement Learning for Intraday Operating Rooms Scheduling under Uncertainty

多代理强化学习用于在日手术室调度中的不确定性处理

Kailiang Liu, Ying Chen, Ralf Borndörfer, Thorsten Koch

机构 * Department of Mathematics, National University of Singapore(新加坡国立大学数学系) Department of Mathematics & Risk Management Institute & Center for Quantitative Finance, National University of Singapore(新加坡国立大学数学系及风险管理研究所及量化金融中心) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系) Department of Network Optimization, Zuse Institute Berlin(柏林Zuse研究所网络优化部) Faculty of Mathematics and Natural Sciences, Technische Universität Berlin(柏林技术大学数学与自然科学学院) Department of Applied Algorithmic Methods, Zuse Institute Berlin(柏林Zuse研究所应用算法方法部)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出基于多代理强化学习的手术室调度方法,通过集中训练和分布式执行策略,有效应对不确定性,提升调度效率和及时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09414 2025-12-05 cs.SE 88%

Multi-agent Assisted Automatic Test Generation for Java JSON Libraries

多智能体辅助的Java JSON库自动测试生成

Sinan Wang, Zhiyuan Zhong, Shaojin Wen, Yepang Liu

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.SE

AI总结 JsonATG通过多智能体系统生成Java JSON库的多样化测试用例,有效提升测试覆盖率并发现多个bug。

Comments In the 32nd Asia-Pacific Software Engineering Conference (APSEC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04469 2025-12-05 cs.AI cs.LG 88%

Mathematical Framing for Different Agent Strategies

针对不同智能体策略的数学框架

Philip Stephens, Emmanuel Salawu

机构 * Google Cloud AI(谷歌云人工智能)

专题命中 多智能体 :agent(title,abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出一种数学框架,用于理解和比较不同智能体策略,引入'自由度'概念以指导策略选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04129 2025-12-05 cs.CR 88%

Tipping the Dominos: Topology-Aware Multi-Hop Attacks on LLM-Based Multi-Agent Systems

推倒多米诺骨牌:面向基于大语言模型的多智能体系统的拓扑感知多跳攻击

Ruichao Liang, Le Yin, Jing Chen, Cong Wu, Xiaoyu Zhang, Huangpeng Gu, Zijian Zhang, Yang Liu

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 针对基于大语言模型的多智能体系统,提出拓扑感知多跳攻击方法,揭示其内在安全漏洞并提出基于拓扑信任的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01523 2025-12-05 cs.IR 88%

MetaSynth: Multi-Agent Metadata Generation from Implicit Feedback in Black-Box Systems

MetaSynth: 从黑盒系统中的隐式反馈生成多智能体元数据

Shreeranjani Srirangamsridharan, Ali Abavisani, Reza Yousefi Maragheh, Ramin Giahi, Kai Zhao, Jason Cho, Sushant Kumar

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 MetaSynth通过多智能体检索增强生成框架,利用黑盒系统中的隐式反馈优化元数据生成,提升了CTR和点击率表现。

Comments IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10961 2025-12-05 cs.SE cs.AI 73%

Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection using LLM-Based Agents

开庭吧:一种基于大语言模型代理的漏洞检测方法

Ratnadira Widyasari, Martin Weyssow, Ivana Clairine Irsan, Han Wei Ang, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, Hong Jin Kang, David Lo

机构 * School of Computing and Information Systems, Singapore Management University, Singapore(计算与信息系统学院,新加坡管理大学,新加坡) School of Computer Science, University of Sydney, Australia(计算机科学学院,悉尼大学,澳大利亚)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 VulTrial通过多代理框架利用大语言模型检测漏洞,显著提升检测效率并发现多个零日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03762 2025-12-05 cs.AI 70%

RoCo: Role-Based LLMs Collaboration for Automatic Heuristic Design

RoCo:基于角色的LLM协作用于自动启发式设计

Jiawei Xu, Feng-Feng Wei, Wei-Neng Chen

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 RoCo通过多角色协作提升自动启发式设计的多样性和质量,实现高绩效的组合优化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04112 2025-12-05 cs.MM cs.AI 57%

MindFuse: Towards GenAI Explainability in Marketing Strategy Co-Creation

MindFuse:迈向营销策略协同创作中的生成式AI可解释性

Aleksandr Farseev, Marlo Ongpin, Qi Yang, Ilia Gossoudarev, Yu-Yi Chu-Farseeva, Sergey Nikolenko

机构 * ITMO University(ITMO大学) SoMin.ai Research(SoMin.ai研究) Faculty of Software Engineering(软件工程学院) Computer Systems, ITMO University(计算机系统,ITMO大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所以及可信人工智能研究中心)

专题命中 多智能体 :agent(abstract);分类 cs.AI

AI总结 MindFuse通过可解释生成式AI框架,实现营销策略协同创作中的内容生成、推理和实时优化,提升营销效率12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09840 2025-12-05 physics.soc-ph cs.MA math.DS nlin.AO 50%

Self-Propelled Agents and Group Social Force

自主推进体与群体社会力

Peng Wang, Peter Luh

专题命中 多智能体 :agent(abstract)

AI总结 本文研究了具有自主推进特征的布朗粒子在社会和经济过程中的集体决策模型,通过定量分析社会关系和群体社会力来描述社会现象。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 8 篇

2512.04785 2025-12-05 cs.AI cs.CR 83%

ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications

ASTRIDE:面向智能体AI应用的安全威胁建模平台

Eranga Bandara, Amin Hass, Ross Gore, Sachin Shetty, Ravi Mukkamala, Safdar H. Bouk, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(老奥布里恩大学) Accenture Technology Labs(埃森哲技术实验室) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 工作流自动化 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ASTRIDE是首个专为AI智能体应用设计的自动化威胁建模平台,通过扩展STRIDE框架并结合微调的视觉语言模型与推理LLM,实现基于图的威胁建模自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04854 2025-12-05 cs.AI 79%

From Task Executors to Research Partners: Evaluating AI Co-Pilots Through Workflow Integration in Biomedical Research

从任务执行者到研究伙伴:通过工作流整合在生物医学研究中评估AI共 pilot

Lukas Weidener, Marko Brkić, Chiara Bacci, Mihailo Jovanović, Emre Ulgac, Alex Dobrin, Johannes Weniger, Martin Vlas, Ritvik Singh, Aakaash Meduri

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.AI

AI总结 本文提出了一种以过程为导向的评估框架,用于评估AI系统在生物医学研究中的协作能力,强调对话质量、工作流编排、会话连续性和研究人员体验等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04716 2025-12-05 physics.flu-dyn cs.AI 77%

Towards an AI Fluid Scientist: LLM-Powered Scientific Discovery in Experimental Fluid Mechanics

迈向人工智能流体科学家:基于LLM的实验流体力学中的科学发现

Haodong Feng, Lugang Ye, Dixia Fan

机构 * Westlake University(西湖大学)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于LLM的AI流体科学家框架,实现自主实验流程,提升流体力学研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04445 2025-12-05 cs.SE cs.AI 73%

Automating Complex Document Workflows via Stepwise and Rollback-Enabled Operation Orchestration

通过分步和回滚功能的操作编排自动化复杂文档工作流

Yanbin Zhang, Hanhui Ye, Yue Bai, Qiming Zhang, Liao Xiang, Wu Mianzhi, Renjun Hu

机构 * Yanbin Zhang, Hanhui Ye, Yue Bai, Qiming Zhang, Liao Xiang, Wu Mianzhi, Renjun Hu(作者)

专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 AutoDW通过分步和回滚功能的操作编排,提升复杂文档工作流的自动化效率

Comments 9 pages, 3 figures, accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01926 2025-12-05 cs.AI cs.CL cs.LG 67%

Large language models can learn and generalize steganographic chain-of-thought under process supervision

大语言模型可以在过程监督下学习和泛化隐写链式思维

Joey Skaf, Luis Ibanez-Lissen, Robert McCarthy, Connor Watts, Vasil Georgiv, Hannes Whittingham, Lorena Gonzalez-Manzano, David Lindner, Cameron Tice, Edward James Young, Puria Radmard

机构 * Mentorship for Alignment Research Students (MARS)(对齐研究 mentorship 项目) University College London(伦敦大学学院) Queen Mary University of London(伦敦女王学院) ML Alignment & Theory Scholars (MATS)(对齐与理论学者) Meridian Impact, Cambridge(剑桥 Meridian Impact) Universidad Carlos III de Madrid(马德里卡洛斯三世大学) Geodesic Research and University of Cambridge(Geodesic Research 和剑桥大学)

专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 大语言模型在过程监督下能够学习并泛化隐写链式思维,通过替换特定字符串实现推理编码,提升监控可靠性。

Comments 10 pages main text, 3 figures main text, 17 pages supplementary material, 1 figure supplementary material, accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04518 2025-12-05 cs.CL cs.AI 62%

UW-BioNLP at ChemoTimelines 2025: Thinking, Fine-Tuning, and Dictionary-Enhanced LLM Systems for Chemotherapy Timeline Extraction

UW-BioNLP在ChemoTimelines 2025中的表现:基于思考、微调和词典增强的LLM系统用于化疗时间线提取

Tianmai M. Zhang, Zhaoyi Sun, Sihang Zeng, Chenxi Li, Neil F. Abernethy, Barbara D. Lam, Fei Xia, Meliha Yetisgen

机构 * University of Washington(华盛顿大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 UW-BioNLP通过思考、微调和词典增强LLM方法,在ChemoTimelines 2025中实现了最佳性能,提升了化疗时间线提取的准确性。

Comments To be published in Proceedings of the 7th Clinical Natural Language Processing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04938 2025-12-05 cs.AI 57%

Toward Continuous Neurocognitive Monitoring: Integrating Speech AI with Relational Graph Transformers for Rare Neurological Diseases

迈向连续神经认知监测:整合语音AI与关系图Transformer用于罕见神经系统疾病

Raquel Norel, Michele Merler, Pavitra Modi

机构 * IBM Research(IBM研究院) IBM Software(IBM软件公司) University of New Brunswick(新 Brunswick大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本研究通过整合语音AI与关系图Transformer,实现对罕见神经系统疾病患者认知状态的连续监测,发现语音特征与血液指标相关,但与传统认知测试无关,为早期预警提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04499 2025-12-05 cs.CV cs.GR 50%

Back to Basics: Motion Representation Matters for Human Motion Generation Using Diffusion Model

回归基础:扩散模型在人类运动生成中的运动表示至关重要

Yuduo Jin, Brandon Haworth

机构 * University of Victoria(维多利亚大学)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文探讨了运动表示和损失函数对扩散模型生成人类运动的影响,通过实验评估不同运动表示和配置的效果,以提升运动扩散模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 软件智能体 1 篇

2506.23749 2025-12-05 cs.SE 57%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与网页智能体 3 篇

2512.04105 2025-12-05 cs.CY cs.AI cs.HC 57%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12679 2025-12-05 cs.CV 50%

TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents

TongUI: 通过多模态网络教程构建大规模GUI代理

Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 TongUI通过多模态网络教程构建大规模GUI代理,利用GUI-Net数据集提升定位和导航性能,优于基线代理10%。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04089 2025-12-05 cs.DC 50%

Serverless Everywhere: A Comparative Analysis of WebAssembly Workflows Across Browser, Edge, and Cloud

无服务器 everywhere:浏览器、边缘和云上WebAssembly工作流的比较分析

Mario Colosi, Reza Farahani, Lauri Loven, Radu Prodan, Massimo Villari

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 本文比较了浏览器、边缘和云环境中WebAssembly工作流的性能,发现AOT编译和预热显著降低启动延迟,浏览器在小负载下表现优异,但随着负载增大,边缘和云节点的AOT执行更优。

Comments 7 pages, 8 Figures, 2 Tables, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 记忆与上下文管理 4 篇

2512.04680 2025-12-05 cs.SE cs.AI cs.HC 62%

Generative AI for Self-Adaptive Systems: State of the Art and Research Roadmap

生成式人工智能在自适应系统中的应用:现状与研究路线图

Jialong Li, Mingyue Zhang, Nianyu Li, Danny Weyns, Zhi Jin, Kenji Tei

机构 * Waseda University(早稻田大学) Southwest University(西南大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学) Tokyo Institute of Technology(东京技术大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。

Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01710 2025-12-05 cs.CL cs.IR 57%

MMAG: Mixed Memory-Augmented Generation for Large Language Models Applications

MMAG:混合记忆增强生成用于大型语言模型应用

Stefano Zeppieri

机构 * Department of Computer Science, Sapienza University of Rome(罗马大学计算机科学系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 MMAG通过整合五层记忆机制提升大型语言模型在对话中的连贯性、个性化和持续性,通过Heero代理验证其有效性,并探讨了存储、隐私等实施挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04302 2025-12-05 cs.AI 57%

Towards better dense rewards in Reinforcement Learning Applications

迈向强化学习应用中更优质的密集奖励

Shuyuan Zhang

机构 * McGill University(麦吉尔大学) Mila

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文探讨了强化学习应用中如何构建更有效的密集奖励,通过逆强化学习、奖励建模和自监督学习等方法提高奖励的准确性和可靠性。

Comments arXiv admin note: substantial text overlap with arXiv:2505.20417

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15068 2025-12-05 cond-mat.supr-con cond-mat.str-el 50%

Scaling behavior of superconductors

超导体的标度行为

V. R. Shaginyan, A. Z. Msezane, S. A. Artamonov

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了超导体的标度行为,揭示了Homes定律适用于传统和非常规超导体,并阐明了费米凝聚与强相关费米系统的关系。

Comments 15 pages, 10 figures

Journal ref Short version: JETP Lett. 122, 158 (2025); Open Access

详情

展开后加载摘要…

URL PDF HTML 收藏

6. Agent评测 9 篇

2512.04367 2025-12-05 cs.AI 83%

AgentBay: A Hybrid Interaction Sandbox for Seamless Human-AI Intervention in Agentic Systems

AgentBay:一种混合交互沙盒,用于无缝的人工智能干预在代理系统中

Yun Piao, Hongbo Min, Hang Su, Leilei Zhang, Lei Wang, Yue Yin, Xiao Wu, Zhejing Xu, Liwei Qu, Hang Li, Xinxin Zeng, Wei Tian, Fei Yu, Xiaowei Li, Jiayi Jiang, Tongxu Liu, Hao Tian, Yufei Que, Xiaobing Tu, Bing Suo, Yuebing Li, Xiangting Chen, Zeen Zhao, Jiaming Tang, Wei Huang, Xuguang Li, Jing Zhao, Jin Li, Jie Shen, Jinkui Ren, Xiantao Zhang

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 AgentBay通过混合交互沙盒实现无缝人机协作,提升代理系统在复杂任务中的成功率与网络适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05073 2025-12-05 cs.LG cs.AI cs.AR cs.SE 82%

David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?

大卫与歌利亚:小型模型能否通过代理AI在硬件设计中胜出?

Shashwat Shankar, Subhranshu Pandey, Innocent Dengkhw Mochahari, Bhabesh Mali, Animesh Basak Chowdhury, Sukanta Bhattacharjee, Chandan Karfa

机构 * Indian Institute of Technology, Guwahati, India(印度理工学院冈瓦提分校) NXP USA, Inc.(NXP美国公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究探讨小型语言模型结合代理AI在硬件设计中的应用,证明其在成本效率和性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04771 2025-12-05 cs.MA cs.LG 79%

Complementary Characterization of Agent-Based Models via Computational Mechanics and Diffusion Models

通过计算力学和扩散模型互补性表征基于代理的模型

Roberto Garrone

机构 * University of Milano-Bicocca(米兰-比科卡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出通过计算力学和扩散模型互补性表征基于代理的模型,结合时间结构与分布几何分析复杂模拟模型。

Comments 11 pages. Methods paper introducing a dual-domain framework for analyzing ABM dynamics. Companion temporal-analysis preprint: arXiv:2510.12729

详情

展开后加载摘要…

URL PDF HTML 收藏