arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 14943 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 14943 篇

2407.03956 2026-06-04 cs.MA cs.CL 88%

Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems

使用约束引导的多智能体系统解决斑马谜题

Shmuel Berman, Kathleen McKeown, Baishakhi Ray

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 提出一种多智能体系统ZPS,结合大语言模型与定理证明器,通过分解问题、生成SMT代码和智能体间反馈,显著提升复杂逻辑谜题的解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13428 2026-06-04 cs.LG cs.MA cs.SY eess.SY stat.ML 88%

Attentional Policies for Cross-Context Multi-Agent Reinforcement Learning

面向跨上下文多智能体强化学习的注意力策略

Matthew A. Wright, Roberto Horowitz

机构 * University of California Berkeley(加州大学伯克利分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种新的神经策略架构,用于解决多智能体问题,通过在策略层面学习多智能体关系,利用注意力机制实现智能体间的协作,优于传统方法并在大规模智能体场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.09630 2026-06-04 cs.MA cs.LG cs.SY eess.SY 88%

Resilient Autonomous Control of Distributed Multi-agent Systems in Contested Environments

在 contested 环境中分布式多智能体系统的鲁棒自主控制

Rohollah Moghadam, Hamidreza Modares

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种鲁棒学习控制协议,用于在存在攻击和系统动态不确定性的情况下实现多智能体系统的同步,通过分布式 H_infinity 控制器和信任-信心机制提高系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.11411 2026-06-04 eess.SY cs.LG cs.MA cs.SY 88%

Observer-based Adaptive Optimal Output Containment Control problem of Linear Heterogeneous Multi-agent Systems with Relative Output Measurements

基于观测器的自适应最优输出包容控制问题:线性异构多智能体系统中的相对输出测量

Majid Mazouchi, Mohammad Bagher Naghibi-Sistani, Seyed Kamal Hosseini Sani, Farzaneh Tatari, Hamidreza Modares

机构 * Department of Electrical Engineering, Ferdowsi University of Mashhad, Mashhad, Iran(马什哈德法尔多西大学电气工程系) Department of Electrical Engineering, University of Semnan, Semnan, Iran(塞姆南大学电气工程系) Missouri University of Science(密苏里科技大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于相对输出反馈的最优解法,用于线性异构多智能体系统的包容控制问题,通过分布式最优控制协议确保跟随器输出处于领导者输出的凸包内并优化暂态性能,采用分布式观测器估计不可用的状态和凸包。

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.01628 2026-06-04 cs.MA cs.AI cs.GT cs.SY eess.SY 88%

Validation of Enhanced Emotion Enabled Cognitive Agent Using Virtual Overlay Multi-Agent System Approach

基于虚拟叠加多智能体系统的增强型情感认知智能体验证

Faisal Riaz, Muaz A. Niazi

专题命中 多智能体 :agent(title,abstract);multi-agent(title);分类 cs.AI

AI总结 本文提出基于虚拟叠加多智能体系统的方法,验证了增强型情感认知智能体在避免道路碰撞中的有效性,展示了其在不同交通情境下感知恐惧等级的能力及更短的停车视距和超车视距。

Comments 35 pages, 21 figures, 19 tables

Journal ref Broad Research in Artificial Intelligence and Neuroscience 8.3 (2017): 13-37

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.06334 2026-06-04 eess.SY cs.AI cs.IT cs.SY math.IT math.OC nlin.AO 88%

Fully Decentralized Policies for Multi-Agent Systems: An Information Theoretic Approach

多智能体系统的完全去中心化策略:信息论方法

Roel Dobbe, David Fridovich-Keil, Claire Tomlin

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出基于信息论的框架,用于多智能体系统中无通信条件下的去中心化策略设计,通过率失真理论分析策略重建最优解的能力,并扩展至确定通信节点以提升个体策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03467 2026-06-03 cs.AI 88%

StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems

StepFinder:多智能体系统中故障归因的时间语义框架

Taiyu Zhu, Yifan Wu, Weilin Jin, Ying Li, Gang Huang

机构 * Peking University(北京大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出StepFinder框架,通过将执行日志编码为时间语义序列并利用时序建模与注意力模块,高效准确地定位多智能体系统中的故障根因步骤。

Comments 12 pages, 5 figures. Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03321 2026-06-03 cs.LG cs.MA cs.SY eess.SY 88%

Validation-Gated Multi-Agent Governance for Online Adaptation of Thermal-Hydraulic Surrogate Models under Operating-Regime Shift

验证门控多智能体治理:运行工况迁移下热工水力代理模型的在线自适应

Doyeong Lim, Seungyoon Lee, In Cheol Bang

机构 * Department of Nuclear Engineering, Ulsan National Institute of Science and Technology (UNIST)(核工程系,乌山国立科学技术研究所(UNIST))

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 针对离线训练模型在运行工况迁移时性能退化问题,提出验证门控多智能体治理框架,通过角色分离的智能体协作与确定性门控机制实现可审计的在线自适应,在实验热工水力数据上将平均绝对误差降低19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03032 2026-06-03 cs.CL 88%

The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation

深思幻觉:诊断多智能体LLM讨论中的事实损耗与立场同质化

Herun Wan, Jiaying Wu, Minnan Luo, Fanxiao Li, Ningnan Wang, Nancy F. Chen, Min-Yen Kan

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学) Yunnan University(云南大学) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR))

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 本文提出DelibTrace框架,通过分解原子事实并追踪其存留,发现多智能体LLM讨论中高达72%的关键事实丢失,导致立场同质化,揭示了“同意越多、知道越少”的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02753 2026-06-03 cs.CV cs.AI 88%

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data

MetaWorld: 从单视角视频数据扩展多智能体视频世界模型

Teng Hu, Mingchun Lu, Yating Wang, Jiangning Zhang, Jinkun Hao, Ye Pan, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出MetaWorld框架,通过单目世界状态展开、主体感知世界生成器和世界状态对齐机制,从单视角视频构建多智能体视频世界模型,解决数据稀缺和世界状态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02614 2026-06-03 cs.CE cs.AI 88%

Margin Play: A Multi-Agent System For Public Policy Analysis In The Brazilian Equatorial Margin

边际博弈:巴西赤道边缘地区公共政策分析的多智能体系统

Antonio de Sousa Leitão Filho, Fabrício Saul Lima, Selby Mykael Lima dos Santos, Rejani Bandeira Vieira Sousa, Luís Jorge Mesquita de Jesus, Dennys Correia da Silva, Allan Kardec Duailibe Barros Filho

机构 * Aia Context Universidade Federal do Maranhão — UFMA(佛罗里达州立大学马纳汉分校) Universidade Estadual de Campinas — UNICAMP(坎皮纳斯州立大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 针对巴西赤道边缘地区石油勘探对马拉尼昂州福利影响的问题,提出基于多智能体强化学习(MARL)的仿真系统Margin Play,通过CTDE范式和BRO-MARL训练六个智能体,发现福利增益取决于制度安排,MA-Prospero配置可显著提升福利并降低环境负债。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02646 2026-06-03 physics.soc-ph cs.AI cs.MA 88%

The Ringelmann Effect in Multi-Agent LLM Systems: A Scaling Law for Effective Team Size

多智能体大语言模型系统中的林格曼效应:有效团队规模的缩放定律

Blaž Bertalanič, Carolina Fortuna

机构 * Jozef Stefan Institute(乔泽夫·斯蒂芬研究所)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文推导出两参数缩放定律 $R(N) = N_\text{eff}/N = 1/(1+c(N-1)N^{-\beta})$,将多智能体LLM系统分为三种渐近状态,并通过44个实验单元验证了该定律,发现密集辩论无法增加答案多样性,噪声安慰剂可模拟自我修正效果,且仅异构团队能突破硬上限。

Comments 41 pages, 9 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19005 2026-06-03 cs.CL 88%

Debating the Unspoken: Role-Anchored Multi-Agent Reasoning for Half-Truth Detection

辩论未尽之言:基于角色锚定的多智能体推理用于半真半假检测

Yixuan Tang, Yirui Zhang, Hang Feng, Anthony K. H. Tung

机构 * National University of Singapore(国立新加坡大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 提出RADAR框架,通过角色锚定的多智能体辩论(政治家与科学家对抗推理,法官中立裁决)和双阈值早停控制,在噪声检索下有效检测因省略上下文而误导的半真半假陈述。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08335 2026-06-03 cs.AI 88%

Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System

谁应得奖励?SHARP:基于Shapley信用的多智能体系统优化

Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 针对多智能体系统中信用分配难题,提出SHARP框架,通过分解奖励机制(全局广播奖励、Shapley边际信用奖励和工具过程奖励)实现精确信用归因,显著提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1209.2194 2026-06-03 math.OC cs.LG cs.MA cs.SY eess.SY 88%

Cooperative learning in multi-agent systems from intermittent measurements

基于间歇测量的多智能体系统协同学习

Naomi Ehrich Leonard, Alex Olshevsky

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 针对时变连接和间歇测量下的多智能体系统,提出一种分布式学习协议,从噪声测量中学习未知向量μ,并给出学习速度与网络大小和组合特征的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02359 2026-06-02 cs.AI 88%

MOC: Multi-Order Communication in LLM-based Multi-Agent Systems

MOC:基于LLM的多智能体系统中的多阶通信

Yao Guan, Lin Wang, Zhihu Lu, Ziyi Wang, Wenzhu Yan, Qiang Duan

机构 * Fudan University(复旦大学) Nanjing Normal University(南京师范大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出多阶通信(MOC)方案,通过重构智能体间通信以捕获多跳依赖,并设计结构消息合并策略,在多个数据集上提升任务性能并降低通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02337 2026-06-02 cs.AI 88%

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

约束多智能体强化学习的协调图

Santiago Amaya-Corredor, Miguel Calvo-Fullana, Anders Jonsson

机构 * Department of Electrical and Computer Engineering, Linköping University(1 链çe普大学电气与计算机工程系)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出CG-CMARL框架,利用协调图和拉格朗日对偶分解联合动作空间与约束耦合问题,实现独立于智能体数量的模型学习,并通过Max-Sum消息传递和拉格朗日乘子控制目标-约束权衡,生成帕累托前沿。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 40 pages (12 main + 28 appendix), 5 figures, 16 tables, 7 theorems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02282 2026-06-02 cs.AI 88%

POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

POIROT: 在多智能体系统中审讯智能体以进行故障检测

Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal, J. M. Valverde-García, Annemarie F. Laudanski, Álvaro Gutiérrez, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出POIROT协议,利用多智能体系统自身的智能体作为诊断层进行故障检测,在复杂问题、多智能体和复合故障条件下优于单LLM评估基线。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01828 2026-06-02 cs.MA cs.AI 88%

Dynamic Trust-Aware Sparse Communication Topology for LLM-Based Multi-Agent Consensus

基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识

Wanshuang Gou, Zihan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01324 2026-06-02 cs.IT cs.AI math.IT 88%

Digital Twin-Assisted Adaptive Multi-Agent DRL for Intelligent Spectrum and Resource Management in Open-RAN UAV-Enabled 6G Networks

数字孪生辅助的自适应多智能体深度强化学习用于Open-RAN无人机赋能6G网络中的智能频谱与资源管理

Marwan Dhuheir, Thang X. Vu, Symeon Chatzinotas

机构 * University of Cambridge(剑桥大学) University of Bristol(布里斯托大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 针对无人机辅助6G网络中动态频谱与资源管理难题,提出数字孪生辅助的自适应深度强化学习框架,结合粒子群优化轨迹与多智能体DRL分配资源,显著提升频谱效率、数据速率和能量利用率。

Comments accepted and presented at IEEE ICC-2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00953 2026-06-02 cs.LG cs.MA 88%

When Parallelism Pays Off: Cohesion-Aware Task Partitioning for Multi-Agent Coding

当并行性有回报时:面向多智能体编码的凝聚力感知任务划分

Xu Yang, Lunyiu Nie, Ethan Chandra, Stanislav Gannutin, Fangru Lin, Swarat Chaudhuri

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Oxford(牛津大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 提出Co-Coder方法,通过静态分析构建依赖图、社区检测划分图及依赖感知调度,在仓库级软件工程中平衡通信与计算开销,实现多智能体并行编码的效率和成本优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00820 2026-06-02 cs.CL 88%

Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate

并非所有翻转都是顺从:多智能体LLM辩论中的立场趋同分解

Xiqi Hao, Zengqing Wu, Yu-Xuan Qiu, Chuan Xiao, Ruiqi Xu, Shuyuan Zheng, Jianbin Qin

机构 * Beijing Institute of Technology(北京理工大学) University of Osaka(大阪大学) Shenzhen University(深圳大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 通过三源分解框架,将多智能体辩论中的答案趋同分解为自发不稳定性、立场诱导的从众和推理诱导的说服,并揭示从众主要是有害的,可通过干预降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00655 2026-06-02 cs.MA cs.AI cs.CY 88%

Scaling Behavior of Single LLM-Driven Multi-Agent Systems

单一LLM驱动的多智能体系统的扩展行为

Jialing Li, Zhouhong Gu, Yin Cai, Hongwei Feng

机构 * Fudan University(复旦大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文通过提出顺序迭代多智能体系统(SIMAS)框架,系统研究了同质多智能体系统性能随智能体数量变化的扩展规律,发现性能并非单调提升,而是受协作协同与协调开销之间的权衡支配,呈现收益递减模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00610 2026-06-02 cs.IR cs.AI cs.MA 88%

MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation

MemGraphRAG:基于记忆的多智能体系统用于图检索增强生成

Chuanjie Wu, Zhishang Xiang, Yunbo Tang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * Xiamen University(厦门大学) Jilin University(吉林大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出MemGraphRAG框架,通过基于记忆的多智能体系统构建高质量知识图谱,并设计记忆感知的分层检索算法,在多个基准上超越现有模型。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00007 2026-06-02 cs.AI 88%

Deliberative Curation: A Protocol for Multi-Agent Knowledge Bases

审慎策展:多智能体知识库协议

Steven Johnson

机构 * Steven Johnson(史蒂文·约翰逊)

专题命中 多智能体 :agent(title,abstract);multi-agent(title);AI agent(abstract);分类 cs.AI

AI总结 针对多智能体知识库的集体策展挑战,提出结合知识工件生命周期、声誉加权审议投票和分级制裁的审慎策展协议,通过基于智能体的仿真验证其在逆境下优于多数投票的鲁棒性。

Comments 29 pages, 1 figure, 6 tables. Open-source implementation available at https://github.com/StevenJohnson998/AIngram

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16167 2026-06-02 cs.MA cs.AI cs.GT 88%

Ev-Trust: An Evolutionarily Stable Trust Mechanism for Decentralized LLM-Based Multi-Agent Service Economies

Ev-Trust: 一种面向去中心化基于LLM的多智能体服务经济的演化稳定信任机制

Jiye Wang, Shiduo Yang, Ting Qiao, Jiayu Qin, Jianbin Li, Yu Wang, Yuanhe Zhao

机构 * School of Control and Computer Engineering, North China Electric Power University(控制与计算机工程学院,华北电力大学) State Grid Corporation of China(国家电网公司)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 针对去中心化LLM多智能体服务经济中欺诈成本降低、服务质量评估困难和服务内容不稳定三大脆弱性,提出Ev-Trust信任机制,通过交叉验证门、方差标准化漂移度量和信任信号嵌入收益函数,实现合作策略的演化稳定,实验表明恶意参与减少约60%,欺诈率降低约50%。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10943 2026-06-02 cs.MA cs.CL 88%

The Social Cost of Intelligence: Emergence, Propagation, and Amplification of Stereotypical Bias in Multi-Agent Systems

智能的社会成本:多智能体系统中刻板偏见的涌现、传播与放大

Thi-Nhung Nguyen, Linhao Luo, Amardeep Kaur, Rollin Omari, Tamas Abraham, Junae Kim, Thuy-Trang Vu, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) Defence Science and Technology Group, Australia(澳大利亚国防科学与技术集团)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 本研究提出一个评估框架,通过三个智能体级指标量化多智能体系统中偏见的涌现、传播和放大,发现通信可触发高达70%的新偏见、传播至80%以上智能体并放大3倍以上刻板印象,且密集竞争性通信增加偏见,系统易受简单偏见注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11083 2026-06-02 cs.CL 88%

RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates

RedDebate:通过多智能体红队辩论实现更安全的响应

Ali Asad, Stephen Obadinma, Radin Shayanfar, Xiaodan Zhu

机构 * Department of Electrical Computer Engineering \& Ingenuity Labs Research Institute, Queen's University, Kingston, Canada

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 提出RedDebate框架,利用多智能体辩论和长期记忆模块,通过全自动红队测试减少大语言模型的不安全输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02511 2026-06-02 cs.AI cs.MA 88%

Stop Wandering, Find the Keys: LLMs Discriminate Key States for Efficient Multi-Agent Exploration

停止徘徊,找到关键:LLMs 辨别关键状态以实现高效多智能体探索

Yun Qu, Boyuan Wang, Yuhang Jiang, Jianzhun Shao, Yixiu Mao, Heming Zou, Chang Liu, Cheems Wang, Meiqin Liu, Xiangyang Ji

机构 * Department of Automation, Tsinghua University, Beijing 100084, China(清华大学自动化系) College of Electrical Engineering, Zhejiang University, Hangzhou 310027, China(浙江大学电气工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学人机混合增强智能国家级重点实验室)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出 LEMAE 方法,利用大语言模型辨别关键状态并设计子空间内在奖励和关键状态记忆树,引导多智能体高效探索,在 SMAC 和 MPE 基准上显著超越现有方法,实现 10 倍加速。

Journal ref SCIENCE CHINA Information Sciences 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03644 2026-06-02 cs.LG cs.MA 88%

MACCA: Offline Multi-agent Reinforcement Learning with Causal Credit Assignment

MACCA: 离线多智能体强化学习中的因果信用分配

Ziyan Wang, Yali Du, Yudi Zhang, Meng Fang, Biwei Huang

机构 * King’s College London(伦敦国王学院) Eindhoven University of Technology(埃因霍温理工大学) University of Liverpool(利物浦大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 提出基于动态贝叶斯网络的因果信用分配框架MACCA,通过建模环境变量、状态、动作和奖励的因果关系,实现离线多智能体强化学习中准确且可解释的信用分配。

Comments 21 pages, 4 figures

Journal ref TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏