arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 14943 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 14943 篇

2605.01750 2026-05-14 cs.MA cs.AI 88%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01457 2026-05-14 cs.AI 88%

CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making

CoFlow:协调的少步流用于离线多智能体决策制定

Guowei Zou, Haitao Wang, Beiwen Zhang, Boning Zhang, Hejun Wu

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 CoFlow通过协调速度注意力和自适应协调门控,在少步生成中保持多智能体协调,提升离线多智能体强化学习的效率与协调性。

Comments 34 pages, 15 figures, 10 tables. Project page: https://guowei-zou.github.io/coflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08944 2026-05-14 cs.LG cs.MA 88%

Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication

多智能体决策导向学习 via 值感知序列通信

Benjamin Amoh, Geoffrey Parker, Wesley Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯大学泰勒工程学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出SeqComm-DFL方法,通过值感知序列通信与决策导向学习结合,提升多智能体任务性能。方法引入序列Stackelberg条件生成消息,利用信息论界限证明收敛性,并在协作医疗和StarCraft多智能体挑战中取得显著奖励和胜率提升。

Comments 9 pages, 2 figues, 1 table, neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01453 2026-05-14 cs.LG 88%

The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration

合作多智能体探索中的地平线阈值

Idan Barnea, Orin Levy, Yishay Mansour

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文研究了在无奖励探索设定下合作多智能体强化学习,提出了一种分阶段学习框架,通过有限时间步数的MDP,确定学习阶段数与智能体数量的权衡,证明当学习阶段数等于地平线H时,算法效率与精度的最优平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01049 2026-05-14 cs.LG 88%

Centralized Adaptive Sampling for Reliable Co-Training of Independent Multi-Agent Policies

集中式自适应采样用于独立多智能体策略的可靠协同训练

Nicholas E. Corrado, Josiah P. Hanna

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出CoSER方法,通过协调动作选择减少联合采样误差,提升多智能体强化学习中策略梯度算法的收敛可靠性。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12240 2026-05-13 cs.AI 88%

No Action Without a NOD: A Heterogeneous Multi-Agent Architecture for Reliable Service Agents

没有NOD就没有行动:一种异质多智能体架构用于可靠的服务代理

Zixu Yang, Hang Zheng, Nan Jiang, Zhiyang Tang, Situo Zhang, Xiaobao Wu, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Shanghai Innovation Institution, Shanghai, China(上海创新机构,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出NOD架构,通过外部化全局状态和选择性外部监督,提升服务代理在长周期任务中的可靠性,实验表明其在任务成功率和关键动作精度上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11880 2026-05-13 cs.LG cs.MA 88%

Adaptive TD-Lambda for Cooperative Multi-agent Reinforcement Learning

自适应TD-λ用于合作多智能体强化学习

Yue Deng, Zirui Wang, Yin Zhang

机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出自适应TD(λ)方法,通过参数化无偏密度比估计器和双回放缓冲区解决多智能体强化学习中策略分布计算问题,实验证明其在SMAC和Gfootball场景中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09769 2026-05-13 cs.AI 88%

UTS at PsyDefDetect: Multi-Agent Councils and Absence-Based Reasoning for Defense Mechanism Classification

在PsyDefDetect上使用UTS:多智能体委员会与基于缺席的推理用于防御机制分类

Dima Galat, Marian-Andrei Rizoiu

机构 * University of Technology Sydney(技术大学悉尼)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出利用DMRS对情感支持对话中的防御机制进行分类,通过多阶段 deliberative 委员会架构,采用特定类别的倡导者评估证据强度,实现F1 0.382的高精度,同时通过针对性的重写集提升F1至0.410。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24145 2026-05-13 cs.AI 88%

OpsAgent: An Evolving Multi-agent System for Incident Management in Microservices

OpsAgent:一种用于微服务中 incident 管理的演进多智能体系统

Yu Luo, Jiamin Jiang, Jingfei Feng, Lei Tao, Qingliang Zhang, Xidao Wen, Yongqian Sun, Shenglin Zhang, Dan Pei

机构 * Nankai University(南开大学) Alibaba Cloud(阿里云) Lenovo(联想) Tsinghua University(清华大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出 OpsAgent,一种轻量级自演进多智能体系统,通过训练自由数据处理器将异构可观测数据转化为结构化文本描述,并结合多智能体协作框架实现诊断推理的透明性和可审计性,实验证明其在微服务系统中的泛化性、可解释性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11789 2026-05-13 cs.AI 88%

Beyond Inefficiency: Systemic Costs of Incivility in Multi-Agent Monte Carlo Simulations

超越低效:多智能体蒙特卡洛模拟中不文明行为的系统性成本

Alison Moldovan-Mauer, Benedikt Mangold

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 研究通过多智能体蒙特卡洛模拟探讨不文明行为对交互效率的影响,发现参数较少的模型收敛延迟更显著,并发现先发优势在不同毒性条件下均显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11738 2026-05-13 cs.AI 88%

OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

OptArgus:一种多智能体系统用于检测基于大语言模型的优化建模中的幻觉

Zhong Li, Zihan Guo, Xiaohan Lu, Juntao Wang, Jie Song, Chao Shen, Jiageng Wu, Mingyang Sun

机构 * Great Bay University(大湾大学) Peking University(北京大学) Jilin University(吉林大学) Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出OptArgus多智能体系统,通过细粒度幻觉分类法检测优化建模中的错误,通过三部分基准测试验证其在清洁、控制和自然生成 artifact 上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11469 2026-05-13 cs.LG 88%

Robust Multi-Agent Path Finding under Observation Attacks: A Principled Adversarial-Plus-Smoothing Training Recipe

在观察攻击下的鲁棒多智能体路径寻找:一种基于对抗性加平滑训练的原理性配方

Riad Ahmed

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出两种训练方法,使多智能体路径寻找在受扰观测下保持稳定,通过对抗训练和平滑项提升鲁棒性,实验显示在8x8地图上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11204 2026-05-13 eess.SY cs.LG cs.MA cs.SY math.AT 88%

Multi-Agent System Identification with Nonlinear Sheaf Diffusion

多智能体系统识别与非线性sheaf扩散

Nivar Anwer, Hans Riess, Matthew Hale

机构 * Department of Computer Science, Georgia Tech(佐治亚理工学院计算机科学系) Department of Electrical & Computer Engineering, Georgia Tech(佐治亚理工学院电气与计算机工程系)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文研究多智能体系统中非线性sheaf扩散的识别问题,指出拓扑学中的sheaf上同调是恢复交互规律的关键因素,通过实验验证了在有限维参数化类中恢复的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11136 2026-05-13 cs.AI 88%

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

EVOCHAMBER:在个体、团队和种群层面进行多智能体系统的测试时间共进化

Yaolun Zhang, Tianyi Xu, Shengyu Dai, Zhenwen Shao, Qingyun Wu, Huazheng Wang

机构 * Oregon State University(俄勒冈州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johnson & Johnson(强生公司) Pennsylvania State University(宾夕法尼亚州立大学) AG2AI, Inc.(AG2AI公司)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 EVOCHAMBER通过在多智能体系统中实现测试时间共进化,解决了传统方法在跨智能体学习和专业化保留上的不足,通过协作梦境协议和群体生命周期操作,在不同任务流上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10482 2026-05-13 eess.SY cs.LG cs.RO cs.SY 88%

Priority-Driven Control and Communication in Decentralized Multi-Agent Systems via Reinforcement Learning

基于强化学习的去中心化多智能体系统优先级控制与通信

Qingyun Guo, Junyi Shi, Tomasz Piotr Kucner, Dominik Baumann

机构 * Department of Electrical Engineering and Automation, Aalto University, Espoo, Finland(埃因霍恩理工大学电气工程与自动化系,芬兰 Espoo) Finnish Center for Artificial Intelligence, Helsinki, Finland(芬兰人工智能中心,芬兰 Helsinki)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出一种无模型、优先级驱动的强化学习算法,通过数据联合学习通信优先级和控制策略,解决事件触发控制中通信带宽浪费问题,实验表明其优于基线方法。

Comments Accepted to the 23rd IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15103 2026-05-13 cs.MA cs.AI 88%

Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning

大规模多智能体强化学习中的脆弱智能体识别

Simin Li, Zihao Mao, Zheng Yuwei, Linhao Wang, Ruixiao Xu, Chengdong Ma, Zhiqian Liu, Xin Yu, Yuqing Ma, Xin Wang, Jie Luo, Bo An, Yaodong Yang, Weifeng Lv, Xianglong Liu

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文研究大规模多智能体强化学习中的脆弱智能体识别问题,提出通过分层对抗性去中心化均值场控制框架,结合Fenchel-Rockafellar变换和强化学习算法,有效识别脆弱智能体并降低计算复杂度。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19417 2026-05-13 cs.LG cs.MA 88%

Focusing Influence Mechanism for Multi-Agent Reinforcement Learning

多智能体强化学习中的聚焦影响机制

Yisak Park, Sunwoo Lee, Seungyul Han

机构 * Graduate School of Artificial Intelligence(人工智能研究生院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出FIM机制,通过熵基准则引导智能体聚焦未探索的状态空间区域,利用 eligibility traces 实现多智能体协同探索,提升合作性能。

Comments 9 technical page followed by references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10717 2026-05-12 cs.LG cs.CV 88%

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

异方差扩散用于多智能体轨迹建模

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10698 2026-05-12 cs.MA cs.AI 88%

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

多智能体推理中的旁观者效应:量化协作互动中的认知惰性

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 研究揭示多智能体系统中社交压力引发的认知惰性现象,通过评估22500条轨迹发现模型在协作中逻辑主权崩溃,揭示了主权缺口与对齐幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10614 2026-05-12 cs.AI 88%

PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

PRISM:多智能体大语言模型管道中生成时间的秘密泄漏检测与缓解

Riya Tapwal, Abhishek Kumar, Carsten Maple

机构 * School of Computing and Electrical Engineering(计算与电子工程学院) Indian Institute of Technology, Mandi (IIT)(印度理工学院,曼迪(IIT)) The Alan Turing Institute, London(阿兰·图灵研究所,伦敦) University of Warwick(沃里克大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 PRISM通过实时检测生成过程中的风险累积,利用16种特征信号预测并阻止敏感信息泄露,有效提升安全性和输出实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10528 2026-05-12 cond-mat.stat-mech cs.CL cs.MA physics.soc-ph 88%

Collective Alignment in LLM Multi-Agent Systems: Disentangling Bias from Cooperation via Statistical Physics

大语言模型多智能体系统中的集体对齐:通过统计物理方法分离偏见与合作

Cristiano De Nobili

机构 * Critiqality

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 研究通过统计物理方法分析大语言模型多智能体系统在二维正方形晶格中的集体动态,揭示社会从众与内在偏见的分离,计算临界指数并探测多智能体系统的集体行为与可能相变。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04474 2026-05-12 cs.MA cs.AI 88%

From Spark to Fire: Modeling and Mitigating Error Cascades in LLM-Based Multi-Agent Collaboration

从Spark到Fire:在基于大语言模型的多智能体协作中建模和缓解错误级联

Yizhe Xie, Congcong Zhu, Xinyue Zhang, Tianqing Zhu, Dayong Ye, Minfeng Qi, Huajie Chen, Wanlei Zhou

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Minzu University of China(民族大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种针对LLM-MAS的传播动力学模型,通过实验识别出三种漏洞类型,并引入基因图治理层以抑制误差级联,有效缓解了错误传播风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03688 2026-05-12 cs.AI 88%

TodyComm: Task-Oriented Dynamic Communication for Multi-Round LLM-based Multi-Agent System

TodyComm: 任务导向的多轮LLM多智能体系统动态通信

Wenzhe Fan, Tommaso Tognoli, Henry Peng Zou, Chunyu Miao, Yibo Wang, Xinhua Zhang

机构 * Department of Compute Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出TodyComm算法,通过策略梯度优化任务效用,生成适应动态的协作拓扑,实验证明其在动态对抗和通信预算约束下表现优异,具备高效、可扩展和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15518 2026-05-12 cs.AI cs.MA 88%

HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics

HAMLET:一种分层自适应的多智能体框架用于实时具身戏剧

Shufan Jiang, Sizhou Chen, Chios Chen, Chi Zhang, Xiao-Lei Zhang, Xuelong Li

机构 * East China University of Science and Technology(东华大学) The University of Sydney(悉尼大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) Datawhale Org(Datawhale组织) Independent Researcher(独立研究员)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 HAMLET通过分层自适应多智能体框架实现戏剧创作与实时表演,提升戏剧表现力和物理交互性,采用自适应推理模块和具身互动增强沉浸感。

Comments Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10064 2026-05-12 cs.AI 88%

MAGE: Multi-Agent Self-Evolution with Co-Evolutionary Knowledge Graphs

MAGE:多智能体自进化与共进化知识图谱

Ruiyi Yang, Zechen Li, Hao Xue, Imran Razzak, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 MAGE通过共进化知识图谱实现多智能体自进化,利用冻结弱骨干模型与任务级搜索带宽及技能级路由带宽协同更新,提升冻结学习者在多个领域任务中的表现。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09539 2026-05-12 cs.CL 88%

TacoMAS: Test-Time Co-Evolution of Topology and Capability in LLM-based Multi-Agent Systems

TacoMAS: 在基于大语言模型的多智能体系统中拓扑与能力的测试时间共演

Chen Xu, Yicheng Hu, Ruizi Wang, Xinyu Lin, Wenjie Wang, Dongrui Liu, Fuli Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 TacoMAS通过联合调整拓扑和能力,以不同时间尺度优化多智能体系统,实验表明其在四个基准测试中优于20个基线模型,平均提升13.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09278 2026-05-12 cs.AI 88%

EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium

EquiMem:通过博弈论均衡校准多智能体辩论中的共享内存

Yuqiao Meng, Sakshi Sunil Narvekar, Luoxi Tang, Rupali Rajendra Vaje, Yingxue Zhang, Muchao Ye, Zhaohan Xi

机构 * Binghamton University, State University of New York(宾夕法尼亚州立大学布林茅尔分校) University of Iowa(爱荷华大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出EquiMem,通过博弈论均衡校准多智能体辩论中的共享内存,解决传统方法在过滤错误信息时的不足,提升内存增强推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04012 2026-05-12 cs.AI 88%

SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment

SymptomAI:迈向日常症状评估的对话式AI代理

Joseph Breda, Fadi Yousif, Beszel Hawkins, Marinela Cotoi, Miao Liu, Ray Luo, Po-Hsuan Cameron Chen, Mike Schaekermann, Samuel Schmidgall, Xin Liu, Girish Narayanswamy, Samuel Solomon, Maxwell A. Xu, Xiaoran Fan, Longfei Shangguan, Anran Wang, Bhavna Daryani, Buddy Herkenham, Cara Tan, Mark Malhotra, Shwetak Patel, John B. Hernandez, Quang Duong, Yun Liu, Zach Wasson, Dimitrios Antos, Bob Lou, Matthew Thompson, Jonathan Richina, Anupam Pathak, Nichole Young-Lin, Jake Sunshine, Daniel McDuff

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 多智能体 :AI agent(title,abstract);agent(title);agentic(abstract);分类 cs.AI

AI总结 本文研究了SymptomAI在日常生活中对患者症状评估的准确性,通过真实世界数据验证其优于传统临床诊断,展示了专用症状访谈策略的优越性。

Comments 13 page main text, 54 pages total. 16 figures total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01805 2026-05-12 cs.MA cs.LG 88%

MAGIC: Multi-Step Advantage-Gated Causal Influence for Multi-agent Reinforcement Learning

MAGIC: 多步优势门多智能体强化学习中的多步优势门因果影响

Haohan Yu, Jinmiao Cong, Shengzhi Wang, Lu Wang, Chanjuan Liu

机构 * Dalian University of Technology(大连理工大学) Microsoft(微软) Microsoft, Beijing, China(微软(北京,中国))

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 MAGIC通过多步优势门因果影响方法,估计多智能体强化学习中多步动作影响,将其中的有益行为转化为内在奖励,提升协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09212 2026-05-12 cs.LG 88%

Rethinking Ratio-Based Trust Regions for Policy Optimization in Multi-Agent Reinforcement Learning

重新思考基于比率的信任区域用于多智能体强化学习中的策略优化

Chulabhaya Wijesundara, Andrea Baisero, Zhongheng Li, Gregory Castañón, Alan Carlin, Christopher Amato

机构 * Northeastern University(东北大学) STR University of California, Irvine(加州大学尔湾分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本文提出MARS方法,通过乘法对称几何屏障替代传统比率信任区域机制,提升多智能体策略优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏