Who is Helping Whom? Analyzing Inter-dependencies to Evaluate Cooperation in Human-AI Teaming
谁在帮助谁?分析相互依赖性以评估人机协同中的合作
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出'建设性相互依赖'作为评估人机协同合作的新指标,发现训练智能体虽能获得高任务奖励,但无法诱导协作行为,揭示任务奖励与合作无必然联系。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
谁在帮助谁?分析相互依赖性以评估人机协同中的合作
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出'建设性相互依赖'作为评估人机协同合作的新指标,发现训练智能体虽能获得高任务奖励,但无法诱导协作行为,揭示任务奖励与合作无必然联系。
从最小最大视角看近稳定匹配
专题命中 Agent评测 :agent(abstract)
AI总结 本文从最小最大视角提出近稳定匹配的新方法,通过保护最不利代理免受不成比例不稳定性,揭示了稳定性与计算复杂性之间的根本权衡。
Comments Preliminary version to appear at AAMAS 2026
在最大可提取价值存在下确立提议者构建者分离
专题命中 Agent评测 :agent(abstract)
AI总结 本研究揭示ePBS在最大可提取价值存在下加剧了利润和内容集中,指出其在去中心化和公平性上的不足。
连接资源分配中的福利损失
专题命中 Agent评测 :agent(abstract)
AI总结 研究连接资源分配中的福利损失,提出平等和功利连接价格概念,并为不同图结构给出连接价格的界限。
Comments Appears in the 33rd International Joint Conference on Artificial Intelligence (IJCAI), 2024
Journal ref Discrete Applied Mathematics, 385:1-23 (2026)
MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Chemical Technology(北京化工大学) ; Microsoft(微软公司) ; University of Chicago(芝加哥大学)
专题命中 Agent评测 :agent(abstract)
AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。
Comments Tech Report
超越准确率:评估图像推理中的 grounded 视觉证据
机构 * ZGCA(中钢集团自动化研究院) ; NTU(国立.ntu) ; HKUST(香港科技大学) ; HKU(香港大学) ; ZGCI(中钢集团信息院)
专题命中 Agent评测 :agentic(abstract)
AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。
Comments Preprint, Under review
关于机会型供应链稳定性条件分析
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种综合框架,结合GBM、贝叶斯学习和LOLOG模型,分析机会型供应链在波动性、信任和网络结构共同作用下的稳定性条件。
从人类偏见到机器人选择:职业背景和种族刻板印象如何塑造机器人选择
专题命中 Agent评测 :agent(abstract)
AI总结 研究探讨职业背景和种族刻板印象如何影响人机选择,发现浅肤色机器人在医疗和教育领域更受青睐,而深肤色机器人在建筑和体育领域更受欢迎,揭示了社会偏见在机器人选择中的传递机制。
Comments HRI '26
生成AI中的欺骗与操纵
专题命中 其他Agent :agentic(abstract)
AI总结 本文探讨生成AI中的欺骗与操纵问题,提出更严格的监管标准和防御措施以防止AI生成内容的误导性行为。
Journal ref Philosophical Studies, Volume 182 (2025), pp 1865-87