arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-21 至 2026-01-21 共收录 249 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 42 篇

2502.06976 2026-01-21 cs.MA cs.AI 57%

Who is Helping Whom? Analyzing Inter-dependencies to Evaluate Cooperation in Human-AI Teaming

谁在帮助谁?分析相互依赖性以评估人机协同中的合作

Upasana Biswas, Vardhan Palod, Siddhant Bhambri, Subbarao Kambhampati

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出'建设性相互依赖'作为评估人机协同合作的新指标,发现训练智能体虽能获得高任务奖励,但无法诱导协作行为,揭示任务奖励与合作无必然联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14195 2026-01-21 cs.GT cs.DS 50%

A Minimax Perspective on Almost-Stable Matchings

从最小最大视角看近稳定匹配

Frederik Glitzner, David Manlove

专题命中 Agent评测 :agent(abstract)

AI总结 本文从最小最大视角提出近稳定匹配的新方法,通过保护最不利代理免受不成比例不稳定性,揭示了稳定性与计算复杂性之间的根本权衡。

Comments Preliminary version to appear at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12989 2026-01-21 cs.DC 50%

Enshrined Proposer Builder Separation in the presence of Maximal Extractable Value

在最大可提取价值存在下确立提议者构建者分离

Yitian Wang, Yebo Feng, Yingjiu Li, Jiahua Xu

专题命中 Agent评测 :agent(abstract)

AI总结 本研究揭示ePBS在最大可提取价值存在下加剧了利润和内容集中,指出其在去中心化和公平性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03467 2026-01-21 cs.GT cs.DM 50%

Welfare Loss in Connected Resource Allocation

连接资源分配中的福利损失

Xiaohui Bei, Alexander Lam, Xinhang Lu, Warut Suksompong

专题命中 Agent评测 :agent(abstract)

AI总结 研究连接资源分配中的福利损失,提出平等和功利连接价格概念,并为不同图结构给出连接价格的界限。

Comments Appears in the 33rd International Joint Conference on Artificial Intelligence (IJCAI), 2024

Journal ref Discrete Applied Mathematics, 385:1-23 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 50%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract)

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11633 2026-01-21 cs.CV 50%

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images

超越准确率:评估图像推理中的 grounded 视觉证据

Xuchen Li, Xuzhao Li, Renjie Pi, Shiyu Hu, Jian Zhao, Jiahui Gao

机构 * ZGCA(中钢集团自动化研究院) NTU(国立.ntu) HKUST(香港科技大学) HKU(香港大学) ZGCI(中钢集团信息院)

专题命中 Agent评测 :agentic(abstract)

AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11566 2026-01-21 econ.GN math.OC q-fin.EC 50%

On Analyzing the Conditions for Stability of Opportunistic Supply Chains Under Network Growth

关于机会型供应链稳定性条件分析

Gurkirat Wadhwa, Priyank Sinha

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种综合框架,结合GBM、贝叶斯学习和LOLOG模型,分析机会型供应链在波动性、信任和网络结构共同作用下的稳定性条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20951 2026-01-21 cs.RO cs.HC 50%

From Human Bias to Robot Choice: How Occupational Contexts and Racial Priming Shape Robot Selection

从人类偏见到机器人选择:职业背景和种族刻板印象如何塑造机器人选择

Jiangen He, Wanqi Zhang, Jessica Barfield

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨职业背景和种族刻板印象如何影响人机选择,发现浅肤色机器人在医疗和教育领域更受青睐,而深肤色机器人在建筑和体育领域更受欢迎,揭示了社会偏见在机器人选择中的传递机制。

Comments HRI '26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2401.11335 2026-01-21 cs.CY 50%

Deception and Manipulation in Generative AI

生成AI中的欺骗与操纵

Christian Tarsney

专题命中 其他Agent :agentic(abstract)

AI总结 本文探讨生成AI中的欺骗与操纵问题,提出更严格的监管标准和防御措施以防止AI生成内容的误导性行为。

Journal ref Philosophical Studies, Volume 182 (2025), pp 1865-87

详情

展开后加载摘要…

URL PDF HTML 收藏