arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-24 至 2026-08-24 共收录 190 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 38 篇

2608.18423 2026-08-24 cs.AI 版本更新 57%

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

FM-Bench:用于多智能体竞争的长周期管理基准

Tianyou Wang, Chongyang Gao, Kezhen Chen, Dong Chen, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li

机构 * AnalogyAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28881 2026-08-24 cs.AI 版本更新 57%

Fragility of Value under Imperfect Alignment

不完美对齐下价值的脆弱性

Winter Cross, Léo Cymbalista, Alfred Harwood, Jose Faustino

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。

Comments 25 pages, 7 figures. Expanded the contribution statements and added three researchers as coauthors. Made small text improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27984 2026-08-24 cs.AI 版本更新 57%

Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation

共享评判,学习弃权:专业化在大语言模型评估中的作用

Ye Chen, Weining Zhang

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。

Comments 18 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-08-24 cs.IR cs.AI cs.CV cs.MM 版本更新 57%

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Accepted by KDD'26 Benchmark track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05978 2026-08-24 cs.LG eess.SY 版本更新 57%

Smart Exploration in Reinforcement Learning using Bounded Uncertainty Models

利用有界不确定性模型的智能探索强化学习

J.S. van Hulst, W.P.M.H. Heemels, D.J. Antunes

机构 * Control Systems Technology Section, Department of Mechanical Engineering, Eindhoven University of Technology(控制系统技术部门,机械工程系,埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出BUMEX方法,通过有界不确定性模型优化加速强化学习中的探索过程,实现有限时间收敛到最优策略。

Comments Presented at 64th IEEE Conference on Decision and Control, CDC 2025, Rio de Janeiro, Brazil, 2025, pp. 5132--5138. This version contains minor revisions compared to the IEEE publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 50%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20395 2026-08-24 physics.soc-ph 新提交 50%

The Effective Gravitational Field of the Ball in Association Football

足球运动中球的有效引力场

Oliver B. Wright

专题命中 Agent评测 :agent(abstract)

AI总结 该研究以足球追踪数据为基础,探究球员围绕球的集体运动是否可用类引力有效场描述,得出了球员径向漂移的经验定律及漂移场模式。

Comments 13 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20139 2026-08-24 quant-ph cond-mat.dis-nn cond-mat.stat-mech cond-mat.str-el 版本更新 50%

Reinforcement Learning to Harness Approximation Errors for Long-Time Quantum Simulation

利用近似误差的强化学习用于长时间量子模拟

Yu-Bo Shi, Markus Heyl, Roderich Moessner, Marin Bukov, Hongzheng Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出RL-Trotter强化学习框架,将量子模拟的近似误差视为校正资源,通过优化长时间演化发现自校正序列,提升精度并降低测量开销,可推广迁移至更大系统。

Comments 12+12 pages, 6+6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00175 2026-08-24 cs.GT 版本更新 50%

Knowing Who, Not How Much: Learning-Augmented Mechanisms for Consumer Utility Maximization

知道谁,而非多少:面向消费者效用最大化的学习增强机制

Kira Goldner, Divyarthi Mohan, Thodoris Tsilivis

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线随机顺序模型中战略代理的消费者效用最大化问题,通过识别最高价值代理的身份预测,设计了一个确定性的真实机制,在预测正确时实现常数近似最优解,在预测错误时仍保证常数近似最优可实施解。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026); fixed minor typos, added/fixed some citations

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2608.20940 2026-08-24 cs.AI cs.CY cs.MA 新提交 57%

The Logic of Machine Self-Preservation

机器自我保存的逻辑

Cheng Siong Chin

机构 * Newcastle University(纽卡斯尔大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文探讨具身AI的自我保存行为,指出其源于工具收敛理论,通过三家机构实验证实该行为在对抗环境中出现,明确其本质并探讨对具身系统开发的意义。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏