FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
FM-Bench:用于多智能体竞争的长周期管理基准
机构 * AnalogyAI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
FM-Bench:用于多智能体竞争的长周期管理基准
机构 * AnalogyAI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。
不完美对齐下价值的脆弱性
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。
Comments 25 pages, 7 figures. Expanded the contribution statements and added three researchers as coauthors. Made small text improvements
共享评判,学习弃权:专业化在大语言模型评估中的作用
机构 * Cheung Kong Graduate School of Business(长江商学院)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。
Comments 18 pages, 5 figures, 9 tables
PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。
Comments Accepted by KDD'26 Benchmark track
利用有界不确定性模型的智能探索强化学习
机构 * Control Systems Technology Section, Department of Mechanical Engineering, Eindhoven University of Technology(控制系统技术部门,机械工程系,埃因霍温理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出BUMEX方法,通过有界不确定性模型优化加速强化学习中的探索过程,实现有限时间收敛到最优策略。
Comments Presented at 64th IEEE Conference on Decision and Control, CDC 2025, Rio de Janeiro, Brazil, 2025, pp. 5132--5138. This version contains minor revisions compared to the IEEE publication
超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。
Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment
足球运动中球的有效引力场
专题命中 Agent评测 :agent(abstract)
AI总结 该研究以足球追踪数据为基础,探究球员围绕球的集体运动是否可用类引力有效场描述,得出了球员径向漂移的经验定律及漂移场模式。
Comments 13 pages, 11 figures, 6 tables
利用近似误差的强化学习用于长时间量子模拟
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出RL-Trotter强化学习框架,将量子模拟的近似误差视为校正资源,通过优化长时间演化发现自校正序列,提升精度并降低测量开销,可推广迁移至更大系统。
Comments 12+12 pages, 6+6 figures
知道谁,而非多少:面向消费者效用最大化的学习增强机制
专题命中 Agent评测 :agent(abstract)
AI总结 研究在线随机顺序模型中战略代理的消费者效用最大化问题,通过识别最高价值代理的身份预测,设计了一个确定性的真实机制,在预测正确时实现常数近似最优解,在预测错误时仍保证常数近似最优可实施解。
Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026); fixed minor typos, added/fixed some citations
机器自我保存的逻辑
机构 * Newcastle University(纽卡斯尔大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文探讨具身AI的自我保存行为,指出其源于工具收敛理论,通过三家机构实验证实该行为在对抗环境中出现,明确其本质并探讨对具身系统开发的意义。
Comments 6 pages, 1 figure