DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation
DashArena:面向交互式分析仪表板生成的大语言模型基准测试
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
DashArena:面向交互式分析仪表板生成的大语言模型基准测试
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。
RLMOpt:基于递归语言模型的自适应提示优化器
机构 * Autonomize AI ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。
迈向AI对齐中的价值理论
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。
Comments 15 pages, 2 figures
评估协议决定结果:在TwoRoom上独立复现LeWorldModel
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。
Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab
OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。
Comments 14 pages, 1 figure
提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果
机构 * University of Florida(佛罗里达大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。
Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results
测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台
机构 * The University of Sydney(悉尼大学) ; University of Oxford(牛津大学) ; The University of Western Australia(西澳大利亚大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。
访问时机作为脚手架:一种强化学习方法在生成式AI教育中的应用
机构 * Universitat Pompeu Fabra(庞培法华大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究通过强化学习智能体控制生成式AI的访问时机,基于元认知理论、认知负荷理论和生产性失败设计奖励函数,实验证明策略性定时访问相比无限制和完全限制使用能提高学习效果和元认知准确性。
Checkup2Action:面向患者行动的多模态临床检查报告数据集
机构 * Durham University(杜伦大学) ; University of Oxford(牛津大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。
大规模行为推断:动机与信念系统之间的根本不对称性
机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。
Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H
Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)
带容量约束验证的最优序贯分配
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。
SOFR衍生品的最优定价与对冲
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。
E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。
具有二元边际的单调成本函数下,EFX chore分配不存在性
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。
是选择EFX还是MMS,这是个问题
专题命中 Agent评测 :agent(abstract)
AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。
优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程
专题命中 Agent评测 :workflow(abstract)
AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。
Comments * These authors contributed equally to this work
高阶相互作用对集体运动的影响
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。
Comments 6 pages, 7 figures
切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析
专题命中 Agent评测 :agent(abstract)
AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。
XPolicyLab:用于机器人策略评估与部署的统一标准及开放生态系统
机构 * THU(清华大学)
专题命中 Agent评测 :agent(abstract)
AI总结 XPolicyLab是统一机器人策略评估与部署的开放生态系统,通过标准化接口降低集成成本,集成42个策略,可适配仿真与真实机器人,减少了策略与环境的适配工作量。
Comments Website: xpolicylab.github.io, Code: https://github.com/XPolicyLab/XPolicyLab
面向卫星巡检任务的信息感知模型预测控制
专题命中 Agent评测 :agent(abstract)
AI总结 该研究提出信息感知MPC框架,将估计协方差纳入控制目标,通过数值模拟验证其能生成满足约束且主动降低目标估计协方差的卫星巡检轨迹。
Comments Presented at the 2026 AAS/AIAA Astrodynamics Specialist Conference in Whistler, BC, Canada. v2 - corrected title metadata, content remains unchanged
来自偏好平均的RLHF中的程序公平性失败
机构 * Vishnu Institute of Technology(维什努理工学院)
专题命中 其他Agent :agentic(abstract,comments);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。
Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)