arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-12 至 2026-08-12 共收录 201 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 39 篇

2608.10567 2026-08-12 cs.AI 新提交 57%

DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

DashArena:面向交互式分析仪表板生成的大语言模型基准测试

Xiaotong Wang, Dazhen Deng

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10471 2026-08-12 cs.AI 新提交 57%

RLMOpt: Adaptive Prompt Optimization via Recursive Language Models

RLMOpt:基于递归语言模型的自适应提示优化器

Subhash Bangalore Satheesha, Nirvik Pande, Deepthi Duddempudi, Bharath Dandala

机构 * Autonomize AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10327 2026-08-12 cs.AI 新提交 57%

Toward a Theory of Value in AI Alignment

迈向AI对齐中的价值理论

Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09988 2026-08-12 cs.CE cs.CL 新提交 57%

OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架

Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05353 2026-08-12 cs.CL 版本更新 57%

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果

Divyansh Singh

机构 * University of Florida(佛罗里达大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。

Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10309 2026-08-12 cs.AI 版本更新 57%

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

机构 * The University of Sydney(悉尼大学) University of Oxford(牛津大学) The University of Western Australia(西澳大利亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15850 2026-08-12 cs.CY cs.AI cs.HC 版本更新 57%

Access Timing as Scaffolding: A Reinforcement Learning Approach to GenAI in Education

访问时机作为脚手架:一种强化学习方法在生成式AI教育中的应用

Janne Rotter, Pau Benazet i Montobbio, Davinia Hernández-Leo

机构 * Universitat Pompeu Fabra(庞培法华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究通过强化学习智能体控制生成式AI的访问时机,基于元认知理论、认知负荷理论和生产性失败设计奖励函数,实验证明策略性定时访问相比无限制和完全限制使用能提高学习效果和元认知准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 57%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05624 2026-08-12 cs.MA cs.LG 版本更新 57%

Behavioral Inference at Scale: The Fundamental Asymmetry Between Motivations and Belief Systems

大规模行为推断:动机与信念系统之间的根本不对称性

Jason Starace, Terence Soule

机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。

Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H

Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10478 2026-08-12 econ.TH 新提交 50%

Optimal Sequential Assignment with Capacity Constrained Verification

带容量约束验证的最优序贯分配

Vilok Taori

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10711 2026-08-12 q-fin.PR 新提交 50%

Optimal Pricing and Hedging of SOFR Derivatives

SOFR衍生品的最优定价与对冲

Teemu Pennanen, Waleed Taoum

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 50%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10572 2026-08-12 cs.GT 新提交 50%

Non-Existence of EFX Chore Allocations for Monotone Cost Functions with Binary Marginals

具有二元边际的单调成本函数下,EFX chore分配不存在性

Zehan Lin, Shengxin Liu, Biaoshuai Tao, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10397 2026-08-12 cs.GT 新提交 50%

To EFX OR to MMS, That is the Question

是选择EFX还是MMS,这是个问题

Hadi Hosseini, Payas Khurana, Shraddha Pathak, Rohit Vaish

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09981 2026-08-12 cs.CE 新提交 50%

Optimizing Parameterized Physics-Informed Neural Networks to Solve Multilayered Static Linear Elastic PDEs

优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程

Joseph Lim, Hanbo Song, Zhen Zhang

专题命中 Agent评测 :workflow(abstract)

AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。

Comments * These authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10844 2026-08-12 physics.bio-ph 新提交 50%

Impact of Higher-Order Interactions on Collective Motion

高阶相互作用对集体运动的影响

Maryam Masoumi, Amir Kargaran, Reza Jafari

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09987 2026-08-12 physics.soc-ph 新提交 50%

The Impact of Cut-ins on Mixed-Autonomy Traffic Flow: Bridging Microscopic Game-Theoretic Model and Macroscopic Flow Analysis

切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析

Yu Song

专题命中 Agent评测 :agent(abstract)

AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09892 2026-08-12 cs.RO 版本更新 50%

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

XPolicyLab:用于机器人策略评估与部署的统一标准及开放生态系统

XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Zanxin Chen, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

机构 * THU(清华大学)

专题命中 Agent评测 :agent(abstract)

AI总结 XPolicyLab是统一机器人策略评估与部署的开放生态系统,通过标准化接口降低集成成本,集成42个策略,可适配仿真与真实机器人,减少了策略与环境的适配工作量。

Comments Website: xpolicylab.github.io, Code: https://github.com/XPolicyLab/XPolicyLab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07765 2026-08-12 eess.SY cs.SY 版本更新 50%

Information-Aware Model Predictive Control for Satellite Inspection

面向卫星巡检任务的信息感知模型预测控制

Sarah E. Clees, Sean Phillips, Christopher Petersen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出信息感知MPC框架,将估计协方差纳入控制目标,通过数值模拟验证其能生成满足约束且主动降低目标估计协方差的卫星巡检轨迹。

Comments Presented at the 2026 AAS/AIAA Astrodynamics Specialist Conference in Whistler, BC, Canada. v2 - corrected title metadata, content remains unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2608.10126 2026-08-12 cs.LG cs.AI cs.CL 新提交 69%

Procedural Fairness Failures in RLHF from Preference Averaging

来自偏好平均的RLHF中的程序公平性失败

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju

机构 * Vishnu Institute of Technology(维什努理工学院)

专题命中 其他Agent :agentic(abstract,comments);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。

Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)

详情

展开后加载摘要…

URL PDF HTML 收藏