arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 227 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2608.26221 2026-08-28 physics.soc-ph cs.AI cs.LG cs.MA 新提交 62%

Prompt Sensitivity of Generative Agents: Evidence from an Epidemic Model

生成式智能体的提示敏感性:来自流行病模型的证据

Ross Williams, Niyousha Hosseinichimeh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究借助生成式智能体流行病模型,探究生成式智能体的行为对提示修改和角色名称的敏感性,发现同义提示影响极小,提示微小变化或情境改变会影响结果,角色名称对流行病结果无显著影响。

Comments 14 pages, 3 figures. Code and data: https://github.com/RossFW/Paper2-Prompt-Sensitivity-of-Generative-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-08-28 cs.AI cs.DC cs.LG cs.SI q-fin.CP 版本更新 62%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27182 2026-08-28 cs.LG 新提交 57%

TraceBench: Controlled Evaluation of LLM Agents for Time-Series Root-Cause Attribution

TraceBench:用于时间序列根因归因的LLM智能体受控评估框架

Tommaso Bendinelli, Artur Dox, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院) CSEM SA(CSEM公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对LLM智能体时间序列根因归因性能缺乏受控评估的问题,推出TraceBench框架,评估了四个LLM智能体的表现并揭示其分析规律,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26400 2026-08-28 cs.SE cs.PL 新提交 57%

Spec2Vision: Contract-Guided Delivery of AI-Generated Computer Vision Pipelines

Spec2Vision:基于规约引导的AI生成计算机视觉流水线交付

Ghfran Jabour, Sergey Ivanov

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 该研究提出Spec2Vision框架,通过分阶段运行时保持任务规约明确性,在17项CV任务的850次运行评估中实现81/85的通过率,证实任务规约明确性对AI生成CV流水线交付的重要性。

Journal ref CEUR Workshop Proceedings, Vol. 4238, Proceedings of the 2nd Generative Code Intelligence Workshop (GeCoIn 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12227 2026-08-28 cs.AI 版本更新 57%

Rethinking the Evaluation of Harness Evolution for Agents

重新思考智能体的 harness 进化评估

Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究重新审视大语言模型智能体的自动 harness 进化评估,通过在可比条件下与基线比较及在保留任务上测试,发现其不总优于简单方法且泛化有限,对其有效性提出质疑,强调需更公平评估协议和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-08-28 cs.AI 版本更新 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27261 2026-08-28 econ.TH 新提交 50%

Strategy-Proof and Minimally Wasteful Random Assignment

防策略且浪费最少的随机分配

Christian Basteck, Lars Ehlers

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对不可分物品的随机分配问题,证明满足特定条件的机制必然存在至少1/6的代理人-物品浪费,且随机串行独裁(RSD)在相关场景中达到浪费最小界限,随机延期接受(RDA)浪费更低但违反平等对待条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27301 2026-08-28 cs.GR cs.CV cs.HC 新提交 50%

Comparative Evaluation of 3D Reconstruction Methods for Immersive Visualization of Laboratory Objects

面向实验室对象沉浸式可视化的三维重建方法对比评估

Brian De La Cruz, Aaron Y. Zhao, Maitrey Gramopadhye, Sawyer J. Lazar, Xianming Tan, Daniel Szafir, David S. Lawrence

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究对比评估了摄影测量法、NeRF等四种三维重建方法,发现基于NeRF的方法生成的实验室物品全息模型保真度最高,可为AR/MR教育环境提供沉浸式学习对象的实用流程。

Comments 36 pages, 18 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26833 2026-08-28 cs.CV 新提交 50%

Rethinking Image Processing for the Age of AI: A Problem-First Framework for Scientific Progress

人工智能时代的图像处理反思:面向科学进步的问题优先框架

Guoping Qiu

机构 * University of Nottingham Ningbo China(宁波诺丁汉大学) University of Nottingham(诺丁汉大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 本文针对人工智能时代图像处理的“模型优先”研究弊端,提出六阶段“问题优先”框架,结合超分辨率等案例明确基准与真实问题的差异,呼吁变革研究文化以推动真正的科学技术进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26801 2026-08-28 cs.GT 新提交 50%

A lone divider allocation algorithm with subjective divisibility

带有主观可分性的 lone divider 分配算法

Uriel Feige

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对主观可分性分配模型,通过调整lone divider框架,证明存在3/5-MMS分配,拓展了该领域的相关研究成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27300 2026-08-28 math.AG cs.GT 新提交 50%

Nash Loci

纳什轨迹

Luca Sodomaco, Julian Weigert

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨有限参与者博弈中与固定代数簇相交的纳什轨迹,确定其维数、多重次数及方程,还将其与多重分次相伴簇关联,推广了相关超曲面。

Comments 25 pages. Supplementary software documentation is available at https://doi.org/10.5281/zenodo.20639533. Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26616 2026-08-28 cond-mat.soft 新提交 50%

Influence of twist direction and large deformation on soft material torsional contact

扭转方向与大变形对软材料扭转接触的影响

Yucai Hu, Pengfei Li, Michele Ciavarella, Yue Wu, Yang Xu

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过实验探究扭转方向与大变形对软PDMS扭转接触的影响,明确大变形可驱动剪切诱导的接触面积减小,为软界面摩擦接触模型提供了基准。

Comments 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-28 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22051 2026-08-28 econ.TH cs.GT 版本更新 50%

Centralization and Stability in Formal Constitutions

形式宪法中的集中化与稳定性

Yotam Gafni

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了形式宪法中自我维持SCF对集中化的影响,通过不同信念假设和规则,证明了在特定条件下只有独裁者能维持自身,其他SCF最终会导向独裁。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2608.27147 2026-08-28 cs.AI 新提交 57%

Thomson: Continual Learning of Frontier Models for SovereignAI

Thomson:面向主权人工智能的前沿模型持续学习

Shengzhuang Chen, Jerrod Parker, Yejin Bang, Andrew M. Bean, Nabeel Seedat, Stefan Winzeck, Daniil Glazko, Jannik Zgraggen, Fangyi Yu, Scott Arnott, Dietrich Trautmann, Luca Ciuffreda, Guglielmo Bonifazi, Davide Romano, Bradley Bell, Kirsty Fielding, Daniele Giofrè, Tom Zielund, Ipshita Chatterjee, Sneha Murthy Ghantasala, Manpreet Nanreh, John Scoville, Maciej Sakowicz, Wassim Seifeddine, Lukas Thede, Jonathan Richard Schwarz

机构 * Imperial College London(帝国理工学院) DatologyAI Lambda

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 该研究提出Thomson,通过对开放权重模型的持续学习,以低预算实现前沿模型性能,可帮助更多机构构建主权人工智能,且在多任务表现优异,几乎消除了遗忘问题。

Comments Open-weight model: https://huggingface.co/thomsonreuters/Thomson-1.0-Small

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27006 2026-08-28 cs.IR 新提交 50%

Conversational Recommendation over Live E-Commerce Catalogues with Self-Refreshing Retrieval

基于自刷新检索的直播电商目录对话推荐

Ante Kapetanovic, Tomislav Duricic, Dionizije Fa, Andro Mercep, Emanuel Lacic

专题命中 其他Agent :agentic(abstract)

AI总结 该研究针对电商目录动态变化问题,提出与商家无关的多轮对话购物助手,核心为自刷新检索器,仅处理目录增量,对话层用LLM做意图分类,演示为WhatsApp购物助手。

Comments ACM RecSys 2026, 3 pages, 2 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏