arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 41 篇

2607.22188 2026-08-27 cs.MA 版本更新 78%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnikov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24946 2026-08-27 cs.LG 新提交 74%

MacroAgent: Regularity-Aware Macro Legalization with LLM-Agent-Designed Contour Algorithms

MacroAgent:结合大语言模型智能体设计轮廓算法的感知规则性宏合法化方法

Jiaxi Jiang, Xufeng Yao, Yuxuan Zhao, Yuntao Lu, Peiyu Liao, Zuodong Zhang, Yibo Lin, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 MacroAgent是结合LLM智能体设计轮廓算法的四阶段宏合法化框架,在TILOS、Chipyard等基准及Cadence Innovus工具上,实现布局规则性、布线长度等指标的显著提升与更好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13940 2026-08-27 cs.AI 版本更新 70%

AI Research Preference Models

AI研究偏好模型

Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster

机构 * FAIR at Meta University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对AI研究智能体的候选方案评估成本过高问题,提出AI研究偏好模型,将其集成到AIRA-dojo智能体后提升了基准任务性能,且达到目标性能的时间更短、预算更少。

Comments 34 pages, 17 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25325 2026-08-27 cs.AI cs.CL 新提交 62%

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

FinRiskAtlas:面向金融风险审查的决策对齐大语言模型评估

Suyang Zhong, Jingzhe Zhu, Qi Xu, Liyao Sun, Yin Wang, Qingqing Sun, Shuai Chen, Tianyi Zhang

机构 * Ant International(蚂蚁集团) Xiamen University(厦门大学) Shanghai University(上海大学) Tongji University(同济大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究推出面向金融风险审查的中文基准FinRiskAtlas,从操作执行与证据状态控制两维度评估金融大语言模型,发现通用金融能力评分无法完全反映模型在专业工作流程中的可靠性,需采用决策对齐的评估单元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22266 2026-08-27 cs.AI cs.CL 版本更新 62%

Clarify User Expertise: Towards Proactive Conversational Agents Tailoring Responses to User Proficiency

明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体

Zhihong Cao, Chen Huang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25623 2026-08-27 cs.AI cs.CY cs.HC 新提交 57%

Using profiles of cognitive capability to assess AI suitability for workplace tasks

利用认知能力画像评估AI对职场任务的适用性

Jonathan Prunty, Marko Tešić, Patrick Quinn, José Hernández-Orallo, Lucy Cheke

机构 * University of Cambridge(剑桥大学) Department for Science, Innovation and Technology(科学、创新与技术部) Universitat Politècnica de València(瓦伦西亚理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于共享核心认知能力的画像流程,通过AI与职场任务的认知维度匹配,为AI职场任务范围界定提供工具,还探讨了扩展至人机协同画像的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25512 2026-08-27 cs.PL cs.SE 新提交 57%

A Programming Paradigm for Spatiotemporal Composability

一种时空可组合性的编程范式

Yifan Shi, Wei Zhang, Tianyi Cui

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 该研究针对软件动态组合的时空可组合性问题,提出上下文范式,实现可撤销效应与反应式余效应,开发元框架Cordis,将时空可组合性扩展至整个组件系统。

Comments 92 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25348 2026-08-27 cs.SE 新提交 57%

Point-in-Time Audit Before Alpha: Public-Archive Availability and a Negative Matched-Budget Study on BTC Perpetual Futures

Alpha前的时点审计:公开存档可用性及BTC永续期货的负向匹配预算研究

Baocheng Zeng, Jinhao Yang, Peilin Han, Kangnan He

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究审计Binance BTCUSDT USD-M永续期货公开存档的可用性,调整数据要求后,经审计的自适应智能体未确立优越性,报告范围受限的负向结果。

Comments 11 pages, 4 figures; scoped negative-result preprint; reproducibility materials included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25085 2026-08-27 cs.CL 新提交 57%

MTDiag: A Multi-Turn Diagnostic Dataset Towards Clinically Meaningful LLM Evaluation

MTDiag:面向临床有意义的大语言模型评估的多轮诊断数据集

Pia Chouayfati, Alexander M. Fichtl, Miriam Anschütz, George Doumat, Georg Groh

机构 * Technical University of Munich(慕尼黑工业大学) UT Southwestern(西南大学(德克萨斯州))

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究针对现有医学大语言模型评估基准无法反映临床多轮交互诊断能力的问题,构建了多轮诊断数据集MTDiag,并提出临床知识导向的多轮鉴别诊断评估指标。

Comments 20 pages, published in the SIGDIAL 2026 conference proceedings, see https://aclanthology.org/2026.sigdial-1.58/

Journal ref Chouayfati, Pia, et al. "MTDiag: A Multi-Turn Diagnostic Dataset Towards Clinically Meaningful LLM Evaluation." Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24913 2026-08-27 cs.HC cs.SE 新提交 57%

From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility

从盲编辑到经验证的修复:构建可信的用户端大语言模型智能体以实现网页可访问性

Lily Bundgaard Wanscher, Markus Heidemann Lorensen, Mohammed Ammad Shafiq, Mahyar Tourchi Moghaddam, Mina Alipour

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究构建了用户端LLM智能体的三个核心模块,通过双条件协议诊断盲编辑的缺陷,再结合验证修复工具实现了网页可访问性的可信修复,相关资源已公开。

Comments Accepted to be presented at ICME 2026 (5-9 October, Napoli, Italy) and to be published in ICMI companion proceedings by ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25220 2026-08-27 cs.AI cs.LO math.OC 新提交 57%

FLARE: Verifying MILP Reformulations with LLM-Based Theorem Proving

FLARE:基于大语言模型定理证明的MILP重构验证方法

Henry Robbins, Connor Lawless, Madeleine Udell, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出FLARE方法,结合LLM智能体与Lean证明助手验证MILP重构,在FormulationBench的NP-难子集达100%准确率,还提出无需证书的FLARE-NL,为自动化优化建模提供可靠验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25181 2026-08-27 cs.LG math.DS 新提交 57%

Simultaneous inference of environmental and interaction forces in collective dynamics

群体动力学中环境力与相互作用力的同时推断

Nipuni de Silva, Ming Zhong, James M. Greene

机构 * Clarkson University(克拉克森大学) University of Houston(休斯顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出一种框架,可同时非参数推断群体动力学的相互作用核并学习环境力,通过引入的模型选择程序能从轨迹数据区分群体动力学框架并恢复相互作用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15971 2026-08-27 cs.CL 版本更新 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG: 查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, Xingcheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。

Comments v2: revised version, with the earlier copy of this revision inadvertently posted as a separate submission (arXiv:2608.12129, now withdrawn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05458 2026-08-27 stat.CO cs.LG 版本更新 57%

Generative Modeling: A Review

生成式建模:综述

Maria Nareklishvili, Nick Polson, Vadim Sokolov

机构 * Stanford University, Graduate School of Business(斯坦福大学商学院) Chicago Booth(芝加哥商学院) George Mason University(乔治·马歇尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本综述围绕三类生成器组织生成式建模文献,提出生成式贝叶斯计算方法,在埃博拉传播应用中验证其能低成本恢复准确后验,性能优于同类方法。

Comments arXiv admin note: substantial text overlap with arXiv:2305.14972

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25952 2026-08-27 cs.CY cs.MA 新提交 50%

Spatial-Knowledge-Graph-Grounded LLM Agents for Neighborhood Livability Evaluation

基于空间知识图谱的大语言模型智能体用于社区宜居性评估

Haiyan Hao

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出结合空间知识图谱与大语言模型智能体的框架,通过生成修订家庭日程等评估社区宜居性,发现设施可用性不代表便利可达,为关联空间机会与居民体验提供可审计方法。

Comments 31 pages, 4 figures, prototype framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25666 2026-08-27 cs.RO 新提交 50%

PRISM: Projection-Integrated Sampling-Based MPC with Bayesian Cost Tuning for Bimanual Manipulation

PRISM:用于双臂操作的集成投影的基于采样的模型预测控制框架(MPC),结合贝叶斯成本调优

Alinjar Dan, Iryna Hurova, Karl Kruusamäe, Arun Kumar Singh

机构 * University of Tartu(塔尔图大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出PRISM框架,结合QP引导采样策略与定制QP求解器、贝叶斯优化调优成本,在PerAct²任务上提升双臂操作鲁棒性与成功率,实现仿真到真实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25664 2026-08-27 cs.HC 新提交 50%

AffectSim: A Controllable Interactive 3D Simulation Benchmark for Embodied Affective Perception

AffectSim:用于具身情感感知的可控交互式3D仿真基准

Ke Xing, Zhilong Wang, Zheng Lian, Sicheng Zhao, Haifeng Lu, Zhen Zhang, Zitong Yu, Xiaojiang Peng, Changxin Huang, Runhao Zeng, Xiping Hu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AffectSim这一可控交互式3D仿真基准,通过分离情感行为与观测条件实现可控感知,实验显示主动观测基线可提升多数感知模型性能,该基准为具身情感感知研究提供了新平台。

Comments 21 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25396 2026-08-27 cs.NI 新提交 50%

SPFR: Semantic Potential Field Routing for the Distributed Internet of Agents

SPFR:面向分布式智能体互联网的语义势场路由

Yeguang Qin, Liangqi Peng, Fengxiao Tang, Ming Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对分布式智能体互联网路由挑战,提出SPFR算法,整合执行器发现与重新选择到逐跳转发,经模拟验证其性能优于相关方法且鲁棒性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25492 2026-08-27 physics.chem-ph cond-mat.mtrl-sci 新提交 50%

Battery Recycling: Mechanistic Modelling of LiCoO$_2$ Leaching with Coupled Diffusion-Reaction Kinetics and Film Passivation

电池回收:耦合扩散-反应动力学与薄膜钝化的LiCoO₂浸出机理建模

Uddipta Sarma, Ganesh Madabattula

专题命中 Agent评测 :agent(abstract)

AI总结 本研究开发了耦合扩散-反应动力学与薄膜钝化的LiCoO₂浸出机理模型,经多组酸与H₂O₂浓度实验验证,可用于电池回收的锂钴浸出过程,且可扩展至其他相关体系。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26604 2026-08-27 cs.GT cs.DC cs.NI econ.TH 版本更新 50%

Credibility Trilemma in Polymatroidal Service Markets

多拟阵服务市场中的可信度三难困境

Lauri Lovén, Sujit Gujar, Kalle Timperi, Hassan Mehmood, Praveen Kumar Donta, Sasu Tarkoma, Schahram Dustdar

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究多拟阵服务市场中市场运营者的策略行为,证明在非模多拟阵上不存在同时满足收益最优、激励兼容和可信的静态密封投标机制,并引入不可信成本度量该困境的福利损失。

Comments 60 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17932 2026-08-27 cs.CY 版本更新 50%

Operational Agency: A Permeable Legal Fiction for Tracing Culpability in AI Systems

可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。

Journal ref SMU Science and Technology Law Review. XXIX, (1), 163-232, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13253 2026-08-27 cs.HC 版本更新 50%

Human learning is an understudied but promising lever for boosting human--AI synergy

促进人类学习对于提升人机协同至关重要

Julian Berger, Jason W. Burton, Ralph Hertwig, Thomas Kosch, Ralf H. J. M. Kurvers, Benito Kurzenberger, Christopher Lazik, Linda Onnasch, Tobias Rieger, Anna I. Thoma, Dirk U. Wulff, Stefan M. Herzog

专题命中 Agent评测 :agent(abstract)

AI总结 通过重新分析74项研究,发现当前人机协同实验因忽视人类学习设计(如结果反馈)而低估协同潜力,并证明反馈与AI解释结合能产生正向协同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04167 2026-08-27 cs.RO 版本更新 50%

Human vs. Teleoperated Robots in Vineyard Management: A Simulation-Based Analysis of Travel Speed, Routing, and Task Performance

葡萄园管理中的人类与遥控机器人:基于仿真的移动速度、路径规划及任务绩效分析

Daniel Udekwe, Hasan Seyyedhasani, Muhammad Ali Qadri

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过仿真对比人类与遥控机器人在葡萄园两项任务的绩效,发现移动速度是核心影响因素,遥控机器人的应用优势在于劳动力、续航等而非作业时长。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2507.08249 2026-08-27 cs.AI cs.CR 版本更新 79%

Giving AI Agents Access to Cryptocurrency and Smart Contracts Creates New Vectors of AI Harm

赋予人工智能代理访问加密货币和智能合约的新AI危害途径

Bill Marino, Ari Juels

机构 * University of Cambridge(剑桥大学)

专题命中 其他Agent :AI agent(title,abstract);分类 cs.AI

AI总结 本文探讨了赋予AI代理访问加密货币和智能合约可能带来的新AI危害途径,并呼吁进行技术研究以防范这些风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24916 2026-08-27 cs.SD cs.AI 新提交 74%

Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications

面向电话智能体的领域自适应ASR:针对企业联络中心应用微调Canary Flash模型

Chanameth Boonpramuk, Winn Voravuthikunchai, Songpol Bunyang

机构 * Botnoi Group(博特诺伊集团)

专题命中 其他Agent :AI agent(title);分类 cs.AI

AI总结 本研究基于NVIDIA NeMo框架微调Canary Flash模型,构建电话导向数据集,经四项实验验证其可提升电话环境下ASR的识别性能,同时保持实时响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏