arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 573 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 573 篇

2603.28906 2026-07-03 cs.AI 版本更新 57%

Working Paper: Towards a Category-theoretic Comparative Framework for Artificial General Intelligence

预印本:迈向人工通用智能的范畴论比较框架

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata R+D & Universidad Autonoma de Madrid(Cognodata研发与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文旨在构建一个通用的范畴论框架,用于描述、比较和分析不同的人工通用智能架构,揭示其共同点与差异,并指导未来研究。

Comments 37 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03042 2026-07-03 cs.CV cs.AI 版本更新 57%

PPTArena: A Benchmark for PowerPoint Editing

PPTArena: 一个用于PowerPoint编辑的基准测试

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18266 2026-06-25 cs.LG 版本更新 57%

A Probabilistic Framework for LLM-Based Model Discovery

基于LLM的模型发现的概率框架

Stefan Wahl, Raphaela Schenk, Ali Farnoud, Jakob H. Macke, Daniel Gedon

机构 * Machine Learning in Science, University of Tübingen, Tübingen, Germany(图宾根大学机器学习科学系,图宾根,德国) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department Empirical Inference, Max Planck Institute for Intelligent Systems, Tübingen, Germany(经验推断部门,智能系统马克斯·普朗克研究所,图宾根,德国)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 将模型发现重新定义为概率推理问题,提出基于序贯蒙特卡洛采样的ModelSMC算法,利用LLM迭代提出和优化候选模型,并通过似然加权选择,在真实科学系统中发现可解释机制并改进后验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06177 2026-06-24 cs.AI 版本更新 57%

BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents

BioMedArena:构建和评估生物医学深度研究代理的开源工具包

Jinge Wu, Hongjian Zhou, Mingde Zeng, Jiayuan Zhu, Junde Wu, Jiazhen Pan, Ayush Noori, Sean Wu, Honghan Wu, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) Technical University of Munich(慕尼黑技术大学) Oxford-Suzhou Centre for Advanced Research, China(牛津-苏州先进研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 BioMedArena通过解耦六个评估层,提供公平比较不同基础模型的平台,显著提升生物医学基准的性能,实现8个代表性基准的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11957 2026-06-24 cs.CL 版本更新 57%

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

PEARL: 基于强化学习的自我进化时间管理助手

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Viven

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对日历冲突解决任务,提出PEARL框架,通过外部偏好记忆和逐轮奖励优化,显著降低LLM代理的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03509 2026-06-24 cs.AI cs.NE 版本更新 57%

Evolving Programmatic Skill Networks

演化式程序化技能网络

Haochen Shi, Xingdi Yuan, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(DIRO与Courtois研究所,蒙特利尔大学) Mila – Québec AI Institute(魁北克人工智能研究所) Microsoft Research(微软研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出程序化技能网络(PSN),通过大语言模型驱动的故障定位、渐进优化和结构重构,实现开放环境中技能库的持续构建与复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新 57%

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08690 2026-06-23 cs.LG cs.CR 版本更新 57%

SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity

SoK: 深度强化学习在网络安全中的陷阱

Shae McFadden, Myles Foley, Elizabeth Bates, Ilias Tsingenopoulos, Sanyam Vyas, Vasilios Mavroudis, Chris Hicks, Fabio Pierazzi

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cardiff University(卡迪夫大学) KU Leuven(鲁汶大学) Devotion AI Labs(Devotion AI 实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文系统梳理了深度强化学习应用于网络安全时的11个方法学陷阱,通过分析66篇论文量化其普遍性,并在三个典型场景中实验验证其影响,最后提出改进建议。

Comments Accepted at USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22963 2026-06-23 cs.CR cs.AI 版本更新 57%

When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents

当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击

Zesen Liu, Zhixiang Zhang, Yuchong Xie, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04266 2026-06-19 cs.CL 版本更新 57%

ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents

ShoppingBench:面向LLM智能体的真实世界意图导向购物基准

Jiangyuan Wang, Kejun Xiao, Qi Sun, Huaipeng Zhao, Tao Luo, Jian Dong Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出ShoppingBench基准,包含多层级真实购物意图任务,通过模拟环境和250万商品评估LLM智能体,发现GPT-4.1成功率低于50%,并提出轨迹蒸馏策略提升小模型性能。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20822 2026-06-18 cs.CV cs.LG 版本更新 57%

Global Offshore Wind Infrastructure: Deployment and Operational Dynamics from Dense Sentinel-1 Time Series

全球海上风电基础设施:基于密集Sentinel-1时间序列的部署与运行动态

Thorsten Hoeser, Felix Bachofer, Claudia Kuenzer

机构 * Earth Observation Center (EOC), German Aerospace Center (DLR)(地球观测中心(EOC),德国航空航天中心(DLR)) Institute for Geography and Geology, University of Wuerzburg(地理与地质研究所,乌尔姆大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出全球Sentinel-1 SAR时间序列数据集,通过目标检测和规则分类器识别海上风电基础设施的部署与运行阶段,支持全球尺度动态分析。

Comments 29 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02690 2026-06-18 cs.SE 版本更新 57%

Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All

超越LLM截止日期:一个面向所有人的实时内核崩溃修复基准

Chenxi Huang, Alex Mathai, Feiyang Yu, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Eugene Wu, Kostis Kaffes, Junfeng Yang, Baishakhi Ray

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 提出Live-kBench和kEnv框架,用于持续评估LLM代理修复新发现的Linux内核崩溃,实验显示代理在截止日期前修复率高出25%,但仅20%的补丁与开发者修复匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27049 2026-06-17 stat.ML cs.LG 版本更新 57%

Overcoming the Incentive Collapse Paradox

克服激励崩溃悖论

Qichuan Yin, Ziwei Su, Shuangning Li

机构 * Department of Statistics, University of Chicago(芝加哥大学统计系) Booth School of Business, University of Chicago(芝加哥大学博世商学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对AI辅助任务中激励崩溃问题,提出哨兵审计支付机制,在有限成本下维持正人力努力,并构建激励感知的主动统计推断框架优化审计率与采样分配。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03802 2026-06-17 cs.LG 版本更新 57%

Learning in Matching Games with Bandit Feedback

带强盗反馈的匹配博弈学习

Andreas Athanasopoulos, Christos Dimitrakakis

机构 * University of Neuchatel(日内瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究广义双边匹配市场中代理通过零和博弈交互的学习问题,提出基于UCB的算法,以匹配不稳定性为遗憾度量,实现次线性遗憾上界。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13725 2026-06-16 cs.CR cs.AI 版本更新 57%

Can We Stop Malicious AI? KILLBENCH: A Benchmark for External AI Kill Switch Feasibility

我们能阻止恶意AI吗?KILLBENCH:外部AI终止开关可行性基准

Sechan Lee, Hyounghun Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Killbench基准,通过外部信号(如输入文本)评估终止恶意AI代理行为的方法,无需访问内部参数,实验表明在多种模型上外部终止开关具有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20710 2026-06-16 cs.CV cs.AI cs.CR 版本更新 57%

Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?

受神经启发的多模态视觉-语言模型对成员推断隐私泄露是否具有弹性?

David Amebley, Sayanton Dibbo

机构 * The University of Alabama(阿拉巴马大学) Alabama Center for the Advancement of AI(阿拉巴马人工智能 advancement 中心) Trustworthy AI Lab(可信人工智能实验室) Department of Computer Science, The University of Alabama(计算机科学系)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究受神经启发的多模态视觉-语言模型(VLM)对基于图像-文本的成员推断攻击的弹性,提出拓扑正则化框架,实验表明神经VLM在保持模型效用同时显著降低攻击成功率。

Comments Accepted at USENIX WOOT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18909 2026-06-16 cs.LG cs.IT math.IT stat.ML 版本更新 57%

Best Arm Identification with Minimal Regret

最小化遗憾的最佳臂识别

Junwen Yang, Vincent Y. F. Tan, Tianyuan Jin

机构 * Institute of Operations Research and Analytics National University of Singapore(运营研究与分析研究所,新加坡国立大学) Department of Mathematics Department of Electrical and Computer Engineering Institute of Operations Research and Analytics National University of Singapore(数学系电子与计算机工程系运营研究与分析研究所,新加坡国立大学) Department of Mathematics National University of Singapore(数学系新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出在最小化累积遗憾的同时以置信度δ识别最佳臂的问题,利用信息论推导下界,并设计渐近最优的Double KL-UCB算法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11238 2026-06-09 cs.CL 版本更新 57%

SurveyLens: A Discipline-Aware Benchmark for Automatic Survey Generation

SurveyLens:一个学科感知的自动综述生成基准

Beichen Guo, Zhiyuan Wen, Jia Gu, Haochen Shi, Jian Wang, Senzhang Wang, Haoyang Li, Ruosong Yang, Shuaiqi Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Central South University(中南大学) Alibaba Cloud(阿里巴巴云)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 提出SurveyLens,首个学科感知的自动综述生成基准,包含跨10个学科的1000篇人工撰写综述数据集和双视角评估框架,发现深度研究智能体在跨学科鲁棒性上最优,而所有范式在参考文献质量上仍薄弱。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06307 2026-06-09 cs.CL 版本更新 57%

Lost in Speech: Benchmarking, Evaluation, and Parsing of Spoken Bilingual Conversational Language Beyond Standard UD Assumptions

迷失在语音中:超越标准UD假设的口语双语会话的基准测试、评估与解析

Nemika Tyagi, Olga Kellert, Holly Hendrix, Nelvin Licona-Guevara, Justin Mackie, Phanos Kareen, Megan Michelle Smith, Tatiana Gallego Hernande, Samhitha Harish, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 针对口语双语会话中的不流利和话语驱动结构,提出SpokeBench基准、Flex-UD评估指标和DECAP解析框架,显著提升依赖解析性能。

Comments 17 pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16073 2026-06-08 cs.RO cs.AI cs.LO cs.SY eess.SY 版本更新 57%

ScenicRules: An Autonomous Driving Benchmark with Multi-Objective Specifications and Abstract Scenarios

ScenicRules:具有多目标规范和抽象场景的自动驾驶基准测试

Kevin Kai-Chun Chang, Ekin Beyazit, Alberto Sangiovanni-Vincentelli, Tichakorn Wongpiromsarn, Sanjit A. Seshia

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ScenicRules基准,通过层次化规则框架和形式化场景模型,在随机环境下评估自动驾驶系统对优先级多目标规范的满足程度。

Comments v2: Minor numerical corrections for Table V. 16 pages, 14 figures, 7 tables. Extended version of paper accepted to 2026 IEEE Intelligent Vehicles Symposium (IV 2026). ScenicRules benchmark available at https://github.com/BerkeleyLearnVerify/ScenicRules

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.00522 2026-07-14 econ.GN q-fin.EC 版本更新 56%

Constraining to Motivate

通过约束来激励

Liqun Liu

专题命中 Agent评测 :agent(abstract,comments)

AI总结 研究有效决策中代理人因职业依赖决策认知而回避获取信息的问题,提出约束性委托的解决方案,即限制代理人选择集来重塑声誉风险与恢复信息获取激励,可反常提高决策质量。

Comments Revised version of "The Politics of (No) Compromise: Information Acquisition, Policy Discretion, and Reputation" (arXiv:2111.00522). Same model and core results: constrained delegation restores a career-concerned agent's incentive to acquire information by eliminating the action that serves as the uninformed agent's safe harbor. Retitled "Constraining to Motivate."

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14499 2026-08-21 cs.GT 版本更新 50%

Ex-ante versus Ex-post: Egalitarian Facility Location Mechanism Design

事前与事后:平等主义设施选址机制设计

Zohar Barak, Inbal Talgam-Cohen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对欧氏空间的设施选址问题,对比事前与事后评估,在低维中设计出打破确定性壁垒的机制,高维中则证明随机旋转中位数机制为最优平等主义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12818 2026-08-21 econ.TH 版本更新 50%

Schedule equilibria

日程均衡

Harry Kleyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究一般均衡下的不完全竞争,推导家庭与企业最优条件,建立均衡存在性与颤抖手精炼,将框架应用于多场景,发现内生价格反应会改变相关标准结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10968 2026-08-21 physics.soc-ph 版本更新 50%

Radicalization Kinetics under Algorithmic Exposure in a Stochastic Multiplex Model of Opinion Dynamics

交叉接触激进化引擎:观点动力学随机复合模型中的平台设计、注意力与地理因素

Ruben E. Araújo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究构建随机复合观点动力学模型,分析社交媒体平台设计、注意力与地理因素对激进化的影响,发现算法同质性可悖论性抑制极端主义,未策划接触是激进化饱和水平的决定因素。

Comments 14 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18556 2026-08-21 eess.SY cs.SY eess.SP 版本更新 50%

Wind-Resilient Trajectory Optimization for UAV-BS Networks: TD3 for Continuous Service Availability

抗风无人机基站网络轨迹优化:基于TD3的连续服务可用性

Azim Akhtarshenas, German Svistunov, Kuangyu Zheng, David Lopez-Perez

专题命中 Agent评测 :agent(abstract)

AI总结 针对风扰导致无人机基站位置漂移和通信质量下降问题,提出基于TD3算法的抗风轨迹调整框架,通过随机运动学建模学习自适应控制策略,在湍流条件下维持最优覆盖,仿真验证其优于PPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11716 2026-08-21 cs.AR 版本更新 50%

A Fast Locality Simulator for GEMM Design-Space Exploration on Multi-Chiplet GPUs

面向多芯片GPU的GEMM设计空间探索的快速局部性模拟器

Euijun Chung, Hyesoon Kim

专题命中 Agent评测 :agentic(abstract)

AI总结 提出一种快速、功能级、瓦片级局部性模拟器,用于评估多芯片GPU上GEMM的内核选择对片间流量影响,发现远程流量变化可达90倍,并揭示2D块交织CTA遍历可减少远程流量达5.1倍。

Comments Poster presentation at the Workshop on Modeling & Simulation of Systems and Applications (MODSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03502 2026-08-20 cs.GT 版本更新 50%

On the characterization of constrained correlated equilibria in Markov games

马尔可夫博弈中约束关联均衡的表征与存在性

Tingting Ni, Anna Maddux, Maryam Kamgarpour

专题命中 Agent评测 :agent(abstract)

AI总结 本文形式化并刻画了马尔可夫博弈中约束关联均衡的概念,证明了在耦合约束下此类均衡的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03646 2026-08-19 cs.CE econ.GN q-fin.EC 版本更新 50%

Crypto-Microeconomics: The Distribution of Bitcoin Wealth Among Diverse Economic Agents

加密微观经济学:比特币财富在不同经济主体间的分布

Syed Azhar Hussain, Kashif Ahmad, Mubashir Husain Rehmani

专题命中 Agent评测 :agent(abstract)

AI总结 提出“加密微观经济可观测性框架”,通过描述性、不平等和纵向集中度指标,研究五个标签主体类别的比特币财富微观差异,揭示财富高度集中及各主体内不平等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12825 2026-08-19 econ.EM 版本更新 50%

Nonseparable Dyadic Regression

不可分二进回归

Brice Romuald Gueyap Kounga

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对不可分二进结果模型,推导了两制度中心极限定理,提出主体级自助法,发现独立性置信区间覆盖率不足,自助法可恢复覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03369 2026-08-17 econ.TH cs.CY cs.IR 版本更新 50%

Impact of Rankings and Personalized Recommendations in Marketplaces

市场中排名与个性化推荐的影响

Omar Besbes, Yash Kanoria, Akshit Kumar

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过大市场模型,量化了无容量与有容量约束供给下,公共排名和个性化推荐对市场福利的影响,发现二者价值随市场条件和偏好异质性变化,且引入策略定价后价值会被市场短边获取。

详情

展开后加载摘要…

URL PDF HTML 收藏