arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2605.09708 2026-06-30 cs.LG cs.AI cs.DC 62%

Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon

Metal-Sci: 一个用于苹果硅芯片上进化式LLM内核搜索的科学计算基准

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Metal-Sci基准通过10个科学任务和六个优化领域,评估LLM在自动内核搜索中的性能,展示了不同模型在不同任务上的加速效果及结构化评估方法的可靠性。

Comments Published at the Fifth Workshop on Deep Learning for Code (DL4C) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10109 2026-06-30 cs.AI cs.HC cs.LG 62%

LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals

基于自我报告的LLM代理能够实现通用个体模拟

Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, Michael S. Bernstein

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Department of Communication Studies, Northwestern University(西北大学传播学系) Department of Communication, University of Washington(华盛顿大学传播学系) Google DeepMind(谷歌DeepMind) Department of Sociology, Stanford University(斯坦福大学社会学系) Sciences Po(巴黎政治学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于自我报告数据的LLM代理在模拟个体行为方面的有效性,通过不同数据源构建代理并验证其在多种任务中的准确性和跨群体公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03915 2026-06-30 cs.CL cs.AI 62%

Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects

重新思考角色扮演评估:匿名基准测试与对性格效应的系统研究

Ji-Lun Peng, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学) Academia Sinica(中央研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出匿名基准测试方法,揭示角色扮演能力与角色识别的关联,通过性格增强方法提升匿名场景下的角色扮演性能。

Comments SIGdial 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27406 2026-06-29 cs.SE cs.AI 新提交 62%

Towards Evaluation of Implicit Software World Models in Coding LLMs

面向编码大语言模型中隐式软件世界模型的评估

Egor Bogomolov, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过预测执行资源(峰值内存、墙钟时间、分析器输出)扩展软件世界模型评估,发现前沿模型表现有限,表明对软件执行理解不足。

Comments Accepted to DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10238 2026-06-29 cs.CL cs.LG 版本更新 62%

Learning to Evict from Key-Value Cache

学习从键值缓存中驱逐

Luca Moschella, Laura Manduchi, Ozan Sener

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出基于强化学习的KV缓存驱逐策略KVP,通过轻量级逐头代理学习预测令牌未来效用,显著提升长上下文和多轮对话性能。

Comments Accepted to ICML 2026. Code available at: https://github.com/apple/ml-learning-to-evict

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 62%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26406 2026-06-26 cs.LG cs.AI math-ph math.MP 新提交 62%

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统

A. S. Ushakov, Yu. N. Berdinsk

机构 * Saint Petersburg State University(圣彼得堡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23993 2026-06-25 cs.LG cs.AI hep-ex 新提交 62%

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

学习触发:大型强子对撞机的强化学习

Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Fermi National Accelerator Laboratory(费米国家加速器实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对大型强子对撞机实时触发系统在带宽、延迟和存储约束下的阈值调优问题,提出基于强化学习的在线阈值控制方法,在模拟和真实数据上分别提升48%和56%的容忍时间比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04718 2026-06-25 cs.CL cs.AI 62%

AI-Assisted Moot Courts: Simulating Justice-Specific Questioning in Oral Arguments

AI辅助模拟法庭:模拟特定司法机关的口头辩论提问

Kylie Zhang, Nimra Nadeem, Lucia Zheng, Dominik Stammbach, Peter Henderson

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文研究AI能否有效模拟特定司法机关的提问以辅助模拟法庭训练,提出双层评估框架,发现模拟问题被人类标注者认为真实且能识别法律问题,但存在提问类型单一和奉承等问题。

Comments Accepted at CS & Law 2026

Journal ref CSLAW '26: Symposium on Computer Science and Law, March 3-5, 2026, Berkeley, CA, USA, ACM, pp. 136-172

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 62%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26144 2026-06-24 cs.SE cs.AI cs.CV 版本更新 62%

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

VISTA:面向视觉规格到网页应用编码智能体的端到端基准

JunJia Guo, Yuhang Yao, Jiawei, Zhou, Jingdi Chen

机构 * University of Arizona(亚利桑那大学) Zoom Stony Brook University(石溪大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。

Comments Project page: https://kaboider.github.io/VIS_APP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24050 2026-06-24 cs.SE cs.AI stat.AP 版本更新 62%

More Skills, Worse Agents? Skill Shadowing Degrades Performance When Expanding Skill Libraries

更多技能,更差智能体?扩展技能库时技能遮蔽降低性能

Hongwen Song, Song Wei

机构 * Databricks Inc.(Databricks公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM智能体技能库扩展导致性能下降的现象,提出将性能下降分解为技能遮蔽和上下文开销两种效应,并通过实验证明技能遮蔽是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23654 2026-06-23 cs.CL cs.SE 新提交 62%

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

EnterpriseClawBench: 从真实工作会话中基准测试智能体

Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang

机构 * Horizon Research, Frontis.AI(地平线研究,Frontis.AI)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 提出EnterpriseClawBench,从真实企业工作会话构建852个可复现任务,评估智能体在文件读取、工具调用和工件交付方面的能力,最佳配置得分仅0.663。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交 62%

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22977 2026-06-23 cs.CL cs.AI 新提交 62%

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

StatABench:评估大语言模型统计分析能力的数据集与框架

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 62%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22769 2026-06-23 cs.LG cs.AI 新提交 62%

Noise is Signal: Density-Based Outliers as Leading Indicators of Occupational Emergence in Labor Market Text

噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标

Shreyash Rawat

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22207 2026-06-23 cs.CL cs.AI 新提交 62%

Lexical Consensus: Grounded Word Learning and Shared Meaning in Artificial Agents

词汇共识:人工智能体中的具身词汇学习与共享意义

Patricio M. Vera

机构 * Neurocreaciones

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出词汇共识框架,利用冻结的DINOv2视觉嵌入和卡罗尔式无意义词,研究智能体如何从结构化感知中获取、稳定和使用新词汇意义,发现感知距离主导词汇习得梯度。

Comments 41 pages, 12 figures, 9 tables. Code and experiment artifacts available at https://github.com/patriciomvera/lexical-consensus

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21820 2026-06-23 cs.SI cs.AI cs.CL 新提交 62%

Generating Public Health Responses using Survey-Augmented Large Language Models

使用调查增强的大语言模型生成公共卫生响应

Leonardo Marciaga, Thuyen Pham, Julia Rezvani, Alina Hyk, Chunyang Liao, Konstantinos Mitsopoulos, Raffaele Vardavas

机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20708 2026-06-23 cs.AI cs.CL cs.HC 新提交 62%

Simulated Customers Never Walk Away: Decision Fidelity of LLM User Simulators Measured Against Real Purchase Outcomes

模拟客户永不离开:LLM用户模拟器与实际购买结果的决策保真度

Liang Chen

机构 * Chinese relationship-matchmaking service(中国婚恋服务平台)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出决策保真度概念,通过对比LLM模拟器与真实客户在销售对话中的决策状态,发现模拟器高估非购买者的参与度,低估其拒绝意愿,导致系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20376 2026-06-23 cs.LG cs.AI 新提交 62%

CRAX: Fast Safe Reinforcement Learning Benchmarking

CRAX:快速安全强化学习基准测试

Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于JAX加速的安全RL基准CRAX,利用MJX物理引擎实现高达100倍加速,包含6个环境套件和3个智能体任务,评估6种方法揭示性能与安全权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19721 2026-06-19 cs.LG cs.AI 新提交 62%

OnDeFog: Online Decision Transformer under Frame Dropping

OnDeFog:帧丢失下的在线决策变压器

Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa

机构 * Yokohama National University(横滨国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对帧丢失导致性能下降的问题,提出OnDeFog,将DeFog机制与在线决策变压器结合,通过直接环境交互学习策略,在高丢帧率环境下优于ODT,在低奖励数据集上优于DeFog。

Comments Accepted to PRICAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18782 2026-06-18 cs.CL cs.AI 新提交 62%

RedactionBench

RedactionBench:基于上下文完整性的隐私保护基准测试

Sean Brynjólfsson, Shashvat Jayakrishnan, Esha Sali, Diptanshu Purwar, Madhav Aggarwal

机构 * A10 Networks, Inc.(A10网络公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 RedactionBench通过200个跨11个领域的文档,评估红actions的上下文隐私问题,提出R-Score指标,揭示红actions的主观性,推动隐私保护系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18733 2026-06-18 cs.SE cs.AI 新提交 62%

SWE-Future: Forecast-Conditioned Data Synthesis for Future-Oriented Software Engineering Agents

SWE-Future: 面向未来软件工程智能体的预测条件数据合成

Qiao Zhao, JianYing Qu, Jun Zhang, Yehua Yang, Hanwen Du, Zhongkai Sun

机构 * Baidu Inc(百度公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Future方法,利用仓库历史证据预测未来任务类型(如功能实现、缺陷修复),并基于预测条件合成200个编码智能体任务,减少对历史PR回放的依赖,在80个仓库中达到58.1%的未来工作相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18530 2026-06-18 cs.CR cs.CL cs.LG 新提交 62%

Evaluating Prompting-Based Defenses Against Domain-Camouflaged Injection Attacks

评估基于提示的防御策略对抗领域伪装注入攻击

Aaditya Pai

机构 * Data Science Institute(数据科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 针对领域伪装注入攻击,评估五种基于提示的防御方法(如释义、重点标记等)在三个模型家族和三个部署领域中的有效性,发现释义法最有效,可将伪装攻击成功率降低55-84%。

Comments 9 pages, 4 figures, 4 tables; under review at the AdvML-Frontiers x CoTMA workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18122 2026-06-17 cs.LG cs.AI cs.AR eess.AS eess.SP 新提交 62%

Embedded Machine Learning for Microcontroller-Class Edge Devices: Data, Feature, Evaluation, and Deployment Pipelines

面向微控制器级边缘设备的嵌入式机器学习:数据、特征、评估与部署流程

Mostafa Darvishi

机构 * IEEE

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文系统介绍面向微控制器平台的嵌入式机器学习工作流,重点涵盖采样缓冲、特征提取、不平衡验证、模型/运行时协同设计及流式部署等工程决策,并以惯性运动识别和关键词检测为例给出实用设计规则。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17847 2026-06-17 cs.AI cs.LG 新提交 62%

WallZero: Mastering the Game of WallGo with Strategic Analysis

WallZero:通过战略分析掌握WallGo游戏

Hsing-Yu Chen, Jérôme Arjonilla, I-Chen Wu, Ti-Rong Wu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Academia Sinica(中央研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于AlphaZero的WallZero智能体,通过定制动作和特征设计,在WallGo游戏中击败职业围棋选手,并分析游戏公平性与关键策略。

Comments Accepted by the Computers and Games conference (CG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17541 2026-06-17 cs.LG cs.AI 新提交 62%

Offline Preference-Based Trajectory Evaluation

基于偏好的离线轨迹评估

Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对离线评估中仅使用终端成功率导致统计效率低下的问题,提出基于偏好的轨迹评估方法,通过比较轨迹的时间偏好减少平局,提升区分能力、排名稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 62%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 62%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏