arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2606.28277 2026-06-29 cs.LG cs.AI cs.CL cs.CY 新提交 67%

Towards Automating Scientific Review with Google's Paper Assistant Tool

迈向自动化科学评审:谷歌论文助手工具

Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad

机构 * Google Research USA(谷歌美国研究)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出四层AI-人类协作分类法,并介绍论文助手工具(PAT),通过推理缩放技术实现深度科学评审,在SPOT基准上数学错误召回率提升34%,并在STOC和ICML会议中成功识别关键错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23293 2026-06-26 physics.soc-ph 版本更新 67%

Partial exploiters sustain cooperation: the hump-shaped strategy stably coexists with unconditional cooperators

部分利用者维持合作:驼峰策略稳定共存于无条件合作者

Kai Otsubo, Yuta Kido, Ryutaro Mori

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 研究揭示驼峰策略在中间规模群体中适应性强,能与无条件合作者共同维持大规模合作,通过稳定均衡排除自由搭车者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23127 2026-06-23 cs.AI cs.CL cs.SE 新提交 67%

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

管理LLM智能体中的程序性记忆:控制、适应与评估

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出AFTER基准(382个企业任务,22种程序性技能),评估技能在任务、角色和模型间的迁移,实验表明程序性记忆可提升3.7-6.7点性能,跨模型准确率达73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04018 2026-06-23 cs.AI cs.CL cs.CY cs.LG 版本更新 67%

AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性

Akshat Naik, Emma Gouné, Patrick Quinn, Guillermo Bosch, Francisco Javier Campos Zabala, Jason Ross Brown, Edward James Young

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学) Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne Université(索邦大学) The Leverhulme Centre for the Future of Intelligence(未来智能中心) University of Cambridge(剑桥大学) Independent Researcher(独立研究者) Department of Computer Science and Technology(计算机科学与技术系) Department of Engineering(工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。

Comments Prepint, under review for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 67%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 Agent评测 :agent(abstract);tool use(abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16849 2026-06-18 cs.NE cs.GR cs.HC 新提交 67%

Evolution & Foundation: AI Shares Creative Control

进化与基础模型:AI共享创意控制

Dylan Banarse, Stephen Todd, William Latham, Frederic Fol Leymarie

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08355 2026-06-18 cs.CV 版本更新 67%

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

E-VAds:面向多模态大语言模型的电商短视频理解基准

Xianjie Liu, Yiman Hu, Liang Wu, Ping Hu, Yixiong Zou, Jian Xu, Bo Zheng

机构 * Alimama Tech, Taobao \& Tmail Group of Alibaba Huazhong University of Science Vin University

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 提出电商短视频理解基准E-VAds,通过多模态信息密度评估框架量化领域复杂性,并构建多智能体生成的问答数据集,最后开发基于强化学习的推理模型E-VAds-R1,在商业意图推理上实现109.2%的性能提升。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13979 2026-06-18 cs.HC 版本更新 67%

Personality Pairing Improves Human-AI Collaboration

人格配对改善人机协作

Harang Ju, Sinan Aral

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 通过大规模实验,将人类与具有不同大五人格特质的AI配对,发现人格匹配显著影响广告质量和团队表现,外倾人类与尽责AI配对效果最差,而神经质人类与神经质AI配对点击率最高。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-06-17 cs.CV 新提交 67%

Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: https://fr3d-wm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17229 2026-06-17 cs.LG cs.AI cs.CL 新提交 67%

Rift: A Conflict Signature for Deception in Language Models

Rift: 语言模型中欺骗行为的冲突特征

Petr Nyoma

机构 * Harmonic Labs

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过对比知情欺骗与无知错误,发现欺骗性前向传递具有高残差秩的冲突特征,能以100%准确率无标签识别谎言,并跨模型、语言和架构迁移。

Comments 13 pages, 4 figures. Code and experiment logs: https://github.com/Omibranch/Rift

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16978 2026-06-17 cs.CV 版本更新 67%

A Benchmark for Omni-Modal Reasoning in Long Videos

长视频全模态推理基准

Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou, Sahal Shaji Mullappilly, Mohammad Almansoori, Noor Ahsan, Beknur Kalmakhanbet, Sambal Shikhar, Rishabh Lalla, Jean Lahoud, Mariette Awad, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) American University of Beirut(贝鲁特美国大学) Linköping University(利尔贝里大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16903 2026-06-16 cs.DB 新提交 67%

Directory-Aware Query and Maintenance in Vector Databases

向量数据库中的目录感知查询与维护

Mengzhao Wang, Zheng Gong, Jingpei Hu, Jiajie Fu, Maojia Sheng, Junwen Chen, Yifan Zhu

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 针对向量数据库缺乏层次目录语义的问题,提出目录语义查询(DSQ)和目录语义维护(DSM)算子,并评估三种实现策略,其中基于Trie的层次索引(TrieHI)通过树遍历实现高效递归检索并降低维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13474 2026-06-12 cs.CY 新提交 67%

Exploring Systems-Thinking Approaches to Loss of Control Risk

探索系统思维方法应对失控风险

Aurelio Carlucci, Sean P. Fillingham, James Walpole, Jakub Kryś

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文运用STECA、STPA和FRAM三种系统安全方法分析前沿实验室编码智能体场景,发现模型级评估可能遗漏治理责任、反馈回路和操作变异等风险,主张将模型评估与系统级危害分析和操作保证相结合。

Comments Accepted to the Technical AI Governance Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05405 2026-06-12 cs.AI cs.CL cs.LG 版本更新 67%

Agents' Last Exam

Agents' Last Exam

Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-Gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, Yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Chenyu Zhu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-Ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, Andy Zeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lyu, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Shi Qiu, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Cheng Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, He Ren, Zhenyu He, Qiao Jin, Langlang Li, Yuetai Li, Sylvia Liu, Lu Lu, Luqing Zhou, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Yian Ma, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Yinglun Zhu, Dawn Song

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对AI系统在专业领域缺乏经济性部署的问题,提出Agents' Last Exam (ALE)基准,通过250+专家协作构建覆盖13个行业集群55个子领域的1000+长期真实经济任务,当前最难层级平均通过率仅2.6%。

Comments Project website: https://agents-last-exam.org Code: https://github.com/rdi-berkeley/agents-last-exam

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 67%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10242 2026-06-11 cs.CV 版本更新 67%

MedVeriSeg: Teaching LISA-Like Medical Segmentation Models to Verify Query Validity Without Extra Training

MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练

Qinyue Tong, Xiaozhen Wang, Ziqian Lu, Jun Liu, Yunlong Yu, Zheming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) Southern Medical University(南方医科大学) School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 67%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09748 2026-06-09 cs.AI cs.CL cs.LG 新提交 67%

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

深度研究智能体在过程级反馈下的多轮评估

Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

机构 * Google DeepMind(谷歌DeepMind) OpenAI Perplexity AI LangChain AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对深度研究智能体(DRA)在单轮输出评估的不足,提出研究缺口推断(RGI)方法提供过程级反馈,发现单轮过程反馈可提升8-15分,但多轮改进因回归问题难以持续。

Comments Published as a workshop paper at SCALE - ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08481 2026-06-09 cs.LG cs.AI cs.DB cs.SE 新提交 67%

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

PIPE-Cypher:面向文本到Cypher系统的自动企业基准生成

Suraj Ranganath, Anish Raghavendra

机构 * Halıcıoğlu School of Data Science and Computing, University of California, San Diego(加利福尼亚大学圣迭戈分校哈勒乔卢数据科学与计算学院) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出PIPE-Cypher流水线,利用本地大模型从企业属性图自动生成平衡的NL-to-Cypher基准,通过模式分析、逆向查询约束生成和执行验证等步骤,实现可重复的基准构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07379 2026-06-09 cs.LG cs.AI cs.CL stat.ME 版本更新 67%

Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

编码智能体会欺骗我们吗?通过带随机测试的上限评估检测和防止作弊

Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori, Nontawat Charoenphakdee, Masashi Sugiyama, Takashi Ishida

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出CapCode框架,通过设置上限评估检测模型在编码任务中的作弊行为,并设计CapReward奖励机制防止作弊,实验表明该方法能有效检测和减少作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09506 2026-06-09 cs.CE 67%

Beyond Knowledge to Agency: Evaluating Expertise, Autonomy, and Integrity in Finance with CNFinBench

超越知识到能动性:用CNFinBench评估金融领域的专业知识、自主性和完整性

Jinru Ding, Chao Ding, Yidong Jiang, Wenrao Pang, Boyi Xiao, Zhiqiang Liu, Jiayuan Chen, Yun Zhong, Tiantian Yuan, Junming Guan, Dawei Cheng, Jie Xu

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出CNFinBench基准,通过专业知识、自主性和完整性三维度评估LLM在金融领域的代理能力,并引入HICS指标量化多轮对抗攻击下的安全退化。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20182 2026-06-09 cs.CV 版本更新 67%

PEDRA: Evaluating the Realism of Pedestrian Dynamics in Video Generation

PEDRA: 评估视频生成中行人动态的真实性

Aaron Appelle, Jerome P. Lynch

机构 * Duke University(杜克大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 提出PEDRA评估协议,通过重建鸟瞰轨迹等方法,测试文本/图像到视频模型生成多行人交互场景的真实性,发现现有模型虽具备先验但存在行人合并消失等物理不一致问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06741 2026-06-08 cs.AI cs.CL cs.LG 新提交 67%

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill: 面向LLM智能体的开放世界自我进化

Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

机构 * Lehigh University(莱维大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Salesforce AI Research(Salesforce人工智能研究) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。

Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04123 2026-06-08 cs.CY cs.AI cs.LG cs.SE 版本更新 67%

Measuring Agents in Production

生产环境中的智能体测量

Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

机构 * University of California at Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05793 2026-06-05 cs.CL cs.AI cs.CY cs.LG 67%

CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement

CollabBench: 通过主动参与与多样化玩家基准测试和释放LLMs的协作能力

Hong Qian, Yuanhao Liu, Zihan Zhou, Zongbao Zhang, Hanjie Ge, Haotian Shi, Liang Dou, Xiangfeng Wang, Jingwen Yang, Aimin Zhou

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science(计算机科学学院) East China Normal University(东华大学) Tencent Inc.(腾讯公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出CollabBench基准,通过多样化玩家模拟和协作智能体训练范式,提升LLM在合作游戏中的任务效率和情感适应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05567 2026-06-05 cs.CR cs.MA 67%

ZERO-APT: A Closed-Loop Adversarial Framework for LLM-Driven Automated Penetration Testing under Intelligent Defense

ZERO-APT: 智能防御下LLM驱动的自动化渗透测试的闭环对抗框架

Anlan Zheng, Tiantian Zhu

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出ZERO-APT框架,通过集成可配置的LLM防御者、架构级因果一致性机制和专用裁判智能体,解决了LLM驱动渗透测试在真实性、一致性和可审计性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05415 2026-06-05 cs.CL cs.AI cs.LG 67%

Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval

可执行模式合约:从自动摄入到多源检索

Padmaja Jonnalagedda, Yuguang Yao, Xiang Gao, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一种自动从多源数据中发现可执行模式并将其作为共享合约的系统,通过模式约束的检索路由和结构化分析提升多源问答性能。

Comments 9 pages, 4 figures, plus supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏