arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2606.29592 2026-06-30 cs.LG cond-mat.mtrl-sci physics.atom-ph physics.optics quant-ph 70%

STEMGym: Benchmarking Sequential Decision-Making under Dose Budgets in Autonomous Electron Microscopy

STEMGym: 自主电子显微镜中剂量预算下的序列决策基准测试

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Dept. of Electrical & Computer Eng.(电气与计算机工程系) Texas A&M Univ.(德克萨斯A&M大学) Dept. of Prosthetics & Orthotics(假肢与矫形学系) College of Science & Eng.(科学与工程学院) Ankara Univ.(安卡拉大学) Hamad Bin Khalifa Univ. and Texas A&M Univ. at Qatar(哈马德·本·卡西姆大学和德克萨斯A&M大学(卡塔尔))

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 通过15个物理模拟的STEM环境基准,发现感知管道(CNN分析师)是剂量效率的主要决定因素,而非导航策略,为自主电子显微镜的机器学习投入方向提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28450 2026-06-30 cs.CR cs.AI 70%

LLM agents security duality: a comprehensive survey of self-security and empowered cybersecurity

LLM代理安全二元性:自我安全与赋能网络安全的综合调查

Yiwei Xu, Yong Zhuang, Xuanming Liu, Tian Zhang, Bowen Xiao, Xiaoyang Xu, Delong Jiang, Juan Wang, Hongxin Hu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 综述LLM代理的自我安全威胁与防御,以及其在网络攻防中的赋能作用,首次揭示两者间的正反馈协同效应。

Comments 73 pages,12 figures, 9 tables, Artificial Intelligence Review

Journal ref Artif Intell Rev (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 70%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 70%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22000 2026-06-23 cs.AI cs.CL cs.LG cs.SE 新提交 70%

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试

Rishi Srivastava

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。

Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21959 2026-06-23 cs.CL 新提交 70%

OpenBioRQ: Unsolved Biomedical Research Questions for Agents

OpenBioRQ: 未解决的生物医学研究问题

Minbyul Jeong

机构 * Upstage AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出OpenBioRQ基准,包含12,553个无答案的未解决生物医学问题,用于评估智能体在检索、忠实性和工具使用方面的能力,发现当前模型存在工具使用崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19924 2026-06-19 cs.AI 新提交 70%

The Tao of Agency: Autotelic AI, Embedded Agency and Dissolution of the Self

主体之道:自生目标人工智能、嵌入主体与自我的消解

Aritra Sarkar

机构 * Aritra Sarkar

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨自生目标AI中主体生成自身目标的问题,通过内在动机、资源驱动先验、因果干预学习、稳态和嵌入性等概念,揭示嵌入性虽必要但不充分,并指出核心难题在于主体如何生成并相对化自我,最后提出量子表述、哲学解读和基于LLM的具体实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19868 2026-06-19 cs.AI 新提交 70%

A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models

大型语言模型黑盒不确定性估计方法的系统评估

Jiayi Wang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 系统评估了24种黑盒不确定性估计方法在4个模型和4个数据集上的表现,发现无单一方法普遍最优,但基于答案空间推理和比较的方法通常有效,混合方法在多数条件下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19704 2026-06-19 cs.AI 新提交 70%

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

超越静态排行榜:LLM智能体评估的预测有效性

Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasiecznik, Sagar Chethan Kumar, Tanmay Agarwal, Rohith Kanathur, Sam Colman, Amaan Sheikh, Dev Bahl, Ann Li, Krish Veera, Alimurtaza Mustafa Merchant, Shambhawi Baswaraj Bhure, Sajal Kumar Goyla, Chengrui Li, Kirthana Natarajan, Rui Li, Thomas Ajai, Rujing Li, Vivek G. Iyer, Sanjaii Vijayakumar, Yitong Bai, Ayal Yakobe, Darief Maes, Yassine Jebbouri, Tianyang Xu, Thai Quoc On, Vera Mazeeva, Winston Li, Yuval Shemla, Yeshitha Bhuvanesh, Rushin Bhatt, Siddharth Chethan Gowda, Alisha Vinod, Caroline Cahill, Shriya Aishani Rachakonda, Yunfeng Chen, Aryaman Agrawal, Aman Upganlawar, Mao Le Jonathan Ang, Yubin Sally Go, Madhav Rajkondawar, Yang-Jung Chen, Trisha Maturi, Ananya Kapoor, Andrew Li, Shrey Arora, Mana Abbaszadeh, Shen Li, Charles Xu, Byeolah Kwon

机构 * IBM

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。

Comments 17 pages, 2 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15345 2026-06-18 cs.CL cs.IR 新提交 70%

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

超越单语言深度研究:用跨语言 BrowseComp-Plus 评估智能体和检索器

Yuheng Lu, Qingcheng Zeng, Heli Qi, Puxuan Yu, Fuheng Zhao, Rui Yang, Hitomi Yanaka, Naoto Yokoya, Weihao Xuan

机构 * Waseda University(早稻田大学) Northwestern University(西北大学) RIKEN AIP(理化学研究所革新智能研究中心) Snowflake Inc.(Snowflake公司) University of Utah(犹他大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出跨语言基准 XBCP,评估深度研究智能体在证据语言与查询不同时的表现,发现检索和智能体端均存在显著性能下降。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17546 2026-06-17 cs.AI 新提交 70%

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

SEAGym: 自我进化LLM智能体的评估环境

Congjie Zheng, Chuanyi Xue, Bin Liang, Jun Yang, Changshui Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出SEAGym评估环境,通过训练、验证、测试、重放和成本记录多维度衡量智能体框架更新,揭示更新是否带来可复用改进、过拟合、成本增加或旧行为退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-06-17 cs.RO cs.AI cs.CV 新提交 70%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17114 2026-06-17 cs.CR cs.AI 新提交 70%

An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

现实场景中工具使用LLM代理的数据泄露风险评估

Hankyul Baek, Jaewon Noh, Sang Seo, Yongsu Kim, Gabriel Waikin Loh Matienzo, Young Il Kim, Ee Wei Seah, Akriti Vij

机构 * Korea AI Safety Institute(韩国人工智能安全研究所) Singapore AI Safety Institute(新加坡人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 评估了12个非对抗性任务中AI代理的数据泄露风险,发现所有代理均存在数据安全意识不足、信息过度访问等问题,表明操作数据泄露是独立于对抗性窃取的一阶安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16605 2026-06-16 cs.AI 新提交 70%

ARB4WM: An Adversarial Robustness Benchmark for World Models in Continuous Control

ARB4WM:连续控制中世界模型的对抗鲁棒性基准

Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan Gu

机构 * College of Computer Science, National University of Defense Technology(国防科技大学计算机学院) College of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of New Networks, Peng Cheng Laboratory(鹏城实验室新型网络部) National Key Laboratory of Advanced Communication Networks(先进通信网络全国重点实验室)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出ARB4WM统一基准,从策略、价值和潜在动力学三个层面评估世界模型在视觉扰动下的对抗鲁棒性,发现多目标攻击和时序暴露模式对安全评估至关重要。

Comments 24 pages, 10 figures, 5 tables. Source code available at https://github.com/zaoanguai/ARB4WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16596 2026-06-16 cs.CL 新提交 70%

How Far Can Machine Translation Quality Take You? Extrinsic Discourse Evaluation in Goal-Oriented Setups

机器翻译质量能带你走多远?目标导向设置中的外在话语评估

Wafaa Mohammed, Kata Naszadi, Vlad Niculae

机构 * Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 研究机器翻译在静态和交互式目标导向任务中的外在话语评估,发现高内在翻译质量不能保证下游话语成功,且强系统仍存在指代不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16190 2026-06-16 cs.AR cs.AI 新提交 70%

Embedded Arena: Iterative Optimization via Hardware Feedback

嵌入式竞技场:通过硬件反馈的迭代优化

Zhihan Zhang, Alexander Le Metzger, Jiuyang Lyu, Chun-Cheng Chang, Jiayi Shao, Yujia Liu, Emmanuel Azuh Mensah, Edward Wang, Kurtis Heimerl, Gregory D. Abowd, Shwetak Patel, Natasha Jaques, Vikram Iyer

机构 * University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出硬件在环智能体框架,通过迭代编译、烧录和测量真实硬件,实现模型与固件的闭环优化,在嵌入式设备上达到250倍压缩且精度损失<3.3%。

Comments Code: https://github.com/ubicomplab/embedded-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 70%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 70%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12268 2026-06-11 cs.AI 新提交 70%

The Impossibility of Eliciting Latent Knowledge

引出潜在知识的不可能性

Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport, Tom Everitt, Jonathan Richens

机构 * The London School of Economics and Political Science(伦敦政治经济学院) Independent(独立机构)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文利用因果影响图形式化定义引出潜在知识问题,证明不存在仅依赖行为反馈的训练策略能确保智能体诚实报告其信念。

Comments 24 pages, 3 figures. Includes proofs in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11120 2026-06-10 cs.AI cs.CV 新提交 70%

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

Andrew Kang, Priya Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。

Comments CVPR 2026, CVSports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05463 2026-06-10 cs.AI 版本更新 70%

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准

Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

机构 * Emory University(埃默里大学) Scale AI Mayo Clinic(梅奥诊所) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09826 2026-06-09 cs.CV cs.AI 新提交 70%

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体

Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang, Wei Huang, Yitang Li, Fan Zhang, Zeyu Hu, Lingting Zhu, Xin Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) LIGHTSPEED The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09663 2026-06-09 cs.AI 新提交 70%

From 0-to-1 to 1-to-N: Reproducible Engineering Evidence for MetaAI Recursive Self-Design

从0到1再到N:MetaAI递归自我设计的可复现工程证据

Dun Li, Jiatao Li, Hongzhi Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Maritime University(上海海事大学) Chizhou University(池州学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出可复现证据框架,通过四个标准评估现有系统,其中Darwin Goedel Machine在SWE-bench上提升30%,并给出可复现协议MetaAI-Mini。

Comments 6 pages, 2 figures, 7 tables. Supplementary code: https://github.com/DunLi-Tsinghua/MetaAI-Mini

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09236 2026-06-09 cs.RO cs.AI 新提交 70%

Self-Paced Curriculum Reinforcement Learning for Autonomous Superbike Racing in Simulation

用于模拟自主超级摩托车赛车的自定进度课程强化学习

Luca Ghisi, Jacopo Essenziale, Carlo D'Eramo, Matteo Luperto

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出自定进度课程深度强化学习框架,结合软演员-评论家算法,动态生成渐进任务,在物理精确模拟器中训练自主摩托车赛车,优于标准SAC。

Comments Presented at the "1st Workshop on Generalization in Autonomous Driving: Paradigms, Practice, and Public Road Demonstrations" at ICRA 2026, Vienna. Oral+poster presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01478 2026-06-09 cs.RO cs.AI cs.MA cs.SY eess.SY 版本更新 70%

Crazyflow: An Accurate, GPU-Accelerated, Differentiable Drone Simulator in JAX

Crazyflow: 基于JAX的精确、GPU加速、可微分的无人机模拟器

Martin Schuck, Marcel P. Rath, Yufei Hua, Abhishek Goudar, SiQi Zhou, Angela P. Schoellig

机构 * Technical University of Munich(慕尼黑技术大学) University of Toronto(多伦多大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出Crazyflow模拟器,通过GPU加速和可微分设计,实现单机超高速仿真、数千架无人机集群模拟,并支持基于解析梯度的策略学习与采样避障,甚至能在0.38秒内从零训练飞行恢复策略。

Comments Fix minor metadata mistakes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12453 2026-06-09 cs.CL 版本更新 70%

CSE-UOI at SemEval-2026 Task 6: A Two-Stage Heterogeneous Ensemble with Deliberative Complexity Gating for Political Evasion Detection

CSE-UOI在SemEval-2026任务6中的表现:一种双阶段异构集成与 deliberative 复杂性门控的政治理论逃避检测方法

Christos Tzouvaras, Konstantinos Skianis, Athanasios Voulodimos

机构 * University of Ioannina(伊奥安纳大学) National Technical University of Athens(雅典国家技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出一种双阶段异构集成方法,结合自我一致性与加权投票,以及新颖的后处理修正机制Deliberative Complexity Gating,用于政治逃避检测,最终在评估集上获得0.85的Macro-F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06546 2026-06-08 cs.LG 新提交 70%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05342 2026-06-08 cs.AI 版本更新 70%

SentinelBench: A Benchmark for Long-Running Monitoring Agents

SentinelBench: 一个用于长时间运行监控代理的基准测试

Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin, Hussein Mozannar, Gagan Bansal, Maya Murad, Rafah Hosn, Saleema Amershi

机构 * University of Florida(佛罗里达大学) Microsoft Research, AI Frontiers(微软研究院,人工智能前沿)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出SentinelBench,一个包含10个合成网络环境中100个任务的基准测试,用于评估AI代理在长时间监控任务中的表现,衡量任务完成度、反应时间和资源使用。

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05671 2026-06-05 cs.CL 70%

QueryAgent-R1: Bridging Query Generation and Product Retrieval for E-Commerce Query Recommendation

QueryAgent-R1:连接查询生成与商品检索的电商查询推荐

Dike Sun, Zheng Zou, Jingtong Zang, Qi Sun, Huaipeng Zhaoand Tao Luo, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出QueryAgent-R1框架,通过记忆增强和检索链优化,将查询生成与实际库存检索对齐,以提升电商搜索中查询推荐的产品转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05557 2026-06-05 cs.CL 70%

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

AURA: 面向情境化LLM代理中隐式需求挖掘的意图导向探测

Yang Li, Jiaxiang Liu, Jiang Cai, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

专题命中 Agent评测 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 提出AURA方法,通过在场景感知和工具使用之间插入意图推理步骤生成IntentFrame,以结构化估计隐式需求并控制探测预算,在隐式意图基准上提升覆盖率达+0.07,同时减少82%的探测次数并避免隐私违规。

Comments Submitted to EMNLP 2026. Code, simulator, and benchmark: https://github.com/innovation64/AURA

详情

展开后加载摘要…

URL PDF HTML 收藏