arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1239 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1239 篇

2606.18733 2026-06-18 cs.SE cs.AI 新提交 62%

SWE-Future: Forecast-Conditioned Data Synthesis for Future-Oriented Software Engineering Agents

SWE-Future: 面向未来软件工程智能体的预测条件数据合成

Qiao Zhao, JianYing Qu, Jun Zhang, Yehua Yang, Hanwen Du, Zhongkai Sun

机构 * Baidu Inc(百度公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Future方法,利用仓库历史证据预测未来任务类型(如功能实现、缺陷修复),并基于预测条件合成200个编码智能体任务,减少对历史PR回放的依赖,在80个仓库中达到58.1%的未来工作相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18530 2026-06-18 cs.CR cs.CL cs.LG 新提交 62%

Evaluating Prompting-Based Defenses Against Domain-Camouflaged Injection Attacks

评估基于提示的防御策略对抗领域伪装注入攻击

Aaditya Pai

机构 * Data Science Institute(数据科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 针对领域伪装注入攻击,评估五种基于提示的防御方法(如释义、重点标记等)在三个模型家族和三个部署领域中的有效性,发现释义法最有效,可将伪装攻击成功率降低55-84%。

Comments 9 pages, 4 figures, 4 tables; under review at the AdvML-Frontiers x CoTMA workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18122 2026-06-17 cs.LG cs.AI cs.AR eess.AS eess.SP 新提交 62%

Embedded Machine Learning for Microcontroller-Class Edge Devices: Data, Feature, Evaluation, and Deployment Pipelines

面向微控制器级边缘设备的嵌入式机器学习:数据、特征、评估与部署流程

Mostafa Darvishi

机构 * IEEE

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文系统介绍面向微控制器平台的嵌入式机器学习工作流,重点涵盖采样缓冲、特征提取、不平衡验证、模型/运行时协同设计及流式部署等工程决策,并以惯性运动识别和关键词检测为例给出实用设计规则。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17847 2026-06-17 cs.AI cs.LG 新提交 62%

WallZero: Mastering the Game of WallGo with Strategic Analysis

WallZero:通过战略分析掌握WallGo游戏

Hsing-Yu Chen, Jérôme Arjonilla, I-Chen Wu, Ti-Rong Wu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Academia Sinica(中央研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于AlphaZero的WallZero智能体,通过定制动作和特征设计,在WallGo游戏中击败职业围棋选手,并分析游戏公平性与关键策略。

Comments Accepted by the Computers and Games conference (CG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17541 2026-06-17 cs.LG cs.AI 新提交 62%

Offline Preference-Based Trajectory Evaluation

基于偏好的离线轨迹评估

Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对离线评估中仅使用终端成功率导致统计效率低下的问题,提出基于偏好的轨迹评估方法,通过比较轨迹的时间偏好减少平局,提升区分能力、排名稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 62%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 62%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16748 2026-06-16 cs.LG cs.CL 新提交 62%

MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

MyPCBench: 个人智能计算机使用代理的基准测试

Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出MyPCBench基准,在模拟真实桌面环境(含17个Web应用)中测试个人计算机使用代理,发现最佳模型Claude Opus 4.6仅解决55.4%任务,失败集中在多应用和长轨迹任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16432 2026-06-16 cs.CL cs.AI 新提交 62%

ACCORD: Action-Conditioned Contextual Grounding for Language Agents

ACCORD: 面向语言智能体的动作条件上下文接地

Lai Jiang, Cheng Qian, Zhenhailong Wang, Pan Lu, Heng Ji, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16262 2026-06-16 cs.SE cs.AI 新提交 62%

UXBench: Measuring the Actionability of LLM-Generated UX Critiques

UXBench: 衡量LLM生成的UX评论的可操作性

Wenjie Wang, Yue Huang, Zipeng Ling, Han Bao, Hang hua, Xiaonan Luo, Yu Jiang, Shiyi Du, Yuexing Hao, Xiaomin Li, Yuchen Ma, Dianzhuo Wang, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12386 2026-06-11 cs.LG cs.AI 新提交 62%

ATLAS: Active Theory Learning for Automated Science

ATLAS: 自动化科学的主动理论学习

Noémi Éltető, Nathaniel D. Daw, Kimberly L. Stachenfeld, Kevin J. Miller

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ATLAS框架,通过主动学习迭代生成稀疏神经网络假设并设计最优区分实验,在bandit任务中恢复强化学习智能体,相比随机实验采样效率提升5-10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11045 2026-06-10 cs.AI cs.LG 新提交 62%

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化

Martin Andres Bertran, Aaron Roth, Zhiwei Steven Wu

机构 * Amazon Responsible AI(亚马逊负责任人工智能) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11007 2026-06-10 cs.CR cs.AI cs.SE 新提交 62%

Understanding and mitigating the risks of OpenClaw for non-technical users: A practical guide with Skill

理解并减轻非技术用户使用OpenClaw的风险:一份实用指南与Skill

Junchang Zheng, Junfeng Tan, Jialiang Lin

机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology, Guangzhou, China(计算机科学与工程学院,广州科学与技术研究院,中国广州) Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology, Guangzhou, China(科学与教育评估实验室,广州科学与技术研究院,中国广州)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对非技术用户,识别OpenClaw的七类核心风险,用通俗语言解释,提供可操作的防御策略,并开发自动化安全配置的Skill,降低使用门槛。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09764 2026-06-09 cs.LG cs.CL 新提交 62%

iOSWorld: A Benchmark for Personally Intelligent Phone Agents

iOSWorld:个人智能手机代理的基准测试

Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08938 2026-06-09 cs.CL cs.AI 新提交 62%

PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus

PACT: 通过特权合成与分支共识学习多样化诊断策略

Gen Li, Yuanze Hu, Zhichao Yang, Qingchen Yu, Jianwei Lv, Yue Guo, Yujing Liu, Faguo Wu, Hongwei Zheng, Xiandong Li, Bo Yuan, Yifan Sun, Zhaoxin Fan

机构 * Beihang University(北京航空航天大学) Baidu(百度) ByteDance(字节跳动) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出PACT框架,通过特权合成对话数据和多分支共识训练,使LLM同时学习多种诊断推理范式,在中文医疗诊断基准上取得最优性能。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08369 2026-06-09 cs.LG cs.AI 新提交 62%

An Information-Theoretic Definition for Open-Ended Learning

开放学习的信息论定义

Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于比特等价的信息论定义开放环境,证明经典赌博机非开放,设计算法实现开放学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 62%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07853 2026-06-09 cs.CL cs.AI 新提交 62%

Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

超越英语基准:巴西葡萄牙语临床大语言模型评估

Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima, Daniel Schneider

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出首个双语临床基准ClinicalBr,基于巴西病例报告构建,评估四个模型发现葡萄牙语-英语性能差距具有任务依赖性,诊断检索英语优势明显,其他任务差距消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 62%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18104 2026-08-20 cs.AI 新提交 61%

Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective

自进化智能体作为动态图变换:一项综述与新视角

Yuanyuan Xu, Wenjie Zhang, Yin Chen, Xuemin Lin, Ying Zhang

机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Zhejiang Gongshang University(浙江工商大学)

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI

AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。

Comments Project: https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16813 2026-08-18 cs.AI cs.DB 新提交 61%

Quipu: A Governed Bitemporal Knowledge Graph Store

Quipu:一种受管控的双时态知识图存储系统

Steve Brown

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI

AI总结 研究针对智能体知识图存储的四项默认规则缺陷,提出受管控双时态知识图存储系统Quipu,经Census、DEMM-Bench等基准测试,其在缺陷检测、裁决准确性、管控问题回答等方面表现优于基线。

Comments 15 pages, 2 figures, 4 tables. Subtitle: "Start strict: rethinking knowledge-graph defaults for agent-written knowledge". Source and the benchmark/census/ artifacts behind every reported number are archived at doi:10.5281/zenodo.21878428 (concept DOI, resolves to newest release). Development repository: github.com/scbrown/quipu

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交 61%

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG;agentic(comments)

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18242 2026-07-22 cs.AI cs.MA cs.NI 新提交 61%

AI Tool Discovery at Scale: All You Need is DNS

大规模人工智能工具发现:你所需要的只是DNS

Enhao Chen, Yulin Shao

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI;agent(comments)

AI总结 针对自主人工智能代理时代工具发现难题,提出ToolDNS框架,通过嵌入意图和信任将语义搜索转为轻量级名称解析,引入三项增强。经大规模基准测试验证,其在减少搜索空间和降低延迟方面效果显著,证明可通过利用现有基础设施实现可扩展的AI互操作性。

Comments keywords: AI tool discovery, ToolDNS, Agent, DNS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23525 2026-08-25 cs.AI 新提交 57%

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试

Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao

机构 * NUIST(南京信息工程大学) HKU(香港大学) McGill(麦吉尔大学) HKUST(GZ)(香港科技大学(广州)) Georgia Tech(佐治亚理工学院) NUS(新加坡国立大学) Tsinghua(清华大学) Griffith(格里菲斯大学) UT Austin(德克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23435 2026-08-25 cs.CV cs.AI 新提交 57%

Towards Comprehensive Basketball Understanding

迈向全面的篮球理解

Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有篮球理解基准仅单一评估能力的不足,构建多模态基准BasketballBench,并提出智能体BasketballSkills,实验显示其在整合多能力的篮球理解任务上优于现有MLLM。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22729 2026-08-25 cs.LG cs.NE 新提交 57%

Spiking Neural Networks for Continuous Control: Neuromorphic Reinforcement Learning in Conventional Computing

用于连续控制的脉冲神经网络:传统计算中的神经形态强化学习

Jessica Hunter, Md Maruf Hossain Shuvo, Krishna Roy

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术学院) The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出SANSAC算法,在传统硬件上验证其性能与SAC近乎相当,证明基于脉冲神经网络的算法可用于复杂连续环境,为神经形态强化学习研究奠定了基础。

Journal ref ICLR 2026 2nd Workshop on World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22606 2026-08-25 cs.LG 新提交 57%

Adversarial Agents on Topology Optimization: Understanding the Fragility and Robustness of Deep Learning-based and Physics-Based Design Models under Adversarial Perturbation

拓扑优化上的对抗智能体:理解基于深度学习与基于物理的设计模型在对抗扰动下的脆弱性与鲁棒性

Hoang Anh Nguyen, Yuan Hong, Hongyi Xu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究构建力学驱动的对抗智能体评估拓扑优化中深度学习代理模型的脆弱性,发现初始噪声会引发机械失效,物理梯度调节未必提升鲁棒性,SIMP优化器可部分恢复性能,为鲁棒生成式设计智能体训练提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22124 2026-08-25 cs.CL 新提交 57%

LLM assisted writing deserves empirical evaluation

大语言模型辅助写作值得实证评估

Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng

机构 * Weill Cornell Medicine(威尔康奈尔医学院) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 该研究针对常被当作检测问题的大语言模型辅助写作,分析69209篇健康信息学论文发现其关联更聚焦呈现等特征,主张应从学术质量而非工具使用角度评估手稿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22103 2026-08-25 cs.AI 新提交 57%

Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks

可验证黑客终端基准:评估终端任务中的奖励黑客行为

Amit Roth, Ivan Bercovich, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出可验证黑客终端基准(HVTB),将可验证黑客环境(HVE)适配至终端基准,用于测量前沿模型的奖励黑客率,并探究提示能否缓解该行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22092 2026-08-25 cs.LG 新提交 57%

Counterfactual Quotient Models: Learning What Actions Change, Not What the World Does

反事实商模型:学习动作会改变什么,而非世界会发生什么

Junlin Chen, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出反事实商模型,通过移除动作间共享的未来分量,直接从同步反事实回滚学习动作依赖效应,在物理环境实验中验证其可抑制无关变异、提升动作排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏