arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 573 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 573 篇

2506.02255 2026-07-17 cs.LG 版本更新 57%

SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems

SafeOR-Gym:用于实际运筹学问题的安全强化学习算法的基准套件

Asha Ramanujam, Adam Elyoumi, Hao Chen, Sai Madhukiran Kompalli, Akshdeep Singh Ahluwalia, Shraman Pal, Dimitri J. Papageorgiou, Can Li

机构 * Davidson School of Chemical Engineering, Purdue University(普渡大学化学工程学院) Energy Sciences, ExxonMobil Technology and Engineering Company(埃克森美孚技术与工程公司能源科学部)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 针对现有安全强化学习基准与高风险领域相关性有限的问题,提出SafeOR-Gym基准套件,含九个运筹学环境,集成CMDP接口,评估多种算法,揭示性能差异,为安全强化学习研究提供实用测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21688 2026-07-16 cs.LO cs.LG 版本更新 57%

A-IC3: Learning-Guided Adaptive Inductive Generalization for Hardware Model Checking

A-IC3:用于硬件模型检查的学习引导自适应归纳泛化

Xiaofeng Zhou, Guangyu Hu, Hongce Zhang, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对IC3算法在硬件模型检查中归纳泛化策略固定的问题,提出基于机器学习的轻量级框架,利用多臂赌博机算法动态选择策略,经实验验证该方法能有效提升rIC3解决案例数量及PAR-2分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 57%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04365 2026-07-16 cs.LG 版本更新 57%

Survival Dynamics of Neural and Programmatic Policies in Evolutionary Reinforcement Learning

进化强化学习中神经策略与编程策略的生存动态

Anton Roupassov-Ruiz, Yiyang Zuo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究进化强化学习中神经策略与编程策略的生存动态,通过开源重新实现经典测试平台并进行严格生存分析,发现编程策略在生存性能上超越神经策略,如PERL比NERL平均多存活201.69步。

Comments Remove the Acknowledgement

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13467 2026-07-16 cs.LG 版本更新 57%

On the Sublinear Regret of Continuous K-Max Bandits

关于连续 K 最大多臂老虎机的次线性遗憾

Yu Chen, Siwei Wang, Longbo Huang, Wei Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Institute for Interdisciplinary Information Sciences(交叉信息院) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究连续K最大多臂老虎机问题,该问题在推荐等应用中出现,有离散化误差等困难。引入DCK - UCB算法,证明其实现了\(\widetilde{O}(T^{3/4})\)遗憾界,还针对特定情况提出MLE - Exp算法,为连续组合老虎机提供了算法解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 57%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27905 2026-07-14 cs.CL 版本更新 57%

AI Research Agents Narrow Scientific Exploration

AI研究代理缩小科学探索范围

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过四个AI研究代理框架和六个大语言模型生成37,802个科学想法,发现AI生成的想法比人类论文更集中、更接近起始文献,且与低引用论文相似,表明当前AI代理更适合局部细化而非拓宽科学探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07066 2026-07-14 cs.AI 版本更新 57%

2.5-D Decomposition for LLM-Based Spatial Construction

基于2.5-D分解的LLM空间构建

Paul Whitten, Li-Jen Chen, Sharath Baddam

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23242 2026-07-14 cs.AI 版本更新 57%

A Model-Free Universal AI

无模型通用人工智能

Yegon Kim, Juho Lee

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出首个在通用强化学习中证明渐近ε最优的无模型智能体AIQI,通过分布动作值函数的通用归纳实现,并扩展了Self-AIXI的渐近最优性证明。

Comments 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04277 2026-07-14 cs.RO cs.AI 版本更新 57%

VehAnchor: Metadata-Free Metric Scale Recovery from Vehicle Cues in Aerial Imagery

VANGUARD:用于GPS受限环境下的无人机车辆锚定地面采样距离估计

Yifei Chen, Chenqian Le, Jiayi Cheng, Xupeng Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Tandon School of Engineering, New York University(纽约大学工学院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 VANGUARD通过利用车辆锚点和核密度估计,为无人机在GPS受限环境中提供可靠地面采样距离估计,降低空间推理中的误差和失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03953 2026-07-14 cs.RO cs.AI cs.CV 版本更新 57%

RVN-Bench: A Benchmark for Reactive Visual Navigation

RVN-Bench: 一种用于反应式视觉导航的基准测试

Jaewon Lee, Jaeseok Heo, Gunmin Lee, Howoong Jun, Jeongwoo Oh, Songhwai Oh

机构 * Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI)(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)) Interdisciplinary Program in Artificial Intelligence, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(人工智能跨学科项目,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Sequor Robotics Inc.(Sequor机器人公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 RVN-Bench是一种针对室内移动机器人安全视觉导航的碰撞感知基准测试,通过高保真度场景和标准化工具,支持在线和离线学习,提升导航任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 57%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21431 2026-07-14 stat.ML cs.LG 版本更新 57%

Oracle-Efficient Combinatorial Semi-Bandits

神谕高效组合半带式赌博机

Jung-hun Kim, Milan Vojnović, Min-hwan Oh

机构 * CREST, ENSAE, IP Paris(CREST、ENSAE、IP巴黎) FairPlay joint team(FairPlay联合团队) London School of Economics(伦敦经济学院) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究组合半带式赌博机问题,提出神谕高效框架,减少神谕调用次数,在最坏情况线性奖励设置下,算法用较少神谕查询达低遗憾值,还有协方差自适应算法及扩展到非线性奖励,降低神谕使用时间并获理论保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08921 2026-07-14 cs.LG 版本更新 57%

Neural Active Learning Meets the Partial Monitoring Framework

神经主动学习与部分监测框架相遇

Maxime Heuillet, Ola Ahmad, Audrey Durand

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究在线主动学习设置,基于部分监测为OAL任务提出新基础,表明相关任务是部分监测实例,引入成本敏感型任务扩展潜力,提出NeuralCBP策略,实验显示其在多类OAL任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02871 2026-07-10 cs.AI 版本更新 57%

SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection

SimRPD:通过基于模拟器的数据评估和选择优化招聘主动对话代理

Zhiyong Cao, Dunqiang Liu, Qi Dai, Haojun Xu, Huai Yuen Khor, Hao Wang, Huan He, Yafei Liu, Ke Ma, Ruqian Shi, Sicheng Zhou, Sijia Yao

机构 * Zhaopin Limited(智聘有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation,Beijing Institute of Technology(北京理工大学自动化学院) Central University of Finance and Economics(中央财经大学) Beihang University(北航) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对招聘主动对话代理训练数据稀缺问题,提出SimRPD框架。通过高保真用户模拟器合成数据,基于意图链的评估框架选数据,在所选数据集上训练代理。实验证明该框架优于现有策略,有工业部署价值和其他场景适用性。

Comments Published in the ACL 2026 Industry Track. Oral presentation

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2026, pp. 1359-1377

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04203 2026-07-10 cs.LG cs.CV 版本更新 57%

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

计算、凝聚及其之间的不完备性:智能的耦合基础

Xin Li

机构 * Department of Computer Science, University at Albany, SUNY(计算机科学系,阿尔巴尼大学,SUNY)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究探讨计算理论与智能所回答问题的差异,指出智能需计算与记忆两个算子耦合,证明单独算子不完备,确定耦合代价是关键操作不可判定且有误差下限,认为耦合是普遍法则并给出其可证伪核心与范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02704 2026-07-10 cs.GT cs.LG 版本更新 57%

Calibrated Stackelberg Games: Learning Optimal Commitments Against Calibrated Agents

校准的斯塔克尔伯格博弈:学习针对校准代理的最优承诺

Nika Haghtalab, Chara Podimata, Kunhe Yang

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究校准斯塔克尔伯格博弈,将标准框架推广,其中代理依校准预测行动。虽信息减少,但委托人最优效用有界。针对校准挑战,开发新校准概念及算法,包括基于最佳响应区域的松弛,及代理自适应校准算法,助委托人更快收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21556 2026-07-09 cs.AI cs.GT 版本更新 57%

Power and Limitations of Aggregation in Compound AI Systems

复合人工智能系统中聚合的力量与局限性

Nivasini Ananthakrishnan, Meena Jagadeesan

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究复合人工智能系统中聚合的力量与局限性,在委托 - 代理框架内揭示可行性扩展等三种机制,证明其对引出能力扩展的作用,通过玩具任务实证说明结果,朝表征系统克服相关局限迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 57%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14271 2026-07-09 cs.AI 版本更新 57%

Neutral Substrates: A Design Constraint for Shared Records Under Persistent Interpretive Disagreement

中性基底:持续解释分歧下共享记录的设计约束

Denise M. Case

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在因果等解释有分歧时共享记录的中立性问题,提出中性基底概念,其基础层受限以保证中立性,借助具体化等机制,给出共享记录基础层可检查条件及相关假设与边界条件,确保问责又不偏向一方解释。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08630 2026-07-09 cs.AI cs.RO 版本更新 57%

Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control

上下文马尔可夫决策过程中用于通用形态控制的共享模块化递归

Laurens Engwegen, Max Weltevrede, Caroline Horsch, Daan Brinks, Wendelin Böhmer

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究旨在解决多机器人形态差异大时的控制难题,提出利用模块化交互恢复上下文特征,实现更好的多机器人控制及泛化。通过基于变压器且具共享模块化递归的架构在MuJoCo机器人上评估,显著提升了零样本泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 57%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09426 2026-07-07 cs.AI 版本更新 57%

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新 57%

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17673 2026-07-07 cs.CR cs.AI 版本更新 57%

Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation

在Linux提权中使用可验证奖励进行训练后的本地LLM代理

Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20203 2026-07-07 cs.AI 版本更新 57%

Shutdownable Agents through POST-Agency

通过后代理实现可关闭的智能体

Elliott Thornley

机构 * OpenAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19186 2026-07-07 cs.CL 版本更新 57%

When Users Are Happy but Agents Are Wrong: Multi-Dimensional Evaluation of Tool-Augmented Dialogue

当用户满意但智能体出错:工具增强对话的多维度评估

Tanya Shourya, Yingfan Wang, Zhaoyi Joey Hou, Shamik Roy, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah

机构 * AWS AI Labs(AWS人工智能实验室) University of Pittsburgh(匹兹堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对工具增强对话系统中用户满意但智能体错误的问题,提出TRACE基准,通过系统合成多样错误案例,评估现有框架发现性能远未理想。

Comments The Fifth Generation, Evaluation & Metrics Workshop (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 57%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 57%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏