arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27288 2026-07-31 cs.CR 新提交 67%

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

开放安全基准:面向自主企业网络防御

Gal Engelberg, Michael Arenzon, Leon Goldberg

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 该研究针对自主企业网络防御智能体AI的环境数据缺口,提出Open Security Benchmark框架,通过冻结环境等设计实现端到端评估,还规划了框架的扩展方向。

Comments 14 pages, 3 tables. Code: https://github.com/OpenSecurityAI/osb ; datasets: https://huggingface.co/OpenSecurityAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26115 2026-07-30 cs.CR cs.AI cs.CL cs.LG 新提交 67%

GPT-Red: Automated Red Teaming via Self-Play at Scale

GPT-Red:基于大规模自博弈的自动化红队测试

Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出GPT-Red,一种基于大规模自博弈的自动化红队测试智能体,可发现新型提示注入攻击、攻破过往模型且泛化能力强,用于提升LLM鲁棒性并形成自我改进飞轮。

Comments 28 pages.13 main pages and 13 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 67%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20645 2026-07-24 cs.CL cs.AI cs.LG 新提交 67%

Frontier Financial Judgement: Can agents tell what might move a stock?

前沿金融判断:智能体能否判断哪些因素会推动股票走势?

Joshua Harris

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究引入前沿金融判断基准,结合多种文章创建评估项目,让智能体区分金融信息。最强智能体匹配率仅52.4%,智能体在误报率等方面有显著差异,且在多方面存在权衡,阻碍新闻流过滤在实践中的可靠部署。

Comments 19 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21533 2026-07-24 quant-ph 新提交 67%

Benchmarking Agents for Proving Theorems in Quantum Algorithms and Quantum Information

量子算法和量子信息定理证明智能体的基准测试

Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang

专题命中 Agent评测 :AI agent(abstract);agentic(abstract)

AI总结 研究人工智能智能体在量子算法和信息定理证明的能力,引入两个Lean 4基准测试,在通用框架下评估四个模型,发现LAD可提升性能,揭示智能体证明弱点及模型成本差异,为开发更优证明智能体提供基线。

Comments 22 pages, including appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16831 2026-07-21 cs.DC 新提交 67%

Technical Report: AI-Assisted Gated DeltaNet Optimization on NVIDIA Blackwell

技术报告:NVIDIA Blackwell上的人工智能辅助门控DeltaNet优化

Hyunjun Shin, Jiseung Jang, Jaewoo Maeng, Hyunjun Kim

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 研究以MSInfer团队提交给MLSys 2026 FlashInfer竞赛的作品为例,探讨人工智能辅助GPU编程。该作品优化门控DeltaNet解码和预填充,在NVIDIA B200/Blackwell上实现1.58倍加速,揭示竞赛级优化需考虑多方面,将其视为端到端系统问题。

Comments 10 pages, 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16215 2026-07-21 cs.AI cs.CL cs.SE 新提交 67%

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

RAIL Guard:弥合大语言模型智能体负责任人工智能中评估与修复的差距

Sumit Verma, Pritam Prasun, Pritish Kumar

机构 * Responsible AI Labs(负责任人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对大语言模型智能体评估与修复差距问题,提出RAIL Guard闭环负责任人工智能管道,在多维度评估输出并迭代修复。实验表明其闭环修复收敛率高,能减少不安全执行,还区分了可修复与结构维度问题,系统开源。

Comments 15 pages, 10 figures, 4 tables. Code: https://github.com/Responsible-AI-Labs/rail-score-sdk (Python). Benchmark: https://huggingface.co/datasets/responsible-ai-labs/rail-guard-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13465 2026-07-16 cs.CL cs.AI cs.HC cs.MA cs.SE 新提交 67%

DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

DevicesWorld:异构环境中跨设备智能体的基准测试

Huatao Li, Xinwei Geng, Yuheng Wang, Yutong Li, Runde Yang, Hantao Chen, Shu Yao, Jingru Fan, Xuhui Ren, Yuanyuan Zhao, Fei Huang, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Honor Device Co., Ltd(荣耀终端有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对智能体跨设备协同操作难评估的问题,引入DevicesWorld基准测试,整合多类设备环境及众多任务,通过固定评估集评估五个前沿智能体系统,发现成功率低,为可靠跨设备智能体研究提供了可执行、可重现及有诊断作用的评估。

Comments https://github.com/AgenticOrgLab/DevicesWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13190 2026-07-16 physics.ed-ph 新提交 67%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11632 2026-07-14 cs.AI cs.CL cs.LG cs.SI physics.soc-ph 新提交 67%

Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling

使用大语言模型在路径选择中重现人类偏差:迈向可扩展的行为建模

Jiangtao Han, Shoufeng Ma, Shuxian Xu, Geng Li, Shuai Ling, Ning Jia, Zhengbing He

机构 * Laboratory of Computation and Analytics of Complex Management Systems (CACMS), Tianjin University, China(复杂管理系统的计算与分析实验室,天津大学,中国) College of Management and Economics, Tianjin University, China(管理与经济学院,天津大学,中国) Faculty of Science and Engineering, University of Nottingham Ningbo China(科学与工程学院,诺丁汉大学宁波校区,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究探讨大语言模型能否在不明确前景理论参数时重现人类路径选择行为偏差,设计行为评估框架并比较,发现其能重现偏差及展现相关决策行为,为人类决策建模及相关研究提供可扩展替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 67%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04542 2026-07-07 cs.LG cs.AI cs.SE 新提交 67%

Auto: The AGI Compiler

自动:通用人工智能编译器

Jaber Jaber, Osama Jaber

机构 * RightNow AI(即时人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。

Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交 67%

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31213 2026-07-01 cs.CL cs.AI cs.LG 新提交 67%

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

LLMs能否想象超越二元困境的道德替代方案?

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park

机构 * Korea University(高丽大学) XenoStep AI Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对LLMs在道德困境中缺乏替代方案想象能力的问题,提出MoralAltDataset数据集,通过引入妥协和重构替代方案,发现LLMs倾向于选择替代方案,且生成的替代方案在质量和伦理标准上优于人类。

Comments "23 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28277 2026-06-29 cs.LG cs.AI cs.CL cs.CY 新提交 67%

Towards Automating Scientific Review with Google's Paper Assistant Tool

迈向自动化科学评审:谷歌论文助手工具

Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad

机构 * Google Research USA(谷歌美国研究)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出四层AI-人类协作分类法,并介绍论文助手工具(PAT),通过推理缩放技术实现深度科学评审,在SPOT基准上数学错误召回率提升34%,并在STOC和ICML会议中成功识别关键错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23127 2026-06-23 cs.AI cs.CL cs.SE 新提交 67%

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

管理LLM智能体中的程序性记忆:控制、适应与评估

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出AFTER基准(382个企业任务,22种程序性技能),评估技能在任务、角色和模型间的迁移,实验表明程序性记忆可提升3.7-6.7点性能,跨模型准确率达73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 67%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 Agent评测 :agent(abstract);tool use(abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16849 2026-06-18 cs.NE cs.GR cs.HC 新提交 67%

Evolution & Foundation: AI Shares Creative Control

进化与基础模型:AI共享创意控制

Dylan Banarse, Stephen Todd, William Latham, Frederic Fol Leymarie

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17229 2026-06-17 cs.LG cs.AI cs.CL 新提交 67%

Rift: A Conflict Signature for Deception in Language Models

Rift: 语言模型中欺骗行为的冲突特征

Petr Nyoma

机构 * Harmonic Labs

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过对比知情欺骗与无知错误,发现欺骗性前向传递具有高残差秩的冲突特征,能以100%准确率无标签识别谎言,并跨模型、语言和架构迁移。

Comments 13 pages, 4 figures. Code and experiment logs: https://github.com/Omibranch/Rift

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16903 2026-06-16 cs.DB 新提交 67%

Directory-Aware Query and Maintenance in Vector Databases

向量数据库中的目录感知查询与维护

Mengzhao Wang, Zheng Gong, Jingpei Hu, Jiajie Fu, Maojia Sheng, Junwen Chen, Yifan Zhu

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 针对向量数据库缺乏层次目录语义的问题,提出目录语义查询(DSQ)和目录语义维护(DSM)算子,并评估三种实现策略,其中基于Trie的层次索引(TrieHI)通过树遍历实现高效递归检索并降低维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13474 2026-06-12 cs.CY 新提交 67%

Exploring Systems-Thinking Approaches to Loss of Control Risk

探索系统思维方法应对失控风险

Aurelio Carlucci, Sean P. Fillingham, James Walpole, Jakub Kryś

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文运用STECA、STPA和FRAM三种系统安全方法分析前沿实验室编码智能体场景,发现模型级评估可能遗漏治理责任、反馈回路和操作变异等风险,主张将模型评估与系统级危害分析和操作保证相结合。

Comments Accepted to the Technical AI Governance Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 67%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09748 2026-06-09 cs.AI cs.CL cs.LG 新提交 67%

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

深度研究智能体在过程级反馈下的多轮评估

Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

机构 * Google DeepMind(谷歌DeepMind) OpenAI Perplexity AI LangChain AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对深度研究智能体(DRA)在单轮输出评估的不足,提出研究缺口推断(RGI)方法提供过程级反馈,发现单轮过程反馈可提升8-15分,但多轮改进因回归问题难以持续。

Comments Published as a workshop paper at SCALE - ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08481 2026-06-09 cs.LG cs.AI cs.DB cs.SE 新提交 67%

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

PIPE-Cypher:面向文本到Cypher系统的自动企业基准生成

Suraj Ranganath, Anish Raghavendra

机构 * Halıcıoğlu School of Data Science and Computing, University of California, San Diego(加利福尼亚大学圣迭戈分校哈勒乔卢数据科学与计算学院) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出PIPE-Cypher流水线,利用本地大模型从企业属性图自动生成平衡的NL-to-Cypher基准,通过模式分析、逆向查询约束生成和执行验证等步骤,实现可重复的基准构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06741 2026-06-08 cs.AI cs.CL cs.LG 新提交 67%

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill: 面向LLM智能体的开放世界自我进化

Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

机构 * Lehigh University(莱维大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Salesforce AI Research(Salesforce人工智能研究) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。

Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19449 2026-07-23 cs.LG cs.AI cs.CR 新提交 66%

Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents

作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为

Aarushi Singh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)

AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。

Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏