arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2607.08768 2026-07-10 cs.CL 新提交 57%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02871 2026-07-10 cs.AI 版本更新 57%

SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection

SimRPD:通过基于模拟器的数据评估和选择优化招聘主动对话代理

Zhiyong Cao, Dunqiang Liu, Qi Dai, Haojun Xu, Huai Yuen Khor, Hao Wang, Huan He, Yafei Liu, Ke Ma, Ruqian Shi, Sicheng Zhou, Sijia Yao

机构 * Zhaopin Limited(智聘有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation,Beijing Institute of Technology(北京理工大学自动化学院) Central University of Finance and Economics(中央财经大学) Beihang University(北航) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对招聘主动对话代理训练数据稀缺问题,提出SimRPD框架。通过高保真用户模拟器合成数据,基于意图链的评估框架选数据,在所选数据集上训练代理。实验证明该框架优于现有策略,有工业部署价值和其他场景适用性。

Comments Published in the ACL 2026 Industry Track. Oral presentation

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2026, pp. 1359-1377

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04203 2026-07-10 cs.LG cs.CV 版本更新 57%

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

计算、凝聚及其之间的不完备性:智能的耦合基础

Xin Li

机构 * Department of Computer Science, University at Albany, SUNY(计算机科学系,阿尔巴尼大学,SUNY)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究探讨计算理论与智能所回答问题的差异,指出智能需计算与记忆两个算子耦合,证明单独算子不完备,确定耦合代价是关键操作不可判定且有误差下限,认为耦合是普遍法则并给出其可证伪核心与范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02704 2026-07-10 cs.GT cs.LG 版本更新 57%

Calibrated Stackelberg Games: Learning Optimal Commitments Against Calibrated Agents

校准的斯塔克尔伯格博弈:学习针对校准代理的最优承诺

Nika Haghtalab, Chara Podimata, Kunhe Yang

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究校准斯塔克尔伯格博弈,将标准框架推广,其中代理依校准预测行动。虽信息减少,但委托人最优效用有界。针对校准挑战,开发新校准概念及算法,包括基于最佳响应区域的松弛,及代理自适应校准算法,助委托人更快收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07040 2026-07-09 cs.AI 新提交 57%

Measuring Intelligence Beyond Human Scale

超越人类水平的智能测量

Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan

机构 * Princeton(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究如何测量超越人类能力的智能,提出基于相对测量的新范式,模型生成公开挑战,汇总结果得对抗性心理测量评级系统,还描述实用协议,在不同领域实例化框架,实现对超越人类前沿系统的测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06121 2026-07-09 q-fin.TR cs.AI 新提交 57%

Can Reinforcement Learning Efficiently Discover Price Manipulation?

强化学习能否有效地发现价格操纵行为?

Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo

机构 * Scuola Normale Superiore(斯克沃尔纳正常大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究无模型强化学习智能体能否比传统基于模型方法更有效识别价格操纵机会,通过在单资产市场比较两种有限样本学习方法,发现中等波动率下强化学习表现良好,高波动率时都无法识别,低波动率时基于模型方法更优,凸显强化学习有效性及相关风险。

Comments 30 pages, 11 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21556 2026-07-09 cs.AI cs.GT 版本更新 57%

Power and Limitations of Aggregation in Compound AI Systems

复合人工智能系统中聚合的力量与局限性

Nivasini Ananthakrishnan, Meena Jagadeesan

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究复合人工智能系统中聚合的力量与局限性,在委托 - 代理框架内揭示可行性扩展等三种机制,证明其对引出能力扩展的作用,通过玩具任务实证说明结果,朝表征系统克服相关局限迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 57%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14271 2026-07-09 cs.AI 版本更新 57%

Neutral Substrates: A Design Constraint for Shared Records Under Persistent Interpretive Disagreement

中性基底:持续解释分歧下共享记录的设计约束

Denise M. Case

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在因果等解释有分歧时共享记录的中立性问题,提出中性基底概念,其基础层受限以保证中立性,借助具体化等机制,给出共享记录基础层可检查条件及相关假设与边界条件,确保问责又不偏向一方解释。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08630 2026-07-09 cs.AI cs.RO 版本更新 57%

Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control

上下文马尔可夫决策过程中用于通用形态控制的共享模块化递归

Laurens Engwegen, Max Weltevrede, Caroline Horsch, Daan Brinks, Wendelin Böhmer

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究旨在解决多机器人形态差异大时的控制难题,提出利用模块化交互恢复上下文特征,实现更好的多机器人控制及泛化。通过基于变压器且具共享模块化递归的架构在MuJoCo机器人上评估,显著提升了零样本泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 57%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 57%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05185 2026-07-07 cs.AI cs.SC 新提交 57%

ClassicLogic: A Knowledge-Driven Benchmark of Classic Puzzle Games for Evaluating Compositional Generalization

ClassicLogic:用于评估组合泛化能力的经典益智游戏知识驱动基准集

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有组合泛化基准缺乏复杂显式结构的问题,构建含4类经典逻辑谜题的新基准,可细粒度评估智能体从基础规则学习到多步组合推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 57%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04576 2026-07-07 cs.CL cs.CY cs.IR 新提交 57%

Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation

大语言模型维护的维基知识库的渐进式披露:一项预注册的对比研究

Theodore O. Cochran

机构 * AI for Altruism (A4A)(人工智能促进利他主义组织)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对大语言模型维护的维基知识库,通过预注册对比研究,改造知识库实现渐进式披露。虽原节省索引加载成本未实现,但答案质量达标且成本降低,源于更有针对性的访问。

Comments 14 pages, 2 figures, 6 tables. Preregistered on OSF (https://osf.io/feka7, DOI 10.17605/OSF.IO/FEKA7). Materials-availability and deviations described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交 57%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 57%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03501 2026-07-07 cs.DB cs.AI cs.MA 新提交 57%

STRATOS: Bridging the Symbolic-to-Numeric Gap in Spatio-Temporal Text-to-SQL for Meteorological Data

STRATOS:弥合气象数据时空文本到SQL中符号到数字的差距

Yi Zhang, Farhad Nooralahzadeh, Jonathan Fürst, Fabio Scherrer, Antonis Bezes, Vassiliki Kotroni, Kurt Stockinger

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对气象数据文本到SQL的问题,提出端到端框架STRATOS,通过解析自然语言解决模糊概念,重写复杂空间谓词,减少执行时间,并引入评估工作负载来测试系统。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02879 2026-07-07 cs.AI 新提交 57%

MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents

MedCalc-Pro:使用大语言模型智能体解决复杂医学计算问题

Siran Zhao, Ruihui Hou, Ziyue Huai, Chennuo Zhang, Tong Ruan

机构 * East China University of Science and Technology(华东理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对医学计算评估大语言模型的基准过于简化的问题,提出新基准MedCalc-Pro及更通用智能体框架,含多场景任务设置和真实病例,新框架性能最佳,为评估应用LLMs提供新基准和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 57%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 57%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21585 2026-07-07 cs.LG cs.IT math.DG math.IT math.ST stat.TH 新提交 57%

A Transport-Based Geometry of Belief-Cost

信念的成本几何:有限资源下含噪观测的推理

Laurent Caraffa

机构 * Université Gustave Eiffel, LASTIG, IGN-ENSG(古斯塔夫·埃菲尔大学,LASTIG,IGN-ENSG)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文引入信念空间的成本几何(Wasserstein最优传输经Fisher信息共形加权),证明确定性被观测和物理双重否定,并揭示三个不变结果:推理墙、诚实成本与刚性双曲几何,其中高斯分布为最极端位置-尺度信念。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20408 2026-07-07 cs.CR cs.AI 新提交 57%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09426 2026-07-07 cs.AI 版本更新 57%

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交 57%

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新 57%

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17673 2026-07-07 cs.CR cs.AI 版本更新 57%

Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation

在Linux提权中使用可验证奖励进行训练后的本地LLM代理

Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏