arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Dawn Song

AI / Security

至 收录 13
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

URL PDF HTML 收藏
2608.04205 2026-08-06 cs.AI 新提交

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

MatrAIx:用83亿个 persona 智能体模拟世界

Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen, Shirley Huang, Yifan Liu, Xiaoyi Liu, Yilan Fan, Yijun Wang, Koutian Wu, Ruoqi Gao, Muhammad Ahmed Mohsin, Jing Tang, Brihi Joshi, Heming Liu, Zheyuan Deng, Zonglin Di, Sankalp Jajee, Jiuyao Lu, Zhiwei Zhang, Saksham Kapoor, Ishan Gupta, Yunhan Zhao, Chanwoo Park, Yucheng Lu, Bing Hu, Weihang Xiao, Aravind Mohan, Hanwen Xing, Runyu Zhang, Mihir Kulshreshtha, Yuanda Xu, Qianyu Zhu, Dianzhuo Wang, Yuxin Xiao, Bowen Jiang, Yongye Su, Wenhao Chai, Zuxin Liu, Lawrence Yunliang Chen, Xuandong Zhao, Ethan Ye, Shivam Patel, Jason Xie, Alex Martin Richmond, Weixiang Ding, Emre Okcular, Diya Mathew, Ziheng Wang, Rana M. Shahroz Khan, Zhejian Peng, Fang Wu, Fan Nie, Xinyang Han, Yubin Kim, Jiawei Zhang, Zhenting Qi, Huangyuan Su, Xu Pan, Abinitha Gourabathina, Hyewon Jeong, Hemanth Neelgund Ramesh, Kumail Alhamoud, Kimia Hamidieh, Zidi Xiong, Samuel Schmidgall, Pengrui Han, Yepeng Huang, Yongheng Wang, Bowen Yang, Alex Gu, Yuchu Wang, Akshay Paruchuri, Brenna Li, Hejie Cui, Jiayuan Ding, Chaosheng Dong, Jiahao Wang, Yixuan He, Chi Wang, Pamela Bhattacharya, Tianyi Peng, Paul Pu Liang, Mitchell Gordon, Yilun Du, Marinka Zitnik, James Zou, Prasanna Tambe, Philip Torr, Emily Fox, Asu Ozdaglar, Dawn Song

AI总结 MatrAIx是含83亿 persona 智能体的模拟用户评估基础设施,含Persona 8B、MatrAIx Playground及1010个多领域任务,经验证可高效评估AI系统与数字产品。

Comments Project website: https://matraix.ai

URL PDF HTML 收藏
2607.22024 2026-07-27 cs.CR cs.AI 新提交

Agent Security Needs Redefinition through a Holistic Framework

通过整体框架重新定义智能体安全需求

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

AI总结 研究指出智能体安全是上下文问题,当前基于内容的框架有误。通过源授权、任务对齐、行动对齐和数据隔离四个属性实施上下文安全,改变了防御连贯性、评估有效性及可识别的攻击模式。

Comments ICML 2026 Position Paper

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

URL PDF HTML 收藏
2607.05790 2026-07-08 cs.AI 新提交

Controlling Tool Use with Heading-Specific Activation Steering

通过特定标题激活控制工具使用

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

AI总结 研究工具增强大语言模型中工具使用决策的稳定内部表示,通过从标题锚点位置提取引导向量对工具调用行为进行双向因果控制,发现其因果有效性与线性结构不符,还区分了工具使用引导向量与参数化概念的引导向量,二者关系待解。

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

URL PDF HTML 收藏
2606.14027 2026-07-01 cs.CR cs.AI cs.CL cs.SY eess.SY 新提交

Same-Origin Policy for Agentic Browsers

代理浏览器的同源策略

Xilong Wang, Xiaoxing Chen, Patrick Li, Dawn Song, Neil Gong

机构 * Duke University(杜克大学) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 研究代理浏览器中同源策略的有效性,构建SOPBench评估基准,发现现有代理浏览器频繁违反SOP,并提出SOPGuard机制来强制执行SOP,同时保持效用和低开销。

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

URL PDF HTML 收藏
2606.21654 2026-06-23 cs.AI cs.CL 新提交

ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

ChainWorld: 从原子OSWorld任务组合成长时桌面工作负载

Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

机构 * Scale AI University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 提出ChainWorld,通过方向兼容性搜索将原子OSWorld任务组合成长时桌面工作负载,包含347条长度为2-4的任务链,评估四种智能体,最高完成率31%,揭示单轮与多轮评估的不同失败模式。

URL PDF HTML 收藏
2606.20881 2026-06-23 cs.AI 新提交

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

内在奖励何时对代码推理有效?一项全面研究

Xiaolong Jin, Xuandong Zhao, Wenbo Guo, Xiangyu Zhang, Dawn Song

机构 * Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 通过系统实验,发现基于确定性的内在奖励方法在代码生成中早期有效但最终导致模型崩溃,且作为RLVR预训练无显著优势,并给出实用建议。

Comments 18 pages, 45 figures

URL PDF HTML 收藏
2606.20008 2026-06-19 cs.LG 新提交

VIMPO: Value-Implicit Policy Optimization for LLMs

VIMPO: 值隐式策略优化用于大语言模型

Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

URL PDF HTML 收藏
2606.07818 2026-06-09 cs.CL cs.NE 新提交

Representational Similarity and Model Behavior in Multi-Agent Interaction

多智能体交互中的表征相似性与模型行为

Yujin Potter, Seun Eisape, Shiyang Lai, Alexander Huth, James Evans, Been Kim, Jacob Eisenstein, Dawn Song, Alane Suhr

机构 * University of Washington(华盛顿大学)

AI总结 研究LLM对间的表征相似性对合作与创新的影响,发现高相似性促进合作但降低新颖性,且早期层相似性关联最强。

Comments ICML 2026

URL PDF HTML 收藏