VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
VulnLLM-R:基于代理架构的专用推理LLM用于漏洞检测
Yuzhou Nie, Hongwei Li, Chengquan Guo, Ruizhe Jiang, Zhun Wang, Bo Li, Dawn Song, Wenbo Guo
机构
*
Department of Computer Science, University of California, Santa Barbara, CA, USA(加州大学圣芭芭拉分校计算机科学系)
;
Department of Computer Science, University of Chicago, Chicago, IL, USA(芝加哥大学计算机科学系)
;
Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系)
;
Department of Computer Science, University of Illinois Urbana-Champaign, Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
思维链可监控性:AI安全的新且脆弱的机会
Tomek Korbak, Mikita Balesni, Elizabeth Barnes, Yoshua Bengio, Joe Benton, Joseph Bloom, Mark Chen, Alan Cooney, Allan Dafoe, Anca Dragan, Scott Emmons, Owain Evans, David Farhi, Ryan Greenblatt, Dan Hendrycks, Marius Hobbhahn, Evan Hubinger, Geoffrey Irving, Erik Jenner, Daniel Kokotajlo, Victoria Krakovna, Shane Legg, David Lindner, David Luan, Aleksander Mądry, Julian Michael, Neel Nanda, Dave Orr, Jakub Pachocki, Ethan Perez, Mary Phuong, Fabien Roger, Joshua Saxe, Buck Shlegeris, Martín Soto, Eric Steinberger, Jasmine Wang, Wojciech Zaremba, Bowen Baker, Rohin Shah, Vlad Mikulik
机构
*
UK AI Security Institute(英国人工智能安全研究所)
;
Apollo Research(阿波罗研究)
;
METR
;
University of Montreal(蒙特利尔大学)
;
Mila
;
Anthropic
;
OpenAI(开放人工智能研究所)
;
Google DeepMind(谷歌DeepMind)
;
Truthful AI
;
UC Berkeley(伯克利大学)
;
Center for AI Safety(人工智能安全中心)
;
AI Futures Project(人工智能未来项目)
;
Amazon(亚马逊)
;
Scale AI
;
Magic
;
Meta
;
Redwood Research(红木研究)
CommentsThe paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)
LabOS: The AI-XR Co-Scientist That Sees and Works With Humans
LabOS:能够看见并与人类协作的AI-XR共科学家
Le Cong, David Smerkous, Xiaotong Wang, Di Yin, Zaixi Zhang, Ruofan Jin, Yinkai Wang, Michal Gerasimiuk, Ravi K. Dinesh, Alex Smerkous, Lihan Shi, Joy Zheng, Ian Lam, Xuekun Wu, Shilong Liu, Peishan Li, Yi Zhu, Ning Zhao, Meenal Parakh, Simran Serrao, Imran A. Mohammad, Chao-Yeh Chen, Xiufeng Xie, Tiffany Chen, David Weinstein, Greg Barbone, Belgin Caglar, John B. Sunwoo, Fuxin Li, Jia Deng, Joseph C. Wu, Sanfeng Wu, Mengdi Wang
CommentsA critical technical error was discovered during our internal review, leading to unreliable experimental results. The issue cannot be resolved, and the paper has also been formally withdrawn from AAAI 2026. We therefore request withdrawal of the arXiv version to maintain scientific accuracy