arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Dawn Song

AI / Security

至 收录 309
2410.06172 2025-04-24 cs.AI cs.CL

Multimodal Situational Safety

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Anderson Compalas, Dawn Song, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Berkeley(加州大学伯克利分校)

Comments ICLR 2025 Camera Ready

URL PDF HTML 收藏
2410.07369 2025-04-23 cs.CR cs.AI cs.LG cs.MM

An Undetectable Watermark for Generative Image Models

Sam Gunn, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

Comments ICLR 2025

URL PDF HTML 收藏
2410.21060 2025-04-22 cs.CR cs.AI cs.LG

CTINexus: Automatic Cyber Threat Intelligence Knowledge Graph Construction Using Large Language Models

Yutong Cheng, Osama Bajaber, Saimon Amanuel Tsegai, Dawn Song, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) UC Berkeley(加州大学伯克利分校)

Comments Accepted at 2025 IEEE European Symposium on Security and Privacy (Euro S&P)

URL PDF HTML 收藏
2504.09946 2025-04-21 cs.CY cs.CL

Assessing Judging Bias in Large Reasoning Models: An Empirical Study

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Xuandong Zhao, Wenxuan Zhang, Dawn Song, Bingsheng He

URL PDF HTML 收藏
2504.12691 2025-04-18 cs.CL

Why and How LLMs Hallucinate: Connecting the Dots with Subsequence Associations

Yiyou Sun, Yu Gai, Lijie Chen, Abhilasha Ravichander, Yejin Choi, Dawn Song

URL PDF HTML 收藏
2305.14046 2025-04-15 cs.CR

Enhancing Smart Contract Security Analysis with Execution Property Graphs

Kaihua Qin, Zhe Ye, Zhun Wang, Weilin Li, Liyi Zhou, Chao Zhang, Dawn Song, Arthur Gervais

URL PDF HTML 收藏
2412.05282 2025-04-10 cs.CY cs.AI

International Scientific Report on the Safety of Advanced AI (Interim Report)

Yoshua Bengio, Sören Mindermann, Daniel Privitera, Tamay Besiroglu, Rishi Bommasani, Stephen Casper, Yejin Choi, Danielle Goldfarb, Hoda Heidari, Leila Khalatbari, Shayne Longpre, Vasilios Mavroudis, Mantas Mazeika, Kwan Yee Ng, Chinasa T. Okolo, Deborah Raji, Theodora Skeadas, Florian Tramèr, Bayo Adekanmbi, Paul Christiano, David Dalrymple, Thomas G. Dietterich, Edward Felten, Pascale Fung, Pierre-Olivier Gourinchas, Nick Jennings, Andreas Krause, Percy Liang, Teresa Ludermir, Vidushi Marda, Helen Margetts, John A. McDermid, Arvind Narayanan, Alondra Nelson, Alice Oh, Gopal Ramchurn, Stuart Russell, Marietje Schaake, Dawn Song, Alvaro Soto, Lee Tiedrich, Gaël Varoquaux, Andrew Yao, Ya-Qin Zhang

Comments Available under the open government license at https://www.gov.uk/government/publications/international-scientific-report-on-the-safety-of-advanced-ai

URL PDF HTML 收藏
2503.16861 2025-03-26 cs.AI

In-House Evaluation Is Not Enough: Towards Robust Third-Party Flaw Disclosure for General-Purpose AI

Shayne Longpre, Kevin Klyman, Ruth E. Appel, Sayash Kapoor, Rishi Bommasani, Michelle Sahar, Sean McGregor, Avijit Ghosh, Borhane Blili-Hamelin, Nathan Butters, Alondra Nelson, Amit Elazari, Andrew Sellars, Casey John Ellis, Dane Sherrets, Dawn Song, Harley Geiger, Ilona Cohen, Lauren McIlvenny, Madhulika Srikumar, Mark M. Jaycox, Markus Anderljung, Nadine Farid Johnson, Nicholas Carlini, Nicolas Miailhe, Nik Marda, Peter Henderson, Rebecca S. Portnoff, Rebecca Weiss, Victoria Westerhoff, Yacine Jernite, Rumman Chowdhury, Percy Liang, Arvind Narayanan

URL PDF HTML 收藏
2503.14827 2025-03-20 cs.CL cs.AI cs.CR

MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models

Chejian Xu, Jiawei Zhang, Zhaorun Chen, Chulin Xie, Mintong Kang, Yujin Potter, Zhun Wang, Zhuowen Yuan, Alexander Xiong, Zidi Xiong, Chenhui Zhang, Lingzhi Yuan, Yi Zeng, Peiyang Xu, Chengquan Guo, Andy Zhou, Jeffrey Ziwei Tan, Xuandong Zhao, Francesco Pinto, Zhen Xiang, Yu Gai, Zinan Lin, Dan Hendrycks, Bo Li, Dawn Song

Comments ICLR 2025

URL PDF HTML 收藏
2412.07808 2025-03-11 cs.LG cs.AI

Boosting Alignment for Post-Unlearning Text-to-Image Generative Models

Myeongseob Ko, Henry Li, Zhun Wang, Jonathan Patsenker, Jiachen T. Wang, Qinbin Li, Ming Jin, Dawn Song, Ruoxi Jia

Comments The Thirty-Eighth Annual Conference on Neural Information Processing Systems

URL PDF HTML 收藏
2310.01405 2025-03-04 cs.LG cs.AI cs.CL cs.CV cs.CY

Representation Engineering: A Top-Down Approach to AI Transparency

Andy Zou, Long Phan, Sarah Chen, James Campbell, Phillip Guo, Richard Ren, Alexander Pan, Xuwang Yin, Mantas Mazeika, Ann-Kathrin Dombrowski, Shashwat Goel, Nathaniel Li, Michael J. Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, J. Zico Kolter, Dan Hendrycks

Comments Code is available at https://github.com/andyzoujm/representation-engineering

URL PDF HTML 收藏
2502.10673 2025-02-18 cs.CR cs.CL

Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs

Yepeng Liu, Xuandong Zhao, Dawn Song, Yuheng Bu

URL PDF HTML 收藏
2408.00761 2025-02-11 cs.LG cs.AI cs.CL

Tamper-Resistant Safeguards for Open-Weight LLMs

Rishub Tamirisa, Bhrugu Bharathi, Long Phan, Andy Zhou, Alice Gatti, Tarun Suresh, Maxwell Lin, Justin Wang, Rowan Wang, Ron Arel, Andy Zou, Dawn Song, Bo Li, Dan Hendrycks, Mantas Mazeika

Comments Website: https://www.tamper-resistant-safeguards.com

URL PDF HTML 收藏
2501.17805 2025-01-30 cs.CY cs.AI cs.LG

International AI Safety Report

Yoshua Bengio, Sören Mindermann, Daniel Privitera, Tamay Besiroglu, Rishi Bommasani, Stephen Casper, Yejin Choi, Philip Fox, Ben Garfinkel, Danielle Goldfarb, Hoda Heidari, Anson Ho, Sayash Kapoor, Leila Khalatbari, Shayne Longpre, Sam Manning, Vasilios Mavroudis, Mantas Mazeika, Julian Michael, Jessica Newman, Kwan Yee Ng, Chinasa T. Okolo, Deborah Raji, Girish Sastry, Elizabeth Seger, Theodora Skeadas, Tobin South, Emma Strubell, Florian Tramèr, Lucia Velasco, Nicole Wheeler, Daron Acemoglu, Olubayo Adekanmbi, David Dalrymple, Thomas G. Dietterich, Edward W. Felten, Pascale Fung, Pierre-Olivier Gourinchas, Fredrik Heintz, Geoffrey Hinton, Nick Jennings, Andreas Krause, Susan Leavy, Percy Liang, Teresa Ludermir, Vidushi Marda, Helen Margetts, John McDermid, Jane Munga, Arvind Narayanan, Alondra Nelson, Clara Neppel, Alice Oh, Gopal Ramchurn, Stuart Russell, Marietje Schaake, Bernhard Schölkopf, Dawn Song, Alvaro Soto, Lee Tiedrich, Gaël Varoquaux, Andrew Yao, Ya-Qin Zhang, Fahad Albalawi, Marwan Alserkal, Olubunmi Ajala, Guillaume Avrin, Christian Busch, André Carlos Ponce de Leon Ferreira de Carvalho, Bronwyn Fox, Amandeep Singh Gill, Ahmet Halit Hatip, Juha Heikkilä, Gill Jolly, Ziv Katzir, Hiroaki Kitano, Antonio Krüger, Chris Johnson, Saif M. Khan, Kyoung Mu Lee, Dominic Vincent Ligot, Oleksii Molchanovskyi, Andrea Monti, Nusu Mwamanzi, Mona Nemer, Nuria Oliver, José Ramón López Portillo, Balaraman Ravindran, Raquel Pezoa Rivera, Hammam Riza, Crystal Rugege, Ciarán Seoighe, Jerry Sheehan, Haroon Sheikh, Denise Wong, Yi Zeng

URL PDF HTML 收藏
2501.14784 2025-01-28 cs.DC cs.AI

DeServe: Towards Affordable Offline LLM Inference via Decentralization

Linyu Wu, Xiaoyuan Liu, Tianneng Shi, Zhe Ye, Dawn Song

URL PDF HTML 收藏
2405.00253 2025-01-22 cs.CL cs.SE

CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification

Yuchen Tian, Weixiang Yan, Qian Yang, Xuandong Zhao, Qian Chen, Wen Wang, Ziyang Luo, Lei Ma, Dawn Song

Comments Accepted by AAAI 2025 main conference

URL PDF HTML 收藏
2412.16075 2024-12-23 cs.AI cs.LG cs.LO

Formal Mathematical Reasoning: A New Frontier in AI

Kaiyu Yang, Gabriel Poesia, Jingxuan He, Wenda Li, Kristin Lauter, Swarat Chaudhuri, Dawn Song

URL PDF HTML 收藏
2412.09538 2024-12-13 cs.LG stat.ML

Capturing the Temporal Dependence of Training Data Influence

Jiachen T. Wang, Dawn Song, James Zou, Prateek Mittal, Ruoxi Jia

Comments Correspondence to Jiachen T. Wang and Ruoxi Jia

URL PDF HTML 收藏
2412.06219 2024-12-10 cs.CR cs.AI cs.CV

Data Free Backdoor Attacks

Bochuan Cao, Jinyuan Jia, Chuxuan Hu, Wenbo Guo, Zhen Xiang, Jinghui Chen, Bo Li, Dawn Song

Comments 24 pages, 8 figures, accepted by NeurIPS 2024

URL PDF HTML 收藏
2411.07781 2024-11-13 cs.SE cs.AI

RedCode: Risky Code Execution and Generation Benchmark for Code Agents

Chengquan Guo, Xun Liu, Chulin Xie, Andy Zhou, Yi Zeng, Zinan Lin, Dawn Song, Bo Li

Comments Accepted by NeurIPS 2024 Datasets and Benchmarks Track

URL PDF HTML 收藏
2410.24190 2024-11-12 cs.CL cs.CY

Hidden Persuaders: LLMs' Political Leaning and Their Influence on Voters

Yujin Potter, Shiyang Lai, Junsol Kim, James Evans, Dawn Song

Comments EMNLP 2024 Main

URL PDF HTML 收藏
2212.10388 2024-11-01 cs.CR cs.DB

ThreatKG: An AI-Powered System for Automated Open-Source Cyber Threat Intelligence Gathering and Management

Peng Gao, Xiaoyuan Liu, Edward Choi, Sibo Ma, Xinyu Yang, Dawn Song

Comments Accepted at Workshop on Large AI Systems and Models with Privacy and Safety Analysis (LAMPS), 2024

URL PDF HTML 收藏
2410.13095 2024-10-18 cs.SI cs.CE cs.CR cs.CY cs.HC

Future of Algorithmic Organization: Large-Scale Analysis of Decentralized Autonomous Organizations (DAOs)

Tanusree Sharma, Yujin Potter, Kornrapat Pongmala, Henry Wang, Andrew Miller, Dawn Song, Yang Wang

URL PDF HTML 收藏
2408.12787 2024-09-09 cs.CR cs.AI

LLM-PBE: Assessing Data Privacy in Large Language Models

Qinbin Li, Junyuan Hong, Chulin Xie, Jeffrey Tan, Rachel Xin, Junyi Hou, Xavier Yin, Zhun Wang, Dan Hendrycks, Zhangyang Wang, Bo Li, Bingsheng He, Dawn Song

URL PDF HTML 收藏
2310.03710 2024-08-15 cs.CL cs.AI cs.LG

Agent Instructs Large Language Models to be General Zero-Shot Reasoners

Nicholas Crispino, Kyle Montgomery, Fankun Zeng, Dawn Song, Chenguang Wang

Comments Accepted to ICML 2024

URL PDF HTML 收藏
2407.17436 2024-08-07 cs.CY cs.AI

AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies

Yi Zeng, Yu Yang, Andy Zhou, Jeffrey Ziwei Tan, Yuheng Tu, Yifan Mai, Kevin Klyman, Minzhou Pan, Ruoxi Jia, Dawn Song, Percy Liang, Bo Li

URL PDF HTML 收藏
2402.03181 2024-07-31 cs.AI cs.CL cs.IR

C-RAG: Certified Generation Risks for Retrieval-Augmented Language Models

Mintong Kang, Nezihe Merve Gürel, Ning Yu, Dawn Song, Bo Li

Comments Accepted to ICML 2024

URL PDF HTML 收藏
2403.13031 2024-07-25 cs.CR cs.AI cs.CL cs.LG

RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content

Zhuowen Yuan, Zidi Xiong, Yi Zeng, Ning Yu, Ruoxi Jia, Dawn Song, Bo Li

URL PDF HTML 收藏
2407.12784 2024-07-18 cs.LG cs.CR cs.IR

AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases

Zhaorun Chen, Zhen Xiang, Chaowei Xiao, Dawn Song, Bo Li

Comments 22 pages, 13 figures, 7 tables

URL PDF HTML 收藏
2407.04787 2024-07-09 cs.CL cs.AI cs.LG

Re-Tuning: Overcoming the Compositionality Limits of Large Language Models with Recursive Tuning

Eric Pasewark, Kyle Montgomery, Kefei Duan, Dawn Song, Chenguang Wang

Comments Accepted to ACL 2024

URL PDF HTML 收藏