Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
多样性越低,安全性越差:大规模语言模型测试时缩放的间接但广泛的风险
Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra
机构
*
Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)
;
University of South Florida, Tampa, Florida, USA(佛罗里达州塔帕斯大学)
;
University of California, Davis, California, USA(加州大学戴维斯分校)
Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures
面向大语言模型内在可解释性的探索:设计原则与架构的综述
Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan
机构
*
MOE Key Lab of Computational Linguistics, Peking University(计算语言学MOE实验室,北京大学)
;
Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
;
Nanjing University of Science and Technology(南京理工大学)
;
Purdue University(普渡大学)
From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
从P(y|x)到P(y):在预训练空间中研究强化学习
Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
National University of Singapore(新加坡国立大学)
;
Tencent AI Lab(腾讯AI实验室)
机构
*
Tsinghua University(清华大学)
;
ShanghaiTech University(上海交通大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Renmin University of China(中国人民大学)
Self-Improving Pretraining: using post-trained models to pretrain better models
自我改进预训练:利用后训练模型来预训练更好的模型
Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva
Comments20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全
Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen
机构
*
Southeast University(东南大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Zhejiang University of Technology(浙江工业大学)
;
Tsinghua University(清华大学)
;
RealAI
机构
*
School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院)
;
School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院)
;
Longwood Valley MedTech
Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research
机器去学习并不如你所想:生成式AI政策与研究的启示
A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee
机构
*
The GenLaw Center(GenLaw中心)
;
Microsoft Research(微软研究院)
;
Stanford University(斯坦福大学)
;
Google DeepMind(谷歌DeepMind)
;
Center for Democracy & Technology(民主与科技中心)
;
Princeton(普林斯顿)
;
Google(谷歌)
;
University of Washington(华盛顿大学)
;
University of Michigan(密歇根大学)
;
Cornell Tech(康奈尔科技)
;
Cornell Law School(康奈尔法学院)
;
Cornell University(康奈尔大学)
;
Lighthouse
;
Stanford Law School(斯坦福法学院)
;
UC Berkeley(伯克利大学)
;
Independent(独立研究者)
;
Northeastern University(东北大学)
;
Harvard Business School(哈佛商学院)
;
W. Virginia University College of Law(维珍尼亚大学法学院)