arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-16 至 2025-10-16 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2510.13653 2025-10-16 cs.CY 88%

International AI Safety Report 2025: First Key Update: Capabilities and Risk Implications

Yoshua Bengio, Stephen Clare, Carina Prunkl, Shalaleh Rismani, Maksym Andriushchenko, Ben Bucknall, Philip Fox, Tiancheng Hu, Cameron Jones, Sam Manning, Nestor Maslej, Vasilios Mavroudis, Conor McGlynn, Malcolm Murray, Charlotte Stix, Lucia Velasco, Nicole Wheeler, Daniel Privitera, Sören Mindermann, Daron Acemoglu, Thomas G. Dietterich, Fredrik Heintz, Geoffrey Hinton, Nick Jennings, Susan Leavy, Teresa Ludermir, Vidushi Marda, Helen Margetts, John McDermid, Jane Munga, Arvind Narayanan, Alondra Nelson, Clara Neppel, Gopal Ramchurn, Stuart Russell, Marietje Schaake, Bernhard Schölkopf, Alavaro Soto, Lee Tiedrich, Gaël Varoquaux, Andrew Yao, Ya-Qin Zhang, Leandro Aguirre, Olubunmi Ajala, Fahad Albalawi Noora AlMalek, Christian Busch, André Carvalho, Jonathan Collas, Amandeep Gill, Ahmet Hatip, Juha Heikkilä, Chris Johnson, Gill Jolly, Ziv Katzir, Mary Kerema, Hiroaki Kitano, Antonio Krüger, Aoife McLysaght, Oleksii Molchanovskyi, Andrea Monti, Kyoung Mu Lee, Mona Nemer, Nuria Oliver, Raquel Pezoa, Audrey Plonk, José Portillo, Balaraman Ravindran, Hammam Riza, Crystal Rugege, Haroon Sheikh, Denise Wong, Yi Zeng, Liming Zhu

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13351 2025-10-16 cs.CL cs.AI 86%

Protect: Towards Robust Guardrailing Stack for Trustworthy Enterprise LLM Systems

Karthik Avinash, Nikhil Pareek, Rishav Hada

机构 * FutureAGI Inc.(未来人工智能公司)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09710 2025-10-16 cs.CL cs.AI 81%

SeCon-RAG: A Two-Stage Semantic Filtering and Conflict-Free Framework for Trustworthy RAG

Xiaonan Si, Meilin Zhu, Simeng Qin, Lijia Yu, Lijun Zhang, Shuaitong Liu, Xinfeng Li, Ranjie Duan, Yang Liu, Xiaojun Jia

机构 * Institute of Software Chinese Academy of Sciences Beijing China(中国科学院软件研究所) Key Laboratory of System Software (Chinese Academy of Sciences) and State Key Laboratory of Computer Science, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院系统软件重点实验室和计算机科学国家重点实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Northeast University China(东北大学) Institute of Ai For industries Nanjing China(人工智能产业研究院) Southwest University China(西南大学) Nanyang Technological University Singapore(新加坡南洋理工大学) Alibaba China(阿里巴巴(中国))

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17244 2025-10-16 cs.CL cs.AI 81%

ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models

Changyi Li, Jiayi Wang, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 75%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13804 2025-10-16 cs.CV cs.AI cs.CL 62%

Generative Universal Verifier as Multimodal Meta-Reasoner

Xinchen Zhang, Xiaoying Zhang, Youbin Wu, Yanbin Cao, Renrui Zhang, Ruihang Chu, Ling Yang, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13106 2025-10-16 cs.SE cs.AI cs.CL 62%

TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models

Ruoyu Sun, Da Song, Jiayang Song, Yuheng Huang, Lei Ma

机构 * University of Alberta(阿尔伯塔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) The University of Tokyo(东京大学) Macau University of Science and Technology(澳门科学技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 4 pages, 2 figures, To appear in ASE 2025 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07575 2025-10-16 cs.AI cs.LG 62%

Benchmarking is Broken -- Don't Let AI be its Own Judge

Zerui Cheng, Stella Wohnig, Ruchika Gupta, Samiul Alam, Tassallah Abdullahi, João Alves Ribeiro, Christian Nielsen-Garcia, Saif Mir, Siran Li, Jason Orender, Seyed Ali Bahrainian, Daniel Kirste, Aaron Gokaslan, Mikołaj Glinka, Carsten Eickhoff, Ruben Wolff

机构 * Princeton University(普林斯顿大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Michigan State University(密歇根州立大学) Ohio State University(俄亥俄州立大学) Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Los Angeles(加州大学洛杉矶分校) University of Tübingen(图宾根大学) Old Dominion University(旧 Dominion 大学) Technical University of Munich(慕尼黑技术大学) Cornell University(康奈尔大学) Forest AI(森林AI)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 14 pages; Accepted to NeurIPS 2025. Link to poster: https://neurips.cc/virtual/2025/poster/121919; Link to project website: https://www.peerbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02594 2025-10-16 cs.HC cs.AI cs.CL 62%

A Risk Taxonomy and Reflection Tool for Large Language Model Adoption in Public Health

Jiawei Zhou, Amy Z. Chen, Darshi Shah, Laura M. Schwab Reese, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12981 2025-10-16 cs.LG 57%

Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check

Sungjun Cho, Dasol Hwang, Frederic Sala, Sangheum Hwang, Kyunghyun Cho, Sungmin Cha

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LG AI Research(LG人工智能研究) Seoul National University of Science and Technology(首尔科学技术大学) New York University(纽约大学) Genentech(基因泰克)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12931 2025-10-16 cs.CV cs.CL 57%

Unifying Vision-Language Latents for Zero-label Image Caption Enhancement

Sanghyun Byun, Jung Ick Guack, Mohanad Odema, Baisub Lee, Jacob Song, Woo Seong Chung

机构 * LG Electronics USA(LG电子美国公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to PMLR and NeurIPS 2025 UniReps

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09558 2025-10-16 cs.CL 57%

AutoPR: Let's Automate Your Academic Promotion!

Qiguang Chen, Zheng Yan, Mingda Yang, Libo Qin, Yixin Yuan, Hanjing Li, Jinhao Liu, Yiyan Ji, Dengyun Peng, Jiannan Guan, Mengkang Hu, Yantao Du, Wanxiang Che

机构 * LARG Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学) The University of Hong Kong(香港大学) ByteDance China (Seed)(字节跳动中国(种子))

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Preprint. Code: https://github.com/LightChen233/AutoPR . Benchmark: https://huggingface.co/datasets/yzweak/PRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12995 2025-10-16 cs.CV 50%

Brought a Gun to a Knife Fight: Modern VFM Baselines Outgun Specialized Detectors on In-the-Wild AI Image Detection

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Jinhua Zeng, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU AFS Joint Innovation Center for AI Technology, Shenzhen University(深圳大学AFS人工智能技术联合创新中心) University of North Texas(北卡罗来纳州立大学) Academy of Forensic Science(法医科学研究院) Nanchang University(南昌大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16902 2025-10-16 cs.CV cs.RO 50%

RealEngine: Simulating Autonomous Driving in Realistic Context

Junzhe Jiang, Nan Song, Jingyu Li, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Surrey(萨里大学)

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏