arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-22 至 2025-09-22 共收录 45 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2310.08164 2025-09-22 cs.LG 70%

Interpreting Learned Feedback Patterns in Large Language Models

Luke Marks, Amir Abdullah, Clement Neo, Rauno Arike, David Krueger, Philip Torr, Fazl Barez

机构 * Luke Marks Amir Abdullah Clement Neo Rauno Arike David Krueger Philip Torr Fazl Barez

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.LG

Comments 19 pages, 8 figures. Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14442 2025-09-22 cs.CL cs.AI 62%

Creative Preference Optimization

Mete Ismayilzada, Antonio Laverghetta, Simone A. Luchini, Reet Patel, Antoine Bosselut, Lonneke van der Plas, Roger Beaty

机构 * EPFL(苏黎世联邦理工学院) Università della Svizzera Italiana(瑞士联邦理工学院) Wesleyan University(韦斯利安大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12123 2025-09-22 cs.CL cs.AI 62%

MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling

Zhaopeng Feng, Jiahan Ren, Jiayuan Su, Jiamei Zheng, Hongwei Wang, Zuozhu Liu

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings. Project page:https://sabijun.github.io/MT_RewardTreePage

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11006 2025-09-22 cs.LG cs.CL 62%

Entropy-Regularized Process Reward Model

Hanning Zhang, Pengcheng Wang, Shizhe Diao, Yong Lin, Rui Pan, Hanze Dong, Dylan Zhang, Pavlo Molchanov, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) NVIDIA(英伟达) Princeton University(普林斯顿大学) Salesforce Research(Salesforce研究)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments Upate TMLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07570 2025-09-22 cs.CV cs.AI 57%

OptiScene: LLM-driven Indoor Scene Layout Generation via Scaled Human-aligned Data Synthesis and Multi-Stage Preference Optimization

Yixuan Yang, Zhen Luo, Tongsheng Ding, Junru Lu, Mingqi Gao, Jinyu Yang, Victor Sanchez, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Shanghai Innovation Institute(上海创新研究院) University of Warwick(沃林顿大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16127 2025-09-22 cs.CV 50%

BaseReward: A Strong Baseline for Multimodal Reward Model

Yi-Fan Zhang, Haihua Yang, Huanyu Zhang, Yang Shi, Zezhou Chen, Haochen Tian, Chaoyou Fu, Haotian Wang, Kai Wu, Bo Cui, Xu Wang, Jianfei Pan, Haotian Wang, Zhang Zhang, Liang Wang

机构 * ByteDance(字节跳动) CASIA(中国科学院自动化研究所) NJU(南京大学) PKU(北京大学) THU(清华大学)

专题命中 偏好对齐 :RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2409.20016 2025-09-22 cs.AI cs.LG 81%

Dynamic Policy Fusion for User Alignment Without Re-Interaction

Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu Rana

机构 * A2I2 Deakin University(德肯大学) School of IT(信息学院)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15491 2025-09-22 cs.RO cs.AI cs.SY eess.SY 70%

Explainable AI-Enhanced Supervisory Control for Robust Multi-Agent Robotic Systems

Reza Pirayeshshirazinezhad, Nima Fathi

机构 * Visual Computing and Computational Media, Texas A&M University(视觉计算与计算媒体,德克萨斯A&M大学) Mechanical Engineering Department, Texas A&M University(机械工程系,德克萨斯A&M大学) Department of Marine Engineering Technology, Texas A&M University(海洋工程技术系,德克萨斯A&M大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04429 2025-09-22 cs.AI 70%

Activation Space Interventions Can Be Transferred Between Large Language Models

Narmeen Oozeer, Dhruv Nathawani, Nirmalendu Prakash, Michael Lan, Abir Harrasse, Amirali Abdullah

机构 * Nvidia Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 75 pages. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15157 2025-09-22 cs.LG cs.CL 62%

Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning

Shiwan Zhao, Xuyang Zhao, Jiaming Zhou, Aobo Kong, Qicheng Li, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16088 2025-09-22 cs.LG 57%

Randomized Smoothing Meets Vision-Language Models

Emmanouil Seferis, Changshun Wu, Stefanos Kollias, Saddek Bensalem, Chih-Hong Cheng

机构 * National Technical University of Athens(希腊雅典国家技术大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CSX-AI(CSX-AI公司) Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全训练 :jailbreak(abstract);分类 cs.LG

Comments EMNLP'25 full version, including appendix (proofs, additional experiments)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04794 2025-09-22 cs.RO 50%

Runtime Learning of Quadruped Robots in Wild Environments

Yihao Cai, Yanbing Mao, Lui Sha, Hongpeng Cao, Marco Caccamo

机构 * Engineering Technology Division, Wayne State University(韦恩州立大学工程技术系) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) School of Engineering and Design, Technical University of Munich(慕尼黑技术大学工程与设计学院) School of Electrical Engineering and Computer Science, Washington State University(华盛顿州立大学电气与计算机科学学院)

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2509.16060 2025-09-22 cs.LG cs.CL 90%

SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection

Maithili Joshi, Palash Nandi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted in EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09466 2025-09-22 cs.CR cs.CL 85%

AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender

Weixiang Zhao, Jiahe Guo, Yulin Hu, Yang Deng, An Zhang, Xingyu Sui, Xinyang Han, Yanyan Zhao, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理大学) National University of Singapore(国立新加坡大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

Comments 19 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15739 2025-09-22 cs.CL 57%

Can LLMs Judge Debates? Evaluating Non-Linear Reasoning via Argumentation Theory Semantics

Reza Sanayei, Srdjan Vesic, Eduardo Blanco, Mihai Surdeanu

机构 * Department of Computer Science, University of Arizona(亚利桑那大学计算机科学系) CRIL CNRS & University of Artois(CNRS CRIL与阿维尼昂大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2509.15775 2025-09-22 cs.SD eess.AS 67%

EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model

Yiqing Yang, Man-Wai Mak

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2507.14067 2025-09-22 cs.CV cs.AI 79%

VLA-Mark: A cross modal watermark for large vision-language alignment model

Shuliang Liu, Qi Zheng, Jesse Jiaxi Xu, Yibo Yan, Junyan Zhang, He Geng, Aiwei Liu, Peijie Jiang, Jia Liu, Yik-Cheung Tam, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) University of Toronto(多伦多大学) Ant Group, Alibaba(蚂蚁集团,阿里巴巴) New York University Shanghai(纽约大学上海分校)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI

Comments Accepted by the main conference, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 9 篇

2509.15932 2025-09-22 cs.LG cs.AI cs.IT math.IT stat.ML 81%

The Alignment Bottleneck

Wenjun Cao

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15541 2025-09-22 cs.AI 79%

Stress Testing Deliberative Alignment for Anti-Scheming Training

Bronson Schoen, Evgenia Nitishinskaya, Mikita Balesni, Axel Højmark, Felix Hofstätter, Jérémy Scheurer, Alexander Meinke, Jason Wolfe, Teun van der Weij, Alex Lloyd, Nicholas Goldowsky-Dill, Angela Fan, Andrei Matveiakin, Rusheb Shah, Marcus Williams, Amelia Glaese, Boaz Barak, Wojciech Zaremba, Marius Hobbhahn

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17764 2025-09-22 cs.CL cs.AI math.ST stat.TH 76%

BBScoreV2: Learning Time-Evolution and Latent Alignment from Stochastic Representation

Tianhao Zhang, Zhecheng Sheng, Zhexiao Lin, Chen Jiang, Dongyeop Kang

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16188 2025-09-22 cs.CL cs.AI 62%

CultureScope: A Dimensional Lens for Probing Cultural Understanding in LLMs

Jinghao Zhang, Sihang Jiang, Shiwei Guo, Shisong Chen, Yanghua Xiao, Hongwei Feng, Jiaqing Liang, Minggui HE, Shimin Tao, Hongxia Ma

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09871 2025-09-22 cs.CL cs.AI 62%

Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case

Bastián González-Bustamante, Nando Verelst, Carla Cisternas

机构 * Universidad Diego Portales(迪亚戈·波特莱斯大学) Leiden University(莱顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Working paper: 18 pages, 4 tables, 2 figures

Journal ref Empiria Lab Method Series (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13759 2025-09-22 cs.LG cs.AI 62%

Discrete Diffusion in Large Language and Multimodal Models: A Survey

Runpeng Yu, Qi Li, Xinchao Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13951 2025-09-22 cs.CL cs.AI 62%

A Layered Multi-Expert Framework for Long-Context Mental Health Assessments

Jinwen Tang, Qiming Guo, Wenbo Sun, Yi Shang

机构 * Texas A\&M University-Corpus Christi(德克萨斯A&M大学-科珀斯克里斯蒂) Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Journal ref Proc. 2025 IEEE Conference on Artificial Intelligence (CAI), Santa Clara, CA, USA, 2025, pp. 435-440

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15239 2025-09-22 cs.CL 57%

WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai

Peerat Limkonchotiwat, Pume Tuchinda, Lalita Lowphansirikul, Surapon Nonesung, Panuthep Tasawong, Alham Fikri Aji, Can Udomcharoenchaikit, Sarana Nutanong

机构 * AI Singapore(AI新加坡) VISTEC MBZUAI

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main). Model and Dataset: https://huggingface.co/collections/airesearch/wangchan-thai-instruction-6835722a30b98e01598984fd

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15432 2025-09-22 cs.IR 50%

SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates

专题命中 安全评测 :alignment(abstract)

Comments Accepted

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 3 篇

2509.16151 2025-09-22 cs.LG cs.CR 57%

Automated Cyber Defense with Generalizable Graph-based Reinforcement Learning Agents

Isaiah J. King, Benjamin Bowman, H. Howie Huang

机构 * Cybermonic LLC(Cybermonic公司) The George Washington University(乔治华盛顿大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15803 2025-09-22 cs.CV cs.AI 57%

CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models

Fangjian Shen, Zifeng Liang, Chao Wang, Wushao Wen

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangzhou, China(工程学院,中山大学,广州,中国)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments 5 pages, 7 figures, submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12566 2025-09-22 cs.AI 57%

Exploring the Impact of Personality Traits on LLM Bias and Toxicity

Shuo Wang, Renhao Li, Xi Chen, Yulin Yuan, Derek F. Wong, Min Yang

机构 * University of Macau(澳门大学) Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院) Nanyang Technological University(南洋理工大学) Department of Chinese Language and Literature, University of Macau(中文语言文学系,澳门大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 16 篇

2503.12613 2025-09-22 cs.HC cs.AI cs.CY cs.MA 81%

Negotiative Alignment: Embracing Disagreement to Achieve Fairer Outcomes -- Insights from Urban Studies

Rashid Mushkani, Hugo Berard, Shin Koseki

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.CY

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏