arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-30 至 2025-09-30 共收录 101 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 19 篇

2505.18126 2025-09-30 cs.LG cs.AI cs.CL 82%

Reward Model Overoptimisation in Iterated RLHF

Lorenz Wolf, Robert Kirk, Mirco Musolesi

机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) Department of Computer Science(计算机科学系) University College London(伦敦大学学院) UK AI Security Institute(英国人工智能安全研究所) Department of Computer Science and Engineering(计算机科学与工程系) University of Bologna(博洛尼亚大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 17 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12083 2025-09-30 cs.CV 82%

Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization

Pritam Sarkar, Ali Etemad

机构 * Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24713 2025-09-30 cs.LG cs.AI 81%

Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF

Jing Liu

机构 * ENS, Université PSL, EHESS, CNRS(高等科学研究所、巴黎国立大学、EHESS、国家科学研究中心)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23667 2025-09-30 cs.LG 79%

Why Alignment Must Precede Distillation: A Minimal Working Explanation

Sungmin Cha, Kyunghyun Cho

机构 * New York University(纽约大学) Genentech(基因泰克)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23024 2025-09-30 cs.LG cs.AI cs.CL 75%

Tracing the Representation Geometry of Language Models from Pretraining to Post-training

Melody Zixuan Li, Kumar Krishna Agrawal, Arna Ghosh, Komal Kumar Teru, Adam Santoro, Guillaume Lajoie, Blake A. Richards

机构 * Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所) UC Berkeley(加州大学伯克利分校) G o o g l e , Paradigms of Intelligence Team(谷歌,智能范式团队) Mathematics and Statistics, Université de Montréal(蒙特利尔大学数学与统计学系) Neurology & Neurosurgery and Montreal Neurological Institute, McGill University(神经病学与神经外科及蒙特利尔神经研究所,麦吉尔大学) CIFAR Learning in Machines & Brains Program(CIFAR 机器与大脑学习计划)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 33 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24491 2025-09-30 cs.CV cs.AI 70%

Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs

Yuanshuai Li, Yuping Yan, Junfeng Tang, Yunxuan Li, Zeqi Zheng, Yaochu Jin

机构 * School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院) School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13257 2025-09-30 cs.CL cs.AI cs.LG 67%

Is Active Persona Inference Necessary for Aligning Small Models to Personal Preferences?

Zilu Tang, Afra Feyza Akyürek, Ekin Akyürek, Derry Wijaya

机构 * Boston University(波士顿大学) MIT(麻省理工学院) Monash University Indonesia(墨尔本大学印度尼西亚分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, EMNLP PALS workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23601 2025-09-30 cs.CL cs.AI 62%

Semantic-guided Diverse Decoding for Large Language Model

Weijie Shi, Yue Cui, Yaguang Wu, Jingzhi Fang, Shibo Zhang, Mengze Li, Sirui Han, Jia Zhu, Jiajie Xu, Xiaofang Zhou

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23715 2025-09-30 cs.CL cs.LG 62%

Do LLMs Understand Romanian Driving Laws? A Study on Multimodal and Fine-Tuned Question Answering

Eduard Barbu, Adrian Marius Dumitran

机构 * Faculty of Mathematics and Informatics, University of Bucharest(数学与信息学系,布加勒斯特大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.LG

Comments Accepted@ CONSILR 2025 Bucharest Romania 9-10 October

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23368 2025-09-30 cs.CL cs.AI 62%

MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction

Xinchun Su, Chunxu Luo, Yixuan Li, Weidong Yang, Lipeng Ma

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15845 2025-09-30 cs.CL cs.AI 62%

Coarse-to-Fine Personalized LLM Impressions for Streamlined Radiology Reports

Chengbo Sun, Hui Yi Leong, Lei Li

机构 * University of Chicago(芝加哥大学) University of Washington(华盛顿大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24781 2025-09-30 cs.CL 57%

SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models

Jun Rao, Yunjie Liao, Xuebo Liu, Zepeng Lin, Lian Lian, Dong Jin, Shengjun Cheng, Jun Yu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(计算与智能学院,哈尔滨工业大学,深圳) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(智能科学与工程学院,哈尔滨工业大学,深圳)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24342 2025-09-30 cs.AI 57%

Fin-Ally: Pioneering the Development of an Advanced, Commonsense-Embedded Conversational AI for Money Matters

Sarmistha Das, Priya Mathur, Ishani Sharma, Sriparna Saha, Kitsuchart Pasupa, Alka Maurya

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(计算机科学与工程系,印度理工学院帕纳布分校) School of Information Technology, King Mongkut's Institute of Technology Ladkrabang, Thailand(信息科技学院,拉差班国王技术学院) CRISIL Limited, India(CRISIL有限公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23140 2025-09-30 cs.CL 57%

Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning

Song Jin, Juntian Zhang, Yong Liu, Xun Zhang, Yufei Zhang, Fei Jiang, Guojun Yin, Wei Lin, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Meituan(美团) Wuhan University(武汉大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22713 2025-09-30 cs.CL 57%

RAR$^2$: Retrieval-Augmented Medical Reasoning via Thought-Driven Retrieval

Kaishuai Xu, Wenjun Hou, Yi Cheng, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学) Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(可信自主系统研究院和计算机科学与工程系,南方科技大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19199 2025-09-30 cs.CL 57%

Agentic Reinforcement Learning with Implicit Step Rewards

Xiaoqian Liu, Ke Wang, Yuchuan Wu, Fei Huang, Yongbin Li, Junge Zhang, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab(通义实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09736 2025-09-30 cs.CV cs.AI 57%

Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation

Yuting Li, Lai Wei, Kaipeng Zheng, Jingyuan Huang, Guilin Li, Bo Wang, Linghe Kong, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Zhongguancun Academy(中关村学院) Tencent(腾讯) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Lehigh University(莱斯大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15963 2025-09-30 cs.CV cs.CL 57%

OViP: Online Vision-Language Preference Learning for VLM Hallucination

Shujun Liu, Siyuan Wang, Zejun Li, Jianxiang Wang, Cheng Zeng, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) ByteDance(字节跳动)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23082 2025-09-30 cs.CV 50%

Follow-Your-Preference: Towards Preference-Aligned Image Inpainting

Yutao Shen, Junkun Yuan, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract)

Comments 16 pages,9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2509.24269 2025-09-30 cs.AI cs.CL 90%

AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models

Zihao Zhu, Xinyu Wu, Gehan Hu, Siwei Lyu, Ke Xu, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State University of New York at Buffalo(纽约州立大学布法罗分校) Huawei International, Singapore(新加坡华为国际)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23614 2025-09-30 cs.AI 79%

PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents

Yaozu Wu, Jizhou Guo, Dongyuan Li, Henry Peng Zou, Wei-Chieh Huang, Yankai Chen, Zhen Wang, Weizhi Zhang, Yangning Li, Meng Zhang, Renhe Jiang, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2025-09-30 cs.CR 78%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

Haoran Li, Yulin Chen, Jingru Zeng, Hao Peng, Huihao Jing, Wenbin Hu, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 安全训练 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15339 2025-09-30 cs.CL cs.LG 62%

LionGuard 2: Building Lightweight, Data-Efficient & Localised Multilingual Content Moderators

Leanne Tan, Gabriel Chua, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15367 2025-09-30 cs.CV cs.AI cs.CL 62%

Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition

Dasol Choi, Seunghyun Lee, Youngsook Song

机构 * AIM Intelligence(AIM智能公司) Yonsei University(延世大学) Lablup Inc.(Lablup公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08753 2025-09-30 cs.CL 57%

Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling

Neil Zeghidour, Eugene Kharitonov, Manu Orsini, Václav Volhejn, Gabriel de Marmiesse, Edouard Grave, Patrick Pérez, Laurent Mazaré, Alexandre Défossez

机构 * Kyutai

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20563 2025-09-30 cs.AI 57%

Taking control: Policies to address extinction risks from advanced AI

Andrea Miotti

机构 * Control AI & Conjecture(Control AI与Conjecture)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 9 篇

2509.23037 2025-09-30 cs.LG 85%

GuardNet: Graph-Attention Filtering for Jailbreak Defense in Large Language Models

Javad Forough, Mohammad Maheri, Hamed Haddadi

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22732 2025-09-30 cs.CR cs.AI 85%

Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks

Haibo Tong, Dongcheng Zhao, Guobin Shen, Xiang He, Dachuan Lin, Feifei Zhao, Yi Zeng

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17739 2025-09-30 cs.LG cs.AI 84%

Speculative Safety-Aware Decoding

Xuekang Wang, Shengyu Zhu, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments Camera-ready version of EMNLP 2025 main conference. Code: https://github.com/k-k1w-w1x-x/Speculative-Safety-Aware-Decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02910 2025-09-30 cs.CV cs.AI 77%

ImgTrojan: Jailbreaking Vision-Language Models with ONE Image

Xijia Tao, Shuai Zhong, Lei Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏