arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 131 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 14 篇

2508.14904 2026-01-21 cs.CL cs.AI 88%

Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training

通过魔法令牌引导的协同训练实现LLM中的高效可切换安全控制

Jianfeng Si, Lin Sun, Zhewen Tan, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(北京奇元科技)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);DPO(abstract)

AI总结 本文提出通过魔法令牌引导的协同训练框架,实现LLM内容安全的高效可切换控制,提升安全性能并降低训练与部署成本。

Comments 15 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06147 2026-01-21 cs.AI cs.CL 88%

DeAL: Decoding-time Alignment for Large Language Models

DeAL:大型语言模型的解码时间对齐

James Y. Huang, Sailik Sengupta, Daniele Bonadiman, Yi-An Lai, Arshit Gupta, Nikolaos Pappas, Saab Mansour, Katrin Kirchhoff, Dan Roth

机构 * University of Southern California(南加州大学) Ω WS AI Labs(Ω WS AI实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

AI总结 DeAL通过允许用户自定义奖励函数和实现解码时间对齐,改进了大型语言模型对齐目标的实现。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06092 2026-01-21 cs.LG cs.CL 86%

Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL

从失败中学习:通过失败意识反向强化学习理解LLM对齐

Nyal Patel, Matthieu Bou, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(帝国理工学院伦敦分校) Amazon AGI(亚马逊人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种失败意识反向强化学习算法,通过聚焦于误分类或困难的例子来提取更准确的奖励函数,从而提升LLM对齐的可解释性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12758 2026-01-21 cs.CL cs.AI cs.LG 82%

VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

VISPA:通过自动价值选择和激活实现多元对齐

Shenyan Zheng, Jiayou Zhong, Anudeex Shetty, Heng Ji, Preslav Nakov, Usman Naseem

机构 * University of Waterloo(滑铁卢大学) University of Melbourne(墨尔本大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MBZUAI(马克斯·普朗克智能系统研究所) Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VISPA通过自动价值选择和激活实现多元对齐,适用于多种模型和场景,提供了一种可扩展的语言模型对齐方法。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11865 2026-01-21 cs.CL 70%

CTPD: Cross Tokenizer Preference Distillation

CTPD: 跨分词器偏好蒸馏

Truong Nguyen, Phi Van Dat, Ngan Nguyen, Linh Ngo Van, Trung Le, Thanh Hong Nguyen

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 CTPD提出一种跨分词器的偏好蒸馏框架,通过对齐跨度投影、跨分词器重要性采样和教师锚定参考,实现不同分词器模型间的偏好信息高效转移。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 62%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20156 2026-01-21 cs.CL cs.AI cs.SD eess.AS 62%

Fun-Audio-Chat Technical Report

Fun-Audio-Chat 技术报告

Tongyi Fun Team, Qian Chen, Luyao Cheng, Chong Deng, Xiangang Li, Jiaqing Liu, Chao-Hong Tan, Wen Wang, Junhao Xu, Jieping Ye, Qinglin Zhang, Qiquan Zhang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 Fun-Audio-Chat通过双分辨率语音表示和核心鸡尾酒训练,解决语音-文本模型的时间分辨率不匹配和灾难性遗忘问题,实现高效且高质量的音频理解与生成。

Comments Authors are listed in alphabetical order, 21 pages, open-source at https://github.com/FunAudioLLM/Fun-Audio-Chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09929 2026-01-21 eess.AS cs.AI cs.LG 62%

Aligning Generative Speech Enhancement with Perceptual Feedback

将生成式语音增强与感知反馈对齐

Haoyang Li, Nana Hou, Yuchen Hu, Jixun Yao, Sabato Marco Siniscalchi, Xuyi Zhuang, Deheng Ye, Wei Yang, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Independent Researcher(独立研究者) Northwestern Polytechnical University, China(西北工业大学) University of Palermo, Italy(巴勒莫大学) Tencent(腾讯)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于语言模型的语音增强方法,通过引入感知反馈和直接偏好优化,提升语音质量并建立新的感知对齐增强范式。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11579 2026-01-21 cs.CL cs.AI 62%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11722 2026-01-21 cs.CL cs.IR 57%

RAC: Retrieval-Augmented Clarification for Faithful Conversational Search

RAC:基于检索的澄清以实现可靠的对话搜索

Ahmed Rayane Kebir, Vincent Guigue, Lynda Said Lhadj, Laure Soulier

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎) Ecole nationale Supérieure d’Informatique (ESI), Algeria(信息技术国家高等学院(ESI)、阿尔及利亚) AgroParisTech, UMR MIA-PS, Palaiseau, France(农业巴黎技术学院、UMR MIA-PS、法国帕莱索)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RAC通过检索增强的方法生成基于语料库的澄清问题,提高对话搜索的准确性与可靠性。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 29 March--2 April, 2026, Delft, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24555 2026-01-21 cs.LG 57%

From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme

从感知到 punchline:通过野生表情包艺术赋能 VLM

Xueyan Li, Yingyi Xue, Mengjie Jiang, Qingzi Zhu, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Software Engineering(软件工程学院) Columbia Engineering(哥伦比亚工程学院) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。

Comments 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16466 2026-01-21 cs.AI 57%

ReviewSense: Transforming Customer Review Dynamics into Actionable Business Insights

ReviewSense:将客户评论动态转化为可操作的商业洞察

Siddhartha Krothapalli, Kartikey Singh Bhandari, Tridib Kumar Das, Praveen Kumar, Naveen Suravarpu, Pratik Narang

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 ReviewSense通过整合聚类、LLM适应和专家评估,将客户评论转化为可操作的商业建议,提升业务增长和客户忠诚度。

Comments 11 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13629 2026-01-21 eess.AS eess.SP 50%

S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

S$^2$Voice: 基于增强条件的风格感知自回归建模用于歌唱风格转换

Ziqian Wang, Xianjun Xia, Chuanzeng Huang, Lei Xie

专题命中 偏好对齐 :DPO(abstract)

AI总结 S$^2$Voice通过增强条件和自回归建模提升歌唱风格转换的风格控制和鲁棒性,实现更自然的音色相似性和更高的转换性能。

Comments accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13505 2026-01-21 cs.IR 50%

Integrating Vision-Centric Text Understanding for Conversational Recommender Systems

集成视觉导向的文本理解用于对话推荐系统

Wei Yuan, Shutong Qiao, Tong Chen, Quoc Viet Hung Nguyen, Zi Huang, Hongzhi Yin

专题命中 偏好对齐 :alignment(abstract)

AI总结 STARCRS通过集成视觉导向的文本理解和大语言模型文本路径,提升对话推荐系统的偏好建模和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 16 篇

2509.16444 2026-01-21 cs.AI cs.LG 84%

Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots

领域特定的宪法AI:增强LLM驱动的心理健康聊天机器人安全性

Chenhan Lyu, Yutong Song, Pengfei Zhang, Amir M. Rahmani

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用领域特定心理健康原则的宪法AI训练方法,以提升心理健康聊天机器人在安全性和领域适应性方面的表现。

Comments Accepted to 2025 IEEE 21st International Conference on Body Sensor Networks (BSN)

Journal ref 2025 IEEE 21st International Conference on Body Sensor Networks (BSN), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11574 2026-01-21 cs.LG cs.AI 84%

GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment

GRADE: 用反向传播替代策略梯度以实现大语言模型对齐

Lukas Abrie Nel

机构 * Lotus Health AI(Lotus健康AI)

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GRADE通过可微松弛的离散令牌采样过程替代策略梯度,实现大语言模型对齐的更稳定和高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13589 2026-01-21 cs.AI cs.SD 79%

Motion-to-Response Content Generation via Multi-Agent AI System with Real-Time Safety Verification

基于多智能体AI系统的运动到响应内容生成及实时安全验证

HyeYoung Lee

机构 * Department of Artificial Intelligence(人工智能系) Korean University(韩国大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多智能体AI系统的实时内容生成方法,通过情感识别与安全验证代理,实现安全可控的响应内容生成,适用于儿童媒体和智能设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12616 2026-01-21 eess.SY cs.SY 78%

Allocating Corrective Control to Mitigate Multi-agent Safety Violations Under Private Preferences

为缓解多智能体安全违规分配纠正控制

Johnathan Corbin, Sarah H. Q. Li, Jonathan Rogers

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种基于隐私保护拍卖机制的多智能体安全纠正控制框架,通过规避信用机制实现高效安全纠正分配。

Comments 8 pages, 3 figures, Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23473 2026-01-21 cs.AI 70%

EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions

EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝

Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 EVOREFUSE通过进化算法生成多样化伪恶意指令,提升LLM对恶意指令的拒绝触发率并减少过度拒绝

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03994 2026-01-21 cs.LG 70%

Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

无需训练的策略违规检测:通过激活空间白化在大语言模型中

Oren Rachmil, Avishag Shapira, Roy Betser, Itay Gershon, Omer Hofman, Asaf Shabtai, Yuval Elovici, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究机构) Ben-Gurion University of the Negev(贝内杰尔大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的策略违规检测方法,通过激活空间白化技术在大语言模型中实现高效检测。

Comments Accepted to the AAAI 2026 Deployable AI (DAI) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12817 2026-01-21 econ.GN q-fin.EC 67%

Liability Sharing and Staffing in AI-Assisted Online Medical Consultation

人工智能辅助在线医疗咨询中的责任分担与人员配置

Yang Xiao

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文研究了人工智能辅助在线医疗咨询中责任分担与人员配置的交互作用,揭示了责任分担比例与拥堵成本对医生模式选择的影响,以及如何通过优化政策平衡风险转移与合规成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12754 2026-01-21 cs.HC cs.AI cs.CL cs.CY 67%

PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support

PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持

Jiwon Kim, Violeta J. Rodriguez, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14228 2026-01-21 cs.LG 57%

Attention-Based Offline Reinforcement Learning and Clustering for Interpretable Sepsis Treatment

基于注意力机制的离线强化学习与聚类用于可解释的脓毒症治疗

Punit Kumar, Vaibhav Saran, Divyesh Patel, Nitin Kulkarni, Alina Vereshchaka

机构 * Department of Computer Science(计算机科学系) Engineering University at Buffalo Buffalo, New York, USA(布法罗大学工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出基于注意力机制的离线强化学习与聚类方法,用于可解释的脓毒症治疗决策支持,通过多模块整合提升治疗准确性和可解释性。

Comments 8 pages, 6 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12822 2026-01-21 cs.AI 57%

MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction

MirrorGuard:通过模拟到现实推理校正实现安全的计算机使用代理

Wenqi Zhang, Yulin Shen, Changyue Jiang, Jiarun Dai, Geng Hong, Xudong Pan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 MirrorGuard通过模拟到现实推理校正提升计算机使用代理的安全性,有效降低系统风险并保持代理实用性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12126 2026-01-21 cs.AI 57%

UniMo: Unified Motion Generation and Understanding with Chain of Thought

UniMo: 基于推理链的统一运动生成与理解

Guocun Wang, Kenkun Liu, Jing Lin, Guorui Song, Jian Li, Xiaoguang Han

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12008 2026-01-21 cs.LG 57%

Extreme Value Policy Optimization for Safe Reinforcement Learning

极值政策优化用于安全强化学习

Shiqing Gao, Yihang Zhou, Shuai Shao, Haoyu Luo, Yiheng Bing, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出极值政策优化算法,通过极值理论建模和极值优先机制,有效减少约束违反并提升安全强化学习性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13057 2026-01-21 eess.SY cs.SY 50%

Convex Model Predictive Control for Safe Output Consensus of Nonlinear Multi-Agent Systems

凸优化模型预测控制用于非线性多智能体系统的安全输出一致性

Chao Wang, Shuyuan Zhang, Lei Wang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于SQP方案的凸模型预测控制方法,通过线性化和凸化非线性约束,有效降低计算复杂度,实现在非线性多智能体系统中的安全输出一致性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12672 2026-01-21 cs.CV 50%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 安全训练 :safety(abstract)

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12634 2026-01-21 cs.CR cs.SE 50%

The Cost of Convenience: Identifying, Analyzing, and Mitigating Predatory Loan Applications on Android

便利的代价:识别、分析和缓解Android上的掠夺性贷款申请

Olawale Amos Akanji, Manuel Egele, Gianluca Stringhini

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了Android上贷款应用的合规性问题,发现大量应用违反国家和谷歌政策,通过分析揭示敏感数据滥用,并建议加强隐私保护和技术保障。

Comments 15 pages, accepted at ACM ASIA CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11983 2026-01-21 cs.CV 50%

An AI-IoT Based Smart Wheelchair with Gesture-Controlled Mobility, Deep Learning-Based Obstacle Detection, Multi-Sensor Health Monitoring, and Emergency Alert System

基于AI-IoT的智能轮椅:具有手势控制移动、深度学习障碍检测、多传感器健康监测和紧急警报系统

Md. Asiful Islam, Abdul Hasib, Tousif Mahmud Emon, Khandaker Tabin Hasan, A. S. M. Ahsanul Sarkar Akib

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Military Institute of Science and Technology(军事科学与技术学院) University of Frontier Technology(前沿技术大学) American International University-Bangladesh(美国国际大学-孟加拉国) Robo Tech Valley(机器人技术谷)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于AI-IoT的智能轮椅系统,结合手势控制、深度学习障碍检测、多传感器健康监测和紧急警报,实现安全导航与健康监测的集成解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏