arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 14 篇

2508.14904 2026-01-21 cs.CL cs.AI 88%

Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training

通过魔法令牌引导的协同训练实现LLM中的高效可切换安全控制

Jianfeng Si, Lin Sun, Zhewen Tan, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(北京奇元科技)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);DPO(abstract)

AI总结 本文提出通过魔法令牌引导的协同训练框架,实现LLM内容安全的高效可切换控制,提升安全性能并降低训练与部署成本。

Comments 15 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06147 2026-01-21 cs.AI cs.CL 88%

DeAL: Decoding-time Alignment for Large Language Models

DeAL:大型语言模型的解码时间对齐

James Y. Huang, Sailik Sengupta, Daniele Bonadiman, Yi-An Lai, Arshit Gupta, Nikolaos Pappas, Saab Mansour, Katrin Kirchhoff, Dan Roth

机构 * University of Southern California(南加州大学) Ω WS AI Labs(Ω WS AI实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

AI总结 DeAL通过允许用户自定义奖励函数和实现解码时间对齐,改进了大型语言模型对齐目标的实现。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06092 2026-01-21 cs.LG cs.CL 86%

Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL

从失败中学习:通过失败意识反向强化学习理解LLM对齐

Nyal Patel, Matthieu Bou, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(帝国理工学院伦敦分校) Amazon AGI(亚马逊人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种失败意识反向强化学习算法,通过聚焦于误分类或困难的例子来提取更准确的奖励函数,从而提升LLM对齐的可解释性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12758 2026-01-21 cs.CL cs.AI cs.LG 82%

VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

VISPA:通过自动价值选择和激活实现多元对齐

Shenyan Zheng, Jiayou Zhong, Anudeex Shetty, Heng Ji, Preslav Nakov, Usman Naseem

机构 * University of Waterloo(滑铁卢大学) University of Melbourne(墨尔本大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MBZUAI(马克斯·普朗克智能系统研究所) Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VISPA通过自动价值选择和激活实现多元对齐,适用于多种模型和场景,提供了一种可扩展的语言模型对齐方法。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11865 2026-01-21 cs.CL 70%

CTPD: Cross Tokenizer Preference Distillation

CTPD: 跨分词器偏好蒸馏

Truong Nguyen, Phi Van Dat, Ngan Nguyen, Linh Ngo Van, Trung Le, Thanh Hong Nguyen

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 CTPD提出一种跨分词器的偏好蒸馏框架,通过对齐跨度投影、跨分词器重要性采样和教师锚定参考,实现不同分词器模型间的偏好信息高效转移。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 62%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20156 2026-01-21 cs.CL cs.AI cs.SD eess.AS 62%

Fun-Audio-Chat Technical Report

Fun-Audio-Chat 技术报告

Tongyi Fun Team, Qian Chen, Luyao Cheng, Chong Deng, Xiangang Li, Jiaqing Liu, Chao-Hong Tan, Wen Wang, Junhao Xu, Jieping Ye, Qinglin Zhang, Qiquan Zhang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 Fun-Audio-Chat通过双分辨率语音表示和核心鸡尾酒训练,解决语音-文本模型的时间分辨率不匹配和灾难性遗忘问题,实现高效且高质量的音频理解与生成。

Comments Authors are listed in alphabetical order, 21 pages, open-source at https://github.com/FunAudioLLM/Fun-Audio-Chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09929 2026-01-21 eess.AS cs.AI cs.LG 62%

Aligning Generative Speech Enhancement with Perceptual Feedback

将生成式语音增强与感知反馈对齐

Haoyang Li, Nana Hou, Yuchen Hu, Jixun Yao, Sabato Marco Siniscalchi, Xuyi Zhuang, Deheng Ye, Wei Yang, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Independent Researcher(独立研究者) Northwestern Polytechnical University, China(西北工业大学) University of Palermo, Italy(巴勒莫大学) Tencent(腾讯)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于语言模型的语音增强方法,通过引入感知反馈和直接偏好优化,提升语音质量并建立新的感知对齐增强范式。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11579 2026-01-21 cs.CL cs.AI 62%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11722 2026-01-21 cs.CL cs.IR 57%

RAC: Retrieval-Augmented Clarification for Faithful Conversational Search

RAC:基于检索的澄清以实现可靠的对话搜索

Ahmed Rayane Kebir, Vincent Guigue, Lynda Said Lhadj, Laure Soulier

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎) Ecole nationale Supérieure d’Informatique (ESI), Algeria(信息技术国家高等学院(ESI)、阿尔及利亚) AgroParisTech, UMR MIA-PS, Palaiseau, France(农业巴黎技术学院、UMR MIA-PS、法国帕莱索)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RAC通过检索增强的方法生成基于语料库的澄清问题,提高对话搜索的准确性与可靠性。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 29 March--2 April, 2026, Delft, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24555 2026-01-21 cs.LG 57%

From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme

从感知到 punchline:通过野生表情包艺术赋能 VLM

Xueyan Li, Yingyi Xue, Mengjie Jiang, Qingzi Zhu, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Software Engineering(软件工程学院) Columbia Engineering(哥伦比亚工程学院) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。

Comments 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16466 2026-01-21 cs.AI 57%

ReviewSense: Transforming Customer Review Dynamics into Actionable Business Insights

ReviewSense:将客户评论动态转化为可操作的商业洞察

Siddhartha Krothapalli, Kartikey Singh Bhandari, Tridib Kumar Das, Praveen Kumar, Naveen Suravarpu, Pratik Narang

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 ReviewSense通过整合聚类、LLM适应和专家评估,将客户评论转化为可操作的商业建议,提升业务增长和客户忠诚度。

Comments 11 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13629 2026-01-21 eess.AS eess.SP 50%

S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

S$^2$Voice: 基于增强条件的风格感知自回归建模用于歌唱风格转换

Ziqian Wang, Xianjun Xia, Chuanzeng Huang, Lei Xie

专题命中 偏好对齐 :DPO(abstract)

AI总结 S$^2$Voice通过增强条件和自回归建模提升歌唱风格转换的风格控制和鲁棒性,实现更自然的音色相似性和更高的转换性能。

Comments accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13505 2026-01-21 cs.IR 50%

Integrating Vision-Centric Text Understanding for Conversational Recommender Systems

集成视觉导向的文本理解用于对话推荐系统

Wei Yuan, Shutong Qiao, Tong Chen, Quoc Viet Hung Nguyen, Zi Huang, Hongzhi Yin

专题命中 偏好对齐 :alignment(abstract)

AI总结 STARCRS通过集成视觉导向的文本理解和大语言模型文本路径,提升对话推荐系统的偏好建模和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏