arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2602.13867 2026-02-17 cs.CL 88%

Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages

弥合多语言安全鸿沟:为全球南方语言实现高效、文化感知的对齐

Somnath Banerjee, Rima Hazra, Animesh Mukherjee

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本文提出为全球南方低资源语言提供高效、文化感知的安全对齐方法,以解决现有安全机制在多语言环境中的失效问题。

Comments Accepted to the EGSAI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13415 2026-02-17 cs.LG 83%

MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection

MAVIS: 通过推理时值引导选择实现多目标对齐

Jeremy Carleton, Debajoy Mukherjee, Srinivas Shakkottai, Dileep Kalathil

机构 * Department of Electrical and Computer Engineering, Texas A\&M University, College Station, Texas, USA(电气与计算机工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 MAVIS通过推理时值引导选择实现多目标对齐,通过训练小价值模型动态调整LLM输出,提升多目标平衡性能。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14560 2026-02-17 cs.LG cs.AI cs.CL 82%

Less is More: Improving LLM Alignment via Preference Data Selection

少即是多:通过偏好数据选择改进大语言模型对齐

Xun Deng, Han Zhong, Rui Ai, Fuli Feng, Zheng Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Cloud Computing(阿里云计算) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)

专题命中 偏好对齐 :alignment(title);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 79%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 73%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 62%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 57%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏