arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-14 至 2026-01-14 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2601.08777 2026-01-14 cs.LG cs.AI cs.CL cs.GT 85%

Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling

渐近通用对齐:通过测试时间缩放实现的新对齐框架

Yang Cai, Weiqiang Zheng

机构 * Yale University(耶鲁大学)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于测试时间缩放的通用对齐框架,通过多玩家对齐游戏实现最优鲁棒性,解决了现有方法在输出多样性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08441 2026-01-14 cs.AI 81%

YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation

YaPO: 用于领域适应的可学习稀疏激活引导向量

Abdelaziz Bounhar, Rania Hossam Elmohamady Elbadry, Hadi Abdine, Preslav Nakov, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)

AI总结 YaPO通过学习稀疏激活引导向量实现LLM的高效、稳定和细粒度对齐,适用于领域适应和文化对齐等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08421 2026-01-14 cs.LG 70%

Coverage Improvement and Fast Convergence of On-policy Preference Learning

策略学习中的覆盖改进与快速收敛

Juno Kim, Jihun Yun, Jason D. Lee, Kwang-Sung Jun

机构 * UC Berkeley(伯克利大学) KRAFTON(KRAFTON公司) University of Arizona(亚利桑那大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出覆盖改进原理,通过分析在线策略学习中的覆盖变化,证明其在批量大小足够时能实现快速收敛,并设计混合采样器和奖励蒸馏方案,提升语言模型对齐性能。

Comments 46 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 70%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02618 2026-01-14 cs.CL 70%

Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation

通过交互蒸馏缓解判别奖励建模中的注意力黑客问题

Jianxiang Zang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出交互蒸馏方法,通过优化注意力机制提升判别奖励建模的稳定性与通用性,缓解注意力黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09243 2026-01-14 cs.CL cs.AI 62%

CrisiText: A dataset of warning messages for LLM training in emergency communication

CrisiText: 一个用于LLM训练的紧急通讯警示信息数据集

Giacomo Gonella, Gian Maria Campedelli, Stefano Menini, Marco Guerini

机构 * Fondazione Bruno Kessler(布雷诺克瑟拉基金会) University of Trento(特伦托大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CrisiText是首个大规模危机警示信息数据集,通过生成13种危机场景下的警示信息,提升LLM在紧急通讯中的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15012 2026-01-14 cs.RO 50%

Learning Contextually-Adaptive Rewards via Calibrated Features

通过校准特征学习上下文自适应奖励

Alexandra Forsey-Smerek, Julie Shah, Andreea Bobu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 偏好对齐 :safety(abstract)

AI总结 本文提出通过校准特征显式建模上下文相关的特征显著性,以提高奖励学习的样本效率和适应性。

Comments Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), March 16 - 19, 2026, Edinburgh, Scotland, UK

详情

展开后加载摘要…

URL PDF HTML 收藏