arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 12 篇

2608.24163 2026-08-26 eess.AS cs.AI cs.LG 新提交 82%

Preference Optimization for Non-Verbal Vocalization Synthesis

非言语发声合成的偏好优化

Haoyang Li, Chenglin Xu, Junchuan Zhao, Yuang Cao, Liumeng Xue, Yiwen Guo, Eng Siong Chng

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 81%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21883 2026-08-26 cs.CL 版本更新 81%

Token-weighted Direct Preference Optimization with Attention

基于注意力的令牌加权直接偏好优化

Chengyu Huang, Zhuohang Li, Sheng-Yen Chou, Claire Cardie

机构 * Cornell University(康奈尔大学) Vanderbilt University(范德比大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24192 2026-08-26 cs.AI cs.CL 新提交 81%

Preference Data Selection for Mitigating the Alignment Tax in Large Language Models

缓解大语言模型对齐税的偏好数据选择

Minsu Kim, Jianxun Lian, Xing Xie, Steven Euijong Whang

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BALIGN策略,通过筛选偏好数据的三个关键特征,缓解大语言模型对齐税,在保留通用能力的同时提升对齐效果,达到最优帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24046 2026-08-26 cs.AI 新提交 79%

Algorithmic Impact Reveals the Hidden Social Choice Structure of Alignment

算法影响揭示对齐的隐藏社会选择结构

Zachary Wojtowicz, Michelle Si, Finale Doshi-Velez, Ariel Procaccia

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 该研究将AI对齐问题转化为凸影响空间上的线性优化,结合福利经济学与机制设计,推导了防策略的社会选择机制及最大化功利主义社会福利的对齐协议,并通过多领域人类偏好实证验证其福利影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06621 2026-08-26 cs.GL cs.LG stat.ML 版本更新 77%

The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence

大卫·布莱克韦尔定理及其对人工智能的贡献

Napoleon Paxton

机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。

Comments Survey article, 20 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-08-26 stat.ML cs.LG stat.ME 版本更新 70%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-08-26 cs.CL cs.AI 版本更新 62%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23999 2026-08-26 cs.CY 新提交 57%

The urban right to AI: Pluralistic co-design and governance of public space

城市的AI权利:公共空间的多元协同设计与治理

Rashid Mushkani

专题命中 偏好对齐 :alignment(abstract);分类 cs.CY

AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。

Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-26 cs.AI 版本更新 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-26 cs.RO cs.AI cs.CV 版本更新 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 偏好对齐 :DPO(abstract_cn);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables, Code is available at: [ this https URL (https://github.com/XuPeng23/AeroDPO) ]

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-08-26 cs.CL 版本更新 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Wen Wang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏