arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2502.01930 2026-01-16 cs.LG cs.AI 84%

Robust LLM Alignment via Distributionally Robust Direct Preference Optimization

通过分布鲁棒直接偏好优化实现鲁棒的大语言模型对齐

Zaiyan Xu, Sushil Vemuri, Kishan Panaganti, Dileep Kalathil, Rahul Jain, Deepak Ramachandran

机构 * Texas A&M University(德克萨斯大学) California Institute of Technology(加州理工学院) Tencent AI Lab(腾讯AI实验室) Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Wasserstein DPO和KLDPO算法,通过分布鲁棒优化解决LLM与人类偏好间的分布偏移问题,提升对齐性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10416 2026-01-16 cs.AI 83%

LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models

LLMdoctor: 基于令牌级流引导的偏好优化用于大语言模型高效测试时间对齐

Tiesunlong Shen, Rui Mao, Jin Wang, Heming Sun, Jian Zhang, Xuejie Zhang, Erik Cambria

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 LLMdoctor通过令牌级流引导偏好优化,实现高效的大语言模型测试时间对齐,提升对齐精度并保留生成多样性。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04675 2026-01-16 cs.AI cs.CL cs.LG 75%

Scalable Oversight for Superhuman AI via Recursive Self-Critiquing

通过递归自我批评实现超人类AI的可扩展监督

Xueru Wen, Jie Lou, Xinyu Lu, Junjie Yang, Yanjiang Liu, Yaojie Lu, Debing Zhang, Xing Yu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过递归自我批评实现超人类AI的可扩展监督,探索批评的批评比直接批评更容易,并验证递归批评在AI监督中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10128 2026-01-16 cs.CE cond-mat.mtrl-sci cs.SE 67%

A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation

在数据稀缺条件下构建可执行领域特定大语言模型的通用框架:以半导体TCAD仿真为例

Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 本文提出一种通用框架,在数据稀缺条件下构建可执行的领域特定大语言模型,通过生成合成数据和代码优化流程,实现领域知识灌输和脚本可执行性提升。

Comments Submitted to Nature Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏