arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2601.17260 2026-01-27 cs.LG cs.AI 88%

The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment

逻辑的粘度:DPO对齐中的相变与滞后效应

Marco Pollanen

机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17329 2026-01-27 cs.LG cs.AI 86%

Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment

符合反馈对齐:量化答案级可靠性以实现鲁棒的大语言模型对齐

Tiejin Chen, Xiaoou Liu, Vishnu Nandam, Kuan-Ru Liou, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 Conformal Feedback Alignment通过量化答案级可靠性提升大语言模型对齐的鲁棒性和数据效率。

Comments Accetped to Findings of EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18760 2026-01-27 cs.LG cs.CL 81%

Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values

超越偏好:基于人类理由和价值观的学习对齐原则

Henry Bell, Lara Neubauer da Costa Schertel, Bochu Ding, Brandon Fain

机构 * Duke University(杜克大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出GCAI框架,通过结合人类理由和价值观生成AI对齐原则,提升AI治理的道德基础和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17096 2026-01-27 cs.CY cs.AI cs.CL 80%

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象

Yueqing Hu, Xinyang Peng, Yukun Zhao, Lin Qiu, Ka-lai Hung, Kaiping Peng

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17671 2026-01-27 cs.CL 79%

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18457 2026-01-27 cs.IR 78%

Token-level Collaborative Alignment for LLM-based Generative Recommendation

基于令牌级的协同对齐用于基于大语言模型的生成推荐

Fake Lin, Binbin Hu, Zhi Zheng, Xi Zhu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Tong Xu

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 TCA4Rec通过令牌级协同对齐框架,将协同过滤与大语言模型生成结合,提升推荐系统的准确性和可控性。

Comments 11 pages, 2 figures, 7 tables, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22881 2026-01-27 cs.LG cs.CL 73%

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

通过最大边际似然估计实现离线偏好优化

Saeed Najafi, Alona Fyshe

机构 * Department of Computing Science, University of Alberta, Canada(计算科学系,阿尔伯塔大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于最大边际似然估计的MMPO方法,通过隐式偏好优化提升模型稳定性与对齐性能。

Comments EACL 2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17918 2026-01-27 cs.CV cs.CL 70%

Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models

医疗大视觉-语言模型的直接偏好优化基准测试

Dain Kim, Jiwoo Lee, Jaehoon Yun, Yong Hoe Koo, Qingyu Chen, Hyunjae Kim, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰林大学医学院) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医院) Yale University(耶鲁大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 本文评估了医疗领域中多种DPO变体,发现其在视觉问答任务中存在性能不一致和视觉误解问题,并提出针对性策略提升3.6%。

Comments EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04472 2026-01-27 cs.CL cs.AI 62%

RECAP: REwriting Conversations for Intent Understanding in Agentic Planning

RECAP:用于代理规划中意图理解的对话重写

Kushan Mitra, Dan Zhang, Hannah Kim, Estevam Hruschka

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过对话重写提升代理规划中的意图理解,提出新基准和方法,验证重写对规划效用的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL 57%

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17567 2026-01-27 cs.IR cs.AI 57%

Real-Time Trend Prediction via Continually-Aligned LLM Query Generation

通过持续对齐的LLM查询生成进行实时趋势预测

Zijing Hui, Wenhan Lyu, Shusen Wang, Li Chen, Chu Wang

机构 * Meta Platforms(Meta平台)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏