arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-28 至 2026-01-28 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2508.10530 2026-01-28 cs.AI cs.CL 84%

Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?

基于直接偏好优化的LM对齐中,策略数据是否总是最佳选择?

Zetian Sun, Dongfang Li, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对齐阶段假设,通过理论和实证分析,揭示了静态与策略偏好数据在LM对齐中的效果差异,并提出算法识别对齐阶段边界。

Comments Accepted by ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 77%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14459 2026-01-28 cs.LG cs.AI 73%

Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning

基于Holdout损失的数据选择用于LLM微调的上下文学习

Ling Zhang, Xianliang Yang, Juwon Yu, Park Cheonyoung, Miran Lee, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于上下文近似(ICA)的方法,通过估计holdout损失来高效选择高价值训练数据,提升LLM微调的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22338 2026-01-28 cs.CL cs.AI 73%

Text2Grad: Reinforcement Learning from Natural Language Feedback

Text2Grad:从自然语言反馈中强化学习

Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。

Comments The code for our method is available at https://github.com/microsoft/Text2Grad

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21044 2026-01-28 cs.LG cs.AI 62%

Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs

强化学习微调增强大语言模型内部电路的激活强度和多样性

Honglin Zhang, Qianyue Hao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 强化学习微调增强了LLMs内部电路的激活强度和多样性,相较于偏好优化方法,其在数学泛化上的优势源于信息流的冗余与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10139 2026-01-28 cs.CL cs.AI 62%

Unsupervised Elicitation of Language Models

无监督的语言模型引导

Jiaxin Wen, Zachary Ankner, Arushi Somani, Peter Hase, Samuel Marks, Jacob Goldman-Wetzler, Linda Petrini, Henry Sleight, Collin Burns, He He, Shi Feng, Ethan Perez, Jan Leike

机构 * Anthropic Schmidt Sciences New York University(纽约大学) George Washington University(乔治华盛顿大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无监督算法ICM,通过模型自动生成标签来微调语言模型,无需外部监督,在多个任务中表现出色,尤其在超人类能力任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19856 2026-01-28 cs.RO 50%

Estimating Trust in Human-Robot Collaboration through Behavioral Indicators and Explainability

通过行为指标和可解释性估计人机协作中的信任

Giulio Campagna, Marta Lagomarsino, Marta Lorenzini, Dimitrios Chrysostomou, Matthias Rehm, Arash Ajoudani

机构 * Human-Robot Interaction Lab., Technical Faculty of IT and Design, Aalborg University, Denmark(人机交互实验室,信息技术与设计技术学院,阿alborg大学,丹麦) Human-Robot Interfaces and Interaction Lab., Istituto Italiano di Tecnologia (IIT), Italy(人机界面与交互实验室,意大利理工学院(IIT)) Smart Production Lab., Faculty of Engineering and Natural Sciences, Aalborg University, Denmark(智能生产实验室,工程与自然科学学院,阿alborg大学,丹麦)

专题命中 偏好对齐 :safety(abstract)

AI总结 本研究提出了一种数据驱动框架,通过行为指标和可解释性评估人机协作中的信任,实验表明机器学习模型在预测信任水平方面具有高准确率。

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏