arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-16 至 2025-12-16 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2512.11838 2025-12-16 cs.LG 88%

D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space

D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制

Samarth Raina, Saksham Aggarwal, Aman Chadha, Vinija Jain, Amitava Das

机构 * IIIT Delhi(印度理工学院德里分校) Microsoft(微软) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.LG

AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 86%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11998 2025-12-16 cs.CL 83%

Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models

直接置信对齐:将 verbalized 置信度与内部置信度对齐于大语言模型

Glenn Zhang, Treasure Mayowa, Jason Fan, Yicheng Fu, Aaron Sandoval, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出直接置信对齐方法,通过优化使LLM的 verbalized 置信度与内部置信度对齐,提升模型透明度和可靠性。

Comments Accepted at ACL 2025 SRW, 5 pages body, 14 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15811 2025-12-16 cs.CL cs.AI 81%

From Clicks to Preference: A Multi-stage Alignment Framework for Generative Query Suggestion in Conversational System

从点击到偏好:一种多阶段对齐框架用于对话系统中的生成查询建议

Junhao Yin, Haolin Wang, Peng Bao, Ju Xu, Yongliang Wang

机构 * Bytedance Shanghai China(字节跳动上海中国) Bytedance Beijing China(字节跳动北京中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多阶段对齐框架,通过提示工程、知识蒸馏和高斯奖励模型,提升生成式查询建议的用户偏好对齐效果,实验显示在自动和人工评估中均优于基线,并提高用户参与度34%

Comments Accepted by SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13426 2025-12-16 cs.CL cs.AI 81%

ALIGN: Word Association Learning for Cultural Alignment in Large Language Models

ALIGN: 用于大语言模型中文化对齐的词关联学习

Chunhua Liu, Kabir Manandhar Shrestha, Sukai Huang

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学) Melbourne Data Analytics Platform, The University of Melbourne(墨尔本数据分析平台,墨尔本大学) Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 ALIGN通过微调大语言模型以学习母语使用者的词关联规范,显著提升文化对齐效果,无需昂贵重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19700 2025-12-16 cs.CL cs.AI 81%

Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models

利用重要性采样将对齐模块从大语言模型中分离出来

Yi Liu, Dianqing Liu, Mingye Zhu, Junbo Guo, Yongdong Zhang, Zhendong Mao

机构 * State Key Laboratory of Communication Content Cognition, People’s Daily Online(通信内容认知国家重点实验室,人民在线) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出残差对齐模型(RAM),通过重要性采样将对齐模块与大语言模型分离,提升灵活性和可扩展性,并在多种任务上优于基线模型。

Comments Accepted by NeurIPS 2025, 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23188 2025-12-16 cs.CL 70%

Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts

诊断、定位、对齐:一种用于在指令冲突下可靠LLM多智能体系统的全栈框架

Guancheng Wan, Leixin Sun, Longxu Dou, Zitong Shi, Fang Wu, Eric Hanchen Jiang, Wenke Huang, Guibin Zhang, Hejia Geng, Xiangru Tang, Zhenfei Yin, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sea AI Lab(Sea AI 实验室) Stanford University(斯坦福大学) University of Oxford(牛津大学) Yale University(耶鲁大学) NTU(南洋理工大学) NUS(新加坡国立大学) Boston University(波士顿大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 本文提出了一种全栈框架,通过诊断、定位和对齐三个阶段提升LLM多智能体系统在指令冲突下的可靠性。

Comments Upon further review, we realized that the version submitted to arXiv was not the final draft and omits crucial results and discussion. To avoid confusion and ensure the integrity of the record, we request withdrawal and will resubmit once the complete work is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL 67%

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12337 2025-12-16 cs.CL cs.AI 62%

SCIR: A Self-Correcting Iterative Refinement Framework for Enhanced Information Extraction Based on Schema

SCIR: 一种基于模式的增强信息提取的自校正迭代细化框架

Yushen Fang, Jianjun Li, Mingqian Ding, Chang Liu, Xinchi Zou, Wenqi Yang

机构 * Yushen Fang, Jianjun Li, Mingqian Ding, Chang Liu, Xinchi Zou, Wenqi Yang(作者)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SCIR框架通过自校正迭代细化方法,有效降低信息提取的训练成本并提升准确性,实现跨任务的高效信息提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13678 2025-12-16 cs.CV cs.AI 57%

Feedforward 3D Editing via Text-Steerable Image-to-3D

通过文本可控的图像到3D进行前馈编辑

Ziqi Ma, Hongqiao Chen, Yisong Yue, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 Steer3D通过文本可控的图像到3D生成方法,实现高效且准确的3D资产编辑,速度提升显著。

Comments https://glab-caltech.github.io/steer3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 50%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏