arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-09 至 2025-12-09 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 12 篇

2512.06515 2025-12-09 cs.CL 83%

ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models

ProSocialAlign:语言模型中的偏好条件测试时间对齐

Somnath Banerjee, Sayan Layek, Sayantan Adak, Mykola Pechenizkiy, Animesh Mukherjee, Rima Hazra

机构 * Cisco Research(思科研究) Indian Institute of Technology Kharagpur(印度理工学院卡里格普尔分校) Eindhoven University of Technology, Netherlands (TU/e)(埃因霍温理工大学(荷兰))

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 ProSocialAlign通过测试时间参数高效方法,在不重新训练模型的情况下,引导生成安全、富有同理心且价值观一致的响应,提升语言模型的安全性和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16929 2025-12-09 cs.CV cs.AI 83%

TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment

TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解

Shicheng Li, Lei Li, Kun Ouyang, Shuhuai Ren, Yuanxin Liu, Yuanxing Zhang, Fuzheng Zhang, Lingpeng Kong, Qi Liu, Xu Sun

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。

Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06196 2025-12-09 cs.AI cs.CL 81%

ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment

ARCANE:一种多智能体框架,用于可解释和可配置的对齐

Charlie Masters, Marta Grześkiewicz, Stefano V. Albrecht

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 ARCANE是一种多智能体框架,通过动态规则生成实现可解释和可配置的对齐,适用于复杂长期任务。

Comments Accepted to the AAAI 2026 LLAMAS Workshop (Large Language Model Agents for Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06097 2025-12-09 cs.CL cs.AI 79%

Empathy by Design: Aligning Large Language Models for Healthcare Dialogue

设计中的共情:为医疗对话对齐大语言模型

Emre Umucu, Guillermina Solis, Leon Garza, Emilia Rivas, Beatrice Lee, Anantaa Kotal, Aritran Piplai

机构 * Department of Public Health Sciences, The University of Texas at El Paso, USA(公共卫生科学系,德克萨斯理工大学埃尔帕索分校) Department of Nursing, The University of Texas at El Paso, USA(护理系,德克萨斯理工大学埃尔帕索分校) Department of Rehabilitation Sciences, The University of Texas at El Paso, USA(康复科学系,德克萨斯理工大学埃尔帕索分校)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DPO的对齐框架,通过优化医疗对话中事实准确性、语义连贯性和共情能力,提升AI助手在医疗场景中的可信度和人文关怀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06920 2025-12-09 cs.LG 70%

Parent-Guided Semantic Reward Model (PGSRM): Embedding-Based Reward Functions for Reinforcement Learning of Transformer Language Models

基于嵌入的语义奖励模型(PGSRM):用于变换器语言模型强化学习的奖励函数

Alexandr Plashchinsky

机构 * VECTOR Labs(VECTOR实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 PGSRM通过嵌入相似度生成语义奖励,为变换器语言模型强化学习提供无需人工标注的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20109 2025-12-09 cs.SE cs.AI 70%

Learning to Align Human Code Preferences

学习对齐人类代码偏好

Xin Yin, Chao Ni, Xiaohu Yang

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出自适应偏好优化(APO)方法,通过动态整合SFT和DPO,提升模型在不同代码偏好场景下的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11227 2025-12-09 cs.AI cs.LG 62%

Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs

PRM是否必要?问题解决RL隐式地在LLMs中诱导PRM能力

Zhangying Feng, Qianglong Chen, Ning Lu, Yongqian Li, Siqi Cheng, Shuangmu Peng, Duyu Tang, Shengcai Liu, Zhirui Zhang

机构 * Huawei Technologies Ltd.(华为技术有限公司) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of CSE, SUSTech(广东省脑启发智能计算重点实验室、信息科学部、南方科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现纯RL训练可提升LLMs的推理能力并隐式诱导PRM能力,挑战了PRM的必要性。

Comments Accepted by NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19296 2025-12-09 cs.LG cs.AR cs.PL 57%

QiMeng-SALV: Signal-Aware Learning for Verilog Code Generation

QiMeng-SALV:面向Verilog代码生成的信号感知学习

Yang Zhang, Rui Zhang, Jiaming Guo, Lei Huang, Di Huang, Yunpu Zhao, Shuyao Cheng, Pengwei Jin, Chongxiao Li, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 QiMeng-SALV通过信号感知学习提升Verilog代码生成的准确性与性能,采用信号级优化解决功能奖励不足问题。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08519 2025-12-09 cs.CL 57%

Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generation

弥合相关性与推理:检索增强生成中的推理蒸馏

Pengyue Jia, Derong Xu, Xiaopeng Li, Zhaocheng Du, Xiangyang Li, Yichao Wang, Yuhao Wang, Qidong Liu, Maolin Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RADIO通过推理提取和基于推理的对齐方法,弥合检索增强生成中重排器与生成器之间的相关性差距。

Comments Accepted to ACL 25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06874 2025-12-09 cs.CL 57%

An Analysis of Large Language Models for Simulating User Responses in Surveys

大型语言模型在模拟调查用户响应中的分析

Ziyun Yu, Yiru Zhou, Chen Zhao, Hongyi Wen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心) New York University(纽约大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

AI总结 本文分析了大型语言模型在模拟调查用户响应中的表现,提出CLAIMSIM方法以提高响应多样性,但发现模型在处理不同人口特征时存在固有偏见和推理限制。

Comments Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06266 2025-12-09 cs.CL 57%

Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models

Nanbeige4-3B 技术报告:探索小型语言模型的前沿

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Wei Ruan, Xiaoqi Liu, Xiaoxue Cheng, Xiyun Xu, Yang Song, Yanzipeng Gao, Yiming Jia, Yun Xing, Yuntao Wen, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳布吉LLM实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06020 2025-12-09 cs.CV cs.AI 57%

PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation

PrefGen: 多模态偏好学习用于偏好条件下的图像生成

Wenyi Mo, Tianyu Zhang, Yalong Bai, Ligong Han, Ying Ba, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) iN2X MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。

Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}

详情

展开后加载摘要…

URL PDF HTML 收藏