MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
专题命中 偏好对齐 :RLHF(title,abstract);alignment(title,abstract);safety(abstract);分类 cs.CL
Comments Project Page: https://mm-rlhf.github.io/
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :RLHF(title,abstract);alignment(title,abstract);safety(abstract);分类 cs.CL
Comments Project Page: https://mm-rlhf.github.io/
DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(title,title_cn)
AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。
Comments Accepted at ECCV2026
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 偏好对齐 :RLHF(title,summary_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
规则还是特性?AI安全设计的缩放定律
专题命中 偏好对齐 :safety(title,abstract);AI safety(title);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 该研究构建模型分析AI安全的特性塑造与规则执行的资源分配,发现部署规模对最优分配影响较小,特性脆弱率才是主导因素,二者的最优值在大规模部署下会收敛。
Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society). 10 pages, 6 figures, 4 tables
BiasGRPO:通过组相对策略优化在高方差奖励景观中稳定偏差缓解
机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 提出BiasGRPO框架,利用组相对策略优化(GRPO)通过归一化组内奖励来稳定大语言模型的社会偏差缓解,优于DPO和PPO。
Comments Accepted to Findings of the ACL
从大众偏好中隐式安全对齐
机构 * Kahlert School of Computing, University of Utah(犹他大学计算学校)
专题命中 偏好对齐 :safety(title,abstract);alignment(title);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文研究如何从大众偏好数据中提取共享的安全标准,并将其转移到下游强化学习任务中以规范智能体行为并确保安全。提出了一种基于大众偏好的安全强化学习框架,通过高级策略将安全对齐的技能组合起来,以安全地解决下游任务。
Comments Accepted to ICML 2026. Conference paper
PRISM:面向多模态集成安全的原理化推理对齐
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.AI
AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。
多语言安全对齐 via 稀疏权重编辑
机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.LG
AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。
可证明收敛的约束语言模型对齐的对偶直接偏好优化
机构 * SUTD ESD(新加坡科技设计大学电子与计算机工程系) ; UIUC ECE(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(abstract);分类 cs.LG
AI总结 本文提出了一种可证明收敛的约束LLM对齐方法,通过改进的DPO技术减少训练模型数量和内存消耗,同时保证约束条件和优化性能。
AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) ; University of Edinburgh(爱丁堡大学) ; University of Washington(华盛顿大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。
在大型语言模型对齐中操作多元价值观揭示了安全、包容性和模型行为之间的权衡
机构 * Technical University of Munich(慕尼黑技术大学) ; Stanford University(斯坦福大学) ; Cornell University(康奈尔大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.AI
AI总结 本研究探讨了在大型语言模型对齐中融入多元价值观的影响,发现不同群体偏好和设计选择对模型行为和安全性有显著影响。
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL
Comments Accepted by ICML 2025 as a spotlight poster
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.CL
机构 * UK AI Security Institute, Centre for the Governance of AI(英国人工智能安全研究所,人工智能治理中心) ; UK AI Security Institute, New York University(英国人工智能安全研究所,纽约大学) ; UK AI Security Institute(英国人工智能安全研究所)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :RLHF(title,abstract);safety(title,abstract);alignment(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);RLHF(abstract);分类 cs.CL
Comments 16 pages, 2 figures, 14 tables
Journal ref ICML 2024
专题命中 偏好对齐 :RLHF(title,abstract);harmlessness(title);alignment(abstract);safety(abstract)
直接偏好优化综述:数据集、理论、变体及应用
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 综述直接偏好优化(DPO)在理论、变体、数据集和应用方面的进展,指出其作为RL-free替代方案的潜力与局限,并提出未来研究方向。
Comments Accepted by TPAMI 2026. Project page: https://github.com/Mr-Loevan/DPO-Survey
尾感知信息论泛化用于RLHF和SGLD
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) ; Advanced Institute of Information Technology, Peking University(北京大学信息技术高等研究院) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) ; Computer and Mathematical Sciences, Computer Science, and Statistics, University of Toronto(多伦多大学计算机与数学科学、计算机科学和统计学系) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :RLHF(title_cn,abstract);alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种尾依赖信息论框架,用于处理亚韦尔bull数据,通过移位对数f_θ-分歧来界定制换测度期望,从而在重尾数据下获得更精确的泛化界限。
Comments 47 pages, 6 figures
守护者与违规者:大语言模型有害内容生成与安全缓解研究综述
机构 * University of South Florida(佛罗里达州立大学) ; Missouri University of Science and Technology(密苏里科技大学)
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)
AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。
Comments Accepted by ECCV 2026
不确定性感知的奖励建模用于稳定的RLHF
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出不确定性感知奖励建模(UARM),通过分位数保形预测校准不确定性并利用异方差方差分解重加权GRPO优势,以缓解奖励黑客问题,提升对齐质量。
UNA: 一种统一的监督框架,用于高效对齐跨反馈类型的大型语言模型
机构 * Salesforce ; RadixArk ; ChatAlpha AI ; University of North Texas(北得克萨斯大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 UNA框架通过通用隐式奖励函数统一处理二元、成对和评分反馈,理论证明其最优性,实验验证其在经典基准上的优势。
引导冻结的大型语言模型:通过在线提示路由实现适应性社会对齐
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Washington(华盛顿大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)
AI总结 本文提出CCLUB框架,通过系统提示路由实现适应性社会对齐,解决部署时静态策略无法应对动态安全规范的问题,实验显示其在累积奖励和子最优差距上优于基线方法。
机构 * Manipal University Jaipur(Manipal大学贾ipur分校) ; LinkedIn ; IIT Kharagpur(印度理工学院Kharagpur分校) ; IIIT Guwahati(印度冈瓦提理工学院) ; Texas A&M University(德克萨斯A&M大学) ; Vellore Institute of Technology(维洛雷理工学院) ; Meta AI ; Evalueserve ; New York University(纽约大学) ; Amazon AI ; BITS Goa(果阿理工学院)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)
NeurIPS应要求对前沿AI安全声明实施可重复性标准
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)
专题命中 偏好对齐 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出要求NeurIPS对涉及前沿AI安全声明的论文实施可重复性标准,通过三级披露框架和强制性声明清单等措施,确保高影响声明的可重复性,以提升AI安全测试的可靠性。
Comments Preprint
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at EMNLP 2024 as long (findings) conference paper