MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.AI
Comments Project URL: https://github.com/Liuziyu77/MIA-DPO
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.AI
Comments Project URL: https://github.com/Liuziyu77/MIA-DPO
为确认而提问:用于自信多轮大语言模型推荐的信息交互
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对多轮LLM推荐中有效挖掘用户偏好的挑战,提出以推荐熵降为奖励的方法微调LLM,结合SFT与DPO在INSPIRED、ReDial数据集上提升了推荐质量与对话效率。
Comments CIKM 2026
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
批量提示中的安全性?理解并缓解批量提示中的安全故障
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);jailbreak(comments)
AI总结 该研究发现批量提示存在独特安全故障模式,可作为黑盒攻击实现高成功率,提出感知批量的偏好优化可缓解该漏洞,为大语言模型安全对齐提供了新方向。
Comments jailbreak, safety
EvoPref:多目标进化优化发现超越梯度下降的多样化大语言模型对齐
机构 * The University of Hong Kong(香港大学) ; Stellaris AI Limited(Stellaris AI有限公司)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 EvoPref通过多目标进化算法在帮助性、无害性和诚实性目标上优化LoRA适配器,发现比梯度下降更丰富的对齐方式,实验显示其在偏好覆盖和崩溃率上均有显著提升。
Comments 10 pages, 2 figures, 6 tables, 1 algorithm. Accepted to GECCO 2026
LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of São Paulo(圣保罗大学) ; Texas A&M University(德克萨斯A&M大学) ; SylphAI
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。
Comments Presented at ICRA 2026
通过合成局部偏好实现解剖学合理的人体图像生成
机构 * Westlake University(西湖大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract)
AI总结 提出 ASAP 框架,利用局部退化机制构建受控偏好对,并结合局部有界 DPO 变体,在保持整体图像质量的同时减少解剖学错误。
StepAudio 2.5 技术报告
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract)
AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。
QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别
机构 * University of Sydney(悉尼大学) ; University of New South Wales(新南威尔士大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract)
AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。
GRLO:从零开始在开放环境中的通用强化学习
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。
G-Zero:从零数据开始的自主开放生成自我学习
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of Virginia(弗吉尼亚大学) ; University of Maryland(马里兰大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 G-Zero通过无验证器的共进化框架实现自主改进,利用Hint-δ内在奖励量化生成模型在无辅助响应与带提示响应间的预测偏移,通过GRPO训练提出者模型持续针对生成器的盲区,同时通过DPO优化生成器内部化提示引导的改进。
STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误
机构 * Guangdong University of Finance and Economics(广东财经大学) ; Chongqing University(重庆大学) ; Westlake University(西湖大学) ; The University of Hong Kong(香港大学)
专题命中 偏好对齐 :alignment(title);DPO(title)
AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。
Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026
机构 * MoE Key Lab of BIPC, University of Science(BIPC联合实验室,科学与技术大学) ; Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)
理解奖励模型中的有用性与无害性张力
机构 * University of Copenhagen(哥本哈根大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract,comments);harmlessness(abstract);分类 cs.CL、cs.LG
AI总结 通过激活分析和消融实验,发现奖励模型中有用性和无害性目标存在干扰,共享神经元对模型行为影响不成比例,导致对齐张力。
Comments The source code used in this study is publicly available at: https://github.com/EshaanT/RM-alignment\_tension
DIAG:面向数据高效数学偏好蒸馏的诊断式迭代对齐与生成
机构 * Tsinghua University(清华大学) ; Kyoto University(京都大学) ; Nanjing University(南京大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 DIAG是一种自适应调整训练分布的框架,通过诊断偏好对产出与生成针对性训练数据,提升数学推理任务中偏好监督的信息价值,在同等训练预算下增强模型性能。
Comments Accepted by EMNLP 2026 findings
CATNIP:通过校准和令牌化的负偏好对齐实现LLM去学习
机构 * George Mason University(乔治·马歇尔大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 CATNIP通过校准和令牌化的负偏好对齐方法,实现有效LLM去学习,无需保留数据或对比对,提升知识遗忘与保留的平衡。
自然语言处理:从分词到RLHF的全面实用指南
机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.CL
AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。
Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available
关于支持保持对齐和有界过滤的局限性
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG
AI总结 研究在大语言模型中,重塑基础模型输出分布的对齐方案与有界安全过滤器结合能否消除有害行为。通过形式化设置并分析,发现有界过滤可能无法消除所有有害输出,实证评估显示有害输出率始终高于零。
Comments Withdrawn to allow a complete rewrite and substantial revision of the theoretical analysis and experiments
Rushes:用于多元对齐的人类偏好数据集
机构 * Microsoft Research(微软研究院)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 该研究引入Rushes数据集,通过游戏界面收集用户与AI叙事交互数据。核心方法是分析用户选择模式,以量化非随机偏好。主要贡献是定位其为多元对齐诊断基准,揭示现有模型在捕捉个性化参与信号上的不足,助力相关研究。
FIRM: 面向大型语言模型的联邦客户端内正则化多目标对齐
机构 * Department of Electrical and Computer Engineering, The Ohio State University, Columbus, OH, USA(电气与计算机工程系,俄亥俄州立大学,哥伦布,OH,USA) ; Department of Computer Science and Engineering, The Ohio State University, Columbus, OH, USA(计算机科学与工程系,俄亥俄州立大学,哥伦布,OH,USA)
专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG
AI总结 提出FIRM算法,通过客户端内正则化缓解客户端分歧漂移并提高通信效率,实现联邦多目标对齐,并首次给出有限时间收敛保证。
SDOF:通过状态约束调度驯服多智能体编排中的对齐税
机构 * Digital China(数字中国)
专题命中 偏好对齐 :alignment(title);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 SDOF通过状态约束调度框架,利用强化学习和有限状态自动机提升多智能体任务执行的准确性和可控性,验证了其在招聘系统中的有效性。
Comments 12 pages, 4 figures, 14 tables
通过偏好维度扩展解释并打破安全与有益性天花板
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; Chongqing University(重庆大学)
专题命中 偏好对齐 :safety(title);alignment(abstract);harmlessness(abstract);分类 cs.AI
AI总结 本文提出MORA方法,通过多维奖励整合解决多目标对齐中的安全与有益性矛盾,实验显示在序列对齐中提升5%-12.4%,同时对齐中整体奖励提升4.6%。
f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐
机构 * Department of Statistics, Purdue University(普渡大学统计学系) ; Department of Statistics, Michigan State University(密歇根州立大学统计学系)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG
AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。
通过调整理性度来缓解强化学习中的人类反馈认知偏差
机构 * University of Oxford(牛津大学) ; Brown University(布朗大学)
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI
AI总结 本文提出通过动态调整理性参数beta来缓解人类反馈中的认知偏差,提升奖励学习模型的理性度,即使在存在强烈偏见的偏好数据集上也能获得更理性的下游模型。
用于高效偏好数据选择与诊断的对齐数据图
机构 * Sogang University(ソガン大学) ; Upstage(アップステージ) ; Korea University(韩国大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出对齐数据图,通过评估偏好数据的对齐分数,选择高质量低变异性样本,提升对齐效果并提高标注准确性。
Comments ACL 2026 Findings Camera-Ready
OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI
AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。
Comments 13 pages, 3 figures
ProMedical:通过显式注入实现医疗大语言模型对齐的分层细粒度标准建模
机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文提出ProMedical框架,通过显式注入细粒度临床标准,提升医疗大语言模型对齐效果,实验表明在安全性和准确性上均优于现有模型。
Comments ACL 2026
FedDetox: 通过设备端数据净化实现鲁棒的联邦SLM对齐
机构 * The University of Tokyo(东京大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG
AI总结 FedDetox通过设备端数据净化技术,提升联邦学习中小型语言模型的安全对齐能力,保持模型安全性和通用性。
SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL
AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。
Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI
BalancedDPO:适应性多指标对齐
机构 * Purdue University(普渡大学) ; University of Maryland(马里兰大学) ; Indian Institute of Technology Bombay(印度理工学院孟买分校) ; University of Central Florida(中佛罗里达大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI
AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。
Comments Transactions on Machine Learning Research, Apr 2026
Journal ref Transactions on Machine Learning Research, Apr 2026