Efficiently Aligning Language Models with Online Natural Language Feedback
通过在线自然语言反馈高效对齐语言模型
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出使用在线自然语言反馈替代可验证奖励,通过迭代优化代理奖励模型并在过优化点收集专家监督,在模糊领域高效对齐语言模型,实验表明可大幅提升专家监督的数据效率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过在线自然语言反馈高效对齐语言模型
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出使用在线自然语言反馈替代可验证奖励,通过迭代优化代理奖励模型并在过优化点收集专家监督,在模糊领域高效对齐语言模型,实验表明可大幅提升专家监督的数据效率。
半参数偏好优化:你的语言模型秘密地是一个单索引模型
机构 * Netflix & Cornell University(Netflix与康奈尔大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出半参数偏好优化方法,通过放宽偏好与潜在奖励之间的链接函数假设,在未知且无限制的链接函数下进行策略对齐,并证明策略类的可实现性诱导出半参数单索引二元选择模型,直接学习策略并给出链接无关的收敛保证。
SoLoPO: 通过短到长偏好优化解锁大语言模型的长上下文能力
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出SoLoPO框架,将长上下文偏好优化解耦为短上下文偏好优化和短到长奖励对齐,以提升大语言模型的长上下文利用能力。
Comments Published as a conference paper at ICLR 2026
迭代纳什偏好优化的高效探索
机构 * Columbia University(哥伦比亚大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对通用偏好模型下的迭代NLHF,提出显式探索算法,结合SFT正则化与对抗性策略探索,实现O(√T)遗憾界,避免对KL正则化参数的指数依赖。
Comments 49 pages
一个接一个的偏差:语言奖励模型中的机械奖励塑造与持续偏差
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文通过系统测量五个高质量奖励模型中的偏差,发现长度、谄媚、过度自信等持续问题,并提出一种简单的后处理干预方法(机械奖励塑造)来减轻低复杂度偏差。
Comments ICML 2026 Camera-ready
MASCOT: 迈向多智能体社会协作伴侣系统
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对多智能体系统中的人格崩溃和社会谄媚问题,提出MASCOT框架,通过双层优化策略(人格感知行为对齐与协作对话优化)提升角色一致性和对话贡献。
Comments 15 pages, 9 figures. https://hello-diana.github.io/MASCOT/
T-POP:基于在线偏好反馈的测试时个性化
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; East China Normal University(华东师范大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Tianjin University(天津大学) ; The Chinese University of Hong Kong(香港中文大学) ; Beihang University(北京航空航天大学) ; City University of Hong Kong(香港城市大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对新用户冷启动问题,提出T-POP算法,通过在线成对偏好反馈和决斗式强盗机制,在不更新模型参数的情况下实时学习用户偏好并引导解码过程,实现快速数据高效的个性化。
Comments Accepted to ICML 2026
线性与神经延迟反馈的对抗性赌博机
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对随机延迟反馈下的上下文对抗性赌博机问题,提出线性(LDB-DF)和神经(NDB-DF)两种算法,通过将逆概率加权(IPW)机制直接融入损失函数实现无偏校正,并给出线性设置下O(d*sqrt(T))的遗憾界和神经设置下的次线性保证。
从临床叙述中学习基于偏好的目标用于动态脓毒症治疗
机构 * Institute of Data Science, National University of Singapore, Singapore(新加坡国立大学数据科学研究所) ; National University Hospital, Singapore(新加坡国立大学医院) ; Saw Swee Hock School of Public Health, National University of Singapore, Singapore(新加坡国立大学 Saw Swee Hock 公共卫生学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出CN-PR框架,利用大语言模型从出院小结中提取轨迹级偏好,通过偏好优化学习奖励函数,在离线强化学习中改善脓毒症治疗结果。
Raon-Speech 技术报告
机构 * KRAFTON
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 Raon-Speech,一个 9B 参数的语音语言模型,通过多阶段训练实现英语和韩语的语音理解、回答与生成,并扩展为全双工对话模型 Raon-SpeechChat,在语音任务上超越同类模型。
实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练
机构 * UC San Diego(加州大学圣迭戈分校) ; MIT(麻省理工学院) ; Adobe(Adobe公司)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。
通用偏好强化学习
机构 * Stanford University(斯坦福大学) ; The University of Oklahoma(俄克拉荷马大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。
基于测试时间可调节的贝叶斯偏好学习的奖励模型
机构 * LinkedIn Corporation(LinkedIn公司) ; Nubank
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种新的贝叶斯奖励建模目标,即变分上下文奖励建模(ICRM),通过上下文偏好演示实现测试时间可调节性,从而适应未见过的偏好分布,提高了奖励模型的准确性和鲁棒性。
Comments Preprint
Hybrid-LoRA: 桥接全微调与低秩适应以实现训练后优化
机构 * Worcester Polytechnic Institute(沃斯特理工学院) ; University of Hong Kong(香港大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Hybrid-LoRA框架,通过选择性地对部分模块进行全微调,其余模块使用LoRA进行适应,从而在训练后优化中实现高效性能。
Beacon:单轮诊断和缓解大型语言模型中潜在的阿谀倾向
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Beacon基准测试,用于单轮诊断和缓解大型语言模型中潜在的阿谀倾向,通过评估十二种最先进的模型,揭示了阿谀倾向在语言和情感方面的稳定子偏差,并提出了在提示和激活层面的干预措施,以调节这些偏差,从而揭示对齐作为事实性和社会合规判断之间的动态流形。
通过二元反馈个性化大语言模型:一种偏好校正的优化框架
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出C-BPO框架,通过偏好校正的二元信号实现LLM个性化,解决用户间差异问题,实验表明其在多种任务中优于基线方法。
Comments Accepted by ACL 2026 Main
用户作为标注者:从比较模式中学习LLM的偏好
机构 * Imperial College Business School(帝国理工商业学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过用户日常交互收集偏好数据,利用期望最大化算法估计用户质量因子,提升LLM对齐效果。
通过因果驱动的推理时干预去偏奖励模型
机构 * Human Informatics Labs., NTT, Inc.(NTT人类信息学实验室)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出因果驱动的干预方法,用于在推理时减轻奖励模型中的多种偏差。通过抑制与预定义偏差属性强相关的神经元激活,减少对虚假特征的敏感性,同时保持性能。
Comments Accepted to ACL 2026 Main Conference
情感流动语言模型用于情感支持对话
机构 * College of computer science, Chongqing University(重庆大学计算机学院) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AFlow模型,通过建模多轮对话中的连续情感流动,提供细粒度监督以提升情感支持对话中的策略一致性和共情响应质量。
Comments 19 pages, 7 figures
对过程奖励模型的调查:从结果信号到大语言模型的过程监督
机构 * Shanghai Jiao Tong University(上海交通大学) ; University College London(伦敦大学学院) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Bristol(布里斯托大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。
LLM-Auction: 面向LLM原生广告的生成拍卖
机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LLM-Auction,首个基于学习的生成拍卖机制,通过整合拍卖与生成过程,优化LLM输出与机制目标的偏好对齐,实现高效分配并满足关键机制属性。
高效的目标令牌级偏好优化用于基于大语言模型的文本到语音
机构 * SpiralAI Inc.(SpiralAI公司) ; The University of Osaka(大阪大学) ; Shizuoka University(izuoka大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。
Comments Accepted at ACL 2026 (Main)
学生不会像你希望的那样使用LLMs
机构 * The University of Sydney(悉尼大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文提出六个计算指标,用于评估学生与AI对话的教育对齐情况,发现部署环境是影响使用模式的主要因素,而非学生偏好或系统设计。
Comments To appear at ACL 2026 (Main Conference)
SMARTER: 一种数据高效框架,通过自增强大语言模型提升毒性检测与解释
机构 * University of Maryland(马里兰大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 SMARTER通过两阶段框架利用大语言模型自身输出生成解释,提升内容审核的可解释性,实验表明在三个基准任务中实现13%的宏F1提升,且数据使用量仅为全训练数据的分数。
Comments ACL 2026. NLP, Hate speech detection, explanation, LLM. Version 3
对话代理的IceBreaker:通过个性化开场白打破第一消息障碍
机构 * ByteDance(字节跳动)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出IceBreaker,通过生成个性化开场白帮助对话代理克服用户初始对话时的障碍,提升用户活跃度和点击率。
Comments ACL 2026 Accepted Paper (Industry Track)
通过AI反馈提升文本到视频生成中动态物体交互
机构 * Google DeepMind(谷歌DeepMind) ; The University of Tokyo(东京大学) ; Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。
Comments Website: https://sites.google.com/view/aif-dynamic-t2v/
基于 Scaffold 的偏好三元组用于大语言模型可控分子优化
机构 * National Key Laboratory of Parallel and Distributed Processing(平行与分布式处理国家重点实验室) ; College of Computer Science and Technology(计算机科学与技术学院) ; National University of DefenseTechnology(国防科技大学) ; DP Technology(DP科技)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出 Scaffold-Conditioned Preference Triplets (SCPT) 方法,通过构建约束三元组实现可控分子优化,提升分子性质改进的同时保持 Scaffold 相似性,优于传统方法。
心理学习范式如何塑造和制约人工智能
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。
Comments preprint journal
通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列
机构 * SpeakLeash ; ACK Cyfronet AGH(AGH科技大学计算机中心) ; Jagiellonian University(雅盖隆大学) ; Azurro ; Enelpol
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。
Comments arXiv admin note: text overlap with arXiv:2601.11579
小语言模型中的共享情感几何:跨架构研究中的表示、行为和方法学混淆
机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) ; ModuLabs(ModuLabs实验室)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了十二种小语言模型在统一理解模式下的21种情绪向量几何,发现五种成熟架构在情绪几何上几乎相同,而Gemma-3 1B base则表现出极端残差流各向异性。
Comments 34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine