Us-vs-Them bias in Large Language Models
大语言模型中的‘我们 vs 他们’偏见
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)
AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
大语言模型中的‘我们 vs 他们’偏见
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)
AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。
基于状态依赖拒绝和学习无能的强化学习人类反馈对齐语言模型
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title);large language model(abstract,comments);分类 cs.AI
AI总结 本研究提出通过观察行为来审计强化学习人类反馈对齐语言模型中的状态依赖拒绝和学习无能现象。
Comments 23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus
对联邦RLHF中偏好聚合的系统评估:为LLM的多元化对齐
机构 * Department of Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学系 加州大学伊文斯分校)
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract,comments);large language model(abstract);language model(abstract)
AI总结 本文提出了一种自适应偏好聚合方法,通过动态调整权重提升联邦RLHF中LLM的公平性与对齐性能。
Comments This paper is accepted at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle
基于一阶逻辑的强化学习人类反馈中奖励模型的替代方案
机构 * School of Computer Science(计算机科学系) ; Engineering Guangxi Normal University Guilin, China(广西师范大学)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 本文提出基于一阶逻辑的奖励机制,替代传统奖励建模,通过逻辑一致性提升模型对齐性能,实验显示其在性能和鲁棒性上优于标准微调方法。
整体效用偏好学习用于列表对齐
机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
AI总结 DRPO通过整体效用学习提升列表对齐效果,优化响应排名质量
先爱后知:基于人设的浪漫兼容性通过LLM文本世界引擎
机构 * BreathingCORE
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于LLM文本世界引擎的浪漫兼容性匹配方法,通过模拟互动预测人类偏好,实现个性化匹配系统。
Comments NeurIPS 2025 Workshop: First Workshop on LLM Persona Modeling (Oral)
理解训练扩散模型用于RLHF中的采样随机性
机构 * Columbia University, IEOR Department(哥伦比亚大学,工业工程与运营研究系)
专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在训练扩散模型用于RLHF时随机采样与确定性采样之间的不匹配问题,通过理论分析和实验验证,提出了非空的界限和更尖锐的收敛速率,并展示了高随机性SDE训练对ODE采样质量的提升作用。
PushGen: 基于LLM的推送通知生成
专题命中 后训练与偏好优化 :LLM(title,abstract)
AI总结 PushGen通过可控提示技术和奖励模型,实现高质量推送通知生成,已应用于大规模用户场景。
Comments Accepted by WSDM 2026
通过人类反馈改进强化学习的可解释性以提升对齐
机构 * Department of Electrical Engineering, Pennsylvania State University(宾夕法尼亚州立大学电气工程系) ; Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) ; College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG
AI总结 本文提出通过纠正RLHF中不满意响应的原因来提升语言模型对齐性的方法,结合事后解释与卸载技术改进模型响应质量。
Zoom-Zero: 通过时间放大实现强化的粗到细视频理解
机构 * NVIDIA(英伟达) ; KAUST(卡塔尔人工智能研究所在线大学)
专题命中 后训练与偏好优化 :language model(abstract)
AI总结 Zoom-Zero通过时间放大和令牌选择性信用分配提升视频问题回答的时空定位精度和答案准确性。
Comments Project page: https://xiaoqian-shen.github.io/Zoom-Zero/