Fine-tuning language models to find agreement among humans with diverse preferences
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2021 Competition Track
专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments WWW 2021, 11 pages
专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG
机构 * Tsinghua University(清华大学) ; Shanghai Qi Zhi Institute(上海启智研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Peng Cheng Laboratory(鹏城实验室) ; National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL;RLHF(comments)
Comments Project Website: https://github.com/RLHF-V/RLAIF-V
机构 * University of Bonn(波恩大学) ; Lamarr Institute for ML and AI(拉马尔机器学习与人工智能研究院)
专题命中 偏好对齐 :alignment(abstract,comments);分类 cs.AI
Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)
专题命中 偏好对齐 :DPO(abstract,comments);分类 cs.CL
Comments ACL 2024. Code and data are available at https://github.com/TianduoWang/DPO-ST
专题命中 偏好对齐 :DPO(abstract,comments);分类 cs.CL
Comments Project Website: https://opendatalab.github.io/HA-DPO, Code: https://github.com/opendatalab/HA-DPO
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL;RLHF(comments)
Comments EMNLP 2023 findings, Length Bias in RLHF, Mitigate bias in reward modeling
指令质量至关重要:优化指令以实现有效的偏好学习
机构 * Sogang University(西江大学) ; Korea University(高丽大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 该研究发现指令质量是偏好学习的隐性瓶颈,提出基于奖励信号与评分标准引导的LLM反馈的指令优化流程,可提升偏好数据质量,增强LLM对齐效果。
Comments Preprint
由大语言模型(LLM)与人类撰写的新冠疫情信息解释的沟通风格及读者偏好:一项案例研究
机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) ; Amazon(亚马逊) ; Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究以健康事实核查为场景,对比LLM与人类新冠信息解释的沟通风格,发现LLM内容在说服性等质量指标上较弱但受读者偏好,揭示LLM在健康领域的潜力与局限。
LLM判断的“先定位后决策”保证
机构 * University of Exeter(埃克塞特大学) ; Cardiff University(卡迪夫大学) ; University of the West of England(西英格兰大学) ; University of Macau(澳门大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 针对LLM作为评估者时候选响应增多导致置信度假设失效的问题,提出“先定位后决策”框架,结合共形预测与校准规则,提升保证成功率与覆盖率。
Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: https://github.com/llm2409/Localize-Then-Decide
VGA-BenchV2:用于评估视频美学与生成质量的扩展统一基准及多模型框架
机构 * Ant Group(蚂蚁集团) ; Beijing Film Academy(北京电影学院) ; Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 该研究提出扩展的视频评估基准VGA-BenchV2,构建混合评估器架构,并将其作为奖励模型优化视频生成器,实现从基准到模型优化的闭环,提升视频的美学质量与人类偏好对齐性。
Comments IJCAI 2026
城市的AI权利:公共空间的多元协同设计与治理
专题命中 偏好对齐 :alignment(abstract);分类 cs.CY
AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。
Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables
MediSkill-Evo:面向证据依据的临床交互的过程约束自进化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 偏好对齐 :DPO(abstract_cn);分类 cs.AI
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables, Code is available at: [https://github.com/XuPeng23/AeroDPO]
开放评分系统:通过成对自适应评分表扩展强化学习
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) ; Beijing University Of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。
对齐人类感知:用于视频生成的校准分布奖励学习
机构 * City University of Hong Kong(香港城市大学) ; ShanghaiTech University(上海科技大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; The Ohio State University(俄亥俄州立大学) ; University of Glasgow(格拉斯哥大学) ; Columbia University(哥伦比亚大学) ; University of Arizona(亚利桑那大学) ; GMI Cloud ; National University of Singapore(新加坡国立大学) ; DeciLix Lab
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。
Comments Accepted by ECCV 2026
LitReview Arena:基于对战式同行评审平台的文献综述智能体评估
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。
Comments 20 pages, ICML 2026
TraceSQL:无参考文本到SQL验证的可追踪答案性估计
机构 * Oracle Corporation(甲骨文公司)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。
Comments 9 pages main paper with 6 pages supplementary material
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
SlidesGen-Bench: 通过计算和定量指标评估幻灯片生成
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 SlidesGen-Bench通过计算和定量指标评估幻灯片生成,提出统一框架和可重复的量化指标,构建人类偏好对齐数据集,提升与人类判断的一致性。
Comments 37 pages, 34 figures, EMNLP 2026 Main Conference
PersonalBench:测量大语言模型个性化中的作者差距
机构 * Independent AI Researcher(独立人工智能研究员)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。
Comments 17 pages. Extended version
欲行远,需同行:多样化偏好引出奖励优化的课程设置
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
AI总结 该研究针对AI对齐中服务不足用户的问题,提出CurriPO方法,通过构建树状课程设置适配多样化用户目标,在个性化连续控制任务上使群体满意度达最强基线的1.2-2.1倍且缩短训练时间。
Comments 14 pages, 7 figures
AI 可以学习科学品味
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 本文提出RLCF框架,通过社区反馈学习科学品味,使AI能提出高潜力研究想法,实验显示其优于现有模型并具备泛化能力。
Comments 47 pages, 5 figures
通过角色扮演训练LLM:探索AI素养对说服力的影响
机构 * Institute for Clarity in Documentation(文档清晰研究所) ; Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) ; Rajiv Gandhi University(拉吉夫·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕默研究实验室)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
AI总结 本文通过角色扮演训练LLMimic,提升用户AI素养,减少AI说服力效果,并增强诚实与社会责任感。
作为元评审员的校准生成式AI:对同行评审的评审的系统功能语言学话语分析
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究以美国公立大学研究生在线课程为对象,基于系统功能语言学分析120份元评审,发现校准生成式AI可近似有效人类反馈特征,能提升学习者对同行评审的参与度。
Comments 39 pages, 3 tables
参与式道德人工智能并非中立:开发者的隐形之手
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 该研究发现,道德AI偏好征集流程中的特征范围、投票者构成、问题措辞三项关键选择会显著影响AI决策,仅靠投票汇总无法实现公平透明的AI,需对流程各阶段审计披露。
Comments 35 pages, 11 Figures
从在线用户反馈中学习购物智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 提出LOFA框架,结合强化学习与反馈感知的策略内蒸馏,利用真实在线用户反馈改进购物智能体,在电商日志实验中提升了推荐质量、回复有用性及用户满意度对齐效果。