Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 10 pages, 1 figure
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments ICLR 2024. Project website and open-source code: https://eureka-research.github.io/
专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
Comments 25 pages, 27 Figures, 8 Tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
Comments PhD thesis
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
Comments CVPR 2024 accepted; huggingface daily paper
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 22 pages, 5 figures, Submitted to ACL 2024
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract,comments);DPO(abstract);分类 cs.CL
Comments Accepted by AAAI-2025, 16 pages, reward model, LLM Alignment, code repository at (https://github.com/e0397123/FLR)
GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索
专题命中 偏好对齐 :alignment(title)
AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026), July 20-24, 2026, Melbourne, VIC, Australia
生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐
机构 * University of Manitoba(曼尼托巴大学) ; University of Winnipeg(温哥华大学)
专题命中 偏好对齐 :alignment(title)
AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。
专题命中 偏好对齐 :alignment(title)
Comments 73 pages
专题命中 偏好对齐 :alignment(title)
Comments 7 pages, 9 figures, 3 tables; appendix 16 pages, 9 figures, 6 tables
机构 * Lenovo Research(联想研究) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学) ; Shandong University(山东大学)
专题命中 偏好对齐 :alignment(title)
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 偏好对齐 :alignment(title)
Comments CVPR2025
超越成对反馈:用于基于偏好的奖励学习的列表式视觉-语言监督
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出首个结合视觉-语言模型生成偏好与普拉科特-卢斯模型的列表式奖励学习框架,在Meta-World操纵任务中,其表现与基线相当且更灵活,最佳配置达86%平均成功率。
Comments 13 pages, 10 figures. Srivalli Katkuri and Maxwell Kawada contributed equally to this work
多卖少玩:LLM真实销售技能基准测试
机构 * SF Express(顺丰速运)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出SalesLLM基准测试,通过30,074个剧本配置和1,805个多轮场景评估大语言模型的销售能力,采用自动评估流程和用户模型CustomerLM提升模拟真实性,实验显示LLM在销售任务上的表现差异显著。
基于上下文的在线不确定性感知偏好学习用于人类反馈
机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) ; Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。
AI University:一款面向工程领域的大语言模型驱动学习助手——以有限元法案例研究为例
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究提出AI-U框架,结合微调LLM、RAG与推理合成模型,以FEM课程为案例开发学习助手,经多维度评估其对齐度优于基础模型,可推广至STEM领域。
Comments 14 pages, 3 figures
为离线强化学习未来政策近似改进数学推理
机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。
Comments 12 pages
LLM 能否可靠地自我报告对抗性预填充,以及如何实现?
机构 * KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(abstract_cn);safety(abstract);分类 cs.CL
AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。
Comments In submission
超越前缀局部性的混合强化学习回滚调度
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。