Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
序列到序列奖励建模:通过语言反馈改进RLHF
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。
Comments 7 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
序列到序列奖励建模:通过语言反馈改进RLHF
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。
Comments 7 pages
LLaDA2.0:将扩散语言模型扩展到100B参数
机构 * Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; HongKong University of Science and Technology(香港科学与技术大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。
Comments 19 pages
沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性
机构 * School of Science and Technology(科学与技术学院) ; Kwansei Gakuin University(冈山大学) ; School of Engineering & Computer Science(工程与计算机科学学院) ; Victoria University of Wellington(惠灵顿维多利亚大学)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。