arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-25 至 2025-12-25 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2409.00162 2025-12-25 cs.CL cs.AI 86%

Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback

序列到序列奖励建模:通过语言反馈改进RLHF

Jiayi Zhou, Jiaming Ji, Juntao Dai, Dong Li, Yaodong Yang

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15745 2025-12-25 cs.LG cs.AI cs.CL 75%

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

LLaDA2.0:将扩散语言模型扩展到100B参数

Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Zhou, Liwang Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Westlake University(西湖大学) HongKong University of Science and Technology(香港科学与技术大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20884 2025-12-25 cs.AI 57%

The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents

沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性

Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学院) Kwansei Gakuin University(冈山大学) School of Engineering & Computer Science(工程与计算机科学学院) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏