Bayesian scaling laws for in-context learning
机构 * Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total
机构 * Texas A&M University(德克萨斯大学) ; University of Michigan(密歇根大学) ; UIUC(伊利诺伊大学香槟分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.LG
Comments Published at EMNLP 2025
机构 * Stanford University(斯坦福大学) ; Boston University(波士顿大学) ; Columbia University(哥伦比亚大学) ; University of Toronto(多伦多大学) ; Institut Teknologi Bandung(Bandung 工程技术大学) ; Monash University Indonesia(墨尔本大学印尼分校) ; Capital One
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint
机构 * Soochow University(苏州大学) ; Baidu Inc.(百度公司) ; Shandong University(山东大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments This paper is accepted by EMNLP2025
机构 * Purdue University(普渡大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2025 Findings
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院) ; Gwangju Institute of Science and Technology (GIST)(全州科学技术院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments 20 page
Journal ref NIPS 2025 Poster
机构 * Fudan University(复旦大学) ; The Chinese University of Hong Kong, MMLab(香港中文大学MMLab) ; Lancaster University(兰卡斯特大学) ; Tongji University(同济大学) ; The University of Toronto(多伦多大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments A Survey of Reinforcement Learning for Large Language Models
专题命中 偏好对齐 :alignment(abstract)
机构 * Korea University(韩国大学) ; Hanwha Vision(翰威英航) ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(abstract)
Comments EMNLP 2025 Findings