Bayesian scaling laws for in-context learning
机构 * Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total
机构 * Texas A&M University(德克萨斯大学) ; University of Michigan(密歇根大学) ; UIUC(伊利诺伊大学香槟分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.LG
Comments Published at EMNLP 2025
机构 * Stanford University(斯坦福大学) ; Boston University(波士顿大学) ; Columbia University(哥伦比亚大学) ; University of Toronto(多伦多大学) ; Institut Teknologi Bandung(Bandung 工程技术大学) ; Monash University Indonesia(墨尔本大学印尼分校) ; Capital One
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint
机构 * Soochow University(苏州大学) ; Baidu Inc.(百度公司) ; Shandong University(山东大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments This paper is accepted by EMNLP2025
机构 * Purdue University(普渡大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2025 Findings
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院) ; Gwangju Institute of Science and Technology (GIST)(全州科学技术院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments 20 page
Journal ref NIPS 2025 Poster
机构 * Fudan University(复旦大学) ; The Chinese University of Hong Kong, MMLab(香港中文大学MMLab) ; Lancaster University(兰卡斯特大学) ; Tongji University(同济大学) ; The University of Toronto(多伦多大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments A Survey of Reinforcement Learning for Large Language Models
专题命中 偏好对齐 :alignment(abstract)
机构 * Korea University(韩国大学) ; Hanwha Vision(翰威英航) ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(abstract)
Comments EMNLP 2025 Findings
机构 * University of Southern California(南加州大学) ; USC Institute for Creative Technologies(USC创意技术研究所)
专题命中 安全训练 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference
机构 * Yang Li Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院大学) ; Qiang Sheng Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所) ; Yehan Yang Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所) ; Xueyao Zhang The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Juan Cao Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院大学)
专题命中 安全训练 :alignment(abstract);DPO(abstract);safety(abstract);harmlessness(abstract)
Comments NeurIPS 2025 Accepted Paper
机构 * Monash University(墨尔本大学) ; The University of Melbourne(墨尔本大学) ; Transurban
专题命中 安全训练 :safety(title);jailbreak(abstract);分类 cs.AI
Comments Accepted to the ASE 2025 International Conference on Automated Software Engineering, Industry Showcase Track
专题命中 安全训练 :safety(abstract);分类 cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.LG
机构 * Beihang University(北京航空航天大学) ; Baidu Inc.(百度公司) ; Zhongguancun Laboratory(中关村实验室)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
Comments EMNLP 2025
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
Comments Under Review
机构 * Berkeley(伯克利) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; Montreal, Quebec, Canada(魁北克省蒙特利尔市) ; McGill University(麦吉尔大学) ; Georgia Tech(佐治亚理工学院)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.CY
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
Comments Accepted to Findings of EMNLP 2025
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学研究院高性能计算研究所) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/39k8f46q
机构 * Shanghai University of Engineering Science(上海工程技术大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Accepted by EMNLP2025
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Amazon(亚马逊) ; University of Sheffield(谢菲尔德大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG
Comments EMNLP25
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; College of Cyber Security, Jinan University(暨南大学网络安全学院)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
Comments 13 pages, 6 figures
机构 * University College London(伦敦大学学院) ; Holistic AI(整体AI)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI
Comments Winner of the OpenAI GPT-OSS-20B Red Teaming Challenge (Kaggle, 2025)
专题命中 红队测试 :alignment(abstract)
Comments AEAS has been implemented in the planning agent of PentestAgent, our LLM-driven automated penetration testing framework. Check out our repository: https://github.com/nbshenxm/pentest-agent
机构 * University of Edinburgh(爱丁堡大学) ; Alibaba Group(阿里巴巴集团) ; INF Technology(INF技术) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments ICLR 2025
机构 * Hidden for Review(保密)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI
机构 * Nara Institute of Science and Technology(奈良科学技术大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG
Comments Accepted at EMNLP 2025 Findings
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Virginia Tech(弗吉尼亚理工大学) ; Meta AI ; Adobe Research(Adobe研究)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
Comments 14 Pages, 8 Tables, 2 Figures. Accepted and to be published in the proceedings of FinNLP, Empirical Methods in Natural Language Processing 2025
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
Comments Accepted at EMNLP 2025 Findings. Camera Ready