arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-01 至 2025-10-01 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2509.25771 2025-10-01 cs.CV cs.AI 85%

Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs

Jia Jun Cheng Xian, Muchen Li, Haotian Yang, Xin Tao, Pengfei Wan, Leonid Sigal, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Kling Team, Kuaishou Technology(快手科技 Kling 团队) NSERC CRC Chair(加拿大NSERC CRC主席)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24610 2025-10-01 cs.LG cs.CL 84%

OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment

Liang Lin, Zhihao Xu, Junhao Dong, Jian Zhao, Yuchen Yuan, Guibin Zhang, Miao Yu, Yiming Zhang, Zhengtao Yao, Huahui Yi, Dongrui Liu, Xinfeng Li, Kun Wang

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) RUC(中国人民大学) USTC(University of Science and Technology of China) NTU(National University of Technology) NUS(National University of Singapore) USC(University of Southern California) SCU(Sichuan University) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25568 2025-10-01 cs.CL cs.AI 76%

Probing the Limits of Stylistic Alignment in Vision-Language Models

Asma Farajidizaji, Akash Gupta, Vatsal Raina

机构 * Imperial College London(伦敦帝国学院) Apta AI

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25717 2025-10-01 cs.CV cs.CL cs.LG 73%

Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization

Xintong Li, Chuhan Wang, Junda Wu, Rohan Surana, Tong Yu, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣迭戈分校) Adobe Research(Adobe研究)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26231 2025-10-01 cs.CV 67%

IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance

Jiayi Guo, Chuanhao Yan, Xingqian Xu, Yulin Wang, Kai Wang, Gao Huang, Humphrey Shi

机构 * Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25409 2025-10-01 cs.CL cs.AI cs.LG 67%

From Faithfulness to Correctness: Generative Reward Models that Think Critically

Qiyao Ma, Yunsheng Shi, Hongtao Tian, Chao Wang, Weiming Chang, Ting Yao

机构 * University of California, Davis(加州大学戴维斯分校) WeChat, Tencent(微信、腾讯) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03006 2025-10-01 cs.SE 67%

A Preference-Driven Methodology for High-Quality Solidity Code Generation

Zhiyuan Peng, Xin Yin, Chenhao Ying, Chao Ni, Yuan Luo

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24361 2025-10-01 cs.CV cs.AI cs.HC 57%

UI-UG: A Unified MLLM for UI Understanding and Generation

Hao Yang, Weijie Qiu, Ru Zhang, Zhou Fang, Ruichao Mao, Xiaoyu Lin, Maji Huang, Zhaosong Huang, Teng Guo, Shuoyang Liu, Hai Rao

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23285 2025-10-01 cs.AI 57%

Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏