arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-01 至 2025-10-01 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2509.25771 2025-10-01 cs.CV cs.AI 85%

Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs

Jia Jun Cheng Xian, Muchen Li, Haotian Yang, Xin Tao, Pengfei Wan, Leonid Sigal, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Kling Team, Kuaishou Technology(快手科技 Kling 团队) NSERC CRC Chair(加拿大NSERC CRC主席)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24610 2025-10-01 cs.LG cs.CL 84%

OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment

Liang Lin, Zhihao Xu, Junhao Dong, Jian Zhao, Yuchen Yuan, Guibin Zhang, Miao Yu, Yiming Zhang, Zhengtao Yao, Huahui Yi, Dongrui Liu, Xinfeng Li, Kun Wang

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) RUC(中国人民大学) USTC(University of Science and Technology of China) NTU(National University of Technology) NUS(National University of Singapore) USC(University of Southern California) SCU(Sichuan University) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25568 2025-10-01 cs.CL cs.AI 76%

Probing the Limits of Stylistic Alignment in Vision-Language Models

Asma Farajidizaji, Akash Gupta, Vatsal Raina

机构 * Imperial College London(伦敦帝国学院) Apta AI

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25717 2025-10-01 cs.CV cs.CL cs.LG 73%

Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization

Xintong Li, Chuhan Wang, Junda Wu, Rohan Surana, Tong Yu, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣迭戈分校) Adobe Research(Adobe研究)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26231 2025-10-01 cs.CV 67%

IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance

Jiayi Guo, Chuanhao Yan, Xingqian Xu, Yulin Wang, Kai Wang, Gao Huang, Humphrey Shi

机构 * Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25409 2025-10-01 cs.CL cs.AI cs.LG 67%

From Faithfulness to Correctness: Generative Reward Models that Think Critically

Qiyao Ma, Yunsheng Shi, Hongtao Tian, Chao Wang, Weiming Chang, Ting Yao

机构 * University of California, Davis(加州大学戴维斯分校) WeChat, Tencent(微信、腾讯) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03006 2025-10-01 cs.SE 67%

A Preference-Driven Methodology for High-Quality Solidity Code Generation

Zhiyuan Peng, Xin Yin, Chenhao Ying, Chao Ni, Yuan Luo

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24361 2025-10-01 cs.CV cs.AI cs.HC 57%

UI-UG: A Unified MLLM for UI Understanding and Generation

Hao Yang, Weijie Qiu, Ru Zhang, Zhou Fang, Ruichao Mao, Xiaoyu Lin, Maji Huang, Zhaosong Huang, Teng Guo, Shuoyang Liu, Hai Rao

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23285 2025-10-01 cs.AI 57%

Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2509.25457 2025-10-01 cs.HC cs.CY 86%

Human vs. AI Safety Perception? Decoding Human Safety Perception with Eye-Tracking Systems, Street View Images, and Explainable AI

Yuhao Kang, Junda Chen, Liu Liu, Kshitij Sharmad, Martina Mazzarello, Simone Mora, Fabio Duarte, Carlo Ratti

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CY

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05021 2025-10-01 cs.CL cs.CR 85%

Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety

Yuyou Zhang, Miao Li, William Han, Yihang Yao, Zhepeng Cen, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25767 2025-10-01 cs.AI 57%

Galton's Law of Mediocrity: Why Large Language Models Regress to the Mean and Fail at Creativity in Advertising

Matt Keon, Aabid Karim, Bhoomika Lohana, Abdul Karim, Thai Nguyen, Tara Hamilton, Ali Abbas

机构 * mv Research Lab(55mv研究实验室) Monash University(莫纳什大学) School of Engineering, Western Sydney University(西澳大学工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26593 2025-10-01 cs.HC 50%

Exploring Large Language Model as an Interactive Sports Coach: Lessons from a Single-Subject Half Marathon Preparation

Kichang Lee

专题命中 安全训练 :safety(abstract)

Comments 23 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 6 篇

2509.26345 2025-10-01 cs.AI 83%

SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models

Qinjian Zhao, Jiaqi Wang, Zhiqiang Gao, Zhihao Dou, Belal Abuhaija, Kaizhu Huang

机构 * Wenzhou-Kean University(温州市凯恩大学) University of Bremen(不莱梅大学) Case Western Reserve University(凯斯西储大学) Duke Kunshan University(杜克昆山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12299 2025-10-01 cs.CR cs.AI 83%

QGuard:Question-based Zero-shot Guard for Multi-modal LLM Safety

Taegyeong Lee, Jeonghwa Yoo, Hyoungseo Cho, Soo Yong Kim, Yunho Maeng

机构 * FnGuide Inc.(FnGuide公司) Safe Generative AI Lab, MODULABS(MODULABS安全生成AI实验室) A.I.MATICS Inc.(A.I.MATICS公司) Ewha Womans University(成均馆大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

Comments Accept to ACLW 2025 (WOAH); fix typo

Journal ref ACL Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21761 2025-10-01 cs.CR cs.AI 77%

Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models

Miao Yu, Zhenhong Zhou, Moayad Aloqaily, Kun Wang, Biwei Huang, Stephen Wang, Yueming Jin, Qingsong Wen

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) United Arab Emirates University(阿拉伯联合酋长国大学) University of California San Diego(加州大学圣地亚哥分校) Abel AI National University of Singapore(新加坡国立大学) Squirrel Ai Learning

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01872 2025-10-01 cs.CL 77%

Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions

Rachneet Sachdeva, Rima Hazra, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science and Hessian Center for AI (hessian.AI), Technical University of Darmstadt(德累斯顿技术大学计算机科学系、海斯堡人工智能中心(hessian.AI)、通用知识处理实验室(UKP Lab))

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13115 2025-10-01 cs.CL cs.AI cs.CR 62%

Dagger Behind Smile: Fool LLMs with a Happy Ending Story

Xurui Song, Zhixin Xie, Shuo Huai, Jiayi Kong, Jun Luo

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校S实验室) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15420 2025-10-01 cs.CR cs.AI 57%

Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries

Yuhao Wang, Wenjie Qu, Shengfang Zhai, Yanze Jiang, Zichen Liu, Yue Liu, Yinpeng Dong, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2509.25894 2025-10-01 cs.SE 71%

Red Teaming Program Repair Agents: When Correct Patches can Hide Vulnerabilities

Simin Chen, Yixin He, Suman Jana, Baishakhi Ray

专题命中 红队测试 :red teaming(title)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2509.25712 2025-10-01 cs.LG 74%

Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking

Dengming Zhang, Xiaowen Ma, Zhenliang Ni, Zhenkai Wu, Han Shu, Xin Jiang, Xinghao Chen

机构 * Zhejiang University(浙江大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 幻觉与事实性 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11625 2025-10-01 cs.LG cs.AI cs.CR 73%

Inducing Uncertainty on Open-Weight Models for Test-Time Privacy in Image Recognition

Muhammad H. Ashiq, Peter Triantafillou, Hung Yun Tseng, Grigoris G. Chrysos

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Warwick(沃里克大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26610 2025-10-01 cs.LG 57%

Uncertainty Quantification for Regression using Proper Scoring Rules

Alexander Fishkov, Kajetan Schweighofer, Mykyta Ielanskyi, Nikita Kotelevskii, Mohsen Guizani, Maxim Panov

机构 * Department of Machine Learning, MBZUAI(机器学习部门,MBZUAI) ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz(林兹ELLIS单元和LIT AI实验室,机器学习研究所,林兹约翰内斯·开普勒大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25669 2025-10-01 cs.AI 57%

GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination

Xinxi Chen, Tianyang Chen, Lijia Hong

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04943 2025-10-01 cs.CV cs.CL 57%

ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding

Jianjiang Yang, Yanshu li, Ziyan Huang

机构 * University of Bristol(布里斯托大学) Brown University(布朗大学) South China University of Technology(华南理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted by conference EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 19 篇

2501.15463 2025-10-01 cs.HC cs.AI cs.CL 81%

Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?

Hua Shen, Nicholas Clark, Tanushree Mitra

机构 * University of Washington(华盛顿大学) NYU Shanghai(纽约大学上海校区) New York University(纽约大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26167 2025-10-01 cs.AI 79%

'Too much alignment; not enough culture': Re-balancing cultural alignment practices in LLMs

Eric J. W. Orlowski, Hakim Norhashim, Tristan Koh Ly Wey

机构 * AI Singapore, National University of Singapore(AI新加坡,国立新加坡大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 8 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25885 2025-10-01 cs.AI 79%

SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents

Ruolin Chen, Yinqian Sun, Jihang Wang, Mingyang Lv, Qian Zhang, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知AI实验室,自动化研究所,中国科学院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全AI与超对齐关键实验室) Beijing Institute of AI Safety and Governance(北京AI安全与治理研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Long-term AI(长期AI)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26122 2025-10-01 math.NA cs.NA 78%

Trustworthy AI in numerics: On verification algorithms for neural network-based PDE solvers

Emil Haugen, Alexei Stepanenko, Anders C. Hansen

专题命中 安全评测 :trustworthy(title,abstract)

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04974 2025-10-01 eess.AS cs.SD 78%

From Voice to Safety: Language AI Powered Pilot-ATC Communication Understanding for Airport Surface Movement Collision Risk Assessment

Yutian Pang, Andrew Paul Kendall, Alex Porcayo, Mariah Barsotti, Anahita Jain, John-Paul Clarke

机构 * Department of Aerospace Engineering and Engineering Mechanics(航空航天工程与工程力学系)

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏