arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-03 至 2025-09-03 共收录 88 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 12 篇

2509.00309 2025-09-03 cs.CL 83%

Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models

Chen Zheng, Yiyuan Ma, Yuan Yang, Deyi Liu, Jing Liu, Zuquan Song, Yuxin Song, Cheng Ren, Hang Zhu, Xin Liu, Yiyuan Ma, Siyuan Qiao, Xun Zhou, Liang Xiang, Yonghui Wu

机构 * Peking University(北京大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20491 2025-09-03 cs.CV cs.CL cs.LG 82%

VPO: Aligning Text-to-Video Generation Models with Prompt Optimization

Jiale Cheng, Ruiliang Lyu, Xiaotao Gu, Xiao Liu, Jiazheng Xu, Yida Lu, Jiayan Teng, Zhuoyi Yang, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02666 2025-09-03 cs.CL 79%

A Survey on Progress in LLM Alignment from the Perspective of Reward Design

Miaomiao Ji, Yanqiu Wu, Zhibin Wu, Shoujin Wang, Jian Yang, Mark Dras, Usman Naseem

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00373 2025-09-03 cs.CV cs.AI 70%

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

Sihao Wu, Gaojie Jin, Wei Huang, Jianhong Wang, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) Purple Mountain Laboratories(紫金山实验室) University of Bristol(布里斯托大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00685 2025-09-03 eess.AS cs.SD 67%

MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech

Kangxiang Xia, Xinfa Zhu, Jixun Yao, Lei Xie

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments Accepted by NCMMSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03742 2025-09-03 cs.CL cs.AI cs.LG 67%

Beyond Scalar Reward Model: Learning Generative Judge from Preference Data

Ziyi Ye, Xiangsheng Li, Qiuchi Li, Qingyao Ai, Yujia Zhou, Wei Shen, Dong Yan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Baichuan AI(拜智科技) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref The Thirteenth International Conference on Learning Representations 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05790 2025-09-03 cs.AI cs.HC cs.LG 66%

Understanding Impact of Human Feedback via Influence Functions

Taywon Min, Haeone Lee, Yongchan Kwon, Kimin Lee

机构 * KAIST(韩国科学技术院) Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :RLHF(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted at ACL 2025, Source code: https://github.com/mintaywon/IF_RLHF

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics 63 (2025) 27471-27500

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21496 2025-09-03 cs.CV cs.AI 57%

ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding

Hao Lu, Jiahao Wang, Yaolun Zhang, Ruohui Wang, Xuanyu Zheng, Yepeng Tang, Dahua Lin, Lewei Lu

机构 * Sensetime(秒氏科技)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01035 2025-09-03 cs.CL 57%

We Politely Insist: Your LLM Must Learn the Persian Art of Taarof

Nikta Gohari Sadr, Sahar Heidariasl, Karine Megerdoomian, Laleh Seyyed-Kalantari, Ali Emami

机构 * Brock University(布鲁克大学) Zoorna AI York University(约克大学) Emory University(埃默里大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03612 2025-09-03 cs.CL 57%

AIR: A Systematic Analysis of Annotations, Instructions, and Response Pairs in Preference Dataset

Bingxiang He, Wenbin Zhang, Jiaxi Song, Cheng Qian, Zixuan Fu, Bowen Sun, Ning Ding, Haiwen Hong, Longtao Huang, Hui Xue, Ganqu Cui, Wanxiang Che, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Lab(上海人工智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accept at the Conference On Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01610 2025-09-03 cs.CV 50%

Improving Large Vision and Language Models by Learning from a Panel of Peers

Jefferson Hernandez, Jing Shi, Simon Jenni, Vicente Ordonez, Kushal Kafle

机构 * Rice University(里士大学) Adobe Research(Adobe研究)

专题命中 偏好对齐 :alignment(abstract)

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01232 2025-09-03 cs.CV 50%

FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework

Lingzhou Mu, Qiang Wang, Fan Jiang, Mengchao Wang, Yaqi Fan, Mu Xu, Kai Zhang

专题命中 偏好对齐 :DPO(abstract)

Comments https://fantasy-amap.github.io/fantasy-hsi/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2509.00654 2025-09-03 cs.SD cs.AI cs.LG cs.MM eess.AS 62%

The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation

Ashwin Nagarajan, Hao-Wen Dong

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Michigan(密歇根大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01379 2025-09-03 cs.CL 57%

WATCHED: A Web AI Agent Tool for Combating Hate Speech by Expanding Data

Paloma Piot, Diego Sánchez, Javier Parapar

机构 * IRLab, CITIC, Universidade da Coruña, Spain(IR实验室、CITIC、科鲁纳大学、西班牙)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15144 2025-09-03 cs.AI 57%

Mobile-Agent-v3: Fundamental Agents for GUI Automation

Jiabo Ye, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Zhaoqing Zhu, Ziwei Zheng, Feiyu Gao, Junjie Cao, Zhengxi Lu, Jitong Liao, Qi Zheng, Fei Huang, Jingren Zhou, Ming Yan

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00918 2025-09-03 cs.CR 50%

PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement

Xubin Yue, Zhenhua Xu, Wenpeng Xing, Jiahui Yu, Mohan Li, Meng Han

专题命中 安全训练 :harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2412.05892 2025-09-03 cs.CR cs.AI 80%

PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

Ruoxi Cheng, Yizhong Ding, Shuirong Cao, Ranjie Duan, Xiaoshuang Jia, Shaowei Yuan, Simeng Qin, Zhiqiang Wang, Xiaojun Jia

机构 * Alibaba Group(阿里巴巴集团) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Northeastern University(东北大学) BraneMatrix AI Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

Comments Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00391 2025-09-03 cs.CL cs.AI cs.CR cs.LG 67%

The Resurgence of GCG Adversarial Attacks on Large Language Models

Yuting Tan, Xuying Li, Zhuo Li, Huizhen Shu, Peikang Hu

机构 * HydroX AI San Jose CA USA(HydroX AI)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10722 2025-09-03 cs.CL cs.AI 62%

MEGen: Generative Backdoor into Large Language Models via Model Editing

Jiyang Qiu, Xinbei Ma, Zhuosheng Zhang, Hai Zhao, Yun Li, Qianren Wang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University(上海交通大学智能交互与认知工程重点实验室) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海Web3可信数据流通与治理重点实验室) Cognitive AI Lab(认知人工智能实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11727 2025-09-03 cs.CR cs.AI cs.CL cs.SE 62%

Efficient Detection of Toxic Prompts in Large Language Models

Yi Liu, Junzhe Yu, Huijia Sun, Ling Shi, Gelei Deng, Yuqi Chen, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) ShanghaiTech University(上海科技大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

Comments Accepted by the 39th IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2509.02163 2025-09-03 cs.RO cs.AI 83%

Enhancing Reliability in LLM-Integrated Robotic Systems: A Unified Approach to Security and Safety

Wenxiao Zhang, Xiangrui Kong, Conan Dewitt, Thomas Bräunl, Jin B. Hong

机构 * The University of Western Australia(西澳大学)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00124 2025-09-03 cs.CR cs.AI cs.CY 62%

A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See

Shaked Zychlinski

机构 * JFrog

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.CY

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 7 篇

2310.03525 2025-09-03 cs.CV 67%

Vehicle-to-Everything Cooperative Perception for Autonomous Driving

Tao Huang, Jianan Liu, Xi Zhou, Dinh C. Nguyen, Mostafa Rahimi Azghadi, Yuxuan Xia, Qing-Long Han, Sumei Sun

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) Momoni AI Department of Electrical and Computer Engineering, University of Alabama in Huntsville(电气与计算机工程系,阿拉巴马大学亨茨维尔分校) Department of Automation and Intelligent Sensing, Shanghai Jiaotong University(自动化与智能感知系,上海交通大学) School of Engineering, Swinburne University of Technology(工程学院,斯威本技术大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息与通信研究机构,科技研究局(A*STAR))

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

Comments This article has been accepted for publication in Proceedings of the IEEE on 11 August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00646 2025-09-03 cs.CY cs.AI 62%

RAG-PRISM: A Personalized, Rapid, and Immersive Skill Mastery Framework with Adaptive Retrieval-Augmented Tutoring

Gaurangi Raul, Yu-Zheng Lin, Karan Patel, Bono Po-Jen Shih, Matthew W. Redondo, Banafsheh Saber Latibari, Jesus Pacheco, Soheil Salehi, Pratik Satam

机构 * College of Information Science, University of Arizona, Tucson, AZ, USA(信息科学学院,亚利桑那大学) Department of Electrical and Computer Engineering, University of Arizona, Tucson, AZ, USA(电气与计算机工程系,亚利桑那大学) Department of Systems and Industrial Engineering, University of Arizona, Tucson, AZ, USA(系统与工业工程系,亚利桑那大学) Department of Industrial Engineering, University of Sonora, Hermosillo, Mexico(工业工程系,索诺拉大学) Leonhard Center for Enhancement of Engineering Education, The Pennsylvania State University, University Park, PA, USA(工程教育增强中心,宾夕法尼亚州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

Comments 9 pages, 5 figures, Accepted by IEEE FIE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02129 2025-09-03 cs.LG cs.CV 57%

Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time

Jintao Cheng, Weibin Li, Jiehao Luo, Xiaoyu Tang, Zhijian He, Jin Wu, Yao Zou, Wei Zhang

机构 * Hong Kong University of Science(香港科学与技术大学) South China Normal University, Shanwei, Guangdong, China(华南师范大学,汕尾,广东,中国) Shenzhen Technology University, Shenzhen, Guangdong, China(深圳科技大学,深圳,广东,中国) University of Science(科学大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00869 2025-09-03 cs.CL 57%

Exploring and Mitigating Fawning Hallucinations in Large Language Models

Zixuan Shangguan, Yanjie Dong, Lanjun Wang, Xiaoyi Fan, Victor C. M. Leung, Xiping Hu

机构 * School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(深圳MSU-BIT大学人工智能研究院) Tianjin University(天津大学) The Hong Kong University of Science(香港科学大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11649 2025-09-03 cs.AI cs.SI 57%

Competing LLM Agents in a Non-Cooperative Game of Opinion Polarisation

Amin Qasmi, Usman Naseem, Mehwish Nasim

机构 * The University of Western Australia(西澳大学) Lahore University of Management Sciences(拉合尔管理科学大学) Macquarie University(麦考瑞大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17187 2025-09-03 cs.GT cs.IR econ.TH 50%

Optimal Calibrated Signaling in Digital Auctions

Zhicheng Du, Wei Tang, Zihe Wang, Shuo Zhang

专题命中 幻觉与事实性 :trustworthy(abstract)

Comments 56 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16988 2025-09-03 cs.IR 50%

RAGentA: Multi-Agent Retrieval-Augmented Generation for Attributed Question Answering

Ines Besrour, Jingbo He, Tobias Schreieder, Michael Färber

专题命中 幻觉与事实性 :trustworthy(abstract)

Comments Accepted at SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2509.02411 2025-09-03 cs.CR cs.AI 57%

A Survey: Towards Privacy and Security in Mobile Large Language Models

Honghui Xu, Kaiyang Li, Wei Chen, Danyang Zheng, Zhiyuan Li, Zhipeng Cai

机构 * Department of Information Technology, Kennesaw State University(肯纳邦大学信息科技系) Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) Nexa AI School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏