arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-05 至 2025-08-05 共收录 48 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2406.16306 2025-08-05 cs.CL cs.LG stat.ML 84%

Cascade Reward Sampling for Efficient Decoding-Time Alignment

Bolian Li, Yifan Wang, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Department of Computer Science(计算机科学系)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01930 2025-08-05 cs.CL cs.AI 81%

Word Overuse and Alignment in Large Language Models: The Influence of Learning from Human Feedback

Tom S. Juzek, Zina B. Ward

机构 * Florida State University(佛罗里达州立大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in the Proceedings of the 5th Workshop on Bias and Fairness in AI (BIAS 2025) at ECML PKDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02312 2025-08-05 cs.CR cs.AI 70%

A Survey on Data Security in Large Language Models

Kang Chen, Xiuze Zhou, Yuanguo Lin, Jinhe Su, Yuanhui Yu, Li Shen, Fan Lin

机构 * School of Computer Engineering, Jimei University, Xiamen, 361021, China(厦门大学计算机工程学院) College of Science, Mathematics and Technology, Wenzhou-Kean University, Wenzhou, 325060, China(温州-凯恩大学科学、数学与技术学院) The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, 511453, China(香港科学与技术大学(广州)) School of Professional Studies, New York University, New York, 10003, United States(纽约大学专业研究学院) School of Informatics, Xiamen University, Xiamen, 361102, China(厦门大学信息学院)

专题命中 偏好对齐 :RLHF(abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13795 2025-08-05 cs.LG cs.AI 62%

Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN

Pengxiang Li, Lu Yin, Shiwei Liu

机构 * Dalian University of Technology(大连理工大学) University of Surrey(Surrey大学) University of Oxford(牛津大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2508.02063 2025-08-05 cs.AI 85%

TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs

Amitava Das, Vinija Jain, Aman Chadha

专题命中 安全训练 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02079 2025-08-05 cs.LG cs.AI 84%

AlignGuard-LoRA: Alignment-Preserving Fine-Tuning via Fisher-Guided Decomposition and Riemannian-Geodesic Collision Regularization

Amitava Das, Abhilekh Borah, Vinija Jain, Aman Chadha

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09845 2025-08-05 cs.RO 78%

Friction-Aware Safety Locomotion for Wheeled-legged Robots using Vision Language Models and Reinforcement Learning

Bo Peng, Donghoon Baek, Qijie Wang, Joao Ramos

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Mechanical Science Engineering(机械科学与工程系) School of Software(软件学院)

专题命中 安全训练 :safety(title,abstract)

Comments Accepted to Humanoids 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01990 2025-08-05 cs.AI 70%

Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems

Bang Liu, Xinfeng Li, Jiayi Zhang, Jinlin Wang, Tanjin He, Sirui Hong, Hongzhang Liu, Shaokun Zhang, Kaitao Song, Kunlun Zhu, Yuheng Cheng, Suyuchen Wang, Xiaoqiang Wang, Yuyu Luo, Haibo Jin, Peiyan Zhang, Ollie Liu, Jiaqi Chen, Huan Zhang, Zhaoyang Yu, Haochen Shi, Boyan Li, Dekun Wu, Fengwei Teng, Xiaojun Jia, Jiawei Xu, Jinyu Xiang, Yizhang Lin, Tianming Liu, Tongliang Liu, Yu Su, Huan Sun, Glen Berseth, Jianyun Nie, Ian Foster, Logan Ward, Qingyun Wu, Yu Gu, Mingchen Zhuge, Xinbing Liang, Xiangru Tang, Haohan Wang, Jiaxuan You, Chi Wang, Jian Pei, Qiang Yang, Xiaoliang Qi, Chenglin Wu

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2502.04322 2025-08-05 cs.LG cs.AI cs.CL cs.CY 81%

Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions

Yik Siu Chan, Narutatsu Ri, Yuxin Xiao, Marzyeh Ghassemi

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00459 2025-08-05 cs.CR 78%

Defense Against Prompt Injection Attack by Leveraging Attack Techniques

Yulin Chen, Haoran Li, Zihao Zheng, Yangqiu Song, Dekai Wu, Bryan Hooi

专题命中 越狱攻击 :prompt injection(title,abstract)

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01306 2025-08-05 cs.AI cs.CR 70%

PUZZLED: Jailbreaking LLMs through Word-Based Puzzles

Yelim Ahn, Jaejin Lee

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01308 2025-08-05 cs.CV 67%

Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks

Jiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Nanjing University(南京大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02523 2025-08-05 cs.CR 50%

Transportation Cyber Incident Awareness through Generative AI-Based Incident Analysis and Retrieval-Augmented Question-Answering Systems

Ostonya Thomas, Muhaimin Bin Munir, Jean-Michel Tine, Mizanur Rahman, Yuchen Cai, Khandakar Ashrafi Akbar, Md Nahiyan Uddin, Latifur Khan, Trayce Hockstad, Mashrur Chowdhury

专题命中 越狱攻击 :safety(abstract)

Comments This paper has been submitted to the Transportation Research Board (TRB) for consideration for presentation at the 2026 Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 4 篇

2508.02419 2025-08-05 cs.CV cs.CL 57%

Modality Bias in LVLMs: Analyzing and Mitigating Object Hallucination via Attention Lens

Haohan Zheng, Zhenguo Zhang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01678 2025-08-05 cs.CV cs.AI 57%

Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models

Zhaochen Wang, Yiwei Wang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06593 2025-08-05 cs.CV 50%

SAGI: Semantically Aligned and Uncertainty Guided AI Image Inpainting

Paschalis Giakoumoglou, Dimitrios Karageorgiou, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(阿尔伯塔大学电气与计算机工程系) Information Technologies Institute, CERTH(信息科技研究所)

专题命中 幻觉与事实性 :alignment(abstract)

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14369 2025-08-05 eess.SP 50%

Uncertainty Awareness in Wireless Communications and Sensing

Shixiong Wang, Wei Dai, Jianyong Sun, Zongben Xu, Geoffrey Ye Li

专题命中 幻觉与事实性 :trustworthy(abstract)

Journal ref IEEE Communications Magazine, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 11 篇

2507.22940 2025-08-05 cs.CL cs.AI 76%

Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes

Rui Jiao, Yue Zhang, Jinku Li

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01198 2025-08-05 cs.CL cs.AI 62%

Adaptive Content Restriction for Large Language Models via Suffix Optimization

Yige Li, Peihai Jiang, Jun Sun, Peng Shu, Tianming Liu, Zhen Xiang

机构 * Singapore Management University(新加坡管理大学) The University of Georgia(佐治亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02525 2025-08-05 cs.AI 57%

Accurate and Interpretable Postmenstrual Age Prediction via Multimodal Large Language Model

Qifan Chen, Jin Cui, Cindy Duan, Yushuo Han, Yifei Shi

机构 * King’s College London(伦敦国王学院) Imperial College London(帝国理工学院) Columbia University(哥伦比亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Submitted to the NeurIPS 2025 Workshop GenAI4Health. Conference website: https://aihealth.ischool.utexas.edu/GenAI4HealthNeurips2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01370 2025-08-05 cs.CL cs.IR 57%

MaRGen: Multi-Agent LLM Approach for Self-Directed Market Research and Analysis

Roman Koshkin, Pengyu Dai, Nozomi Fujikawa, Masahito Togami, Marco Visentini-Scarzanella

机构 * Okinawa Institute of Science and Technology(冲绳科学技术研究所) Institute of Science Tokyo(东京科学研究所) Amazon(亚马逊)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12441 2025-08-05 cs.CV cs.LG 57%

Describe Anything Model for Visual Question Answering on Text-rich Images

Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu

机构 * AI VIETNAM Lab(AI越南实验室) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10130 2025-08-05 cs.AI 57%

A Conjecture on a Fundamental Trade-Off between Certainty and Scope in Symbolic and Generative AI

Luciano Floridi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments version 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06762 2025-08-05 cs.LG cs.RO 57%

Investigating Robotaxi Crash Severity with Geographical Random Forest and the Urban Environment

Junfeng Jiao, Seung Gyu Baik, Seung Jun Choi, Yiming Xu

机构 * Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10047 2025-08-05 cs.MA 50%

Bearing-Distance Flocking with Zone-Based Interactions in Constrained Dynamic Environments

Hossein B. Jond

专题命中 安全评测 :alignment(abstract)

Comments Video for Figure 4: https://youtu.be/5nSml5F2oQk?si=X0q51SXcZiTRBdFS Video for Figure 6 (2D): https://youtu.be/ANkAZ9FMq0o?si=px8oSAeKkUwBR7uf Video for Figure 6 (3D): https://youtu.be/AUlcCH7P73U?si=QFYYeCGLIGdsJCad

Journal ref Journal of Computational Science, Volume 87, 2025, 102574

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02082 2025-08-05 cs.CV 50%

S-RRG-Bench: Structured Radiology Report Generation with Fine-Grained Evaluation Framework

Yingshu Li, Yunyi Liu, Zhanyu Wang, Xinyu Liang, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) University of Wollongong(沃林戈大学) University of Adelaide(阿德莱德大学) First Clinical Medical College, Guangzhou University of Chinese Medicine(广州中医药大学第一临床学院)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01582 2025-08-05 cs.CV 50%

Set Pivot Learning: Redefining Generalized Segmentation with Vision Foundation Models

Xinhui Li, Xinyu He, Qiming Hu, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18645 2025-08-05 cs.CV 50%

Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings

Azim Ospanov, Mohammad Jalali, Farzan Farnia

机构 * The Chinese University of Hong Kong, Department of Computer Science & Engineering(香港中文大学计算机科学与工程系)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 1 篇

2508.00847 2025-08-05 cs.HC cs.CY 57%

GPT Chatbots for Alleviating Anxiety and Depression: A Pilot Randomized Controlled Trial with Afghan Women

Sofia Sahab, Jawad Haqbeen, Diksha Sapkota, Takayuki Ito

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 19 篇

2508.01908 2025-08-05 cs.LG cs.AI cs.CL 82%

Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models

Istabrak Abbes, Gopeshh Subbaraj, Matthew Riemer, Nizar Islah, Benjamin Therien, Tsuguchika Tabaru, Hiroaki Kingetsu, Sarath Chandar, Irina Rish

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究院) Chandar Research Lab(Chandar研究实验室) IBM Research(IBM研究院) Fujitsu Research(富士通研究院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏