arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-04 至 2025-11-04 共收录 66 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2506.02095 2025-11-04 cs.CV cs.LG 83%

Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences

Hyojin Bahng, Caroline Chan, Fredo Durand, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01083 2025-11-04 cs.RO 82%

Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment

Zihan Wang, Jianwen Li, Li-Fan Wu, Nina Mahmoudian

机构 * School of Mechanical Engineering, Purdue University(机械工程学院,普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract)

Comments Submitted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04721 2025-11-04 cs.CL 79%

SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat

Yuru Jiang, Wenxuan Ding, Shangbin Feng, Greg Durrett, Yulia Tsvetkov

机构 * Zhejiang University(浙江大学) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09802 2025-11-04 cs.CL cs.AI 76%

Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment

Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Cloud Computing(阿里云计算)

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI

Comments emnlp 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01807 2025-11-04 cs.CL cs.AI 62%

Plan-and-Write: Structure-Guided Length Control for LLMs without Model Retraining

Adewale Akinfaderin, Shreyas Subramanian, Akarsha Sehwag

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments Presented at Workshop on Prompt Optimization, KDD 2025, Toronto, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2511.01689 2025-11-04 cs.CL cs.AI cs.LG 67%

Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI

Sharan Maiya, Henning Bartsch, Nathan Lambert, Evan Hubinger

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00993 2025-11-04 cs.AI cs.LG 62%

Aligning LLM agents with human learning and adjustment behavior: a dual agent approach

Tianming Liu, Jirong Yang, Yafeng Yin, Manzi Li, Linghao Wang, Zheng Zhu

机构 * Department of Civil and Environmental Engineering, University of Michigan, Ann Arbor, United States(美国密歇根大学土木与环境工程系) Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, United States(美国密歇根大学电气工程与计算机科学系) College of Civil Engineering and Architecture, Zhejiang University, Hangzhou, China(浙江大学建筑工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 32 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00880 2025-11-04 cs.LG cs.AI 62%

KFCPO: Kronecker-Factored Approximated Constrained Policy Optimization

Joonyoung Lim, Younghwan Yoo

机构 * School of Computer Science and Engineering, Pusan National University, Busan, Korea(计算机科学与工程学院,釜山国立大学,韩国釜山)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 8 figures, submitted to ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16813 2025-11-04 cs.CL cs.AI 62%

Incivility and Rigidity: Evaluating the Risks of Fine-Tuning LLMs for Political Argumentation

Svetlana Churina, Kokil Jaidka

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00029 2025-11-04 cs.LG cs.AI 62%

Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts

Samaksh Bhargav, Zining Zhu

机构 * Edison Academy Magnet School New Jersey, USA(新泽西州埃迪森磁校) Department of Computer Science(计算机科学系) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00112 2025-11-04 cs.RO cs.AI 57%

Real-DRL: Teach and Learn in Reality

Yanbing Mao, Yihao Cai, Lui Sha

机构 * Engineering Technology Division(工程科技部门) Wayne State University(韦恩州立大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16240 2025-11-04 cs.RO 50%

Cosmos-Surg-dVRK: World Foundation Model-based Automated Online Evaluation of Surgical Robot Policy Learning

Lukas Zbinden, Nigel Nelson, Juo-Tung Chen, Xinhao Chen, Ji Woong Kim, Mahdi Azizian, Axel Krieger, Sean Huver

机构 * NVIDIA Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学)

专题命中 安全训练 :alignment(abstract)

Comments minor metadata and notation fixes; +3 citations

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2511.00509 2025-11-04 cs.AI cs.CR 90%

Reimagining Safety Alignment with An Image

Yifan Xia, Guorui Chen, Wenqian Yu, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University, Wuhan, China(武汉大学信息管理学院) Torr Vision Group, University of Oxford, Oxford, United Kingdom(牛津大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03343 2025-11-04 cs.CR cs.AI cs.CL 84%

What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks

Nathalie Kirch, Constantin Weisser, Severin Field, Helen Yannakoudakis, Stephen Casper

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) Deepgram University of Louisville(路易斯维尔大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00556 2025-11-04 cs.CL 79%

Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack

Peng Ding, Jun Kuang, Wen Sun, Zongyu Wang, Xuezhi Cao, Xunliang Cai, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Meituan Inc.(美团公司)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

Comments Preprint, 14 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2511.00203 2025-11-04 cs.LG stat.ML 57%

Diffusion LLMs are Natural Adversaries for any LLM

David Lüdke, Tom Wollschläger, Paul Ungermann, Stephan Günnemann, Leo Schwinn

机构 * Department of Computer Science \& Munich Data Science Institute Technical University of Munich, Germany

专题命中 红队测试 :red teaming(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 1 篇

2511.01287 2025-11-04 cs.CL cs.CR 74%

"Give a Positive Review Only": An Early Investigation Into In-Paper Prompt Injection Attacks and Defenses for AI Reviewers

Qin Zhou, Zhexin Zhang, Zhi Li, Limin Sun

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学计算机科学与技术系对话式人工智能小组)

专题命中 提示注入 :prompt injection(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 7 篇

2511.00126 2025-11-04 cs.LG cs.AI 73%

Dynamic Model Selection for Trajectory Prediction via Pairwise Ranking and Meta-Features

Lu Bowen

机构 * Lu Bowen(路 Bowen)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00620 2025-11-04 cs.CL 70%

Certain but not Probable? Differentiating Certainty from Probability in LLM Token Outputs for Probabilistic Scenarios

Autumn Toney-Wails, Ryan Wails

机构 * SciTech Strategies, Inc.(SciTech Strategies公司) Georgetown University(乔治城大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments To appear at the Second Workshop on Uncertainty-Aware NLP @EMNLP 2025 (UncertaiNLP '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05777 2025-11-04 cs.CL cs.AI cs.CY 67%

Medical Hallucinations in Foundation Models and Their Impact on Healthcare

Yubin Kim, Hyewon Jeong, Shan Chen, Shuyue Stella Li, Chanwoo Park, Mingyu Lu, Kumail Alhamoud, Jimin Mun, Cristina Grau, Minseok Jung, Rodrigo Gameiro, Lizhou Fan, Eugene Park, Tristan Lin, Joonsik Yoon, Wonjin Yoon, Maarten Sap, Yulia Tsvetkov, Paul Liang, Xuhai Xu, Xin Liu, Chunjong Park, Hyeonhoon Lee, Hae Won Park, Daniel McDuff, Samir Tulebaev, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University Hospital(首尔国立大学医院) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01458 2025-11-04 cs.CV cs.AI 57%

When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA

Dennis Pierantozzi, Luca Carlini, Mauro Orazio Drago, Chiara Lena, Cesare Hassan, Elena De Momi, Danail Stoyanov, Sophia Bano, Mobarak I. Hoque

机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00419 2025-11-04 cs.CV cs.AI 57%

LGCA: Enhancing Semantic Representation via Progressive Expansion

Thanh Hieu Cao, Trung Khang Tran, Gia Thinh Pham, Tuong Nghiem Diep, Thanh Binh Nguyen

机构 * University of Science, Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学科学大学) National University of Singapore, Singapore(新加坡国立大学) AISIA Lab, Ho Chi Minh City, Vietnam(越南胡志明市AISIA实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments 15 pages, 5 figures, to appear in SoICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08809 2025-11-04 cs.LG 57%

Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models

Wei Chen, Xin Yan, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Long Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Kuaishou Technology(快手科技)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.LG

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 57%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2511.01284 2025-11-04 cs.CV cs.AI 57%

Adaptation of Foundation Models for Medical Image Analysis: Strategies, Challenges, and Future Directions

Karma Phuntsho, Abdullah, Kyungmi Lee, Ickjai Lee, Euijoon Ahn

机构 * James Cook University(詹姆斯库克大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 16 篇

2506.03659 2025-11-04 cs.CL 85%

Trustworthy Medical Question Answering: An Evaluation-Centric Survey

Yinuo Wang, Baiyang Wang, Robert E. Mercer, Frank Rudzicz, Sudipta Singha Roy, Pengjie Ren, Zhumin Chen, Xindi Wang

机构 * Shandong University(山东大学) University of Western Ontario(西方大学) Dalhousie University(达尔豪斯大学) University of Toronto(多伦多大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07170 2025-11-04 cs.LG cs.AI 82%

Trustworthy AI Must Account for Interactions

Jesse C. Cresswell

机构 * Jesse C. Cresswell(独立研究者)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG;alignment(comments)

Comments Presented at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03665 2025-11-04 cs.LG cs.AI 76%

A DbC Inspired Neurosymbolic Layer for Trustworthy Agent Design

Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00843 2025-11-04 cs.HC 75%

Portal UX Agent -- A Plug-and-Play Engine for Rendering UIs from Natural Language Specifications

Xinsong Li, Ning Jiang, Jay Selvaraj

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26781 2025-11-04 cs.CV 71%

ChartAB: A Benchmark for Chart Grounding & Dense Alignment

Aniruddh Bansal, Davit Soselia, Dang Nguyen, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 安全评测 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏