arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-11 至 2025-09-11 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2509.08826 2025-09-11 cs.CV 67%

RewardDance: Reward Scaling in Visual Generation

Jie Wu, Yu Gao, Zilyu Ye, Ming Li, Liang Li, Hanzhong Guo, Jie Liu, Zeyue Xue, Xiaoxia Hou, Wei Liu, Yan Zeng, Weilin Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract)

Comments Bytedance Seed Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08500 2025-09-11 cs.AI 57%

TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making

Kechen Jiao, Zhirui Fang, Jiahao Liu, Bei Li, Qifan Wang, Xinyu Liu, Junhao Ruan, Zhongjian Qiao, Yifan Zhu, Yaxin Xu, Jingang Wang, Xiu Li

机构 * Tsinghua University(清华大学) Meituan(美团) Northeastern University(东北大学) Beijing University of Posts and Telecommunications(北京邮电大学) Meta AI Wuhan University(武汉大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2509.08075 2025-09-11 cs.CL 70%

No for Some, Yes for Others: Persona Prompts and Other Sources of False Refusal in Language Models

Flor Miriam Plaza-del-Arco, Paul Röttger, Nino Scherrer, Emanuele Borgonovo, Elmar Plischke, Dirk Hovy

机构 * LIACS, Leiden University(莱顿大学 LIACS) Bocconi University(博科尼大学) Independent Researcher(独立研究者) Boconni University(博科尼大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍兹中心)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08732 2025-09-11 econ.TH 50%

Incentives for Digital Twins: Task-Based Productivity Enhancements with Generative AI

Catherine Wu, Arun Sundararajan

专题命中 安全训练 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2509.08000 2025-09-11 cs.CL 77%

AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs

Debdeep Sanyal, Manodeep Ray, Murari Mandal

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2509.08638 2025-09-11 cs.RO 78%

AutoODD: Agentic Audits via Bayesian Red Teaming in Black-Box Models

Rebecca Martin, Jay Patrikar, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Field AI

专题命中 红队测试 :red teaming(title);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 1 篇

2509.08646 2025-09-11 cs.CR cs.AI cs.SY eess.SY 70%

Architecting Resilient LLM Agents: A Guide to Secure Plan-then-Execute Implementations

Ron F. Del Rosario, Klaudia Krawiecka, Christian Schroeder de Witt

专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 4 篇

2508.00300 2025-09-11 cs.HC cs.AI cs.LG 62%

MetaExplainer: A Framework to Generate Multi-Type User-Centered Explanations for AI Systems

Shruthi Chari, Oshani Seneviratne, Prithwish Chakraborty, Pablo Meyer, Deborah L. McGuinness

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Amazon Science(亚马逊科学) IBM Research(IBM研究院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08777 2025-09-11 cs.CV cs.CL 57%

Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles

Eric Slyman, Mehrab Tanjim, Kushal Kafle, Stefan Lee

机构 * Adobe(Adobe公司) Oregon State University(俄勒冈州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments 17 pages, 8 figures, Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08679 2025-09-11 cs.LG 57%

Signal Fidelity Index-Aware Calibration for Dementia Predictions Across Heterogeneous Real-World Data

Jingya Cheng, Jiazi Tian, Federica Spoto, Alaleh Azhir, Daniel Mork, Hossein Estiri

机构 * Department of Medicine, Massachusetts General Hospital(麻省总医院内科部) Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛T.H. Chan公共卫生学院生物统计学部) Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院内科部)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13107 2025-09-11 cs.CL cs.IR 57%

All for law and law for all: Adaptive RAG Pipeline for Legal Research

Figarri Keisha, Prince Singh, Pallavi, Dion Fernandes, Aravindh Manivannan, Ilham Wicaksono, Faisal Ahmad, Wiem Ben Rim

机构 * University College London(伦敦大学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments submitted to NLLP 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 2 篇

2507.00596 2025-09-11 cs.HC cs.CR 50%

Gaze3P: Gaze-Based Prediction of User-Perceived Privacy

Mayar Elfares, Pascal Reisert, Ralf Küsters, Andreas Bulling

专题命中 隐私与版权 :alignment(abstract)

Journal ref Proc. Privacy Enhancing Technologies Symposium (PETS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08142 2025-09-11 eess.SP 50%

Privacy Preserving Semantic Communications Using Vision Language Models: A Segmentation and Generation Approach

Haoran Chang, Mingzhe Chen, Huaxia Wang, Qianqian Zhang

专题命中 隐私与版权 :alignment(abstract)

Comments 6 pages, 6 figures, Accepted at IEEE MILCOM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 6 篇

2509.08494 2025-09-11 cs.CY cs.AI cs.CL cs.HC cs.LG 81%

HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants

Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis

机构 * Apart Research AI Safety Cape Town University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Sentience Institute(意识研究所)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08803 2025-09-11 cs.SI cs.AI cs.CL cs.CY 67%

Scaling Truth: The Confidence Paradox in AI Fact-Checking

Ihsan A. Qazi, Zohaib Khan, Abdullah Ghani, Agha A. Raza, Zafar A. Qazi, Wassay Sajjad, Ayesha Ali, Asher Javaid, Muhammad Abdullah Sohail, Abdul H. Azeemi

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 65 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08493 2025-09-11 cs.CR cs.AI 57%

Send to which account? Evaluation of an LLM-based Scambaiting System

Hossein Siadati, Haadi Jafarian, Sima Jafarikhah

机构 * AI Research, Cybera Global Inc./ UNCW(AI研究、Cybera全球公司/UNCW) Department of Computer Science and Engineering, UC Denver(计算机科学与工程系,UC Denver) Department of Computer Science, UNCW(计算机科学系,UNCW)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16838 2025-09-11 cs.CL 57%

REGen: A Reliable Evaluation Framework for Generative Event Argument Extraction

Omar Sharif, Joseph Gatto, Madhusudan Basak, Sarah M. Preum

机构 * Department of Computer Science, Dartmouth College(计算机科学系,达特茅斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08274 2025-09-11 cs.NI 50%

Enhancing 6G Network Security and Incident Response through Integrated VNF and SDN Technologies

Abdul Razaque, Abitkhanova Zhadyra Abitkhanovna

专题命中 安全评测 :safety(abstract)

Comments 14 page, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08221 2025-09-11 cs.RO 50%

A Comprehensive Review of Reinforcement Learning for Autonomous Driving in the CARLA Simulator

Elahe Delavari, Feeza Khan Khanzada, Jaerock Kwon

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

9. AI治理与伦理 3 篇

2508.09016 2025-09-11 cs.CL cs.LG 81%

A Survey on Training-free Alignment of Large Language Models

Birong Pan, Yongqi Li, Weiyu Zhang, Wenpeng Lu, Mayi Xu, Shen Zhou, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) Faculty of Computer Science and Technology, Qilu University of Technology, Shandong, China(青岛科技大学计算机科学与技术学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2025 (findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05929 2025-09-11 cs.CY 57%

Towards Reliable Generative AI-Driven Scaffolding: Reducing Hallucinations and Enhancing Quality in Self-Regulated Learning Support

Keyang Qian, Shiqi Liu, Tongguang Li, Mladen Raković, Xinyu Li, Rui Guan, Inge Molenaar, Sadia Nawaz, Zachari Swiecki, Lixiang Yan, Dragan Gašević

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Journal ref Computers & Education, Volume 240, 2026, 105448

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10160 2025-09-11 cs.CV cs.AI 57%

PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval

Jiancheng Pan, Muyuan Ma, Qing Ma, Cong Bai, Shengyong Chen

机构 * IEEE Publication Technology Department(IEEE出版技术部)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

10. 其他安全 4 篇

2509.08702 2025-09-11 stat.ME cs.CY stat.AP 74%

Generative AI as a Safety Net for Survey Question Refinement

Erica Ann Metheney, Lauren Yehle

专题命中 其他安全 :safety(title);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08820 2025-09-11 cs.RO 71%

RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation

Zongzheng Zhang, Chenghao Yue, Haobo Xu, Minwen Liao, Xianglin Qi, Huan-ang Gao, Ziwei Wang, Hao Zhao

专题命中 其他安全 :safety(title)

Comments Accepted to CoRL 2025, Project Page: https://zzongzheng0918.github.io/RoboChemist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11792 2025-09-11 cs.RO cs.AI cs.LG 62%

Efficient and Generalized end-to-end Autonomous Driving System with Latent Deep Reinforcement Learning and Demonstrations

Zuojin Tang, Xiaoyu Chen, Yongqiang Li, Jianyu Chen

机构 * Shanghai Qizhi Institute(上海启智研究所) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学院) Mogo Auto Intelligence and Telematics Information Technology Co., Ltd(摩戈智能与 telemetry 信息技术有限公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by ECML PKDD 2025 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08498 2025-09-11 cond-mat.mtrl-sci 50%

Benchmarking CHGNet Universal Machine Learning Interatomic Potential Against DFT and EXAFS: Case of Layered WS2 and MoS2

Pjotrs Žguns, Inga Pudza, Alexei Kuzmin

专题命中 其他安全 :alignment(abstract)

Journal ref J. Chem. Theory Comput. 2025, 21, 16, 8142-8150

详情

展开后加载摘要…

URL PDF HTML 收藏