arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-04 至 2025-09-04 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2410.16033 2025-09-04 cs.CL cs.AI cs.LG 87%

TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling

Jiahao Qiu, Yifu Lu, Yifan Zeng, Jiacheng Guo, Jiayi Geng, Chenhao Zhu, Xinzhe Juan, Ling Yang, Huazheng Wang, Kaixuan Huang, Yue Wu, Mengdi Wang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 1 篇

2509.02650 2025-09-04 cs.AI cs.GT q-bio.PE 70%

Can Media Act as a Soft Regulator of Safe AI Development? A Game Theoretical Analysis

Henrique Correia da Fonseca, António Fernandes, Zhao Song, Theodor Cimpeanu, Nataliya Balabanova, Adeela Bashir, Paolo Bova, Alessio Buscemi, Alessandro Di Stefano, Manh Hong Duong, Elias Fernandez Domingos, Ndidi Bianca Ogbo, Simon T. Powers, Daniele Proverbio, Zia Ush Shamszaman, Fernando P. Santos, The Anh Han, Marcus Krellner

机构 * INESC-ID and Instituto Superior Técnico, Universidade de Lisboa(INESC-ID和里斯本大学理工学院) School of Computing, Engineering and Digital Technologies, Teesside University(计算、工程与数字技术学院,泰赛德大学) Biological and Environmental Sciences, University of Stirling(生物与环境科学,斯特林大学) School of Mathematics, University of Birmingham(数学学院,伯明翰大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Machine Learning Group, Université libre de Bruxelles(机器学习小组,布鲁塞尔自由大学) AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学) Division of Computing Science and Mathematics, University of Stirling(计算科学与数学系,斯特林大学) Department of Industrial Engineering, University of Trento(工业工程系,特伦特大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 10 Pages, 7 Figures, accepted in the ALIFE 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 1 篇

2505.23643 2025-09-04 cs.CR cs.AI 57%

Securing AI Agents with Information-Flow Control

Manuel Costa, Boris Köpf, Aashish Kolluri, Andrew Paverd, Mark Russinovich, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Santiago Zanella-Béguelin

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2406.13748 2025-09-04 cs.CL cs.LG 62%

Learn and Unlearn: Addressing Misinformation in Multilingual LLMs

Taiming Lu, Philipp Koehn

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 10 篇

2509.03270 2025-09-04 cs.SE cs.RO 88%

AI Safety Assurance in Electric Vehicles: A Case Study on AI-Driven SOC Estimation

Martin Skoglund, Fredrik Warg, Aria Mirzai, Anders Thorsen, Karl Lundgren, Peter Folkesson, Bastian Havers-zulka

机构 * RISE Research Institutes of Sweden(瑞典RISE研究机构)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract)

Comments 12 pages, 9 figures, EVS38, https://evs38-program.org/en/evs-38-proceedings/all

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17695 2025-09-04 cs.AI cs.NI 79%

Symbiotic Agents: A Novel Paradigm for Trustworthy AGI-driven Networks

Ilias Chatzistefanidis, Navid Nikaein

机构 * Eurecom(埃鲁埃康)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Submitted to Computer Networks AI for 6G

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12100 2025-09-04 cs.CR cs.AI 70%

LLM Embedding-based Attribution (LEA): Quantifying Source Contributions to Generative Model's Response for Vulnerability Analysis

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

机构 * Rochester Institute of Technology(罗切斯特技术学院) Gonzaga University(戈兹加大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03329 2025-09-04 cs.CY cs.CL 62%

SESGO: Spanish Evaluation of Stereotypical Generative Outputs

Melissa Robles, Catalina Bernal, Denniss Raigoso, Mateo Dulce Rubio

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03169 2025-09-04 cs.LG cs.AI 62%

Rashomon in the Streets: Explanation Ambiguity in Scene Understanding

Helge Spieker, Jørn Eirik Betten, Arnaud Gotlieb, Nadjib Lazaar, Nassim Belmecheri

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments AAAI 2025 Fall Symposium: AI Trustworthiness and Risk Assessment for Challenged Contexts (ATRACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21376 2025-09-04 cs.AI cs.CL 62%

AHELM: A Holistic Evaluation of Audio-Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Zijun Wang, Siwei Yang, Yifan Mai, Yuyin Zhou, Cihang Xie, Percy Liang

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克ruz分校) Hitachi America, Ltd.(日立美国有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03383 2025-09-04 cs.AI cs.RO 57%

ANNIE: Be Careful of Your Robots

Yiyang Huang, Zixuan Wang, Zishen Wan, Yapeng Tian, Haobo Xu, Yinhe Han, Yiming Gan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02820 2025-09-04 cs.LG 57%

Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs

Naman Deep Singh, Maximilian Müller, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center, Germany(图宾根大学及图宾根人工智能中心) EPFL, Switzerland(瑞士联邦理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02952 2025-09-04 cs.CV 50%

STAR: A Fast and Robust Rigid Registration Framework for Serial Histopathological Images

Zeyu Liu, Shengwei Ding

机构 * School of Biological Science and Medical Engineering, Beihang University, Beijing, China(生物科学与医学工程学院,北航,北京,中国) School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北航,北京,中国)

专题命中 安全评测 :alignment(abstract)

Comments The code is available at https://github.com/Rowerliu/STAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01275 2025-09-04 cs.CV 50%

Novel Category Discovery with X-Agent Attention for Open-Vocabulary Semantic Segmentation

Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu

专题命中 安全评测 :alignment(abstract)

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 1 篇

2507.03034 2025-09-04 cs.LG cs.AI cs.CR cs.CV cs.CY 67%

Rethinking Data Protection in the (Generative) Artificial Intelligence Era

Yiming Li, Shuo Shao, Yu He, Junfeng Guo, Tianwei Zhang, Zhan Qin, Pin-Yu Chen, Michael Backes, Philip Torr, Dacheng Tao, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Nanyang Technological University(南洋理工大学) University of Maryland(马里兰大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全部分) University of Oxford(牛津大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Perspective paper for a broader scientific audience. The first two authors contributed equally to this paper. 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 11 篇

2409.11171 2025-09-04 eess.SY cs.SY 78%

Preventing Inactive CBF Safety Filters Caused by Invalid Relative Degree Assumptions

Lukas Brunke, Siqi Zhou, Angela P. Schoellig

专题命中 其他安全 :safety(title,abstract)

Comments 8 pages, 4 figures, accepted for publication in the IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03137 2025-09-04 cs.LG cs.AI nucl-ex physics.comp-ph physics.ins-det 62%

A Neural Network Approach to Multi-radionuclide TDCR Beta Spectroscopy

Li Yi, Qian Yang

机构 * Institute of Frontier and Interdisciplinary Science, Shandong University(前沿与交叉科学研究院,山东大学) Key Laboratory of Particle Physics and Particle Irradiation, Ministry of Education, Shandong University(粒子物理与粒子辐照重点实验室,教育部,山东大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03118 2025-09-04 cs.LG cs.AI cs.MA 62%

A Hierarchical Deep Reinforcement Learning Framework for Traffic Signal Control with Predictable Cycle Planning

Hankang Gu, Yuli Zhang, Chengming Wang, Ruiyuan Jiang, Ziheng Qiao, Pengfei Fan, Dongyao Jia

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进技术学院,西安交通大学利物浦大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19475 2025-09-04 cs.CV astro-ph.GA cs.AI cs.LG 62%

GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis

Ruoqi Wang, Haitao Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03409 2025-09-04 cs.SD cs.AI cs.MM 57%

Multi-level SSL Feature Gating for Audio Deepfake Detection

Hoan My Tran, Damien Lolive, Aghilas Sini, Arnaud Delhay, Pierre-François Marteau, David Guennec

机构 * Univ Rennes, IRISA, CNRS(里昂大学、IRISA、CNRS) Univ Bretagne Sud, IRISA, CNRS(布列塔尼南大学、IRISA、CNRS)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02918 2025-09-04 cs.CV cs.AI 57%

Single Domain Generalization in Diabetic Retinopathy: A Neuro-Symbolic Learning Approach

Midhat Urooj, Ayan Banerjee, Farhat Shaikh, Kuntal Thakur, Sandeep Gupta

机构 * Impact Lab, Arizona State University(Impact实验室,亚利桑那州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments Accepted in ANSyA 2025: 1st International Workshop on Advanced Neuro-Symbolic Applications

Journal ref ANSyA 2025: 1st International Workshop on Advanced Neuro-Symbolic Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02610 2025-09-04 q-bio.QM cs.AI 57%

Resilient Biosecurity in the Era of AI-Enabled Bioweapons

Jonathan Feldman, Tal Feldman

机构 * Georgia Institute of Technology(佐治亚理工学院) Yale Law School(耶鲁法学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03129 2025-09-04 math.NT 50%

Unveiling Arithmetic Statistics of Congruent Number Elliptic Curves via Data Science and Machine Learning

Priyavrat Deshpande, Aditya Karnataki, Pratiksha Shingavekar

专题命中 其他安全 :alignment(abstract)

Comments 35 pages, 32 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17879 2025-09-04 eess.SP 50%

LLM4SG: Adapting Large Language Model for Scatterer Generation via Synesthesia of Machines

Zengrui Han, Lu Bai, Ziwei Huang, Xiang Cheng

专题命中 其他安全 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14906 2025-09-04 eess.IV cs.CV 50%

FetalFlex: Anatomy-Guided Diffusion Model for Flexible Control on Fetal Ultrasound Image Synthesis

Yaofei Duan, Tao Tan, Zhiyuan Zhu, Yuhao Huang, Yuanji Zhang, Rui Gao, Patrick Cheong-Iao Pang, Xinru Gao, Guowei Tao, Xiang Cong, Zhou Li, Lianying Liang, Guangzhi He, Linliang Yin, Xuedong Deng, Xin Yang, Dong Ni

机构 * organization= Faculty of Applied Sciences, Macao Polytechnic University , city= Macao , country= China organization= National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University , city= Shenzhen , state= Guangdong , country= China organization= Shenzhen RayShape Medical Technology Co., Ltd , city= Shenzhen , state= Guangdong , country= China organization= Department of Ultrasound, Shenzhen Guangming District People’s Hospital , city= Shenzhen , state= Guangdong , country= China organization= Jinan University , city= Guangzhou , state= Guangdong , country= China organization= Center for Medical Ultrasound, The Affiliated Suzhou Hospital of Nanjing Medical University, Suzhou Municipal Hospital, Gusu School, Nanjing Medical University , city= Suzhou , state= Jiangsu , country= China organization= Medical Ultrasound Image Computing (MUSIC) Laboratory, Shenzhen University , city= Shenzhen , state= Guangdong , country= China organization= Qilu Hospital of Shandong University , city= Jinan , state= Shandong , country= China organization= Northwest Women \& Children Hospital , city= Xian , state= Shaanxi , country= China

专题命中 其他安全 :alignment(abstract)

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16646 2025-09-04 cs.SE 50%

instancespace: a Python Package for Insightful Algorithm Testing through Instance Space Analysis

Yusuf Berdan Güzel, Kushagra Khare, Nathan Harvey, Kian Dsouza, Dong Hyeog Jang, Junheng Chen, Cheng Ze Lam, Mario Andrés Muñoz

专题命中 其他安全 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏