arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-29 至 2025-10-29 共收录 44 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2510.24700 2025-10-29 cs.LG cs.AI cs.IT math.IT stat.ML 81%

Greedy Sampling Is Provably Efficient for RLHF

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Electrical and Computer Engineering University of Virginia(电气与计算机工程大学弗吉尼亚大学) Princeton Language and Intelligence Princeton University(普林斯顿语言与智能普林斯顿大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09539 2025-10-29 cs.CL cs.AI cs.LG 69%

Fine-tuning Large Language Models with Limited Data: A Survey and Practical Guide

Marton Szep, Daniel Rueckert, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与医学中的chair,技术大学慕尼黑(TUM)和慕尼黑技术大学医院) Department of Orthopaedics and Sports Orthopaedics, TUM University Hospital(骨科与运动骨科,慕尼黑技术大学医院) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML)) Department of Computing, Imperial College London, UK(计算系,帝国理工学院伦敦)

专题命中 偏好对齐 :alignment(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to TACL. Pre-MIT Press version. Major restructuring; added preference alignment section and additional tables. 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23751 2025-10-29 cs.LG cs.AI stat.ML 62%

Debiasing Reward Models by Representation Learning with Guarantees

Ignavier Ng, Patrick Blöbaum, Siddharth Bhandari, Kun Zhang, Shiva Kasiviswanathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德智能大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21143 2025-10-29 cs.AI 57%

PanicToCalm: A Proactive Counseling Agent for Panic Attacks

Jihyun Lee, Yejin Min, San Kim, Yejin Jeon, SungJun Yang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) Department of Computer Science and Engineering, POSTECH(计算机科学与工程系,POSTECH)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22092 2025-10-29 cs.AI 57%

VIRAL: Vision-grounded Integration for Reward design And Learning

Valentin Cuzin-Rambaud, Emilien Komlenovic, Alexandre Faure, Bruno Yun

机构 * Université Claude Bernard Lyon 1(克莱尔伯恩大学里昂1分校) CNRS(国家科学研究中心) Ecole Centrale de Lyon(里昂中央理工学院) INSA Lyon(里昂工业高等学院) Université Lumière Lyon 2(里昂2大学卢米埃尔分校) LIRIS(图像研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24430 2025-10-29 cs.IR 50%

From Time and Place to Preference: LLM-Driven Geo-Temporal Context in Recommendations

Yejin Kim, Shaghayegh Agah, Mayur Nankani, Neeraj Sharma, Feifei Peng, Maria Peifer, Sardar Hamidian, H Howie Huang

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20900 2025-10-29 cs.IR 50%

OneRec-V2 Technical Report

Guorui Zhou, Hengrui Hu, Hongtao Cheng, Huanjie Wang, Jiaxin Deng, Jinghao Zhang, Kuo Cai, Lejian Ren, Lu Ren, Liao Yu, Pengfei Zheng, Qiang Luo, Qianqian Wang, Qigen Hu, Rui Huang, Ruiming Tang, Shiyao Wang, Shujie Yang, Tao Wu, Wuchao Li, Xinchen Luo, Xingmei Wang, Yi Su, Yunfan Wu, Zexuan Cheng, Zhanyu Liu, Zixing Zhang, Bin Zhang, Boxuan Wang, Chaoyi Ma, Chengru Song, Chenhui Wang, Chenglong Chu, Di Wang, Dongxue Meng, Dunju Zang, Fan Yang, Fangyu Zhang, Feng Jiang, Fuxing Zhang, Gang Wang, Guowang Zhang, Han Li, Honghui Bao, Hongyang Cao, Jiaming Huang, Jiapeng Chen, Jiaqiang Liu, Jinghui Jia, Kun Gai, Lantao Hu, Liang Zeng, Qiang Wang, Qidong Zhou, Rongzhou Zhang, Shengzhe Wang, Shihui He, Shuang Yang, Siyang Mao, Sui Huang, Tiantian He, Tingting Gao, Wei Yuan, Xiao Liang, Xiaoxiao Xu, Xugang Liu, Yan Wang, Yang Zhou, Yi Wang, Yiwu Liu, Yue Song, Yufei Zhang, Yunfeng Zhao, Zhixin Ling, Ziming Li

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2510.13139 2025-10-29 cs.CY cs.CE cs.CL cs.MA 81%

Addressing the alignment problem in transportation policy making: an LLM approach

Xiaoyu Yan, Tianxing Dai, Yu Marco Nie

机构 * Department of Civil and Environmental Engineering, Northwestern University(土木与环境工程系,西北大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23960 2025-10-29 cs.CV cs.AI cs.CR 57%

SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability

Peiyang Xu, Minzhou Pan, Zhaorun Chen, Shuang Yang, Chaowei Xiao, Bo Li

机构 * University of Chicago(芝加哥大学) Virtue AI Meta University of Wisconsin, Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 42 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23899 2025-10-29 cs.MA cs.RO 50%

Coordinated Autonomous Drones for Human-Centered Fire Evacuation in Partially Observable Urban Environments

Maria G. Mendoza, Addison Kalanther, Daniel Bostwick, Emma Stephan, Chinmay Maheshwari, Shankar Sastry

机构 * Mechanical Engineering University of California, Berkeley(机械工程 加州大学伯克利分校) Computer Sciences University of California, Berkeley(计算机科学 加州大学伯克利分校) Computer Engineering Johns Hopkins University(计算机工程 约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract)

Comments Accepted to IEEE Global Humanitarian Technology Conference (GHTC 2025). 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2505.16947 2025-10-29 cs.LG cs.AI 73%

MixAT: Combining Continuous and Discrete Adversarial Training for LLMs

Csaba Dékány, Stefan Balauca, Robin Staab, Dimitar I. Dimitrov, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱孟·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院) ELTE Eötvös Loránd University, Budapest, Hungary(ELTE 爱斯特霍特·洛兰德大学,布达佩斯,匈牙利)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments Published at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24034 2025-10-29 cs.CV 50%

AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts

Yufan Liu, Wanqian Zhang, Huashan Chen, Lin Wang, Xiaojun Jia, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学网络空间学院) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :safety(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 2 篇

2510.24368 2025-10-29 cs.LG 57%

Filtering instances and rejecting predictions to obtain reliable models in healthcare

Maria Gabriela Valeriano, David Kohan Marzagão, Alfredo Montelongo, Carlos Roberto Veiga Kiffer, Natan Katz, Ana Carolina Lorena

机构 * Instituto de Computação(计算研究所) Universidade Estadual de Campinas(Campinas州立大学) Department of Informatics(信息学院) King’s College London(伦敦国王学院) Núcleo de Telessaúde(远程医疗中心) Universidade Federal do Rio Grande do Sul(鲁汶联邦大学) Escola Paulista de Medicina(巴西圣保罗医学学院) Universidade Federal de São Paulo(圣保罗联邦大学) Divisão de Ciência da Computação(计算机科学部) Instituto Tecnológico de Aeronáutica(航空技术研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments This paper is under review at Machine Learning (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23464 2025-10-29 cs.AI 57%

The Confidence Paradox: Can LLM Know When It's Wrong

Sahil Tripathi, Md Tabrez Nafis, Imran Hussain, Jiechao Gao

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted at the 14th IJCNLP & 4th AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 16 篇

2505.11842 2025-10-29 cs.CV cs.CL 79%

Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs

Xuannan Liu, Zekun Li, Zheqi He, Peipei Li, Shuhan Xia, Xing Cui, Huaibo Huang, Xi Yang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of California, Santa Barbara(加州大学圣芭芭拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(中国科学院CASIA智能感知与计算中心)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track, Project page: https://liuxuannan.github.io/Video-SafetyBench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01128 2025-10-29 cs.CV cs.AI 74%

RipVIS: Rip Currents Video Instance Segmentation Benchmark for Beach Monitoring and Safety

Andrei Dumitriu, Florin Tatui, Florin Miron, Aakash Ralhan, Radu Tudor Ionescu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国) University of Bucharest, Romania(布加勒斯特大学,罗马尼亚)

专题命中 安全评测 :safety(title);分类 cs.AI

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23921 2025-10-29 cs.CL cs.LG 73%

Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation

Kaveh Eskandari Miandoab, Mahammed Kamruzzaman, Arshia Gharooni, Gene Louis Kim, Vasanth Sarathy, Ninareh Mehrabi

机构 * Tufts University(塔夫茨大学) University of South Florida(佛罗里达州立大学) Sharif University of Technology(谢赫·穆吉布技术大学) Meta Resolution(解决方案)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23966 2025-10-29 cs.LG cs.SE 70%

A Pragmatic Way to Measure Chain-of-Thought Monitorability

Scott Emmons, Roland S. Zimmermann, David K. Elson, Rohin Shah

机构 * Google(谷歌)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24488 2025-10-29 cs.CL cs.AI 62%

A word association network methodology for evaluating implicit biases in LLMs compared to humans

Katherine Abramski, Giulio Rossetti, Massimo Stella

机构 * University of Pisa, Department of Computer Science(比萨大学计算机科学系) National Research Council of Italy, Institute of Information Science and Technologies(意大利国家研究委员会信息科学与技术研究所) University of Trento, Department of Psychology and Cognitive Science(特伦托大学心理学与认知科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13499 2025-10-29 cs.CY cs.AI 62%

Reproducible workflow for online AI in digital health

Susobhan Ghosh, Bhanu T. Gullapalli, Daiqi Gao, Asim Gazi, Anna Trella, Ziping Xu, Kelly Zhang, Susan A. Murphy

机构 * Harvard University(哈佛大学) Imperial College London(帝国理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24115 2025-10-29 cs.AI cs.LG 62%

HistoLens: An Interactive XAI Toolkit for Verifying and Mitigating Flaws in Vision-Language Models for Histopathology

Sandeep Vissapragada, Vikrant Sahu, Gagan Raj Gupta, Vandita Singh

机构 * Indian Institute of Technology(印度理工学院) All India Institute of Medical Sciences(全印度医学科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23854 2025-10-29 cs.CL cs.AI 62%

Can LLMs Narrate Tabular Data? An Evaluation Framework for Natural Language Representations of Text-to-SQL System Outputs

Jyotika Singh, Weiyi Sun, Amit Agarwal, Viji Krishnamurthy, Yassine Benajiba, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24431 2025-10-29 cs.IR cs.AI 57%

MiniOneRec: An Open-Source Framework for Scaling Generative Recommendation

Xiaoyu Kong, Leheng Sheng, Junfei Tan, Yuxin Chen, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20927 2025-10-29 cs.CY 57%

What do model reports say about their ChemBio benchmark evaluations? Comparing recent releases to the STREAM framework

Tom Reed, Tegan McCaslin, Luca Righetti

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments 12 pages, 6 figures. Includes appendices Added supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01778 2025-10-29 cs.LG stat.ML 57%

CONFIDERAI: a novel CONFormal Interpretable-by-Design score function for Explainable and Reliable Artificial Intelligence

Sara Narteni, Alberto Carlevaro, Fabrizio Dabbene, Marco Muselli, Maurizio Mongelli

机构 * Institute of Electronics, Information Engineering and Telecommunications - National Research Council of Italy (CNR-IEIIT)(电子信息与电信研究所 - 意大利国家科研理事会(CNR-IEIIT)) Politecnico di Torino - Department of Control and Computer Engineering (DAUIN)(托尼诺理工学院 - 控制与计算机工程系(DAUIN)) Rulex Innovation Labs(Rulex创新实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 26 pages, 3 figures, international journal

Journal ref Pattern Recognition, Volume 171, Part B, 2026, 112219, ISSN 0031-3203

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24259 2025-10-29 cs.CL cs.RO 57%

Can LLMs Translate Human Instructions into a Reinforcement Learning Agent's Internal Emergent Symbolic Representation?

Ziqi Ma, Sao Mai Nguyen, Philippe Xu

机构 * U2IS, ENSTA, IP-Paris(U2IS、ENSTA、IP-巴黎)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23622 2025-10-29 cs.LG cs.CR 57%

Adversarially-Aware Architecture Design for Robust Medical AI Systems

Alyssa Gerhart, Balaji Iyangar

机构 * Department of Computer Science Benedict College Columbia, SC, USA(计算机科学系 奥本大学 奥斯本, 南卡罗来纳州, 美国)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23988 2025-10-29 cs.RO 50%

A Survey on Collaborative SLAM with 3D Gaussian Splatting

Phuc Nguyen Xuan, Thanh Nguyen Canh, Huu-Hung Nguyen, Nak Young Chong, Xiem HoangVan

机构 * Institute of System Integration, Le Quy Don Technical University, Hanoi, 10000, Vietnam(越南吕文技术大学系统整合研究所) Graduate School of Advanced Science and Technology, Japan Advanced Institute of Science and Technology(日本先进科学技术研究院先进科学技术研究生院) University of Engineering and Technology, Vietnam National University, Hanoi, 10000, Vietnam(越南国家大学工程技术大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23908 2025-10-29 eess.SP cs.ET 50%

Machine Learning-Driven User Localization in RIS-Assisted Wireless Systems

M. T. Hassan, D. Zelenchuk, M. A. B. Abbasi

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12841 2025-10-29 cs.CV 50%

AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning

Yiming Ren, Zhiqiang Lin, Yu Li, Gao Meng, Weiyun Wang, Junjie Wang, Zicheng Lin, Jifeng Dai, Yujiu Yang, Wenhai Wang, Ruihang Chu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏