arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2505.19209 2025-10-28 cs.CL cs.AI cs.CE stat.ML 62%

MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search

Zonglin Yang, Wanhao Liu, Ben Gao, Yujie Liu, Wei Li, Tong Xie, Lidong Bing, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) MiroMind The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17823 2025-10-28 cs.CV cs.AI cs.LG 62%

Robust Multimodal Learning via Cross-Modal Proxy Tokens

Md Kaykobad Reza, Ameya Patil, Mashhour Solh, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 28 Pages, 13 Figures, 11 Tables. Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09947 2025-10-28 cs.LG cs.AI 62%

Identifying Trustworthiness Challenges in Deep Learning Models for Continental-Scale Water Quality Prediction

Xiaobo Xia, Xiaofeng Liu, Jiale Liu, Kuai Fang, Lu Lu, Samet Oymak, William S. Currie, Tongliang Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted by Nexus (Cell Press). 61 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21389 2025-10-27 cs.LG cs.AI cs.HC 62%

Assessing the Real-World Utility of Explainable AI for Arousal Diagnostics: An Application-Grounded User Study

Stefan Kraft, Andreas Theissler, Vera Wienhausen-Wilke, Gjergji Kasneci, Hendrik Lensch

机构 * IT-Designers Gruppe Esslingen am Neckar(埃斯林根内卡尔IT设计组) University of Tübingen(图宾根大学) University of Giessen(吉森大学) Klinikum Esslingen, Klinik für Kardiologie, Pneumologie und Angilologie(埃斯林根克林克医院,心内科、呼吸科和内科) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20611 2025-10-24 cs.LG cs.AI 62%

PSO-XAI: A PSO-Enhanced Explainable AI Framework for Reliable Breast Cancer Detection

Mirza Raquib, Niloy Das, Farida Siddiqi Prity, Arafath Al Fahim, Saydul Akbar Murad, Mohammad Amzad Hossain, MD Jiabul Hoque, Mohammad Ali Moni

机构 * Department of Information and Communication Engineering, Noakhali Science and Technology University(信息与通信工程系,诺阿克利科学与技术大学) Department of Computer Science & Engineering, Netrokona University(计算机科学与工程系,纳特罗克纳大学) Department of Computer and Communication Engineering, International Islamic University Chittagong(计算机与通信工程系,国际伊斯兰大学查塔格ONG) Department of Mechatronics and Industrial Engineering, Chittagong University of Engineering and Technology(机电与工业工程系,查塔格ONG工程与技术大学) School of Computing Sciences and Computer Engineering, University of Southern Mississippi(计算科学与计算机工程学院,密西西比州立大学) AI & Digital Health Technology, Artificial Intelligence and Cyber Futures Institute, Charles Sturt University(人工智能与数字健康技术,人工智能与网络未来研究院,查尔斯·斯图尔特大学) AI & Digital Health Technology, Rural Health Research Institute, Charles Sturt University(人工智能与数字健康技术,农村健康研究学院,查尔斯·斯图尔特大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20270 2025-10-24 cs.LG cs.CL 62%

ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases

Ziqian Zhong, Aditi Raghunathan, Nicholas Carlini

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20211 2025-10-24 cs.SE cs.AI cs.LG 62%

Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents

Zhenning Yang, Hui Guan, Victor Nicolet, Brandon Paulsen, Joey Dodds, Daniel Kroening, Ang Chen

机构 * University of Michigan(密歇根大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20193 2025-10-24 cs.IR cs.CL cs.CV cs.LG 62%

Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures

Rahul Raja, Arpita Vats

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11824 2025-10-24 cs.MA cs.AI cs.LG 62%

Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning

Simin Li, Zihao Mao, Hanxiao Li, Zonglei Jing, Zhuohang bian, Jun Guo, Li Wang, Zhuoran Han, Ruixiao Xu, Xin Yu, Chengdong Ma, Yuqing Ma, Bo An, Yaodong Yang, Weifeng Lv, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院) Institute of data space, Hefei Comprehensive National Science Center(合肥综合国家科学中心数据空间研究院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 44 pages, 16 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07142 2025-10-24 cs.CL cs.AI cs.DL 62%

Toward Purpose-oriented Topic Model Evaluation enabled by Large Language Models

Zhiyin Tan, Jennifer D'Souza

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in International Journal on Digital Libraries (IJDL)

Journal ref International Journal on Digital Libraries, vol. 26, no. 4, pp. 23, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11261 2025-10-24 cs.AI cs.CL 62%

Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework

Yunpu Zhao, Rui Zhang, Junbin Xiao, Changxin Ke, Ruibo Hou, Yifan Hao, Ling Li

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Journal ref Neurocomputing, Volume 659, 2026, 131217

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19866 2025-10-24 cs.CL cs.AI 62%

An Evaluation of the Pedagogical Soundness and Usability of AI-Generated Lesson Plans Across Different Models and Prompt Frameworks in High-School Physics

Xincheng Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20612 2025-10-24 cs.CV cs.CL cs.LG 62%

Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models

Peter Robicheaux, Matvei Popov, Anish Madan, Isaac Robinson, Joseph Nelson, Deva Ramanan, Neehar Peri

机构 * Roboflow Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments The first two authors contributed equally. This work has been accepted to the Neural Information Processing Systems (NeurIPS) 2025 Datasets & Benchmark Track. Project Page: https://rf100-vl.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19032 2025-10-23 cs.CL cs.CY cs.HC 62%

When Can We Trust LLMs in Mental Health? Large-Scale Benchmarks for Reliable LLM Evaluation

Abeer Badawi, Elahe Rahimi, Md Tahmid Rahman Laskar, Sheri Grach, Lindsay Bertrand, Lames Danok, Jimmy Huang, Frank Rudzicz, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14623 2025-10-23 cs.LG cs.AI 62%

LeapFactual: Reliable Visual Counterfactual Explanation Using Conditional Flow Matching

Zhuo Cao, Xuan Zhao, Lena Krieger, Hanno Scharr, Ira Assent

机构 * IAS-8, Forschungszentrum Jülich, Germany(茹里希研究所,德国) Munich Center for Machine Learning (MCML), LMU Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑大学,德国) Aarhus University, Denmark(奥胡斯大学,丹麦)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted as a poster presentation at NeurIPS 2025. Camera-ready version. 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18581 2025-10-22 cs.CY cs.AI 62%

The Cost-Benefit of Interdisciplinarity in AI for Mental Health

Katerina Drakos, Eva Paraschou, Simay Toplu, Line Harder Clemmensen, Christoph Lütge, Nicole Nadine Lønfeldt, Sneha Das

机构 * Center for Social Data Science, Faculty of Social Sciences, University of Copenhagen(哥本哈根大学社会科学学院社会数据科学中心) Dept. of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Institute for Ethics in Artificial Intelligence, School of Social Sciences and Technology, Technical University of Munich(慕尼黑技术大学社会科学与技术学院人工智能伦理研究所) Dept. of Mathematical Sciences, University of Copenhagen(哥本哈根大学数学科学系) Child and Adolescent Mental Health Center, Copenhagen University Hospital(哥本哈根大学医院青少年与儿童心理健康中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

Comments Accepted for poster presentation at the AI in Science Summit 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18898 2025-10-22 cs.CV cs.AI cs.LG cs.RO 62%

Interpretable Decision-Making for End-to-End Autonomous Driving

Mona Mirzaie, Bodo Rosenhahn

机构 * Institute for Information Processing, Leibniz University Hannover(信息处理研究所,汉诺威莱布尼茨大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted to the ICCV 2025 2nd Workshop on the Challenge Of Out-of-Label Hazards in Autonomous Driving (2COOOL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17455 2025-10-21 cs.CL cs.AI 62%

Towards Evaluating Proactive Risk Awareness of Multimodal Language Models

Youliang Yuan, Wenxiang Jiao, Yuejin Xie, Chihao Shen, Menghan Tian, Wenxuan Wang, Jen-tse Huang, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Xiaohongshu Inc.(小红书公司) Renmin University of China(中国人民大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 (Track on Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16017 2025-10-21 cs.CV cs.AI cs.CL cs.RO 62%

InfraGPT Smart Infrastructure: An End-to-End VLM-Based Framework for Detecting and Managing Urban Defects

Ibrahim Sheikh Mohamed, Abdullah Yahya Abdullah Omaisan

机构 * Independent Researchers(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14351 2025-10-21 cs.CL cs.AI 62%

Beyond One World: Benchmarking Super Heros in Role-Playing Across Multiversal Contexts

Perapard Ngokpol, Kun Kerdthaisong, Pasin Buakhaw, Pitikorn Khlaisamniang, Supasate Vorathammathorn, Piyalitt Ittichaiwong, Nutchanon Yongsatianchot

机构 * Faculty of Engineering, Thammasat School of Engineering, Thammasat University(工程学院,泰国朱拉安高校工程学院,泰国朱拉安大学) Department of Computer Engineering and Digital Technology, Faculty of Engineering, Chulalongkorn University(计算机工程与数字技术系,工程学院,朱拉安大学) Artificial Intelligence Association of Thailand(泰国人工智能协会) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,伦敦国王学院) Siriraj Informatics and Data Innovation Center (SIData+), Faculty of Medicine, Siriraj Hospital, Mahidol University(Siriraj信息与数据创新中心(SIData+),医学学院,Siriraj医院,玛希道大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21148 2025-10-21 cs.CL cs.AI 62%

A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

Ming Hu, Chenglong Ma, Wei Li, Wanghan Xu, Jiamin Wu, Jucheng Hu, Tianbin Li, Guohang Zhuang, Jiaqi Liu, Yingzhou Lu, Ying Chen, Chaoyang Zhang, Cheng Tan, Jie Ying, Guocheng Wu, Shujian Gao, Pengcheng Chen, Jiashi Lin, Haitao Wu, Lulu Chen, Fengxiang Wang, Yuanyuan Zhang, Xiangyu Zhao, Feilong Tang, Encheng Su, Junzhi Ning, Xinyao Liu, Ye Du, Changkai Ji, Pengfei Jiang, Cheng Tang, Ziyan Huang, Jiyao Liu, Jiaqi Wei, Yuejin Yang, Xiang Zhang, Guangshuai Wang, Yue Yang, Huihui Xu, Ziyang Chen, Yizhou Wang, Chen Tang, Jianyu Wu, Yuchen Ren, Siyuan Yan, Zhonghua Wang, Zhongxing Xu, Shiyan Su, Shangquan Sun, Runkai Zhao, Zhisheng Zhang, Dingkang Yang, Jinjie Wei, Jiaqi Wang, Jiahao Xu, Jiangtao Yan, Wenhao Tang, Hongze Zhu, Yu Liu, Fudi Wang, Yiqing Shen, Yuanfeng Ji, Yanzhou Su, Tong Xie, Hongming Shan, Chun-Mei Feng, Zhi Hou, Diping Song, Lihao Liu, Yanyan Huang, Lequan Yu, Bin Fu, Shujun Wang, Xiaomeng Li, Xiaowei Hu, Yun Gu, Ben Fei, Benyou Wang, Yuewen Cao, Minjie Shen, Jie Xu, Haodong Duan, Fang Yan, Hongxia Hao, Jielan Li, Jiajun Du, Yanbo Wang, Imran Razzak, Zhongying Deng, Chi Zhang, Lijun Wu, Conghui He, Zhaohui Lu, Jinhai Huang, Wenqi Shao, Yihao Liu, Siqi Luo, Yi Xin, Xiaohong Liu, Fenghua Ling, Yuqiang Li, Aoran Wang, Siqi Sun, Qihao Zheng, Nanqing Dong, Tianfan Fu, Dongzhan Zhou, Yan Lu, Wenlong Zhang, Jin Ye, Jianfei Cai, Yirong Chen, Wanli Ouyang, Yu Qiao, Zongyuan Ge, Shixiang Tang, Junjun He, Chunfeng Song, Lei Bai, Bowen Zhou

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06073 2025-10-21 cs.CL cs.AI cs.CV 62%

GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images

Xiang Lan, Feng Wu, Kai He, Qinghao Zhao, Shenda Hong, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Peking University People’s Hospital(北京大学人民医院) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15768 2025-10-20 cs.CL cs.LG 62%

On Non-interactive Evaluation of Animal Communication Translators

Orr Paradise, David F. Gruber, Adam Tauman Kalai

机构 * EPFL(瑞士联邦理工学院) Project CETI(CETI项目) OpenAI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15211 2025-10-20 cs.LG cs.AI 62%

ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning

Yongchan Kwon, Shang Zhu, Federico Bianchi, Kaitlyn Zhou, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15007 2025-10-20 cs.CL cs.AI 62%

Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective

Zhiqiang Kou, Junyang Chen, Xin-Qiang Cai, Ming-Kun Xie, Biao Liu, Changwei Wang, Lei Feng, Yuheng Jia, Gang Niu, Masashi Sugiyama, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) RIKEN Center for Advanced Intelligence Project (AIP)(RIKEN先进人工智能项目中心) School of Computer Science and Technology, Qilu University of Technology(齐鲁大学计算机科学与技术学院) The University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10444 2025-10-20 cs.CL cs.AI 62%

Do Audio LLMs Really LISTEN, or Just Transcribe? Measuring Lexical vs. Acoustic Emotion Cues Reliance

Jingyi Chen, Zhimeng Guo, Jiyun Chun, Pichao Wang, Andrew Perrault, Micha Elsner

机构 * Department of Linguistics, The Ohio State University, USA(语言学系,俄亥俄州立大学) Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Department of Information Sciences and Technology, Penn State University, USA(信息科学与技术系,宾夕法尼亚州立大学) Amazon, USA(亚马逊公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14242 2025-10-17 cs.CL cs.LG 62%

Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs

Parsa Hejabi, Elnaz Rahmati, Alireza S. Ziabari, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 6 figures, 3 tables, and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12210 2025-10-17 eess.AS cs.CL cs.LG 62%

DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation

Yakun Song, Xiaobin Zhuang, Jiawei Chen, Zhikang Niu, Guanrou Yang, Chenpeng Du, Dongya Jia, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,上海交通大学) ByteDance Inc.(字节跳动公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13804 2025-10-16 cs.CV cs.AI cs.CL 62%

Generative Universal Verifier as Multimodal Meta-Reasoner

Xinchen Zhang, Xiaoying Zhang, Youbin Wu, Yanbin Cao, Renrui Zhang, Ruihang Chu, Ling Yang, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13106 2025-10-16 cs.SE cs.AI cs.CL 62%

TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models

Ruoyu Sun, Da Song, Jiayang Song, Yuheng Huang, Lei Ma

机构 * University of Alberta(阿尔伯塔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) The University of Tokyo(东京大学) Macau University of Science and Technology(澳门科学技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 4 pages, 2 figures, To appear in ASE 2025 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏