arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2509.10266 2025-10-30 cs.CV cs.AI 57%

SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion

Wenfang Wu, Tingting Yuan, Yupeng Li, Daling Wang, Xiaoming Fu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24431 2025-10-29 cs.IR cs.AI 57%

MiniOneRec: An Open-Source Framework for Scaling Generative Recommendation

Xiaoyu Kong, Leheng Sheng, Junfei Tan, Yuxin Chen, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20927 2025-10-29 cs.CY 57%

What do model reports say about their ChemBio benchmark evaluations? Comparing recent releases to the STREAM framework

Tom Reed, Tegan McCaslin, Luca Righetti

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments 12 pages, 6 figures. Includes appendices Added supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01778 2025-10-29 cs.LG stat.ML 57%

CONFIDERAI: a novel CONFormal Interpretable-by-Design score function for Explainable and Reliable Artificial Intelligence

Sara Narteni, Alberto Carlevaro, Fabrizio Dabbene, Marco Muselli, Maurizio Mongelli

机构 * Institute of Electronics, Information Engineering and Telecommunications - National Research Council of Italy (CNR-IEIIT)(电子信息与电信研究所 - 意大利国家科研理事会(CNR-IEIIT)) Politecnico di Torino - Department of Control and Computer Engineering (DAUIN)(托尼诺理工学院 - 控制与计算机工程系(DAUIN)) Rulex Innovation Labs(Rulex创新实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 26 pages, 3 figures, international journal

Journal ref Pattern Recognition, Volume 171, Part B, 2026, 112219, ISSN 0031-3203

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24259 2025-10-29 cs.CL cs.RO 57%

Can LLMs Translate Human Instructions into a Reinforcement Learning Agent's Internal Emergent Symbolic Representation?

Ziqi Ma, Sao Mai Nguyen, Philippe Xu

机构 * U2IS, ENSTA, IP-Paris(U2IS、ENSTA、IP-巴黎)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23622 2025-10-29 cs.LG cs.CR 57%

Adversarially-Aware Architecture Design for Robust Medical AI Systems

Alyssa Gerhart, Balaji Iyangar

机构 * Department of Computer Science Benedict College Columbia, SC, USA(计算机科学系 奥本大学 奥斯本, 南卡罗来纳州, 美国)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22998 2025-10-28 cs.AI 57%

ProfileXAI: User-Adaptive Explainable AI

Gilber A. Corrales, Carlos Andrés Ferro Sánchez, Reinel Tabares-Soto, Jesús Alfonso López Sotelo, Gonzalo A. Ruz, Johan Sebastian Piña Durán

机构 * Facultad de Ingeniería y Ciencias Básicas, Universidad Autónoma de Occidente(工程与基础科学学院,自治大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments pages, 1 figure, 3 tables. Preprint. Evaluated on UCI Heart Disease (1989) and UCI Differentiated Thyroid Cancer Recurrence (2023). Uses IEEEtran

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16343 2025-10-28 cs.SD cs.AI eess.AS 57%

Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries

Pengfei Cai, Yan Song, Qing Gu, Nan Jiang, Haoyu Song, Ian McLoughlin

机构 * University of Science and Technology of China(科学技术大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23035 2025-10-28 cs.CR cs.AI 57%

A high-capacity linguistic steganography based on entropy-driven rank-token mapping

Jun Jiang, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * School of Cyber Science and Technology(网络科学与技术学院) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22618 2025-10-28 cs.CV cs.AI 57%

Cross-Species Transfer Learning in Agricultural AI: Evaluating ZebraPose Adaptation for Dairy Cattle Pose Estimation

Mackenzie Tapp, Sibi Chakravarthy Parivendan, Kashfia Sailunaz, Suresh Neethirajan

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 20 pages, 11 figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20414 2025-10-28 cs.GR cs.CV cs.LG cs.RO 57%

SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

Yandan Yang, Baoxiong Jia, Shujie Zhang, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室、BIGAI) Tsinghua University(2 清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23881 2025-10-28 cs.CV cs.LG 57%

Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection

Reihaneh Zohrabi, Hosein Hasani, Mahdieh Soleymani Baghshah, Anna Rohrbach, Marcus Rohrbach, Mohammad Hossein Rohban

机构 * TU Darmstadt(图宾根大学) Sharif University of Technology(谢赫·穆罕默德·卡齐姆大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12925 2025-10-28 cs.SE cs.AI cs.IR 57%

CPRet: A Dataset, Benchmark, and Model for Retrieval in Competitive Programming

Han Deng, Yuan Meng, Shixiang Tang, Wanli Ouyang, Xinzhu Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Beihang University(北航) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12116 2025-10-28 cs.CL 57%

A Multi-Task Benchmark for Abusive Language Detection in Low-Resource Settings

Fitsum Gaim, Hoyun Song, Huije Lee, Changgeon Ko, Eui Jun Hwang, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21722 2025-10-28 cs.HC cs.AI 57%

AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models

Beitong Tian, Lingzhi Zhao, Bo Chen, Haozhen Zheng, Jingcheng Yang, Mingyuan Wu, Deepak Vasisht, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 12 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03317 2025-10-27 cs.CV cs.AI 57%

Photorealistic Inpainting for Perturbation-based Explanations in Ecological Monitoring

Günel Aghakishiyeva, Jiayi Zhou, Saagar Arya, Julian Dale, James David Poling, Holly R. Houliston, Jamie N. Womble, Gregory D. Larsen, David W. Johnston, Brinnae Bent

机构 * Duke University(杜克大学) University of Agder(阿格德大学) University of Cambridge(剑桥大学) U.S. National Park Service Department of Interior(美国国家公园管理局) Alaska Spatial Science(阿拉斯加空间科学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments NeurIPS 2025 Imageomics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04675 2025-10-27 cs.AI cs.LO 57%

HypRL: Reinforcement Learning of Control Policies for Hyperproperties

Tzu-Han Hsu, Arshia Rafieioskouei, Borzoo Bonakdarpour

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20976 2025-10-27 cs.LG 57%

L^2M^3OF: A Large Language Multimodal Model for Metal-Organic Frameworks

Jiyu Cui, Fang Wu, Haokai Zhao, Minggao Feng, Xenophon Evangelopoulos, Andrew I. Cooper, Yejin Choi

机构 * Department of Chemistry, University of Liverpool(利兹大学化学系) Leverhulme Research Centre for Functional Materials Design, University of Liverpool(利兹大学功能性材料设计研究所以) Department of Computer Science, University of Stanford(斯坦福大学计算机科学系) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20699 2025-10-24 q-fin.CP cs.AI 57%

Fusing Narrative Semantics for Financial Volatility Forecasting

Yaxuan Kong, Yoontae Hwang, Marcus Kaiser, Chris Vryonides, Roel Oomen, Stefan Zohren

机构 * University of Oxford(牛津大学) Pusan National University(釜山国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments The 6th ACM International Conference on AI in Finance (ICAIF 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20337 2025-10-24 cs.AI 57%

Collateral Damage Assessment Model for AI System Target Engagement in Military Operations

Clara Maathuis, Kasper Cools

机构 * Open University of the Netherlands(荷兰开放大学) Royal Military Academy, Belgium(比利时皇家军事学院) Vrije Universiteit Brussel, Belgium(比利时自由大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted at MILCOM 2025 WS07

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11145 2025-10-24 cs.CL cs.PL 57%

Text2Mem: A Unified Memory Operation Language for Memory Operating System

Yi Wang, Lihai Yang, Boyu Chen, Gongyi Zou, Kerun Xu, Bo Tang, Feiyu Xiong, Siheng Chen, Zhiyu Li

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)技术有限公司) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 12 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02464 2025-10-24 cs.CL 57%

SpecEval: Evaluating Model Adherence to Behavior Specifications

Ahmed Ahmed, Kevin Klyman, Yi Zeng, Sanmi Koyejo, Percy Liang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) The Bradley Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20352 2025-10-24 cs.CL 57%

RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing

Hao Xiang, Tianyi Tang, Yang Su, Bowen Yu, An Yang, Fei Huang, Yichang Zhang, Yaojie Lu, Hongyu Lin, Xianpei Han, Jingren Zhou, Junyang Lin, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19271 2025-10-24 cs.SE cs.AI cs.PL 57%

Fine-Tuning Multilingual Language Models for Code Review: An Empirical Study on Industrial C# Projects

Igli Begolli, Meltem Aksoy, Daniel Neider

机构 * Technical University Dortmund, Lovion GmbH(图鲁尼大学,洛维昂公司) Security\ Alliance Ruhr, Technical University Dortmund(安全联盟鲁尔,图鲁尼大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16247 2025-10-24 cs.CV cs.LG 57%

OpenMIBOOD: Open Medical Imaging Benchmarks for Out-Of-Distribution Detection

Max Gutbrod, David Rauber, Danilo Weber Nunes, Christoph Palm

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Updated results for NNGuide and ViM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19836 2025-10-24 cs.AI cs.SY eess.SY 57%

Benchmarking Reasoning Reliability in Artificial Intelligence Models for Energy-System Analysis

Eliseo Curcio

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19616 2025-10-23 cs.CL 57%

PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models

Farhan Farsi, Shayan Bali, Fatemeh Valeh, Parsa Ghofrani, Alireza Pakniat, Kian Kashfipour, Amir H. Payberah

机构 * Amirkabir University of Technology(阿米尔卡比尔技术大学) King’s College London(伦敦国王学院) Politecnico di Milano(米兰理工学院) KTH Royal Institute of Technology(皇家理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19599 2025-10-23 cs.CV cs.AI 57%

XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography

Haozhe Luo, Shelley Zixin Shu, Ziyu Zhou, Sebastian Otalora, Mauricio Reyes

机构 * ARTORG Center for Biomedical Engineering Research, University of Bern, Switzerland(ARTORG生物医学工程研究中心,伯尔尼大学,瑞士) Shanghai Jiao Tong University, China(上海交通大学,中国) Kaiko.AI, Switzerland(Kaiko.AI,瑞士) Dept. of Radiation Oncology, Inselspital, Bern University Hospital(放射肿瘤科,因斯普尔茨医院,伯尔尼大学医院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19419 2025-10-23 cs.CL 57%

BLiSS 1.0: Evaluating Bilingual Learner Competence in Second Language Small Language Models

Yuan Gao, Suchir Salhan, Andrew Caines, Paula Buttery, Weiwei Sun

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted Paper at the BabyLM Workshop 2025 @ EMNLP (Presentation in Suzhou, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19212 2025-10-23 stat.ME cs.AI 57%

No Intelligence Without Statistics: The Invisible Backbone of Artificial Intelligence

Ernest Fokoué

机构 * School of Mathematics and Statistics(数学与统计学学院) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏