arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-28 至 2025-10-28 共收录 25 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 25 篇

2510.23334 2025-10-28 cs.CL 83%

Adaptive Blockwise Search: Inference-Time Alignment for Large Language Models

Mohammad Atif Quamar, Mohammad Areeb, Nishant Sharma, Ananth Shreekumar, Jonathan Rosenthal, Muslum Ozgur Ozmen, Mikhail Kuznetsov, Z. Berkay Celik

机构 * Purdue University(普渡大学) Arizona State University(亚利桑那州立大学) Amazon(亚马逊)

专题命中 安全评测 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19674 2025-10-28 cs.CR cs.AI 83%

SAGE: A Generic Framework for LLM Safety Evaluation

Madhur Jindal, Hari Shrawgi, Parag Agrawal, Sandipan Dandapat

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22095 2025-10-28 cs.AI cs.CL 81%

Embracing Trustworthy Brain-Agent Collaboration as Paradigm Extension for Intelligent Assistive Technologies

Yankai Chen, Xinni Zhang, Yifei Zhang, Yangning Li, Henry Peng Zou, Chunyu Miao, Weizhi Zhang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill University(麦吉尔大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS'25 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21566 2025-10-28 cs.MA cs.CL 79%

ColorEcosystem: Powering Personalized, Standardized, and Trustworthy Agentic Service in massive-agent Ecosystem

Fangwen Wu, Zheng Wu, Jihong Wang, Yunku Chen, Ruiguang Pei, Heyuan Huang, Xin Liao, Xingyu Lou, Huarong Deng, Zhihui Fu, Weiwen Liu, Zhuosheng Zhang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00775 2025-10-28 cs.HC 78%

Efficiency with Rigor! A Trustworthy LLM-powered Workflow for Qualitative Data Analysis

Jie Gao, Zhiyao Shu, Shun Yi Yeo, Alok Prakash, Chien-Ming Huang, Mark Dredze, Ziang Xiao

专题命中 安全评测 :trustworthy(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06185 2025-10-28 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

Can Large Language Models Unlock Novel Scientific Research Ideas?

Sandeep Kumar, Tirthankar Ghosal, Vinayak Goyal, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳布分校) National Center for Computational Sciences, Oak Ridge National Laboratory(计算科学国家中心,橡树岭国家实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22728 2025-10-28 cs.LG cs.CV 70%

S-Chain: Structured Visual Chain-of-Thought For Medicine

Khai Le-Duc, Duy M. H. Nguyen, Phuong T. H. Trinh, Tien-Phat Nguyen, Nghiem T. Diep, An Ngo, Tung Vu, Trinh Vuong, Anh-Tien Nguyen, Mau Nguyen, Van Trung Hoang, Khai-Nguyen Nguyen, Hy Nguyen, Chris Ngo, Anji Liu, Nhat Ho, Anne-Christin Hauschild, Khanh Xuan Nguyen, Thanh Nguyen-Tang, Pengtao Xie, Daniel Sonntag, James Zou, Mathias Niepert, Anh Totti Nguyen

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

Comments First version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23471 2025-10-28 stat.ML cs.AI cs.LG 62%

Robust Decision Making with Partially Calibrated Forecasts

Shayan Kiyani, Hamed Hassani, George Pappas, Aaron Roth

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19209 2025-10-28 cs.CL cs.AI cs.CE stat.ML 62%

MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search

Zonglin Yang, Wanhao Liu, Ben Gao, Yujie Liu, Wei Li, Tong Xie, Lidong Bing, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) MiroMind The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17823 2025-10-28 cs.CV cs.AI cs.LG 62%

Robust Multimodal Learning via Cross-Modal Proxy Tokens

Md Kaykobad Reza, Ameya Patil, Mashhour Solh, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 28 Pages, 13 Figures, 11 Tables. Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09947 2025-10-28 cs.LG cs.AI 62%

Identifying Trustworthiness Challenges in Deep Learning Models for Continental-Scale Water Quality Prediction

Xiaobo Xia, Xiaofeng Liu, Jiale Liu, Kuai Fang, Lu Lu, Samet Oymak, William S. Currie, Tongliang Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted by Nexus (Cell Press). 61 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22998 2025-10-28 cs.AI 57%

ProfileXAI: User-Adaptive Explainable AI

Gilber A. Corrales, Carlos Andrés Ferro Sánchez, Reinel Tabares-Soto, Jesús Alfonso López Sotelo, Gonzalo A. Ruz, Johan Sebastian Piña Durán

机构 * Facultad de Ingeniería y Ciencias Básicas, Universidad Autónoma de Occidente(工程与基础科学学院,自治大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments pages, 1 figure, 3 tables. Preprint. Evaluated on UCI Heart Disease (1989) and UCI Differentiated Thyroid Cancer Recurrence (2023). Uses IEEEtran

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16343 2025-10-28 cs.SD cs.AI eess.AS 57%

Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries

Pengfei Cai, Yan Song, Qing Gu, Nan Jiang, Haoyu Song, Ian McLoughlin

机构 * University of Science and Technology of China(科学技术大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23035 2025-10-28 cs.CR cs.AI 57%

A high-capacity linguistic steganography based on entropy-driven rank-token mapping

Jun Jiang, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * School of Cyber Science and Technology(网络科学与技术学院) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22618 2025-10-28 cs.CV cs.AI 57%

Cross-Species Transfer Learning in Agricultural AI: Evaluating ZebraPose Adaptation for Dairy Cattle Pose Estimation

Mackenzie Tapp, Sibi Chakravarthy Parivendan, Kashfia Sailunaz, Suresh Neethirajan

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 20 pages, 11 figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20414 2025-10-28 cs.GR cs.CV cs.LG cs.RO 57%

SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

Yandan Yang, Baoxiong Jia, Shujie Zhang, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室、BIGAI) Tsinghua University(2 清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23881 2025-10-28 cs.CV cs.LG 57%

Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection

Reihaneh Zohrabi, Hosein Hasani, Mahdieh Soleymani Baghshah, Anna Rohrbach, Marcus Rohrbach, Mohammad Hossein Rohban

机构 * TU Darmstadt(图宾根大学) Sharif University of Technology(谢赫·穆罕默德·卡齐姆大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12925 2025-10-28 cs.SE cs.AI cs.IR 57%

CPRet: A Dataset, Benchmark, and Model for Retrieval in Competitive Programming

Han Deng, Yuan Meng, Shixiang Tang, Wanli Ouyang, Xinzhu Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Beihang University(北航) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12116 2025-10-28 cs.CL 57%

A Multi-Task Benchmark for Abusive Language Detection in Low-Resource Settings

Fitsum Gaim, Hoyun Song, Huije Lee, Changgeon Ko, Eui Jun Hwang, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21722 2025-10-28 cs.HC cs.AI 57%

AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models

Beitong Tian, Lingzhi Zhao, Bo Chen, Haozhen Zheng, Jingcheng Yang, Mingyuan Wu, Deepak Vasisht, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 12 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09110 2025-10-28 cs.CV 56%

Pulling Back the Curtain: Unsupervised Adversarial Detection via Contrastive Auxiliary Networks

Eylon Mizrahi, Raz Lapid, Moshe Sipper

机构 * Ben-Gurion University(本·古里安大学) DeepKeep

专题命中 安全评测 :safety(abstract);trustworthy(journal_ref)

Comments Accepted for Oral Presentation at SafeMM-AI @ ICCV 2025 (Spotlight)

Journal ref ICCV 2025 Workshop on SafeMM-AI: Safe and Trustworthy Multimodal AI Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23032 2025-10-28 cs.CE 50%

P1GPT: a multi-agent LLM workflow module for multi-modal financial information analysis

Chen-Che Lu, Yun-Cheng Chou, Teng-Ruei Chen

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22800 2025-10-28 cs.NE 50%

Probing the Representational Geometry of Color Qualia: Dissociating Pure Perception from Task Demands in Brains and AI Models

Jing Xu

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22785 2025-10-28 cs.CV 50%

Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models

Jiaxiang Liu, Jiawei Du, Xiao Liu, Prayag Tiwari, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Agency for Science, Technology and Research(科技研究局) School of Information Technology(信息技术学院)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20625 2025-10-28 cs.CV 50%

T2ICount: Enhancing Cross-modal Understanding for Zero-Shot Counting

Yifei Qian, Zhongliang Guo, Bowen Deng, Chun Tong Lei, Shuai Zhao, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound

机构 * University of Nottingham(诺丁汉大学) University of St Andrews(圣安德鲁大学) City University of Hong Kong(香港城市大学) Nanyang Technology University(南洋理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :alignment(abstract)

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏