arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2507.03133 2025-11-13 cs.CL 57%

ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models

Boyang Xue, Qi Zhu, Rui Wang, Sheng Wang, Hongru Wang, Minda Hu, Fei Mi, Yasheng Wang, Lifeng Shang, Qun Liu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23015 2025-11-13 cs.CL 57%

Detecting Stealthy Backdoor Samples based on Intra-class Distance for Large Language Models

Jinwen Chen, Hainan Zhang, Fei Sun, Qinnan Zhang, Sijia Wen, Ziwei Wang, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算先进创新中心) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments EMNLP2025Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16774 2025-11-13 cs.CL 57%

IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models

Yiming Gao, Bin Wang, Chengwei Wei, Shuo Sun, AiTi Aw

机构 * Nanyang Technological University (NTU)(南洋理工大学) MiroMind(米罗Mind) Institute for Infocomm Research (I 2 R)(信息与通信研究院) A*STAR(科技研究局)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Link: https://github.com/AudioLLMs/AudioBench/tree/main/IFEval-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06227 2025-11-13 cs.CL 57%

LExT: Towards Evaluating Trustworthiness of Natural Language Explanations

Krithi Shailya, Shreya Rajpal, Gokul S Krishnan, Balaraman Ravindran

机构 * Centre for Responsible AI, IIT Madras(责任人工智能中心,IIT马德拉斯)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08649 2025-11-13 q-bio.QM cs.AI 57%

Bio AI Agent: A Multi-Agent Artificial Intelligence System for Autonomous CAR-T Cell Therapy Development with Integrated Target Discovery, Toxicity Prediction, and Rational Molecular Design

Yi Ni, Liwei Zhu, Shuai Li

机构 * Bio LIMS INC(Bio LIMS公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 12 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15153 2025-11-13 cs.CL 57%

Evaluating Deep Unlearning in Large Language Models

Ruihan Wu, Chhavi Yadav, Russ Salakhutdinov, Kamalika Chaudhuri

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08345 2025-11-12 cs.CR cs.LG cs.NI 57%

Revisiting Network Traffic Analysis: Compatible network flows for ML models

João Vitorino, Daniela Pinto, Eva Maia, Ivone Amorim, Isabel Praça

机构 * GECAD, ISEP, Polytechnic of Porto(GECAD、ISEP、波尔图理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 16 pages, 12 tables, 1 figure, FPS 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08087 2025-11-12 cs.CV cs.AI 57%

Beyond the Pixels: VLM-based Evaluation of Identity Preservation in Reference-Guided Synthesis

Aditi Singhania, Krutik Malani, Riddhi Dhawan, Arushi Jain, Garv Tandon, Nippun Sharma, Souymodip Chakraborty, Vineet Batra, Ankit Phogat

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07794 2025-11-12 cs.CL 57%

Design, Results and Industry Implications of the World's First Insurance Large Language Model Evaluation Benchmark

Hua Zhou, Bing Ma, Yufei Zhang, Yi Zhao

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 16 pages, 11 models,1 set of evaluation framework,5 core dimensions, 54 sub-indicators, 14,430 high-quality questions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05529 2025-11-12 q-bio.QM cs.AI cs.CV 57%

Selective Diabetic Retinopathy Screening with Accuracy-Weighted Deep Ensembles and Entropy-Guided Abstention

Jophy Lin

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05459 2025-11-12 cs.SE cs.AI 57%

SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models

Jingxuan Xu, Ken Deng, Weihao Li, Songwei Yu, Huaixi Tang, Haoyang Huang, Zhiyi Lai, Zizheng Zhan, Yanan Wu, Chenchen Zhang, Kepeng Lei, Yifan Yao, Xinping Lei, Wenqiang Zhu, Zongxian Feng, Han Li, Junqi Xiong, Dailin Li, Zuchen Gao, Kun Wu, Wen Xiang, Ziqi Zhan, Yuanxing Zhang, Wuxuan Gong, Ziyuan Gao, Guanxiang Wang, Yirong Xue, Mengtong Li, Mengfei Xie, Xiaojiang Zhang, Jinghui Wang, Wenhao Zhuang, Zheng Lin, Huiming Wang, Zhaoxiang Zhang, Yuqun Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu

机构 * Kuaishou Technology(快手科技) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24378 2025-11-12 cs.LG 57%

AXIS: Explainable Time Series Anomaly Detection with Large Language Models

Tian Lan, Hao Duong Le, Jinbo Li, Wenjun He, Meng Wang, Chenghao Liu, Chen Zhang

机构 * Huawei(华为)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03764 2025-11-12 cs.IR cs.LG 57%

LLM-based Relevance Assessment for Web-Scale Search Evaluation at Pinterest

Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath

机构 * Pinterest(Pininterest)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments RecSys 2025 EARL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01849 2025-11-12 cs.HC cs.AI 57%

A Multi-Agent Conversational Bandit Approach to Online Evaluation and Selection of User-Aligned LLM Responses

Xiangxiang Dai, Yuejin Xie, Maoli Liu, Xuchuang Wang, Zhuohua Li, Huanyu Wang, John C. S. Lui

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06771 2025-11-12 cs.RO cs.LG cs.MA 57%

JaxRobotarium: Training and Deploying Multi-Robot Policies in 10 Minutes

Shalin Anand Jain, Jiazhen Liu, Siva Kailas, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 22 pages, 14 figures, 10 tables. https://github.com/GT-STAR-Lab/JaxRobotarium. Manuscript accepted for publication at the 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07298 2025-11-11 cs.CV cs.AI 57%

LMM-IQA: Image Quality Assessment for Low-Dose CT Imaging

Kagan Celik, Mehmet Ozan Unal, Metin Ertas, Isa Yildirim

机构 * Department of Electronics and Communication Engineering, Istanbul Technical University(电子与通信工程系,伊斯坦布尔技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07032 2025-11-11 cs.LG stat.ML 57%

Fair Bayesian Data Selection via Generalized Discrepancy Measures

Yixuan Zhang, Jiabin Luo, Zhenggang Wang, Feng Zhou, Quyu Kong

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06530 2025-11-11 cs.CL 57%

Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement

Xiaonan Luo, Yue Huang, Ping He, Xiangliang Zhang

机构 * University of Notre Dame(诺特大学) Vanderbilt University(范德比大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06227 2025-11-11 cs.SE cs.AI cs.CE 57%

Assertion-Aware Test Code Summarization with Large Language Models

Anamul Haque Mollah, Ahmed Aljohani, Hyunsook Do

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted for publication at 2nd ACM International Conference on AI-powered Software (AIware 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20264 2025-11-11 cs.CL 57%

EMBRACE: Shaping Inclusive Opinion Representation by Aligning Implicit Conversations with Social Norms

Abeer Aldayel, Areej Alokaili

机构 * King Saud University, College of Computer and Information Sciences(沙特王后大学,计算机与信息科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted, to appear IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12618 2025-11-11 cs.CL 57%

OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics

Vineeth Dorna, Anmol Mekala, Wenlong Zhao, Andrew McCallum, Zachary C. Lipton, J. Zico Kolter, Pratyush Maini

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Carnegie Mellon University(卡内基梅隆大学) DatologyAI

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05936 2025-11-11 cs.RO cs.AI 57%

10 Open Challenges Steering the Future of Vision-Language-Action Models

Soujanya Poria, Navonil Majumder, Chia-Yu Hung, Amir Ali Bagherzadeh, Chuan Li, Kenneth Kwok, Ziwei Wang, Cheston Tan, Jiajun Wu, David Hsu

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments AAAI 2026 (Senior Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05752 2025-11-11 cs.CL 57%

Multi-Scale Feature Fusion and Graph Neural Network Integration for Text Classification with Large Language Models

Xiangchen Song, Yulin Huang, Jinxu Guo, Yuchen Liu, Yaxuan Luan

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05592 2025-11-11 cs.LG 57%

GRAVER: Generative Graph Vocabularies for Robust Graph Foundation Models Fine-tuning

Haonan Yuan, Qingyun Sun, Junhua Shi, Xingcheng Fu, Bryan Hooi, Jianxin Li, Philip S. Yu

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(北京航空航天大学信息与电子技术学院) Key Lab of Education Blockchain and Intelligent Technology, Guangxi Normal University(广西师范大学教育区块链与智能技术重点实验室) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Computer Science, University of Illinois, Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Accepted by the NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05511 2025-11-11 eess.SY cs.AI cs.SY 57%

From Failure Modes to Reliability Awareness in Generative and Agentic AI System

Janet, Lin, Liangwei Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 24pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23089 2025-11-11 cs.LG cs.NI 57%

Demystifying Network Foundation Models

Sylee Beltiukov, Satyandra Guthula, Wenbo Guo, Walter Willinger, Arpit Gupta

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) NIKSUN, Inc(NIKSUN公司)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02073 2025-11-11 cs.AI 57%

Large model retrieval enhancement framework for construction site risk identification

Jiawei Li, Chengye Yang, Yaochen Zhang, Weilin Sun, Lei Meng, Xiangxu Meng

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04247 2025-11-10 cs.MM cs.AI cs.IR 57%

On the Brittleness of CLIP Text Encoders

Allie Tran, Luca Rossetto

机构 * Dublin City University(都柏林城市大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05299 2025-11-10 cs.CV cs.AI 57%

LiveStar: Live Streaming Assistant for Real-World Online Video Understanding

Zhenyu Yang, Kairui Zhang, Yuhang Hu, Bing Wang, Shengsheng Qian, Bin Wen, Fan Yang, Tingting Gao, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海科技大学) Kuaishou Technology(快手科技) Peng Cheng Laboratory(鹏城实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments NeurIPS 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05269 2025-11-10 cs.MA cs.AI 57%

TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems

Ishan Kavathekar, Hemang Jain, Ameya Rathod, Ponnurangam Kumaraguru, Tanuja Ganu

机构 * International Institute of Information Technology, Hyderabad(国际信息科技研究所,海得拉巴) Microsoft Research, India(微软研究院,印度)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted at ICML 2025 MAS Workshop. This version includes additional experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏