arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2511.04502 2025-11-07 cs.CL cs.AI 73%

RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG

Joshua Gao, Quoc Huy Pham, Subin Varghese, Silwal Saurav, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯敦分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01805 2025-11-05 cs.CL cs.AI 73%

Accumulating Context Changes the Beliefs of Language Models

Jiayi Geng, Howard Chen, Ryan Liu, Manoel Horta Ribeiro, Robb Willer, Graham Neubig, Thomas L. Griffiths

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23921 2025-10-29 cs.CL cs.LG 73%

Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation

Kaveh Eskandari Miandoab, Mahammed Kamruzzaman, Arshia Gharooni, Gene Louis Kim, Vasanth Sarathy, Ninareh Mehrabi

机构 * Tufts University(塔夫茨大学) University of South Florida(佛罗里达州立大学) Sharif University of Technology(谢赫·穆吉布技术大学) Meta Resolution(解决方案)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20099 2025-10-24 cs.AI cs.CE cs.CL 73%

AI PB: A Grounded Generative Agent for Personalized Investment Insights

Daewoo Park, Suho Park, Inseok Hong, Hanwool Lee, Junkyu Park, Sangjun Lee, Jeongman An, Hyunbin Loh

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15232 2025-10-20 cs.LG cs.CL 73%

FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain

Tiansheng Hu, Tongyan Hu, Liuyang Bai, Yilun Zhao, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) National University of Singapore(新加坡国立大学) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06559 2025-10-09 cs.CL cs.AI cs.LO 73%

The Algebra of Meaning: Why Machines Need Montague More Than Moore's Law

Cheonkam Jeong, Sungdo Kim, Jewoo Park

机构 * Savassan(萨瓦桑)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06240 2025-10-09 cs.CL cs.AI cs.DB 73%

Knowledge Graph-Guided Multi-Agent Distillation for Reliable Industrial Question Answering with Datasets

Jiqun Pan, Zhenke Duan, Jiani Tu, Anzhi Cheng, Yanqing Wang

机构 * Zhongnan University of Economics and Law(中南财经政法大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments 41 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23058 2025-10-08 cs.AI cs.LG 73%

Risk Profiling and Modulation for LLMs

Yikai Wang, Xiaocheng Li, Guanting Chen

机构 * Department of Statistics and Operations Research, UNC-Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Imperial College Business School, Imperial College London(帝国理工学院伦敦校区商学院)

专题命中 安全评测 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03604 2025-10-07 cs.LG cs.AI 73%

Deep Domain Adaptation for Turbofan Engine Remaining Useful Life Prediction: Methodologies, Evaluation and Future Trends

Yucheng Wang, Mohamed Ragab, Yubo Hou, Zhenghua Chen, Min Wu, Xiaoli Li

机构 * Institute for Infocomm Research, Agency for Science, Technology and Research, Singapore(新加坡资讯通信研究院,科技研究局) Propulsion and Space Research Center, Technology Innovation Institute, UAE(阿联酋技术创新研究所推进与航天研究中心) James Watt School of Engineering, University of Glasgow, UK(格拉斯哥大学詹姆斯·瓦特工程学院) ISTD Pillar at SUTD(新加坡科技设计大学ISTD支柱)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02677 2025-10-06 cs.AI cs.LG 73%

ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks

Zhaorun Chen, Xun Liu, Mintong Kang, Jiawei Zhang, Minzhou Pan, Shuang Yang, Bo Li

机构 * University of Chicago(芝加哥大学) University of Illinois(伊利诺伊大学) Virtue AI Meta

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 60 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21943 2025-09-30 cs.AI cs.LG 73%

Outlier Detection in Plantar Pressure: Human-Centered Comparison of Statistical Parametric Mapping and Explainable Machine Learning

Carlo Dindorf, Jonas Dully, Steven Simon, Dennis Perchthaler, Stephan Becker, Hannah Ehmann, Kjell Heitmann, Bernd Stetter, Christian Diers, Michael Fröhlich

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13068 2025-09-30 cs.CL cs.AI 73%

Accuracy is Not Agreement: Expert-Aligned Evaluation of Crash Narrative Classification Models

Sudesh Ramesh Bhagat, Ibne Farabi Shihab, Anuj Sharma

机构 * Institute for Transportation(交通研究所) Iowa State University(爱荷华州立大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22651 2025-09-29 cs.CL cs.AI cs.CV cs.HC cs.SD 73%

VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing

Ke Wang, Houxing Ren, Zimu Lu, Mingjie Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院) CPII under InnoHK(创新香港下的CPII)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20680 2025-09-26 cs.LG cs.CL cs.CR 73%

Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation

Wenkai Guo, Xuefeng Liu, Haolin Wang, Jianwei Niu, Shaojie Tang, Jing Yuan

机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) Hangzhou Innovation Institute of Beihang University, Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems, Hangzhou, China(北京航空航天大学杭州创新研究院,浙江省工业大数据与机器人智能系统重点实验室) Center for AI Business Innovation, Department of Management Science and Systems, University at Buffalo, Buffalo, New York, USA(人工智能商业创新中心,管理科学与系统系,布法罗大学) University of North Texas, Denton, Texas, USA(德克萨斯大学达文波特分校) Zhongguancun Laboratory, Beijing, China(中关村实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments 28 pages, 32 figures, accepted to the Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18172 2025-09-23 cs.CL cs.AI 73%

Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering

Zixin Chen, Sicheng Song, Kashun Shum, Yanna Lin, Rui Sheng, Weiqi Wang, Huamin Qu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments 34 pages in total, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.12100 2025-09-10 cs.LG cs.AI 73%

Increasing the Confidence of Deep Neural Networks by Coverage Analysis

Giulio Rossolini, Alessandro Biondi, Giorgio Buttazzo

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Journal ref IEEE Transactions on Software Engineering ( Volume: 49, Issue: 2, 01 February 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07992 2025-09-09 cs.CL cs.LG 73%

Concept Bottleneck Large Language Models

Chung-En Sun, Tuomas Oikarinen, Berk Ustun, Tsui-Wei Weng

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04549 2025-09-08 cs.CL cs.AI 73%

Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions

Faruk Alpay, Taylan Alpay

机构 * Lightcap Department of Future(未来系) Turkish Aeronautical Association(土耳其航空航天协会)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01185 2025-09-05 cs.CL cs.AI 73%

Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation

Seganrasan Subramanian, Abhigya Verma

机构 * ServiceNow

专题命中 安全评测 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15370 2025-08-22 cs.CL cs.AI 73%

Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation

Yichi Zhang, Yao Huang, Yifan Wang, Yitong Sun, Chang Liu, Zhe Zhao, Zhengwei Fang, Huanran Chen, Xiao Yang, Xingxing Wei, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Department of Computer Science and Technology, College of AI, Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(计算机科学与技术系、人工智能学院、人工智能研究所、清华-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院、北航) RealAI

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments For Appendix, please refer to arXiv:2406.07057

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11957 2025-08-19 cs.MA cs.AI cs.LG 73%

A Comprehensive Review of AI Agents: Transforming Possibilities in Technology and Beyond

Xiaodong Qu, Andrews Damoah, Joshua Sherwood, Peiyan Liu, Christian Shun Jin, Lulu Chen, Minjie Shen, Nawwaf Aleisa, Zeyuan Hou, Chenyu Zhang, Lifu Gao, Yanshu Li, Qikai Yang, Qun Wang, Cristabelle De Souza

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) San Francisco State University(旧金山州立大学) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06296 2025-08-14 cs.AI cs.LG 73%

LLM Robustness Leaderboard v1 --Technical report

Pierre Peigné - Lefebvre, Quentin Feuillade-Montixi, Tom David, Nicolas Miailhe

机构 * PRISM Eval(PRISM评估)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00381 2025-08-11 cs.CV cs.AI cs.CE cs.LG 73%

Advancing Welding Defect Detection in Maritime Operations via Adapt-WeldNet and Defect Detection Interpretability Analysis

Kamal Basha S, Athira Nambiar

机构 * Department of Computational Intelligence, Faculty of Engineering and Technology, SRM Institute of Science and Technology(计算智能系,工程与技术学院,SRM科学与技术学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03936 2025-08-07 cs.CR cs.CL cs.LG cs.SE 73%

ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants

Xiangzhe Xu, Guangyu Shen, Zian Su, Siyuan Cheng, Hanxi Guo, Lu Yan, Xuan Chen, Jiasheng Jiang, Xiaolong Jin, Chengpeng Wang, Zhuo Zhang, Xiangyu Zhang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments The first two authors (Xiangzhe Xu and Guangyu Shen) contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16206 2025-07-23 cs.LG cs.AI 73%

METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark

Xu Yang, Qi Zhang, Shuming Jiang, Yaowen Xu, Zhaofan Zou, Hao Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(电信人工智能研究院) Institute of Artificial Intelligence and Robotics(IAIR), Xi’an Jiaotong University(人工智能与机器人研究院) Advanced Technique of Artificial Intelligence(ATAI), Chongqing University of Technology(人工智能先进技术研究院)

专题命中 安全评测 :DPO(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages,3 figures ICCV format

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14615 2025-07-22 cs.CL cs.AI 73%

Retrieval-Augmented Clinical Benchmarking for Contextual Model Testing in Kenyan Primary Care: A Methodology Paper

Fred Mutisya, Shikoh Gitau, Christine Syovata, Diana Oigara, Ibrahim Matende, Muna Aden, Munira Ali, Ryan Nyotu, Diana Marion, Job Nyangena, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha, Eric Mibuari, Jean Philbert Nsengemana, Talkmore Chidede

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 29 pages, 6 figs, 6 tables. Companion methods paper forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21042 2025-07-17 cs.CR cs.AI cs.LG 73%

What's Pulling the Strings? Evaluating Integrity and Attribution in AI Training and Inference through Concept Shift

Jiamin Chang, Haoyang Li, Hammond Pearce, Ruoxi Sun, Bo Li, Minhui Xue

机构 * University of New South Wales \& CSIRO's Data61 Sydney Australia Macquarie University Sydney Australia University of New South Wales Sydney Australia University of Illinois at Urbana–Champaign Champaign University of New South Wales \& CSIRO's Data61 Macquarie University University of New South Wales University of Illinois at Urbana–Champaign

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to The ACM Conference on Computer and Communications Security (CCS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01786 2025-07-10 cs.CL cs.AI 73%

Probing and Steering Evaluation Awareness of Language Models

Jord Nguyen, Khiem Hoang, Carlo Leonardo Attubato, Felix Hofstätter

机构 * Pivotal Research Waseda University(早稻田大学) Apollo Research

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Actionable Interpretability Workshop (Poster) and Workshop on Technical AI Governance (Poster) at ICML 2025, Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04142 2025-07-08 cs.CL cs.AI 73%

Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies

Mael Jullien, Marco Valentino, Leonardo Ranaldi, Andre Freitas

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02788 2025-07-04 cs.AI cs.CY 73%

Moral Responsibility or Obedience: What Do We Want from AI?

Joseph Boland

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏