arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9378 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9378 篇

2505.00029 2025-05-02 cs.CL cs.AI 62%

Keep the General, Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic Forgetting

Yijie Hong, Xiaofei Yin, Xinzhong Wang, Yi Tu, Ya Guo, Sufeng Duan, Weiqiang Wang, Lingyong Fang, Depeng Wang, Huijia Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Security Lab, Ant Group(蚂蚁集团安全实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17179 2025-04-25 cs.AI cs.CV cs.LG cs.RO 62%

AUTHENTICATION: Identifying Rare Failure Modes in Autonomous Vehicle Perception Systems using Adversarially Guided Diffusion Models

Mohammad Zarei, Melanie A Jutras, Eliana Evans, Mike Tan, Omid Aaramoon

机构 * MITRE Corporation(MITRE公司) Cranium Booz Allen Hamilton Virginia(Booz Allen Hamilton弗吉尼亚)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 10 figures. Accepted to IEEE Conference on Artificial Intelligence (CAI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17137 2025-04-25 cs.CL cs.AI 62%

MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation Evaluation

Chanhee Park, Hyeonseok Moon, Chanjun Park, Heuiseok Lim

机构 * Korea University, Republic of Korea(韩国大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04724 2025-04-25 cs.LG cs.AI 62%

On Minimizing Adversarial Counterfactual Error in Adversarial RL

Roman Belaire, Arunesh Sinha, Pradeep Varakantham

机构 * Singapore Management University(新加坡国立管理学院) Rutgers University(罗格斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Presented at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15784 2025-04-23 cs.CL cs.AI 62%

Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach

Ruizhe Li, Chiwei Zhu, Benfeng Xu, Xiaorui Wang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) MetastoneTechnology(metastone技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15135 2025-04-22 cs.IR cs.AI cs.CL 62%

KGMEL: Knowledge Graph-Enhanced Multimodal Entity Linking

Juyeon Kim, Geon Lee, Taeuk Kim, Kijung Shin

机构 * KAIST(韩国科学技术院) Hanyang University(翰林大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments SIGIR 2025 (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14804 2025-04-22 cs.CL cs.AI 62%

Automatic Evaluation Metrics for Document-level Translation: Overview, Challenges and Trends

Jiaxin GUO, Xiaoyu Chen, Zhiqiang Rao, Jinlong Yang, Zongyao Li, Hengchao Shang, Daimeng Wei, Hao Yang

机构 * Huawei Translation Services Center(华为翻译服务中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14640 2025-04-22 cs.SE cs.AI cs.CL 62%

Risk Assessment Framework for Code LLMs via Leveraging Internal States

Yuheng Huang, Lei Ma, Keizaburo Nishikino, Takumi Akazaki

机构 * The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Fujitsu Limited(富士通株式会社)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments To appear in the 33rd ACM International Conference on the Foundations of Software Engineering (FSE Companion'25 Industry Track), June 23-28, 2025, Trondheim, Norway. This work was supported by Fujitsu Limited

Journal ref Companion Proceedings of the 33rd ACM International Conference on the Foundations of Software Engineering (FSE'25 Industry Track), June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13406 2025-04-22 cs.RO cs.AI cs.CL cs.CV 62%

LangCoop: Collaborative Driving with Language

Xiangbo Gao, Yuheng Wu, Rujia Wang, Chenxi Liu, Yang Zhou, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) KAIST(韩国科学技术院) University of Utah(犹他大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Journal ref CVPRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17211 2025-04-22 cs.CL cs.CV cs.LG 62%

A Language Anchor-Guided Method for Robust Noisy Domain Generalization

Zilin Dai, Lehong Wang, Fangzhou Lin, Yidong Wang, Zhigang Li, Kazunori D Yamada, Ziming Zhang, Wang Lu

机构 * Worcester Polytechnic Institute(沃斯通理工大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) Tsinghua University(清华大学) Tohoku University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13924 2025-04-22 cs.AI cs.CL cs.HC 62%

Evaluation and Incident Prevention in an Enterprise AI Assistant

Akash V. Maharaj, David Arbour, Daniel Lee, Uttaran Bhattacharya, Anup Rao, Austin Zane, Avi Feller, Kun Qian, Yunyao Li

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 5 figures. Accepted at IAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05731 2025-04-22 cs.CY cs.AI 62%

AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons

Shaona Ghosh, Heather Frase, Adina Williams, Sarah Luger, Paul Röttger, Fazl Barez, Sean McGregor, Kenneth Fricklas, Mala Kumar, Quentin Feuillade--Montixi, Kurt Bollacker, Felix Friedrich, Ryan Tsang, Bertie Vidgen, Alicia Parrish, Chris Knotz, Eleonora Presani, Jonathan Bennion, Marisa Ferrara Boston, Mike Kuniavsky, Wiebke Hutiri, James Ezick, Malek Ben Salem, Rajat Sahay, Sujata Goswami, Usman Gohar, Ben Huang, Supheakmungkol Sarin, Elie Alhajjar, Canyu Chen, Roman Eng, Kashyap Ramanandula Manjusha, Virendra Mehta, Eileen Long, Murali Emani, Natan Vidra, Benjamin Rukundo, Abolfazl Shahbazi, Kongtao Chen, Rajat Ghosh, Vithursan Thangarasa, Pierre Peigné, Abhinav Singh, Max Bartolo, Satyapriya Krishna, Mubashara Akhtar, Rafael Gold, Cody Coleman, Luis Oala, Vassil Tashev, Joseph Marvin Imperial, Amy Russ, Sasidhar Kunapuli, Nicolas Miailhe, Julien Delaunay, Bhaktipriya Radharapu, Rajat Shinde, Tuesday, Debojyoti Dutta, Declan Grabb, Ananya Gangavarapu, Saurav Sahay, Agasthya Gangavarapu, Patrick Schramowski, Stephen Singam, Tom David, Xudong Han, Priyanka Mary Mammen, Tarunima Prabhakar, Venelin Kovatchev, Rebecca Weiss, Ahmed Ahmed, Kelvin N. Manyeki, Sandeep Madireddy, Foutse Khomh, Fedor Zhdanov, Joachim Baumann, Nina Vasan, Xianjun Yang, Carlos Mougn, Jibin Rajan Varghese, Hussain Chinoy, Seshakrishna Jitendar, Manil Maskey, Claire V. Hardgrove, Tianhao Li, Aakash Gupta, Emil Joswin, Yifan Mai, Shachi H Kumar, Cigdem Patlak, Kevin Lu, Vincent Alessi, Sree Bhargavi Balija, Chenhe Gu, Robert Sullivan, James Gealy, Matt Lavrisa, James Goel, Peter Mattson, Percy Liang, Joaquin Vanschoren

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

Comments 51 pages, 8 figures and an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13059 2025-04-18 cs.RO cs.AI cs.CL 62%

RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins

Yao Mu, Tianxing Chen, Zanxin Chen, Shijia Peng, Zhiqian Lan, Zeyu Gao, Zhixuan Liang, Qiaojun Yu, Yude Zou, Mingkun Xu, Lunkai Lin, Zhiqiang Xie, Mingyu Ding, Ping Luo

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments CVPR 2025 Highlight. 22 pages. Project page: https://robotwin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12562 2025-04-18 cs.AI cs.CL 62%

ZeroSumEval: Scaling LLM Evaluation with Inter-Model Competition

Haidar Khan, Hisham A. Alyahya, Yazeed Alnumay, M Saiful Bari, Bülent Yener

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10673 2025-04-18 cs.CL cs.AI 62%

ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition

Hisham A. Alyahya, Haidar Khan, Yazeed Alnumay, M Saiful Bari, Bülent Yener

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02920 2025-04-17 cs.RO cs.AI cs.CL 62%

RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)

Yao Mu, Tianxing Chen, Shijia Peng, Zanxin Chen, Zeyu Gao, Yude Zou, Lunkai Lin, Zhiqiang Xie, Ping Luo

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Project page: https://robotwin-benchmark.github.io/early-version/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15065 2025-04-17 cs.LG cs.AI 62%

Formal Verification of Graph Convolutional Networks with Uncertain Node Features and Uncertain Graph Structure

Tobias Ladner, Michael Eichelbeck, Matthias Althoff

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments published at Transactions on Machine Learning Research (TMLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08372 2025-04-16 cs.LG cs.AI 62%

FedProphet: Memory-Efficient Federated Adversarial Training via Robust and Consistent Cascade Learning

Minxue Tang, Yitu Wang, Jingyang Zhang, Louis DiValentin, Aolin Ding, Amin Hass, Yiran Chen, Hai "Helen" Li

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted by MLSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08779 2025-04-15 cs.CL cs.AI 62%

Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams

Ruoxin Xiong, Yanyu Wang, Suat Gunhan, Yimin Zhu, Charles Berryman

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14566 2025-04-14 cs.CR cs.AI cs.DC cs.LG 62%

AIArena: A Blockchain-Based Decentralized AI Training Platform

Zhipeng Wang, Rui Sun, Elizabeth Lui, Tuo Zhou, Yizhe Wen, Jiahao Sun

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Camera ready version. Accepted by the ACM Web Conference (WWW) Short Paper Track, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02228 2025-04-14 cs.CL cs.AI cs.IR 62%

Attribution in Scientific Literature: New Benchmark and Methods

Yash Saxena, Deepa Tilwani, Ali Mohammadi, Edward Raff, Amit Sheth, Srinivasan Parthasarathy, Manas Gaur

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18921 2025-04-08 cs.CL cs.AI cs.LO 62%

From Blind Solvers to Logical Thinkers: Benchmarking LLMs' Logical Integrity on Faulty Mathematical Problems

A M Muntasir Rahman, Junyi Ye, Wei Yao, Sierra S. Liu, Jesse Yu, Jonathan Yu, Wenpeng Yin, Guiling Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03051 2025-04-07 cs.CL cs.AI 62%

Task as Context Prompting for Accurate Medical Symptom Coding Using Large Language Models

Chengyang He, Wenlong Zhang, Violet Xinying Chen, Yue Ning, Ping Wang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 5 figures, 5 Tables, ACM/IEEE International Conference on Connected Health: Applications, Systems and Engineering Technologies (CHASE '25), June 24--26, 2025, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02867 2025-04-07 cs.CL cs.AI 62%

Multi-Agent LLM Judge: automatic personalized LLM judge design for evaluating natural language generation applications

Hongliu Cao, Ilias Driouich, Robin Singh, Eoin Thomas

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Presented at SophiaSummit2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02685 2025-04-04 cs.LG cs.AI cs.HC stat.ML 62%

STOOD-X methodology: using statistical nonparametric test for OOD Detection Large-Scale datasets enhanced with explainability

Iván Sevillano-García, Julián Luengo, Francisco Herrera

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01833 2025-04-03 cs.CL cs.AI 62%

YourBench: Easy Custom Evaluation Sets for Everyone

Sumuk Shashidhar, Clémentine Fourrier, Alina Lozovskia, Thomas Wolf, Gokhan Tur, Dilek Hakkani-Tür

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01036 2025-04-03 cs.CY cs.LG cs.SE 62%

Carbon Footprint Evaluation of Code Generation through LLM as a Service

Tina Vartziotis, Maximilian Schmidt, George Dasoulas, Ippolyti Dellatolas, Stefano Attademo, Viet Dung Le, Anke Wiechmann, Tim Hoffmann, Michael Keckeisen, Sotirios Kotsopoulos

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

Comments Stuttgart Symposium, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18497 2025-04-02 cs.LG cs.AI 62%

Statistically Testing Training Data for Unwanted Error Patterns using Rule-Oriented Regression

Stefan Rass, Martin Dallinger

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22954 2025-04-01 cs.CL cs.AI q-bio.QM 62%

Can LLMs Support Medical Knowledge Imputation? An Evaluation-Based Perspective

Xinyu Yao, Aditya Sannabhadti, Holly Wiberg, Karmel S. Shehadeh, Rema Padman

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures, AMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21730 2025-04-01 cs.CL cs.LG 62%

Effective Skill Unlearning through Intervention and Abstention

Yongce Li, Chung-En Sun, Tsui-Wei Weng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted to NAACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏