arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2411.15101 2024-11-25 cs.LG physics.comp-ph 57%

What You See is Not What You Get: Neural Partial Differential Equations and The Illusion of Learning

Arvind Mohan, Ashesh Chattopadhyay, Jonah Miller

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09813 2024-11-25 cs.CR cs.LG 57%

Can Features for Phishing URL Detection Be Trusted Across Diverse Datasets? A Case Study with Explainable AI

Maraz Mia, Darius Derakhshan, Mir Mehedi A. Pritom

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 9 pages, 9 figures, 11th International Conference on Networking, Systems, and Security (NSysS 2024), 2024, Khulna, Bangladesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14198 2024-11-22 cs.CL 57%

Why do language models perform worse for morphologically complex languages?

Catherine Arnett, Benjamin K. Bergen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12352 2024-11-20 physics.optics cs.ET cs.LG 57%

Perfecting Imperfect Physical Neural Networks with Transferable Robustness using Sharpness-Aware Training

Tengji Xu, Zeyu Luo, Shaojie Liu, Li Fan, Qiarong Xiao, Benshan Wang, Dongliang Wang, Chaoran Huang

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07781 2024-11-13 cs.SE cs.AI 57%

RedCode: Risky Code Execution and Generation Benchmark for Code Agents

Chengquan Guo, Xun Liu, Chulin Xie, Andy Zhou, Yi Zeng, Zinan Lin, Dawn Song, Bo Li

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07643 2024-11-13 cs.CV cs.LG 57%

xCG: Explainable Cell Graphs for Survival Prediction in Non-Small Cell Lung Cancer

Marvin Sextro, Gabriel Dernbach, Kai Standvoss, Simon Schallenberg, Frederick Klauschen, Klaus-Robert Müller, Maximilian Alber, Lukas Ruff

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07516 2024-11-13 cs.CV cs.CL 57%

SparrowVQE: Visual Question Explanation for Course Content Understanding

Jialu Li, Manish Kumar Thota, Ruslan Gokhman, Radek Holik, Youshan Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04485 2024-11-12 cs.AI cs.CV 57%

GenAI Arena: An Open Evaluation Platform for Generative Models

Dongfu Jiang, Max Ku, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 9 pages,7 figures

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06032 2024-11-12 cs.CL 57%

LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output

Elise Karinshak, Amanda Hu, Kewen Kong, Vishwanatha Rao, Jingren Wang, Jindong Wang, Yi Zeng

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03225 2024-11-08 cs.AI cs.CV 57%

Knowledge Graphs of Driving Scenes to Empower the Emerging Capabilities of Neurosymbolic AI

Ruwan Wickramarachchi, Cory Henson, Amit Sheth

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18064 2024-11-08 cs.CL 57%

Evaluating Quality of Answers for Retrieval-Augmented Generation: A Strong LLM Is All You Need

Yang Wang, Alberto Garcia Hernandez, Roman Kyslyi, Nicholas Kersting

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 13 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03659 2024-11-07 cs.CY 57%

Towards Scalable Automated Grading: Leveraging Large Language Models for Conceptual Question Evaluation in Engineering

Rujun Gao, Xiaosu Guo, Xiaodi Li, Arun Balajiee Lekshmi Narayanan, Naveen Thomas, Arun R. Srinivasa

专题命中 安全评测 :alignment(abstract);分类 cs.CY

Comments 21 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03395 2024-11-07 cs.HC cs.CL 57%

Exploring Large Language Models for Specialist-level Oncology Care

Anil Palepu, Vikram Dhillon, Polly Niravath, Wei-Hung Weng, Preethi Prasad, Khaled Saab, Ryutaro Tanno, Yong Cheng, Hanh Mai, Ethan Burns, Zainub Ajmal, Kavita Kulkarni, Philip Mansfield, Dale Webster, Joelle Barral, Juraj Gottweis, Mike Schaekermann, S. Sara Mahdavi, Vivek Natarajan, Alan Karthikesalingam, Tao Tu

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02423 2024-11-06 cs.HC cs.AI 57%

Development of CODO: A Comprehensive Tool for COVID-19 Data Representation, Analysis, and Visualization

Biswanath Dutta, Debanjali Bain

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 15 pages, 4 figures, journal

Journal ref Journal of Information and Knowledge, Vol. 61, no. 5, pp. 245-253 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11527 2024-11-06 cs.AI 57%

Improving LLM Reasoning with Multi-Agent Tree-of-Thought Validator Agent

Fatemeh Haji, Mazal Bethany, Maryam Tabar, Jason Chiang, Anthony Rios, Peyman Najafirad

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18777 2024-11-06 cs.LG stat.ML 57%

Aligning Model Properties via Conformal Risk Control

William Overman, Jacqueline Jil Vallon, Mohsen Bayati

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17081 2024-11-05 cs.LG 57%

Effective Layer Pruning Through Similarity Metric Perspective

Ian Pons, Bruno Yamamoto, Anna H. Reali Costa, Artur Jordao

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Published at International Conference on Pattern Recognition (ICPR), 2024. Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00217 2024-11-04 cs.CR cs.AI cs.GT 57%

ADAPT: A Game-Theoretic and Neuro-Symbolic Framework for Automated Distributed Adaptive Penetration Testing

Haozhe Lei, Yunfei Ge, Quanyan Zhu

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04744 2024-11-04 cs.CL 57%

CRAG -- Comprehensive RAG Benchmark

Xiao Yang, Kai Sun, Hao Xin, Yushi Sun, Nikita Bhalla, Xiangsen Chen, Sajal Choudhary, Rongze Daniel Gui, Ziran Will Jiang, Ziyu Jiang, Lingkun Kong, Brian Moran, Jiaqi Wang, Yifan Ethan Xu, An Yan, Chenyu Yang, Eting Yuan, Hanwen Zha, Nan Tang, Lei Chen, Nicolas Scheffer, Yue Liu, Nirav Shah, Rakesh Wanga, Anuj Kumar, Wen-tau Yih, Xin Luna Dong

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23426 2024-11-01 cs.CL 57%

Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?

Yue Huang, Zhengqing Yuan, Yujun Zhou, Kehan Guo, Xiangqi Wang, Haomin Zhuang, Weixiang Sun, Lichao Sun, Jindong Wang, Yanfang Ye, Xiangliang Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10490 2024-11-01 stat.ML cs.LG 57%

Active, anytime-valid risk controlling prediction sets

Ziyu Xu, Nikos Karampatziakis, Paul Mineiro

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 22 pages, 3 figures. Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21802 2024-10-31 cs.CV cs.AI 57%

Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models

Lu Yu, Haiyang Zhang, Changsheng Xu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21791 2024-10-30 cs.CL 57%

Enhancing Adversarial Attacks through Chain of Thought

Jingbo Su

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20494 2024-10-29 cs.CL 57%

MatViX: Multimodal Information Extraction from Visually Rich Articles

Ghazal Khalighinejad, Sharon Scott, Ollie Liu, Kelly L. Anderson, Rickard Stureborg, Aman Tyagi, Bhuwan Dhingra

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19766 2024-10-29 cs.CV cs.LG eess.SP 57%

Large Model for Small Data: Foundation Model for Cross-Modal RF Human Activity Recognition

Yuxuan Weng, Guoquan Wu, Tianyue Zheng, Yanbing Yang, Jun Luo

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19642 2024-10-28 cs.AI cs.CV 57%

VARS: Vision-based Assessment of Risk in Security Systems

Pranav Gupta, Pratham Gohil, Sridhar S

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18525 2024-10-28 cs.LG 57%

Enabling Efficient and Flexible Interpretability of Data-driven Anomaly Detection in Industrial Processes with AcME-AD

Valentina Zaccaria, Chiara Masiero, David Dandolo, Gian Antonio Susto

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18785 2024-10-25 cs.AI 57%

Should We Really Edit Language Models? On the Evaluation of Edited Language Models

Qi Li, Xiang Liu, Zhenheng Tang, Peijie Dong, Zeyu Li, Xinglin Pan, Xiaowen Chu

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments NeurIPS 2024 https://github.com/lqinfdim/EditingEvaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07112 2024-10-25 cs.CV cs.AI 57%

VHELM: A Holistic Evaluation of Vision Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Wenhao Zheng, Yiyang Zhou, Yifan Mai, Josselin Somerville Roberts, Michihiro Yasunaga, Huaxiu Yao, Cihang Xie, Percy Liang

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments NeurIPS 2024. First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17781 2024-10-24 cs.AI 57%

Evaluating Explanations Through LLMs: Beyond Traditional User Studies

Francesco Bombassei De Bona, Gabriele Dominici, Tim Miller, Marc Langheinrich, Martin Gjoreski

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏