arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2410.11114 2024-10-16 cs.CL 79%

Active Learning for Robust and Representative LLM Generation in Safety-Critical Scenarios

Sabit Hassan, Anthony Sicilia, Malihe Alikhani

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04965 2024-10-15 cs.CL 79%

Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression

Zhichao Xu, Ashim Gupta, Tao Li, Oliver Bentham, Vivek Srikumar

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07239 2024-10-11 cs.CL 79%

Locally Measuring Cross-lingual Lexical Alignment: A Domain and Word Level Perspective

Taelin Karidi, Eitan Grossman, Omri Abend

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03744 2024-10-11 cs.AI 79%

MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models

Tessa Han, Aounon Kumar, Chirag Agarwal, Himabindu Lakkaraju

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05349 2024-10-10 cs.CR cs.AI 79%

SoK: Towards Security and Safety of Edge AI

Tatjana Wingarz, Anne Lauscher, Janick Edinger, Dominik Kaaser, Stefan Schulte, Mathias Fischer

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03304 2024-10-07 cs.CL 79%

Learning Personalized Alignment for Evaluating Open-ended Text Generation

Danqing Wang, Kevin Yang, Hanlin Zhu, Xiaomeng Yang, Andrew Cohen, Lei Li, Yuandong Tian

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12168 2024-10-04 cs.CL 79%

FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy Distillation

KaShun Shum, Minrui Xu, Jianshu Zhang, Zixin Chen, Shizhe Diao, Hanze Dong, Jipeng Zhang, Muhammad Omer Raza

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17233 2024-10-04 cs.SE cs.CL 79%

Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement

Yunlong Feng, Dechuan Teng, Yang Xu, Honglin Mu, Xiao Xu, Libo Qin, Qingfu Zhu, Wanxiang Che

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12903 2024-09-20 cs.NI cs.AI 79%

Towards Bridging the FL Performance-Explainability Trade-Off: A Trustworthy 6G RAN Slicing Use-Case

Swastika Roy, Hatim Chergui, Christos Verikoukis

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Submitted for possible publication in IEEE. arXiv admin note: text overlap with arXiv:2210.10147

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00710 2024-09-18 cs.HC cs.AI 79%

Interactive AI Alignment: Specification, Process, and Evaluation Alignment

Michael Terry, Chinmay Kulkarni, Martin Wattenberg, Lucas Dixon, Meredith Ringel Morris

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00935 2024-09-04 cs.CL 79%

Self-Judge: Selective Instruction Following with Alignment Self-Evaluation

Hai Ye, Hwee Tou Ng

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09798 2024-08-20 cs.LG 79%

Enhance Modality Robustness in Text-Centric Multimodal Alignment with Adversarial Prompting

Yun-Da Tsai, Ting-Yu Yen, Keng-Te Liao, Shou-De Lin

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2407.05036

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07094 2024-08-15 cs.LG stat.ML 79%

Overcoming Imbalanced Safety Data Using Extended Accident Triangle

Kailai Sun, Tianxiang Lan, Yang Miang Goh, Yueng-Hsiang Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17075 2024-08-14 cs.CL 79%

SAFETY-J: Evaluating Safety with Critique

Yixiu Liu, Yuxiang Zheng, Shijie Xia, Jiajun Li, Yi Tu, Chaoling Song, Pengfei Liu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17673 2024-07-31 cs.CV cs.AI cs.RO 79%

CRASAR-U-DROIDs: A Large Scale Benchmark Dataset for Building Alignment and Damage Assessment in Georectified sUAS Imagery

Thomas Manzini, Priyankari Perali, Raisa Karnik, Robin Murphy

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 16 Pages, 7 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16808 2024-07-12 cs.AI 79%

Navigating the EU AI Act: A Methodological Approach to Compliance for Safety-critical Products

J. Kelly, S. Zafar, L. Heidemann, J. Zacchi, D. Espinoza, N. Mata

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments To be published in: 2024 IEEE Conference on Artificial Intelligence (CAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18871 2024-06-28 eess.AS cs.CL 79%

DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted to Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17957 2024-06-27 cs.SD cs.AI eess.AS 79%

Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment

Paarth Neekhara, Shehzeen Hussain, Subhankar Ghosh, Jason Li, Rafael Valle, Rohan Badlani, Boris Ginsburg

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Published as a conference paper at INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07045 2024-06-25 cs.CL 79%

SafetyBench: Evaluating the Safety of Large Language Models

Zhexin Zhang, Leqi Lei, Lindong Wu, Rui Sun, Yongkang Huang, Chong Long, Xiao Liu, Xuanyu Lei, Jie Tang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10117 2024-06-17 cs.LG 79%

Trustworthy Artificial Intelligence in the Context of Metrology

Tameem Adel, Sam Bilson, Mark Levene, Andrew Thompson

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Journal ref In Producing Artificial Intelligent Systems: The roles of Benchmarking, Standardisation and Certification, Studies in Computational Intelligence, edited by M. I. A. Ferreira, 2024, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07855 2024-06-13 cs.CL cs.SD eess.AS 79%

VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment

Bing Han, Long Zhou, Shujie Liu, Sanyuan Chen, Lingwei Meng, Yanming Qian, Yanqing Liu, Sheng Zhao, Jinyu Li, Furu Wei

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18510 2024-05-30 cs.AI 79%

Improved Emotional Alignment of AI and Humans: Human Ratings of Emotions Expressed by Stable Diffusion v1, DALL-E 2, and DALL-E 3

James Derek Lomas, Willem van der Maden, Sohhom Bandyopadhyay, Giovanni Lion, Nirmal Patel, Gyanesh Jain, Yanna Litowsky, Haian Xue, Pieter Desmet

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07776 2024-05-29 cs.CL 79%

TELLER: A Trustworthy Framework for Explainable, Generalizable and Controllable Fake News Detection

Hui Liu, Wenya Wang, Haoru Li, Haoliang Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Comments Accepted by Findings of ACL 2024. 28 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12326 2024-05-22 cs.LG 79%

Overlap Number of Balls Model-Agnostic CounterFactuals (ONB-MACF): A Data-Morphology-based Counterfactual Generation Method for Trustworthy Artificial Intelligence

José Daniel Pascual-Triana, Alberto Fernández, Javier Del Ser, Francisco Herrera

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Comments 21 pages, 6 figures. Submitted to Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04937 2024-05-09 cs.AI 79%

Developing trustworthy AI applications with foundation models

Michael Mock, Sebastian Schmidt, Felix Müller, Rebekka Görge, Anna Schmitz, Elena Haedecke, Angelika Voss, Dirk Hecker, Maximillian Poretschkin

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06676 2024-04-30 cs.LG stat.AP stat.CO 79%

Explainable, Interpretable & Trustworthy AI for Intelligent Digital Twin: Case Study on Remaining Useful Life

Kazuma Kobayashi, Syed Bahauddin Alam

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Journal ref Engineering Applications of Artificial Intelligence 129 (2024): 107620

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14366 2024-04-23 cs.CY 79%

Lessons Learned in Performing a Trustworthy AI and Fundamental Rights Assessment

Marjolein Boonstra, Frédérick Bruneault, Subrata Chakraborty, Tjitske Faber, Alessio Gallucci, Eleanore Hickman, Gerard Kema, Heejin Kim, Jaap Kooiker, Elisabeth Hildt, Annegret Lamadé, Emilie Wiinblad Mathez, Florian Möslein, Genien Pathuis, Giovanni Sartor, Marijke Steege, Alice Stocco, Willy Tadema, Jarno Tuimala, Isabel van Vledder, Dennis Vetter, Jana Vetter, Magnus Westerlund, Roberto V. Zicari

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

Comments On behalf of the Z-Inspection$^{\small{\circledR}}$ Initiative

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08608 2024-04-15 cs.LG 79%

Hyperbolic Delaunay Geometric Alignment

Aniss Aiman Medbouhi, Giovanni Luca Marchetti, Vladislav Polianskii, Alexander Kravberg, Petra Poklukar, Anastasia Varava, Danica Kragic

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07520 2024-04-15 cs.CV cs.CL 79%

PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination

Anant Khandelwal

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted at CVPR 2024 LIMIT, 12 pages, 8 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05278 2024-04-15 cs.CL 79%

Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects

Junyu Lu, Dixiang Zhang, Songxin Zhang, Zejian Xie, Zhuoyang Song, Cong Lin, Jiaxing Zhang, Bingyi Jing, Pingjian Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏