arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2504.06011 2025-04-09 cs.CL 70%

Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi

Monojit Choudhury, Shivam Chauhan, Rocktim Jyoti Das, Dhruv Sahnan, Xudong Han, Haonan Li, Aaryamonvikram Singh, Alok Anil Jadhav, Utkarsh Agarwal, Mukund Choudhary, Debopriyo Banerjee, Fajri Koto, Junaid Bhat, Awantika Shukla, Samujjwal Ghosh, Samta Kamboj, Onkar Pandit, Lalit Pradhan, Rahul Pal, Sunil Sahu, Soundar Doraiswamy, Parvez Mullah, Ali El Filali, Neha Sengupta, Gokul Ramakrishnan, Rituraj Joshi, Gurpreet Gosal, Avraham Sheinin, Natalia Vassilieva, Preslav Nakov

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23424 2025-04-01 cs.LG cs.AI cs.CL cs.CR cs.CY 70%

What Makes an Evaluation Useful? Common Pitfalls and Best Practices

Gil Gekker, Meirav Segal, Dan Lahav, Omer Nevo

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22610 2025-03-31 cs.HC cs.AI cs.CL cs.CY cs.LG 70%

Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users

Antonia Karamolegkou, Malvina Nikandrou, Georgios Pantazopoulos, Danae Sanchez Villegas, Phillip Rust, Ruchira Dhar, Daniel Hershcovich, Anders Søgaard

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07306 2025-03-11 cs.CL 70%

Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies

Luyi Jiang, Jiayuan Chen, Lu Lu, Xinwei Peng, Lihao Liu, Junjun He, Jie Xu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14491 2025-03-11 cs.AI 70%

Statistical Scenario Modelling and Lookalike Distributions for Multi-Variate AI Risk

Elija Perrier

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02157 2025-03-05 cs.CV cs.AI 70%

MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models

Aofei Chang, Le Huang, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09927 2025-02-17 cs.CV cs.AI 70%

Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence

Granite Vision Team, Leonid Karlinsky, Assaf Arbelle, Abraham Daniels, Ahmed Nassar, Amit Alfassi, Bo Wu, Eli Schwartz, Dhiraj Joshi, Jovana Kondic, Nimrod Shabtay, Pengyuan Li, Roei Herzig, Shafiq Abedin, Shaked Perek, Sivan Harary, Udi Barzelay, Adi Raz Goldfarb, Aude Oliva, Ben Wieles, Bishwaranjan Bhattacharjee, Brandon Huang, Christoph Auer, Dan Gutfreund, David Beymer, David Wood, Hilde Kuehne, Jacob Hansen, Joseph Shtok, Ken Wong, Luis Angel Bathen, Mayank Mishra, Maksym Lysak, Michele Dolfi, Mikhail Yurochkin, Nikolaos Livathinos, Nimrod Harel, Ophir Azulai, Oshri Naparstek, Rafael Teixeira de Lima, Rameswar Panda, Sivan Doveh, Shubham Gupta, Subhro Das, Syed Zawad, Yusik Kim, Zexue He, Alexander Brooks, Gabe Goodhart, Anita Govindjee, Derek Leist, Ibrahim Ibrahim, Aya Soffer, David Cox, Kate Soule, Luis Lastras, Nirmit Desai, Shila Ofek-koifman, Sriram Raghavan, Tanveer Syeda-Mahmood, Peter Staar, Tal Drory, Rogerio Feris

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04103 2025-02-14 cs.HC cs.AI cs.SE 70%

VTutor: An Open-Source SDK for Generative AI-Powered Animated Pedagogical Agents with Multi-Media Output

Eason Chen, Chenyu Lin, Xinyi Tang, Aprille Xi, Canwen Wang, Jionghao Lin, Kenneth R Koedinger

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02619 2025-02-04 cs.CR cs.LG 70%

Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits

Andis Draguns, Andrew Gritsevskiy, Sumeet Ramesh Motwani, Charlie Rogers-Smith, Jeffrey Ladish, Christian Schroeder de Witt

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments 19 pages, 7 figures

Journal ref 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01818 2025-01-06 cs.CR cs.LG 70%

Rerouting LLM Routers

Avital Shafran, Roei Schuster, Thomas Ristenpart, Vitaly Shmatikov

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16087 2024-12-25 math.OC cs.LG 70%

Unlocking Global Optimality in Bilevel Optimization: A Pilot Study

Quan Xiao, Tianyi Chen

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17011 2024-12-24 cs.CL 70%

Robustness of Large Language Models Against Adversarial Attacks

Yiyi Tao, Yixian Shen, Hang Zhang, Yanxin Shen, Lun Wang, Chuanqi Shi, Shaoshuai Du

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13238 2024-12-20 cs.AI cs.ET cs.RO 70%

SafeDrive: Knowledge- and Data-Driven Risk-Sensitive Decision-Making for Autonomous Vehicles with Large Language Models

Zhiyuan Zhou, Heye Huang, Boqi Li, Shiyue Zhao, Yao Mu, Jianqiang Wang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07278 2024-12-11 cs.AI cs.IT math.IT 70%

Superficial Consciousness Hypothesis for Autoregressive Transformers

Yosuke Miyanishi, Keita Mitani

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments Accepted to PSS Workshop at AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01020 2024-12-03 cs.DC cs.AI 70%

AI Benchmarks and Datasets for LLM Evaluation

Todor Ivanov, Valeri Penchev

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments November 2024 v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10313 2024-11-26 cs.AI cs.CL cs.CY cs.LG 70%

How Far Are We From AGI: Are LLMs All We Need?

Tao Feng, Chuanyang Jin, Jingyu Liu, Kunlun Zhu, Haoqin Tu, Zirui Cheng, Guanyu Lin, Jiaxuan You

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11072 2024-11-20 cs.CL 70%

Multilingual Large Language Models: A Systematic Survey

Shaolin Zhu, Supryadi, Shaoyang Xu, Haoran Sun, Leiyu Pan, Menglong Cui, Jiangcun Du, Renren Jin, António Branco, Deyi Xiong

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09017 2024-11-06 cs.CL 70%

AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic

Emad A. Alghamdi, Reem I. Masoud, Deema Alnuhait, Afnan Y. Alomairi, Ahmed Ashraf, Mohamed Zaytoon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22932 2024-11-04 cs.CL 70%

Multi-Agent Large Language Models for Conversational Task-Solving

Jonas Becker

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15589 2024-11-04 cs.LG cs.CR 70%

Efficient Adversarial Training in LLMs with Continuous Attacks

Sophie Xhonneux, Alessandro Sordoni, Stephan Günnemann, Gauthier Gidel, Leo Schwinn

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22153 2024-10-30 cs.CL 70%

Benchmarking LLM Guardrails in Handling Multilingual Toxicity

Yahan Yang, Soham Dan, Dan Roth, Insup Lee

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08725 2024-10-14 cs.CV cs.AI cs.RO 70%

MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility

Wayne Wu, Honglin He, Jack He, Yiran Wang, Chenda Duan, Zhizheng Liu, Quanyi Li, Bolei Zhou

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Technical report. Project page: https://metadriverse.github.io/metaurban/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06400 2024-10-10 eess.SP cs.LG 70%

Reliable Heading Tracking for Pedestrian Road Crossing Prediction Using Commodity Devices

Yucheng Yang, Jingjie Li, Kassem Fawaz

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05561 2024-10-01 cs.CL 70%

TrustLLM: Trustworthiness in Large Language Models

Yue Huang, Lichao Sun, Haoran Wang, Siyuan Wu, Qihui Zhang, Yuan Li, Chujie Gao, Yixin Huang, Wenhan Lyu, Yixuan Zhang, Xiner Li, Zhengliang Liu, Yixin Liu, Yijue Wang, Zhikun Zhang, Bertie Vidgen, Bhavya Kailkhura, Caiming Xiong, Chaowei Xiao, Chunyuan Li, Eric Xing, Furong Huang, Hao Liu, Heng Ji, Hongyi Wang, Huan Zhang, Huaxiu Yao, Manolis Kellis, Marinka Zitnik, Meng Jiang, Mohit Bansal, James Zou, Jian Pei, Jian Liu, Jianfeng Gao, Jiawei Han, Jieyu Zhao, Jiliang Tang, Jindong Wang, Joaquin Vanschoren, John Mitchell, Kai Shu, Kaidi Xu, Kai-Wei Chang, Lifang He, Lifu Huang, Michael Backes, Neil Zhenqiang Gong, Philip S. Yu, Pin-Yu Chen, Quanquan Gu, Ran Xu, Rex Ying, Shuiwang Ji, Suman Jana, Tianlong Chen, Tianming Liu, Tianyi Zhou, William Wang, Xiang Li, Xiangliang Zhang, Xiao Wang, Xing Xie, Xun Chen, Xuyu Wang, Yan Liu, Yanfang Ye, Yinzhi Cao, Yong Chen, Yue Zhao

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments This work is still under work and we welcome your contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04465 2024-09-10 cs.AI 70%

Here's Charlie! Realising the Semantic Web vision of Agents in the age of LLMs

Jesse Wright

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments The 23rd International Semantic Web Conference, November 11--15, 2024, Hanover, MD - Posters and Demos track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03759 2024-09-09 cs.IR cs.AI 70%

VERA: Validation and Evaluation of Retrieval-Augmented Systems

Tianyu Ding, Adi Banerjee, Laurent Mombaerts, Yunhong Li, Tarik Borogovac, Juan Pablo De la Cruz Weinstein

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

Comments Accepted in Workshop on Evaluation and Trustworthiness of Generative AI Models, KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02565 2024-08-06 cs.CY 70%

Reasons to Doubt the Impact of AI Risk Evaluations

Gabriel Mukobi

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10254 2024-07-30 cs.CR cs.AI cs.CL cs.CY cs.LG 70%

LLM Platform Security: Applying a Systematic Evaluation Framework to OpenAI's ChatGPT Plugins

Umar Iqbal, Tadayoshi Kohno, Franziska Roesner

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments To appear in the proceedings of the 7th AAAI / ACM Conference on AI, Ethics, and Society (AIES), October 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15862 2024-07-24 cs.LG cs.AI cs.CL cs.CY 70%

Performance Evaluation of Lightweight Open-source Large Language Models in Pediatric Consultations: A Comparative Analysis

Qiuhong Wei, Ying Cui, Mengwei Ding, Yanqin Wang, Lingling Xiang, Zhengxiong Yao, Ceran Chen, Ying Long, Zhezhen Jin, Ximing Xu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 27 pages in total with 17 pages of main manuscript and 10 pages of supplementary materials; 4 figures in the main manuscript and 2 figures in supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02395 2024-07-08 cs.SE cs.CL 70%

Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval

Jiexin Wang, Xitong Luo, Liuwen Cao, Hongkui He, Hailin Huang, Jiayuan Xie, Adam Jatowt, Yi Cai

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2310.16263

详情

展开后加载摘要…

URL PDF HTML 收藏