arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2505.00515 2025-05-02 cs.RO cs.AI cs.MA 79%

Safety-Critical Traffic Simulation with Guided Latent Diffusion Model

Mingxing Peng, Ruoyu Yao, Xusen Guo, Yuting Xie, Xianda Chen, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16134 2025-04-24 cs.CV cs.CL 79%

Multimodal Large Language Models for Enhanced Traffic Safety: A Comprehensive Review and Future Trends

Mohammad Abu Tami, Mohammed Elhenawy, Huthaifa I. Ashqar

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14526 2025-04-22 cs.CV cs.CL 79%

Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding

Tong Zeng, Longfeng Wu, Liang Shi, Dawei Zhou, Feng Guo

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) Virginia Tech Transportation Institute, Virginia Tech(弗吉尼亚理工学院交通研究所) Department of Statistics, Virginia Tech(弗吉尼亚理工学院统计学系)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18491 2025-04-15 cs.CL 79%

ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models

Hengxiang Zhang, Hongfu Gao, Qiang Hu, Guanhua Chen, Lili Yang, Bingyi Jing, Hongxin Wei, Bing Wang, Haifeng Bai, Lei Yang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00615 2025-04-14 cs.AI 79%

Towards Responsible and Trustworthy Educational Data Mining: Comparing Symbolic, Sub-Symbolic, and Neural-Symbolic AI Methods

Danial Hooshyar, Eve Kikas, Yeongwook Yang, Gustav Šír, Raija Hämäläinen, Tommi Kärkkäinen, Roger Azevedo

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07022 2025-04-10 cs.CL 79%

Evaluating Retrieval Augmented Generative Models for Document Queries in Transportation Safety

Chad Melton, Alex Sorokine, Steve Peterson

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments 14 pages, 3 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08688 2025-04-10 cs.CY 79%

Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs

Ariba Khan, Stephen Casper, Dylan Hadfield-Menell

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06277 2025-04-10 cs.IR cs.AI 79%

Dynamic Evaluation Framework for Personalized and Trustworthy Agents: A Multi-Session Approach to Preference Adaptability

Chirag Shah, Hideo Joho, Kirandeep Kaur, Preetam Prabhu Srikar Dammu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03906 2025-04-08 cs.CL 79%

CliME: Evaluating Multimodal Climate Discourse on Social Media and the Climate Alignment Quotient (CAQ)

Abhilekh Borah, Hasnat Md Abdullah, Kangda Wei, Ruihong Huang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19852 2025-04-07 cs.AI 79%

AI Alignment: A Comprehensive Survey

Jiaming Ji, Tianyi Qiu, Boyuan Chen, Borong Zhang, Hantao Lou, Kaile Wang, Yawen Duan, Zhonghao He, Lukas Vierling, Donghai Hong, Jiayi Zhou, Zhaowei Zhang, Fanzhi Zeng, Juntao Dai, Xuehai Pan, Kwan Yee Ng, Aidan O'Gara, Hua Xu, Brian Tse, Jie Fu, Stephen McAleer, Yaodong Yang, Yizhou Wang, Song-Chun Zhu, Yike Guo, Wen Gao

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Continually updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12909 2025-04-03 cs.LG physics.comp-ph 79%

Scalable Training of Trustworthy and Energy-Efficient Predictive Graph Foundation Models for Atomistic Materials Modeling: A Case Study with HydraGNN

Massimiliano Lupo Pasini, Jong Youl Choi, Kshitij Mehta, Pei Zhang, David Rogers, Jonghyun Bae, Khaled Z. Ibrahim, Ashwin M. Aji, Karl W. Schulz, Jorda Polo, Prasanna Balaprakash

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Comments 51 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19598 2025-03-26 cs.CL 79%

The Greatest Good Benchmark: Measuring LLMs' Alignment with Utilitarian Moral Dilemmas

Giovanni Franco Gabriel Marraffini, Andrés Cotton, Noe Fabian Hsueh, Axel Fridman, Juan Wisznia, Luciano Del Corro

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03766 2025-03-26 cs.CL 79%

Hierarchical Contextual Manifold Alignment for Structuring Latent Representations in Large Language Models

Meiquan Dong, Haoran Liu, Yan Huang, Zixuan Feng, Jianhong Tang, Ruoxi Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18817 2025-03-25 cs.CV cs.AI 79%

Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations

Jeonghyeon Kim, Sangheum Hwang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15707 2025-03-21 cs.RO cs.AI 79%

Safety Aware Task Planning via Large Language Models in Robotics

Azal Ahmad Khan, Michael Andrev, Muhammad Ali Murtaza, Sergio Aguilera, Rui Zhang, Jie Ding, Seth Hutchinson, Ali Anwar

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14672 2025-03-20 cs.CV cs.AI 79%

FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability

Estelle Aflalo, Gabriela Ben Melech Stan, Tiep Le, Man Luo, Shachar Rosenman, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06232 2025-03-18 cs.CL cs.CV 79%

Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning

Yanjun Chen, Yirong Sun, Xinghao Chen, Jian Wang, Xiaoyu Shen, Wenjie Li, Wei Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09648 2025-03-14 cs.MA cs.CY 79%

A Survey on Trustworthy LLM Agents: Threats and Countermeasures

Miao Yu, Fanci Meng, Xinyun Zhou, Shilong Wang, Junyuan Mao, Linsey Pang, Tianlong Chen, Kun Wang, Xinfeng Li, Yongfeng Zhang, Bo An, Qingsong Wen

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04875 2025-03-10 cs.CL quant-ph 79%

Architecture for a Trustworthy Quantum Chatbot

Yaiza Aragonés-Soria, Manuel Oriol

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04474 2025-03-07 cs.LG cs.CR 79%

Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges

Francisco Eiras, Eliott Zemour, Eric Lin, Vaikkunth Mugunthan

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

Comments Accepted to the ICBINB Workshop at ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16806 2025-03-04 cs.CL 79%

CoT2Align: Cross-Chain of Thought Distillation via Optimal Transport Alignment for Language Models with Different Tokenizers

Anh Duc Le, Tu Vu, Nam Le Hai, Nguyen Thi Ngoc Diep, Linh Ngo Van, Trung Le, Thien Huu Nguyen

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20285 2025-02-28 cs.LG stat.ML 79%

Conformal Tail Risk Control for Large Language Model Alignment

Catherine Yu-Chi Chen, Jingyan Shen, Zhun Deng, Lihua Lei

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05930 2025-02-28 cs.CR cs.AI cs.NI 79%

Trustworthy AI-Generative Content for Intelligent Network Service: Robustness, Security, and Fairness

Siyuan Li, Xi Lin, Yaju Liu, Xiang Chen, Jianhua Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14141 2025-02-26 cs.RO cs.CL 79%

Coherence-Driven Multimodal Safety Dialogue with Active Learning for Embodied Agents

Sabit Hassan, Hye-Young Chung, Xiang Zhi Tan, Malihe Alikhani

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments To appear at AAMAS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16922 2025-02-25 cs.CL 79%

Benchmarking Temporal Reasoning and Alignment Across Chinese Dynasties

Zhenglin Wang, Jialong Wu, Pengfei LI, Yong Jiang, Deyu Zhou

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11910 2025-02-24 cs.LG 79%

Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives

Leo Schwinn, Yan Scholten, Tom Wollschläger, Sophie Xhonneux, Stephen Casper, Stephan Günnemann, Gauthier Gidel

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12668 2025-02-19 cs.CL 79%

Evaluation of Best-of-N Sampling Strategies for Language Model Alignment

Yuki Ichihara, Yuu Jinnai, Tetsuro Morimura, Kaito Ariu, Kenshi Abe, Mitsuki Sakamoto, Eiji Uchibe

专题命中 安全评测 :alignment(title);RLHF(abstract);分类 cs.CL

Journal ref Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09809 2025-02-17 cs.CR cs.AI 79%

AgentGuard: Repurposing Agentic Orchestrator for Safety Evaluation of Tool Orchestration

Jizhou Chen, Samuel Lee Cong

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Project report of AgentGuard in LLM Agent MOOC Hackathon hosted by UC Berkeley in 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09624 2025-02-17 cs.AI cs.CR 79%

Efficient and Trustworthy Block Propagation for Blockchain-enabled Mobile Embodied AI Networks: A Graph Resfusion Approach

Jiawen Kang, Jiana Liao, Runquan Gao, Jinbo Wen, Huawei Huang, Maomao Zhang, Changyan Yi, Tao Zhang, Dusit Niyato, Zibin Zheng

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14662 2025-02-07 cs.LG 79%

Advantage Alignment Algorithms

Juan Agustin Duque, Milad Aghajohari, Tim Cooijmans, Razvan Ciuca, Tianyu Zhang, Gauthier Gidel, Aaron Courville

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments 25 Pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏