arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2504.03767 2025-04-14 cs.CR cs.AI cs.LG 81%

MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security Exploits

Brandon Radosevich, John Halloran

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 27 pages, 21 figures, and 2 Tables. Cleans up the TeX source

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04473 2025-04-08 cs.CL cs.AI 81%

Directed Graph-alignment Approach for Identification of Gaps in Short Answers

Archana Sahu, Plaban Kumar Bhowmick

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21902 2025-03-31 cs.AI cs.CL 81%

OntoAligner: A Comprehensive Modular and Robust Python Toolkit for Ontology Alignment

Hamed Babaei Giglou, Jennifer D'Souza, Oliver Karras, Sören Auer

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, 3 figures. Accepted for the ESWC 2025 Resource Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18762 2025-03-25 cs.LG cs.AI 81%

Mechanistic Interpretability of Fine-Tuned Vision Transformers on Distorted Images: Decoding Attention Head Behavior for Transparent and Trustworthy AI

Nooshin Bahador

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19845 2025-03-25 cs.CR cs.AI cs.CE cs.LG 81%

Enhancing Trust and Safety in Digital Payments: An LLM-Powered Approach

Devendra Dahiphale, Naveen Madiraju, Justin Lin, Rutvik Karve, Monu Agrawal, Anant Modwal, Ramanan Balakrishnan, Shanay Shah, Govind Kaushal, Priya Mandawat, Prakash Hariramani, Arif Merchant

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17777 2025-03-24 cs.AI cs.CV cs.LG eess.SP 81%

Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment

Shenghong Dai, Shiqi Jiang, Yifan Yang, Ting Cao, Mo Li, Suman Banerjee, Lili Qiu

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by SenSys'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15092 2025-03-20 cs.CR cs.AI cs.CL 81%

Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings

Zonghao Ying, Guangyi Zheng, Yongxin Huang, Deyue Zhang, Wenxin Zhang, Quanchen Zou, Aishan Liu, Xianglong Liu, Dacheng Tao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04610 2025-03-19 cs.LG cs.AI eess.SP stat.OT 81%

Data-Driven Semi-Supervised Machine Learning with Safety Indicators for Abnormal Driving Behavior Detection

Yongqi Dong, Lanxin Zhang, Haneen Farah, Arkady Zgonnikov, Bart van Arem

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 16 pages, 10 figures, accepted by the 103rd Transportation Research Board (TRB) Annual Meeting, accepted and published by Transportation Research Record: Journal of the Transportation Research Board

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07635 2025-03-12 cs.LG cs.CL cs.CV 81%

Cross-modal Causal Relation Alignment for Video Question Grounding

Weixing Chen, Yang Liu, Binglin Chen, Jiandong Su, Yongsen Zheng, Liang Lin

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03523 2025-03-04 cs.LG cs.AI 81%

A Probabilistic Perspective on Unlearning and Alignment for Large Language Models

Yan Scholten, Stephan Günnemann, Leo Schwinn

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at ICLR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00468 2025-02-28 cs.CV cs.AI cs.CL 81%

MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation

Jinsheng Huang, Liang Chen, Taian Guo, Fu Zeng, Yusheng Zhao, Bohan Wu, Ye Yuan, Haozhe Zhao, Zhihui Guo, Yichi Zhang, Jingyang Yuan, Wei Ju, Luchen Liu, Tianyu Liu, Baobao Chang, Ming Zhang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, code released at https://github.com/chenllliang/MMEvalPro, Homepage at https://mmevalpro.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16361 2025-02-26 cs.CY cs.CL cs.CV 81%

A Framework for Evaluating Vision-Language Model Safety: Building Trust in AI for Public Sector Applications

Maisha Binte Rashid, Pablo Rivas

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

Comments AAAI 2025 Workshop on AI for Social Impact: Bridging Innovations in Finance, Social Media, and Crime Prevention

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16971 2025-02-25 cs.CL cs.AI 81%

LongSafety: Evaluating Long-Context Safety of Large Language Models

Yida Lu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Cunxiang Wang, Xiaotao Gu, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10410 2025-02-18 cs.CY cs.AI 81%

Auto-Evaluation: A Critical Measure in Driving Improvements in Quality and Safety of AI-Generated Lesson Resources

Hannah-Beth Clark, Margaux Dowland, Laura Benton, Reka Budai, Ibrahim Kaan Keskin, Emma Searle, Matthew Gregory, Mark Hodierne, William Gayne, John Roberts

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI、cs.CY

Comments 27 pages, Part of MIT Open Learning AI and Open Education Initiative Series, published Jan 2025 https://aiopeneducation.pubpub.org/pub/i36sncz8/release/3?readingCollection=06969c6d

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06470 2025-02-11 cs.CL cs.AI 81%

A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks

Hieu Minh "Jord" Nguyen

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Advancing Artificial Intelligence through Theory of Mind Workshop, AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16806 2025-02-11 cs.CL cs.AI 81%

Entity Alignment with Noisy Annotations from Large Language Models

Shengyuan Chen, Qinggang Zhang, Junnan Dong, Wen Hua, Qing Li, Xiao Huang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05591 2025-02-11 cs.CV cs.CL cs.LG 81%

Linear Alignment of Vision-language Models for Image Captioning

Fabian Paischer, Markus Hofmarcher, Sepp Hochreiter, Thomas Adler

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments 9 pages (+ references and appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14778 2025-01-28 cs.CY cs.AI cs.HC 81%

Advancing Trustworthy AI for Sustainable Development: Recommendations for Standardising AI Incident Reporting

Avinash Agarwal, Manisha J Nene

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

Comments 8 pages, 10 tables, and 1 figure. Accepted at the International Telecommunication Union (ITU) Kaleidoscope 2024

Journal ref 2024 ITU Kaleidoscope: Innovation and Digital Transformation for a Sustainable World (ITU K), New Delhi, India, 2024, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14051 2025-01-27 cs.CV cs.AI cs.LG 81%

Revisiting CLIP: Efficient Alignment of 3D MRI and Tabular Data using Domain-Specific Foundation Models

Jakob Krogh Petersen, Valdemar Licht, Mads Nielsen, Asbjørn Munk

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments 10 pages, 2 figures. To be published in ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15474 2025-01-03 cs.CV cs.AI cs.LG cs.RO 81%

EC-IoU: Orienting Safety for Object Detectors via Ego-Centric Intersection-over-Union

Brian Hsuan-Cheng Liao, Chih-Hong Cheng, Hasan Esen, Alois Knoll

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages (IEEE double column format), 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14940 2024-12-30 cs.LG cs.CL 81%

Baichuan Alignment Technical Report

Mingan Lin, Fan Yang, Yanjun Shen, Haoze Sun, Tianpeng Li, Tao Zhang, Chenzheng Zhu, Tao Zhang, Miao Zheng, Xu Li, Yijie Zhou, Mingyang Chen, Yanzhao Qin, Youquan Li, Hao Liang, Fei Li, Yadong Li, Mang Wang, Guosheng Dong, Kun Fang, Jianhua Xu, Bin Cui, Wentao Zhang, Zenan Zhou, Weipeng Chen

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15265 2024-12-24 cs.CL cs.AI 81%

Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models

Yingshui Tan, Boren Zheng, Baihui Zheng, Kerui Cao, Huiyun Jing, Jincheng Wei, Jiaheng Liu, Yancheng He, Wenbo Su, Xiangyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16300 2024-12-20 cs.CL cs.AI 81%

BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment

Shaolei Zhang, Kehao Zhang, Qingkai Fang, Shoutao Guo, Yan Zhou, Xiaodong Liu, Yang Feng

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments BayLing 2's online demo: http://nlp.ict.ac.cn/bayling/demo. BayLing 2's code and models: https://github.com/ictnlp/BayLing

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06512 2024-12-10 cs.AI cs.CL cs.SE 81%

The Fusion of Large Language Models and Formal Methods for Trustworthy AI Agents: A Roadmap

Yedi Zhang, Yufan Cai, Xinyue Zuo, Xiaokun Luan, Kailong Wang, Zhe Hou, Yifan Zhang, Zhiyuan Wei, Meng Sun, Jun Sun, Jing Sun, Jin Song Dong

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19530 2024-12-02 cs.CR cs.AI cs.LG 81%

Quantized Delta Weight Is Safety Keeper

Yule Liu, Zhen Sun, Xinlei He, Xinyi Huang

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16736 2024-11-27 cs.CL cs.AI physics.chem-ph 81%

ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain

Haochen Zhao, Xiangru Tang, Ziran Yang, Xiao Han, Xuanzhi Feng, Yueqing Fan, Senhao Cheng, Di Jin, Yilun Zhao, Arman Cohan, Mark Gerstein

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08977 2024-11-25 cs.CY cs.CL 81%

Robustness and Confounders in the Demographic Alignment of LLMs with Human Perceptions of Offensiveness

Shayan Alipour, Indira Sen, Mattia Samory, Tanushree Mitra

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05403 2024-11-11 cs.CL cs.AI 81%

Benchmarking Distributional Alignment of Large Language Models

Nicole Meister, Carlos Guestrin, Tatsunori Hashimoto

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14125 2024-11-08 cs.AI cs.CL 81%

ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation

Jingnan Zheng, Han Wang, An Zhang, Tai D. Nguyen, Jun Sun, Tat-Seng Chua

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Journal ref 2024 Neurips

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17871 2024-11-06 cs.CV cs.AI cs.CL 81%

Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment

Xin Xiao, Bohong Wu, Jiacong Wang, Chunyuan Li, Xun Zhou, Haoyuan Guo

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments NeurlPS 2024, Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏