arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2501.17883 2025-01-31 eess.SP cs.AI 79%

Explainable and Robust Millimeter Wave Beam Alignment for AI-Native 6G Networks

Nasir Khan, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil, Sinem Coleri

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17749 2025-01-30 cs.SE cs.AI 79%

Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation

Aitor Arrieta, Miriam Ugarte, Pablo Valle, José Antonio Parejo, Sergio Segura

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:2501.17132

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11730 2025-01-23 cs.GT cs.LG 79%

CHG Shapley: Efficient Data Valuation and Selection towards Trustworthy Machine Learning

Huaiguang Cai

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Comments Rejected by ICLR 2025. https://openreview.net/forum?id=uVMZgtw2pf

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07861 2025-01-15 cs.CL 79%

ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Xiaoxue Zang, Kai Zheng, Jun Xu, Xiao Zhang, Song Yang, Han Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06741 2025-01-14 cs.CL 79%

Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation

Shunfan Zheng, Xiechi Zhang, Gerard de Melo, Xiaoling Wang, Linlin Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05207 2025-01-10 cs.MA cs.LG 79%

CoDe: Communication Delay-Tolerant Multi-Agent Collaboration via Dual Alignment of Intent and Timeliness

Shoucheng Song, Youfang Lin, Sheng Han, Chang Yao, Hao Wu, Shuo Wang, Kai Lv

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments AAAI 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00722 2025-01-07 cs.CR cs.AI cs.DC 79%

Pathway to Secure and Trustworthy ZSM for LLMs: Attacks, Defense, and Opportunities

Sunder Ali Khowaja, Parus Khuwaja, Kapal Dev, Hussam Al Hamadi, Engin Zeydan

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19449 2024-12-30 cs.CL 79%

Feature Alignment-Based Knowledge Distillation for Efficient Compression of Large Language Models

Shuo Wang, Chihang Wang, Jia Gao, Zhen Qi, Hongye Zheng, Xiaoxuan Liao

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18842 2024-12-30 cs.CV cs.LG 79%

Context-Based Semantic-Aware Alignment for Semi-Supervised Multi-Label Learning

Heng-Bo Fan, Ming-Kun Xie, Jia-Hao Xiao, Sheng-Jun Huang

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18697 2024-12-30 cs.AI cs.MA 79%

Agents on the Bench: Large Language Model Based Multi Agent Framework for Trustworthy Digital Justice

Cong Jiang, Xiaolei Yang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Draft version; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18022 2024-12-25 cs.DB cs.AI 79%

Trustworthy and Efficient LLMs Meet Databases

Kyoungmin Kim, Anastasia Ailamaki

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12723 2024-12-24 cs.CR cs.AI cs.SE 79%

Python Fuzzing for Trustworthy Machine Learning Frameworks

Ilya Yegorov, Eli Kobrin, Darya Parygina, Alexey Vishnyakov, Andrey Fedotov

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Journal ref Journal of Mathematical Sciences, 2024 Springer Nature Switzerland AG, Vol. 285, No. 2, October, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18580 2024-12-24 cs.CL cs.CR 79%

FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity

Shiyao Cui, Zhenyu Zhang, Yilong Chen, Wenyuan Zhang, Tianyun Liu, Siqi Wang, Tingwen Liu

专题命中 安全评测 :harmlessness(title,abstract);分类 cs.CL

Comments Accepted by KDD workshop on Evaluation and Trustworthiness of Generative AI Models

Journal ref https://genai-evaluation-kdd2024.github.io/genai-evalution-kdd2024/assets/papers/GenAI_Evaluation_KDD2024_paper_5.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15861 2024-12-23 stat.ML cs.LG 79%

On Robust Cross Domain Alignment

Anish Chakrabarty, Arkaprabha Basu, Swagatam Das

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08072 2024-12-18 cs.CL 79%

I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm

Yiming Liang, Ge Zhang, Xingwei Qu, Tianyu Zheng, Jiawei Guo, Xinrun Du, Zhenzhu Yang, Jiaheng Liu, Chenghua Lin, Lei Ma, Wenhao Huang, Jiajun Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11242 2024-12-16 q-bio.GN cs.CL 79%

Bridging Sequence-Structure Alignment in RNA Foundation Models

Heng Yang, Renzhi Chen, Ke Li

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08862 2024-12-13 cs.SE cs.AI 79%

Key Safety Design Overview in AI-driven Autonomous Vehicles

Vikas Vyas, Zheyuan Xu

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08639 2024-12-12 cs.CL cs.CV 79%

Fast Prompt Alignment for Text-to-Image Generation

Khalil Mrini, Hanlin Lu, Linjie Yang, Weilin Huang, Heng Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments TikTok Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04661 2024-12-09 cs.IR cs.AI 79%

HEAL: Hierarchical Embedding Alignment Loss for Improved Retrieval and Representation Learning

Manish Bhattarai, Ryan Barron, Maksim Eren, Minh Vu, Vesselin Grantcharov, Ismael Boureima, Valentin Stanev, Cynthia Matuszek, Vladimir Valtchinov, Kim Rasmussen, Boian Alexandrov

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08981 2024-11-15 cs.AI cs.SY eess.SY 79%

Reliability, Resilience and Human Factors Engineering for Trustworthy AI Systems

Saurabh Mishra, Anand Rao, Ramayya Krishnan, Bilal Ayyub, Amin Aria, Enrico Zio

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08320 2024-11-14 cs.AI 79%

Responsible AI in Construction Safety: Systematic Evaluation of Large Language Models and Prompt Engineering

Farouq Sammour, Jia Xu, Xi Wang, Mo Hu, Zhenyu Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19361 2024-11-07 cs.AI 79%

Engineering Trustworthy AI: A Developer Guide for Empirical Risk Minimization

Diana Pfau, Alexander Jung

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17032 2024-10-23 cs.AI 79%

Insights on Disagreement Patterns in Multimodal Safety Perception across Diverse Rater Groups

Charvi Rastogi, Tian Huey Teh, Pushkar Mishra, Roma Patel, Zoe Ashwood, Aida Mostafazadeh Davani, Mark Diaz, Michela Paganini, Alicia Parrish, Ding Wang, Vinodkumar Prabhakaran, Lora Aroyo, Verena Rieser

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11773 2024-10-21 cs.IR cs.AI 79%

Behavior Alignment: A New Perspective of Evaluating LLM-based Conversational Recommender Systems

Dayu Yang, Fumian Chen, Hui Fang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments Accepted by the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12971 2024-10-18 cs.CL 79%

Self-Pluralising Culture Alignment for Large Language Models

Shaoyang Xu, Yongqi Leng, Linhao Yu, Deyi Xiong

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Implementation for the paper: https://github.com/shaoyangxu/CultureSPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07167 2024-10-17 cs.CV cs.CL 79%

Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate

Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin, Weiming Zhang, Nenghai Yu

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Project page: https://github.com/shikiw/Modality-Integration-Rate

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11114 2024-10-16 cs.CL 79%

Active Learning for Robust and Representative LLM Generation in Safety-Critical Scenarios

Sabit Hassan, Anthony Sicilia, Malihe Alikhani

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04965 2024-10-15 cs.CL 79%

Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression

Zhichao Xu, Ashim Gupta, Tao Li, Oliver Bentham, Vivek Srikumar

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07239 2024-10-11 cs.CL 79%

Locally Measuring Cross-lingual Lexical Alignment: A Domain and Word Level Perspective

Taelin Karidi, Eitan Grossman, Omri Abend

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03744 2024-10-11 cs.AI 79%

MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models

Tessa Han, Aounon Kumar, Chirag Agarwal, Himabindu Lakkaraju

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏