arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2511.18597 2025-11-25 cs.CL 79%

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks

迈向可信的难度评估:大型语言模型作为编程和合成任务的裁判

H. M. Shadman Tabib, Jaber Ahmed Deedar

机构 * Department of Computer Science, Bangladesh University of Engineering and Technology(计算机科学系,孟加拉国工程与技术大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在评估编程问题难度时的可靠性,发现LightGBM在准确性上显著优于GPT-4o,揭示了模型在处理数字约束方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11500 2025-11-25 cs.LG 79%

Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

诚实胜过准确:通过强化犹豫实现可信语言模型

Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 通过强化犹豫方法,将回避作为核心训练目标,使语言模型在风险可控下提升可信度,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22300 2025-11-24 cs.CR cs.AI cs.CV 79%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01418 2025-11-20 cs.CL 79%

On the Alignment of Large Language Models with Global Human Opinion

Yang Liu, Masahiro Kaneko, Chenhui Chu

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04759 2025-11-20 cs.AI 79%

Driving with Regulation: Trustworthy and Interpretable Decision-Making for Autonomous Driving with Retrieval-Augmented Reasoning

Tianhui Cai, Yifan Liu, Zewei Zhou, Haoxuan Ma, Seth Z. Zhao, Zhiwen Wu, Xu Han, Zhiyu Huang, Jiaqi Ma

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02175 2025-11-19 cs.SD cs.CL eess.AS 79%

Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers

Liang Lin, Miao Yu, Kaiwen Luo, Yibo Zhang, Lilan Peng, Dexian Wang, Xuehai Tang, Yuanhe Zhang, Xikang Yang, Zhenhong Zhou, Kun Wang, Yang Liu

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10810 2025-11-17 cs.AI 79%

HARNESS: Human-Agent Risk Navigation and Event Safety System for Proactive Hazard Forecasting in High-Risk DOE Environments

Ran Elgedawy, Sanjay Das, Ethan Seefried, Gavin Wiggins, Ryan Burchfield, Dana Hewit, Sudarshan Srinivasan, Todd Thomas, Prasanna Balaprakash, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克勒斯国家实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09964 2025-11-14 cs.SE cs.AI cs.PL 79%

EnvTrace: Simulation-Based Semantic Evaluation of LLM Code via Execution Trace Alignment -- Demonstrated at Synchrotron Beamlines

Noah van der Vleuten, Anthony Flores, Shray Mathur, Max Rakitin, Thomas Hopkins, Kevin G. Yager, Esther H. R. Tsai

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07871 2025-11-14 cs.CL 79%

AlignSurvey: A Comprehensive Benchmark for Human Preferences Alignment in Social Surveys

Chenxi Lin, Weikang Yuan, Zhuoren Jiang, Biao Huang, Ruitao Zhang, Jianan Ge, Yueqian Xu, Jianxing Yu

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15434 2025-11-14 cs.CV cs.LG 79%

Semantic4Safety: Causal Insights from Zero-shot Street View Imagery Segmentation for Urban Road Safety

Huan Chen, Ting Han, Siyu Chen, Zhihao Guo, Yiping Chen, Meiliu Wu

机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(地理空间工程与科学学院,中山大学) School of Geographical and Earth Sciences, University of Glasgow(地理与地球科学学院,格拉斯哥大学) School of Economics and Management, Shanxi University(经济学与管理学院,山西大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

Comments 11 pages, 10 figures, The 8th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI '25), November 3--6, 2025, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20810 2025-11-12 cs.CL 79%

Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching

Songze Li, Zhiqiang Liu, Zhengke Gui, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Journal ref EMNLP 2025, pages 7683-7703

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11881 2025-11-11 cs.CL 79%

Evaluating Human-LLM Representation Alignment: A Case Study on Affective Sentence Generation for Augmentative and Alternative Communication

Shadab Choudhury, Asha Kumar, Lara J. Martin

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Published at IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04312 2025-11-07 cs.AI 79%

Probing the Probes: Methods and Metrics for Concept Alignment

Jacob Lysnæs-Larsen, Marte Eggen, Inga Strümke

机构 * Department of Computer Science NTNU - Norwegian University of Science and Technology(计算机科学系挪威科学技术大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20621 2025-11-03 cs.AI 79%

Towards the Formalization of a Trustworthy AI for Mining Interpretable Models explOiting Sophisticated Algorithms

Riccardo Guidotti, Martina Cinquini, Marta Marchiori Manerba, Mattia Setzu, Francesco Spinnato

机构 * University of Pisa(比萨大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12667 2025-11-03 cs.AI cs.LO 79%

Building Trustworthy AI by Addressing its 16+2 Desiderata with Goal-Directed Commonsense Reasoning

Alexis R. Tudor, Yankai Zeng, Huaduo Wang, Joaquin Arias, Gopal Gupta

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06497 2025-10-30 cs.CV cs.AI 79%

Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving

Enming Zhang, Peizhe Gong, Xingyuan Dai, Min Huang, Yisheng Lv, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11842 2025-10-29 cs.CV cs.CL 79%

Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs

Xuannan Liu, Zekun Li, Zheqi He, Peipei Li, Shuhan Xia, Xing Cui, Huaibo Huang, Xi Yang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of California, Santa Barbara(加州大学圣芭芭拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(中国科学院CASIA智能感知与计算中心)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track, Project page: https://liuxuannan.github.io/Video-SafetyBench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21566 2025-10-28 cs.MA cs.CL 79%

ColorEcosystem: Powering Personalized, Standardized, and Trustworthy Agentic Service in massive-agent Ecosystem

Fangwen Wu, Zheng Wu, Jihong Wang, Yunku Chen, Ruiguang Pei, Heyuan Huang, Xin Liao, Xingyu Lou, Huarong Deng, Zhihui Fu, Weiwen Liu, Zhuosheng Zhang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21557 2025-10-27 cs.AI 79%

Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured Facts

Hongwei Zhang, Ji Lu, Shiqing Jiang, Chenxiang Zhu, Li Xie, Chen Zhong, Haoran Chen, Yurui Zhu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Zhongxing Telecom Equipment (ZTE), China(中兴通讯设备(ZTE),中国)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21551 2025-10-27 cs.LG 79%

Interpretable Multimodal Zero-Shot ECG Diagnosis via Structured Clinical Knowledge Alignment

Jialu Tang, Hung Manh Pham, Ignace De Lathauwer, Henk S. Schipper, Yuan Lu, Dong Ma, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Singapore Management University(新加坡管理大学) Maxima Medical Center(马克斯医疗中心) Erasmus Medical Center(埃因霍温医学院)

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15086 2025-10-24 cs.CL 79%

Is Safety Standard Same for Everyone? User-Specific Safety Evaluation of Large Language Models

Yeonjun In, Wonjoong Kim, Kanghoon Yoon, Sungchul Kim, Mehrab Tanjim, Sangwu Park, Kibum Kim, Chanyoung Park

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19384 2025-10-23 cs.LG 79%

Learning Noise-Resilient and Transferable Graph-Text Alignment via Dynamic Quality Assessment

Yuhang Liu, Minglai Shao, Zengyi Wo, Yunlong Chu, Bing Hao, Shengzhong Liu, Ruijie Wang, Jianxin Li

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Baidu(百度) Shanghai Jiao Tong University(上海交通大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17452 2025-10-23 cs.CV cs.AI 79%

Training-Free Label Space Alignment for Universal Domain Adaptation

Dujin Lee, Sojung An, Jungmyung Wi, Kuniaki Saito, Donghyun Kim

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12494 2025-10-22 cs.CL 79%

BIRD: A Trustworthy Bayesian Inference Framework for Large Language Models

Yu Feng, Ben Zhou, Weidong Lin, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Journal ref ICLR 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16980 2025-10-21 cs.LG 79%

Towards Interpretable and Trustworthy Time Series Reasoning: A BlueSky Vision

Kanghui Ning, Zijie Pan, Yushan Jiang, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

机构 * School of Computing University of Connecticut Storrs, CT(计算学院 美国康涅狄格大学 斯托尔斯分校) Department of Machine Learning Research Morgan Stanley New York, NY(机器学习研究部 花旗集团 新 York)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22967 2025-10-21 cs.CV cs.LG cs.MM 79%

ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment

Amir Aghdam, Vincent Tao Hu, Björn Ommer

机构 * Department of Computer Science, Temple University(Temple大学计算机科学系) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments Accepted to TMLR 2025 - Project page: https://amir-aghdam.github.io/act-align/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13023 2025-10-20 cs.LG physics.comp-ph 79%

Machine Learning-Based Ultrasonic Weld Characterization Using Hierarchical Wave Modeling and Diffusion-Driven Distribution Alignment

Joshua R. Tempelman, Adam J. Wachtor, Eric B. Flynn

机构 * Data Science Group, Los Alamos National Laboratory, Los Alamos NM, USA(数据科学组,洛斯阿拉莫斯国家实验室) Engineering Institute, Los Alamos National Laboratory, Los Alamos NM, USA(工程学院,洛斯阿拉莫斯国家实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments 26 pages, 6 page appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14398 2025-10-20 cs.CL 79%

Lightweight Safety Guardrails Using Fine-tuned BERT Embeddings

Aaron Zheng, Mansi Rana, Andreas Stolcke

机构 * Uniphore & UC Berkeley(Uniphore与伯克利大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments To appear in Proceedings of COLING 2025

Journal ref Proc. 31st Intl. Conf. Computational Linguistics: Industry Track, COLING 2025, pp. 689-696

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03550 2025-10-17 cs.CL 79%

Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations

Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19179 2025-10-17 cs.AI 79%

A Design Framework for operationalizing Trustworthy Artificial Intelligence in Healthcare: Requirements, Tradeoffs and Challenges for its Clinical Adoption

Pedro A. Moreno-Sánchez, Javier Del Ser, Mark van Gils, Jussi Hernesniemi

机构 * organization= Faculty of Medicine Health Technology, Tampere University , city= Tampere , postcode= 33100 , country= Finland organization= TECNALIA, Basque Research \& Technology Alliance (BRTA) , city= Derio , postcode= 48160 , country= Spain organization= Department of Mathematics, University of the Basque Country (UPV/EHU) , city= Leioa , postcode= 48940 , country= Spain organization= Tampere Heart Hospital, Tampere University Hospital , city= Tampere , postcode= 33520 , country= Finland

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏