arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2502.17017 2025-03-17 cs.CL cs.IT cs.LG math.IT math.LO 76%

Quantifying Logical Consistency in Transformers via Query-Key Alignment

Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva, Andrei Andriiainen, Irina Piontkovskaya, Evgeny Burnaev, Serguei Barannikov

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07212 2025-02-27 cs.CL cs.AI cs.HC 76%

Trustworthy and Practical AI for Healthcare: A Guided Deferral System with Large Language Models

Joshua Strong, Qianhui Men, Alison Noble

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

Comments AAAI-AISI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08353 2025-02-13 cs.LG cs.AI 76%

Trustworthy GNNs with LLMs: A Systematic Review and Taxonomy

Ruizhan Xue, Huimin Deng, Fang He, Maojun Wang, Zeyu Zhang

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments Submitted to IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03467 2025-02-07 cs.CY cs.AI cs.SE 76%

Where AI Assurance Might Go Wrong: Initial lessons from engineering of critical systems

Robin Bloomfield, John Rushby

专题命中 安全评测 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.AI、cs.CY

Comments Presented at UK AI Safety Institute (AISI) Conference on Frontier AI Safety Frameworks (FAISC 24), Berkeley CA, November 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11932 2025-01-07 cs.CL cs.AI 76%

CrossIn: An Efficient Instruction Tuning Approach for Cross-Lingual Knowledge Alignment

Geyu Lin, Bin Wang, Zhengyuan Liu, Nancy F. Chen

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07429 2024-12-11 cs.CL cs.AI 76%

Optimizing Alignment with Less: Leveraging Data Augmentation for Personalized Evaluation

Javad Seraj, Mohammad Mahdi Mohajeri, Mohammad Javad Dousti, Majid Nili Ahmadabadi

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06477 2024-11-06 cs.CL cs.AI 76%

Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation

Tianyu Zheng, Shuyue Guo, Xingwei Qu, Jiawei Guo, Xinrun Du, Qi Jia, Chenghua Lin, Wenhao Huang, Jie Fu, Ge Zhang

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15454 2024-09-25 cs.CL cs.AI 76%

In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Models

Pengrui Han, Peiyang Song, Haofei Yu, Jiaxuan You

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01596 2024-08-06 cs.LG cs.AI cs.GT 76%

Trustworthy Machine Learning under Social and Adversarial Data Sources

Han Shao

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18928 2024-07-30 cs.CY cs.AI 76%

The Voice: Lessons on Trustworthy Conversational Agents from "Dune"

Philip Feldman

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY

Comments 5 pages, 2 figures

Journal ref ACM Conversational User Interfaces 2024 (CUI '24), July 8--10, 2024, Luxembourg, Luxembourg

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07921 2024-07-12 cs.CR cs.AI cs.LG eess.SP 76%

A Trustworthy AIoT-enabled Localization System via Federated Learning and Blockchain

Junfei Wang, He Huang, Jingze Feng, Steven Wong, Lihua Xie, Jianfei Yang

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04766 2024-07-12 cs.CL cs.AI 76%

SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning

Bin Wang, Zhengyuan Liu, Xin Huang, Fangkai Jiao, Yang Ding, AiTi Aw, Nancy F. Chen

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments Published at NAACL 2024. Code: https://seaeval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16424 2024-05-28 cs.HC cs.AI cs.LG 76%

Improving Health Professionals' Onboarding with AI and XAI for Trustworthy Human-AI Collaborative Decision Making

Min Hun Lee, Silvana Xin Yi Choo, Shamala D/O Thilarajah

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04343 2023-12-08 cs.LG cs.AI 76%

Causality and Explainability for Trustworthy Integrated Pest Management

Ilias Tsoumas, Vasileios Sitokonstantinou, Georgios Giannarakis, Evagelia Lampiri, Christos Athanassiou, Gustau Camps-Valls, Charalampos Kontoes, Ioannis Athanasiadis

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2023 Workshop on Tackling Climate Change with Machine Learning: Blending New and Existing Knowledge Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05470 2023-12-08 cs.CL cs.AI 76%

Generative Judge for Evaluating Alignment

Junlong Li, Shichao Sun, Weizhe Yuan, Run-Ze Fan, Hai Zhao, Pengfei Liu

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments Fix typos in Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00848 2023-10-11 cs.SE cs.AI cs.LG cs.PL 76%

Toward Trustworthy Neural Program Synthesis

Darren Key, Wen-Ding Li, Kevin Ellis

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04760 2023-09-12 cs.LG cs.AI cs.CV 76%

RR-CP: Reliable-Region-Based Conformal Prediction for Trustworthy Medical Image Classification

Yizhe Zhang, Shuo Wang, Yejia Zhang, Danny Z. Chen

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments UNSURE2023 (Uncertainty for Safe Utilization of Machine Learning in Medical Imaging) at MICCAI2023; Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10968 2023-06-22 cs.CL cs.AI 76%

BayLing: Bridging Cross-lingual Alignment and Instruction Following through Interactive Translation for Large Language Models

Shaolei Zhang, Qingkai Fang, Zhuocheng Zhang, Zhengrui Ma, Yan Zhou, Langlin Huang, Mengyu Bu, Shangtong Gui, Yunji Chen, Xilin Chen, Yang Feng

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06134 2023-06-13 cs.LG cs.AI 76%

Sound Explanation for Trustworthy Machine Learning

Kai Jia, Pasapol Saowakon, Limor Appelbaum, Martin Rinard

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16634 2023-05-25 cs.CL cs.AI 76%

G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, Chenguang Zhu

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08821 2022-12-20 cs.AI cs.LG 76%

Context-dependent Explainability and Contestability for Trustworthy Medical Artificial Intelligence: Misclassification Identification of Morbidity Recognition Models in Preterm Infants

Isil Guzey, Ozlem Ucar, Nukhet Aladag Ciftdemir, Betul Acunas

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03425 2022-01-11 cs.CL cs.LG 76%

Towards Trustworthy AutoGrading of Short, Multi-lingual, Multi-type Answers

Johannes Schneider, Robin Richner, Micha Riser

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG

Comments International Journal of Artificial Intelligence in Education (Accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.13381 2021-08-31 cs.AI cs.LG cs.NE cs.SE cs.SY eess.SY 76%

Trustworthy AI for Process Automation on a Chylla-Haase Polymerization Reactor

Daniel Hein, Daniel Labisch

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Journal ref Proceedings of the Genetic and Evolutionary Computation Conference Companion GECCO 21 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.06543 2021-07-15 cs.AI cs.LG 76%

TEACHING -- Trustworthy autonomous cyber-physical applications through human-centred intelligence

Davide Bacciu, Siranush Akarmazyan, Eric Armengaud, Manlio Bacco, George Bravos, Calogero Calandra, Emanuele Carlini, Antonio Carta, Pietro Cassara, Massimo Coppola, Charalampos Davalas, Patrizio Dazzi, Maria Carmela Degennaro, Daniele Di Sarli, Jürgen Dobaj, Claudio Gallicchio, Sylvain Girbal, Alberto Gotta, Riccardo Groppo, Vincenzo Lomonaco, Georg Macher, Daniele Mazzei, Gabriele Mencagli, Dimitrios Michail, Alessio Micheli, Roberta Peroglio, Salvatore Petroni, Rosaria Potenza, Farank Pourdanesh, Christos Sardianos, Konstantinos Tserpes, Fulvio Tagliabò, Jakob Valtl, Iraklis Varlamis, Omar Veledar

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.12608 2021-02-01 cs.CL cs.AI 76%

Does injecting linguistic structure into language models lead to better alignment with brain recordings?

Mostafa Abdou, Ana Valeria Gonzalez, Mariya Toneva, Daniel Hershcovich, Anders Søgaard

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.07433 2020-07-21 cs.CL cs.AI cs.SI 76%

LAXARY: A Trustworthy Explainable Twitter Analysis Model for Post-Traumatic Stress Disorder Assessment

Mohammad Arif Ul Alam, Dhawal Kapadia

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

Comments Accepted in SmartComp 2020 (SmartSys)

Journal ref IEEE INTERNATIONAL CONFERENCE ON SMART COMPUTING (SMARTCOMP 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10441 2021-12-21 cs.LG cs.SE 76%

Towards Trustworthy Cross-patient Model Development

Ali El-Merhi, Helena Odenstedt Hergés, Linda Block, Mikael Elam, Richard Vithal, Jaquette Liljencrantz, Miroslaw Staron

专题命中 安全评测 :trustworthy(title,journal_ref);分类 cs.LG

Journal ref AAAI workshop on Trustworthy AI for Healthcare, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.02065 2019-12-05 cs.LG q-bio.GN stat.ML 76%

Safety and Robustness in Decision Making: Deep Bayesian Recurrent Neural Networks for Somatic Variant Calling in Cancer

Geoffroy Dubourg-Felonneau, Omar Darwish, Christopher Parsons, Dami Rebergen, John W Cassidy, Nirmesh Patel, Harry W Clifford

专题命中 安全评测 :safety(title,comments);分类 cs.LG

Comments Safety and Robustness in Decision Making Workshop at NeurIPS 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 75%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 75%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏