arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-08 至 2025-09-08 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2408.09600 2025-09-08 cs.AI cs.CR 88%

Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning

Tiansheng Huang, Gautam Bhattacharya, Pratik Joshi, Josh Kimball, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

Comments Rejected by AAAI25-AIA. Accepted by ICML25. Authors are thankful to the anonymous reviewers from both AAAI25-AIA and ICML25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08613 2025-09-08 cs.CL 79%

Assessing the Sensitivity and Alignment of FOL Closeness Metrics

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04536 2025-09-08 cs.LG math.QA math.ST stat.TH 79%

Q-SafeML: Safety Assessment of Quantum Machine Learning via Quantum Distance Metrics

Oliver Dunn, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17114 2025-09-08 cs.CL cs.CV cs.LG cs.MM 76%

RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language

Subrata Biswas, Mohammad Nur Hossain Khan, Bashima Islam

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05042 2025-09-08 cs.RO 75%

Shared Autonomy through LLMs and Reinforcement Learning for Applications to Ship Hull Inspections

Cristiano Caissutti, Estelle Gerbier, Ehsan Khorrambakht, Paolo Marinelli, Andrea Munafo', Andrea Caiti

机构 * Dept. of Information Engineering University of Pisa, Italy Pisa, Italy(信息工程系 乌迪内大学 乌迪内,意大利)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04549 2025-09-08 cs.CL cs.AI 73%

Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions

Faruk Alpay, Taylan Alpay

机构 * Lightcap Department of Future(未来系) Turkish Aeronautical Association(土耳其航空航天协会)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05199 2025-09-08 cs.CL 70%

Triadic Fusion of Cognitive, Functional, and Causal Dimensions for Explainable LLMs: The TAXAL Framework

David Herrera-Poyatos, Carlos Peláez-González, Cristina Zuheros, Virilo Tejedor, Rosana Montes, Francisco Herrera

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) Andalusian Institute of Data Science and Computational Intelligence(安达卢西亚数据科学与计算智能研究所) University of Granada(格拉纳达大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 27 pages, 9 tables and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04979 2025-09-08 cs.AI 70%

Internet 3.0: Architecture for a Web-of-Agents with it's Algorithm for Ranking Agents

Rajesh Tembarai Krishnamachari, Srividya Rajesh

机构 * NYU(纽约大学) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20986 2025-09-08 cs.CY econ.TH 70%

MAD Chairs: A new tool to evaluate AI

Chris Santos-Lang

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

Comments 17 pages, 1 figure, reproduced with permission from Springer Nature from Coordination, Organizations, Institutions, Norms, and Ethics for Governance of Multi-Agent Systems XVIII (COINE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04657 2025-09-08 cs.CL cs.AI cs.DB cs.LG 67%

Evaluating NL2SQL via SQL2NL

Mohammadtaher Safarzadeh, Afshin Oroojlooyjadid, Dan Roth

机构 * Oracle AI

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04752 2025-09-08 cs.HC cs.AI cs.LG 62%

SePA: A Search-enhanced Predictive Agent for Personalized Health Coaching

Melik Ozolcer, Sang Won Bae

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted at IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI'25). 7 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05528 2025-09-08 cs.AI cs.CL 62%

Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment

Jiahuan Pei, Fanghua Ye, Xin Sun, Wentao Deng, Koen Hindriks, Junxiao Wang

机构 * Vrije University of Amsterdam(阿姆斯特丹自由大学) University College London(伦敦大学学院) University of Amsterdam(阿姆斯特丹大学) National Institute of Informatics(日本信息处理学会) Shandong University(山东大学) Guangzhou University(广州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 14 pages, accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23903 2025-09-08 cs.AI cs.LG 62%

Neural Network Verification with PyRAT

Augustin Lemesle, Julien Lehmann, Tristan Le Gall

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04504 2025-09-08 cs.CL cs.AI 62%

Behavioral Fingerprinting of Large Language Models

Zehua Pei, Hui-Ling Zhen, Ying Zhang, Zhiyuan Yang, Xing Li, Xianzhi Yu, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Submitted to 1st Open Conference on AI Agents for Science (agents4science 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04499 2025-09-08 cs.CL cs.AI 62%

DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence

Pranav Narayanan Venkit, Philippe Laban, Yilun Zhou, Kung-Hsiang Huang, Yixin Mao, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2410.22349

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04794 2025-09-08 cs.CL 57%

Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects

Gunmay Handa, Zekun Wu, Adriano Koshiyama, Philip Treleaven

机构 * University College London(伦敦大学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04619 2025-09-08 eess.SY cs.SY math.DS 50%

$\mathcal{L}_1$-DRAC: Distributionally Robust Adaptive Control

Aditya Gahlawat, Sambhu H. Karumanchi, Naira Hovakimyan

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏