arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-19 至 2025-09-19 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 13 篇

2509.14956 2025-09-19 cs.AI cs.MA 79%

Sentinel Agents for Secure and Trustworthy Agentic AI in Multi-Agent Systems

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI Tesisquare(Tesisquare人工智能负责人) Voiceinteroperability.ai Initiative Member(Voiceinteroperability.ai 创始成员) Linux Foundation AI & Data(Linux基金会人工智能与数据) AI & Data Torino, TO 10100, Italy(人工智能与数据Torino, TO 10100, Italy) Principal Conversational Technologies(对话技术首席专家) Plymouth Meeting, Pennsylvania, USA(美国宾夕法尼亚州Plymouth Meeting)

专题命中 安全评测 :trustworthy(title);prompt injection(abstract);分类 cs.AI

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14446 2025-09-19 q-bio.NC 78%

Mouse vs. AI: A Neuroethological Benchmark for Visual Robustness and Neural Alignment

Marius Schneider, Joe Canzano, Jing Peng, Yuchen Hou, Spencer LaVere Smith, Michael Beyeler

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14396 2025-09-19 econ.TH cs.GT 71%

Friend or Foe: Delegating to an AI Whose Alignment is Unknown

Drew Fudenberg, Annie Liang

专题命中 安全评测 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12476 2025-09-19 cs.CL 70%

Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction

Sumanta Bhattacharyya, Sara Riazi, Pedram Rooshenas

专题命中 安全评测 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14199 2025-09-19 cs.CV cs.AI cs.CL cs.LG 67%

Dense Video Understanding with Gated Residual Tokenization

Haichao Zhang, Wenhao Chai, Shwai He, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14930 2025-09-19 cs.CL cs.AI 62%

Cross-Modal Knowledge Distillation for Speech Large Language Models

Enzhi Wang, Qicheng Li, Zhiyuan Tang, Yuhang Jia

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) Tencent Ethereal Audio Lab, Tencent Corporation, Shenzhen, China(腾讯虚实音频实验室,腾讯公司,深圳,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07054 2025-09-19 cs.AI cs.LG stat.ME 62%

Statistical Methods in Generative AI

Edgar Dobriban

机构 * Edgar Dobriban 1(Edgar Dobriban)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Invited review paper for Annual Review of Statistics and Its Application. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20020 2025-09-19 cs.LG cs.AI 62%

Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models

Xin Wang, Haoyang Li, Haibo Chen, Zeyang Zhang, Wenwu Zhu

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14936 2025-09-19 cs.LG 57%

A Comparative Analysis of Transformer Models in Social Bot Detection

Rohan Veit, Michael Lones

机构 * Department of Computer Science, Heriot-Watt University(计算机科学系,赫瑞斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments To appear in proceedings of UKCI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14304 2025-09-19 cs.SD cs.AI eess.AS 57%

Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework

Eric Zhang, Li Wei, Sarah Chen, Michael Wang

机构 * SSHealth Team(SSHealth团队) AI for Healthcare Laboratory(人工智能医疗实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16538 2025-09-19 cs.CL 57%

Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models

Ercong Nie, Helmut Schmid, Hinrich Schütze

机构 * Center for Information and Language Processing (CIS)(信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15068 2025-09-19 cs.HC 50%

Learning in Context: Personalizing Educational Content with Large Language Models to Enhance Student Learning

Joy Jia Yin Lim, Daniel Zhang-Li, Jifan Yu, Xin Cong, Ye He, Zhiyuan Liu, Huiqin Liu, Lei Hou, Juanzi Li, Bin Xu

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14739 2025-09-19 cs.CV 50%

FMGS-Avatar: Mesh-Guided 2D Gaussian Splatting with Foundation Model Priors for 3D Monocular Avatar Reconstruction

Jinlong Fan, Bingyu Hu, Xingguang Li, Yuxiang Yang, Jing Zhang

机构 * HangZhou Dianzi University(杭州电子大学) Shenzhen Polytechnic University(深圳职业技术大学) WuHan University(武汉大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏