arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2506.07347 2025-12-19 eess.SY cs.AI cs.LG cs.SY 81%

Distributed Risk-Sensitive Safety Filters for Uncertain Discrete-Time Systems

分布式风险敏感安全滤波器用于不确定离散时间系统

Armin Lederer, Erfaun Noorani, Andreas Krause

机构 * Department of Electrical and Computer Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系,设计与工程学院) Learning & Adaptive Systems Group, Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系学习与自适应系统小组)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种分布式风险敏感安全滤波器,用于不确定离散时间多智能体系统,通过价值函数定义的控制屏障函数和两种替代策略确保安全性与鲁棒性。

Journal ref IEEE Control Systems Letters, vol. 9, pp. 1231-1236, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 79%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15894 2025-12-19 cs.AI 79%

PediatricAnxietyBench: Evaluating Large Language Model Safety Under Parental Anxiety and Pressure in Pediatric Consultations

儿童焦虑基准:在儿科咨询中评估大语言模型在父母焦虑和压力下的安全性

Vahideh Zolfaghari

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 PediatricAnxietyBench评估大语言模型在父母焦虑和压力下的安全性,发现70B模型在诊断和紧急情况识别方面表现更优,但所有模型均存在现实压力下的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 79%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15117 2025-12-19 cs.HC cs.AI cs.RO 77%

"I am here for you": How relational conversational AI appeals to adolescents, especially those who are socially and emotionally vulnerable

我在这里等你:关系型对话式AI如何吸引青少年,尤其是那些在社会和情感上脆弱的青少年

Pilyoung Kim, Yun Xie, Sujin Yang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现关系型对话风格能增强青少年对AI的拟人化和情感依赖,尤其吸引社会和情感脆弱的青少年。

Comments I updated a title

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06489 2025-12-19 cs.CL 70%

On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks

大语言模型在对抗攻击下的语言自信度鲁棒性研究

Stephen Obadinma, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Ingenuity Labs Research Institute(创新实验室研究所) Queen’s University(皇后大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在对抗攻击下的语言自信度鲁棒性,发现现有防御技术效果有限,需设计更稳健的自信表达机制。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16770 2025-12-19 cs.CL cs.AI 62%

GinSign: Grounding Natural Language Into System Signatures for Temporal Logic Translation

GinSign:将自然语言接地到系统签名以进行时序逻辑翻译

William English, Chase Walker, Dominic Simon, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 GinSign通过将自然语言接地到系统签名,提升时序逻辑翻译的准确性和下游模型检查能力,实现95.5%的逻辑等价分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15751 2025-12-19 cs.LG cs.AI cs.MA 62%

GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction

GLOW:基于图-语言协同推理的代理工作流性能预测

Wei Guan, Jian Cao, Jinyu Cai, Qiqi Cai, Jianqi Gao, See-Kiong Ng

机构 * School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院) Institute of Data Science, National University of Singapore, Singapore(新加坡国立大学数据科学研究所) School of Computer Engineering and Science, Shanghai University, China(上海大学计算机工程与科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GLOW通过结合图神经网络与大语言模型,提出了一种统一的代理工作流性能预测框架,有效捕捉拓扑依赖和语义逻辑,提升预测准确性与排序效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09149 2025-12-19 cs.CL cs.AI 62%

MindShift: Analyzing Language Models' Reactions to Psychological Prompts

MindShift: 分析语言模型对心理提示的反应

Anton Vasiliuk, Irina Abdullaeva, Polina Druzhinina, Anton Razzhigaev, Andrey Kuznetsov

机构 * FusionBrain Lab(融合大脑实验室) Applied AI Institute(应用人工智能研究院) Innopolis University(因诺普里斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MindShift通过评估语言模型对心理提示的反应,揭示了模型在心理适应性和人格模拟方面的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05368 2025-12-19 cs.RO cs.AI cs.LG 62%

Long-Horizon Visual Imitation Learning via Plan and Code Reflection

通过计划与代码反思实现长 horizon 视觉模仿学习

Quan Chen, Chenrui Shi, Qi Chen, Yuwei Wu, Zhi Gao, Xintong Zhang, Rui Gao, Kun Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过计划与代码反思模块提升长 horizon 视觉模仿学习性能,引入 LongVILBench 基准验证方法有效性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 57%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04133 2025-12-19 cs.AI 57%

TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

TRiSM 用于代理 AI:对基于 LLM 的代理多代理系统中信任、风险和安全管理的综述

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis

机构 * Vector Institute, Toronto, Canada(向量研究所) Cornell University, USA(康奈尔大学) University of Groningen, Netherlands(格罗宁根大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了基于 LLM 的代理多代理系统中信任、风险和安全管理的框架与方法,提出新的评估指标并探讨了安全与隐私增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14902 2025-12-19 cs.CY cs.SE 57%

How frontier AI companies could implement an internal audit function

前沿AI公司如何实施内部审计功能

Francesca Gomez, Adam Buick, Leah Ferentinos, Haelee Kim, Elley Lee

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文探讨了前沿AI公司如何通过专门设计的内部审计功能来加强安全治理,补充外部评估并提供更高信心的风险控制保证。

Comments Colors updated on table 2 for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21557 2025-12-19 cs.CL 57%

Generation-Time vs. Post-hoc Citation: A Holistic Evaluation of LLM Attribution

生成时间与事后引用:对大语言模型归属的全面评估

Yash Saxena, Raviteja Bommireddy, Ankur Padia, Manas Gaur

机构 * UMBC(美国马里兰大学伯克利分校) IIITDM(印度印度理工学院迪瓦德分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文评估了生成时间引用与事后引用在大语言模型归属中的性能差异,发现P-Cite在覆盖和正确性上表现更优,而G-Cite更适用于精度要求高的场景。

Comments NeurIPS 2025 LLM Evaluation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 50%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 安全评测 :jailbreak(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15818 2025-12-19 cs.CR 50%

Unveiling the Attribute Misbinding Threat in Identity-Preserving Models

揭示身份保持模型中的属性绑定威胁

Junming Fu, Jishen Zeng, Yi Jiang, Peiyu Zhuang, Baoying Chen, Siyu Lu, Jianquan Yang

专题命中 安全评测 :safety(abstract)

AI总结 本文提出属性绑定攻击,揭示身份保持模型生成不安全内容的风险,并通过Misbinding Prompt评估集和ABSS指标评估模型的安全性与真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏