arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-16 至 2026-02-16 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 15 篇

2508.08236 2026-02-16 cs.CL cs.CY 88%

Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge

通过LLM-as-Judge探索LLM在中文心理健康对话中的安全对齐评估

Yunna Cai, Fan Wang, Haowei Wang, Kun Wang, Kailai Yang, Sophia Ananiadou, Moyan Li, Mingming Fan

机构 * HKUST(GZ)(香港科技大学(广州)) Wuhan Univ.(武汉大学) Univ. of Iowa(爱荷华大学) Univ. of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本文提出PsyCrisis-Bench,通过LLM-as-Judge方法评估LLM在中文心理健康对话中的安全对齐性,提供高质量数据集和可解释的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22620 2026-02-16 cs.CL 83%

Layer-wise Swapping for Generalizable Multilingual Safety

分层交换以实现通用多语言安全

Hyunseo Shin, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出分层交换方法,通过将英语安全专家的安全对齐转移到低资源语言专家,提升多语言安全性能,同时保持通用任务性能。

Comments EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 81%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10661 2026-02-16 cs.CL 79%

Targeted Syntactic Evaluation of Language Models on Georgian Case Alignment

针对格鲁吉亚语的语法评估:变换语义分析

Daniel Gallagher, Gerhard Heyer

机构 * Institute for Applied Informatics (InfAI)(应用信息研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文针对格鲁吉亚语的语法评估,通过生成特定语法测试数据集,评估不同语言模型在处理分裂-反向语态对齐任务中的表现。

Comments To appear in Proceedings of The Second Workshop on Language Models for Low-Resource Languages (LoResLM), EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07117 2026-02-16 cs.AI cs.LG 73%

The Conditions of Physical Embodiment Enable Generalization and Care

物理具身的条件使泛化和关怀成为可能

Leonardo Christov-Moore, Arthur Juliani, Alex Kiefer, Joel Lehman, Nicco Reggente, B. Scot Rousse, Adam Safron, Nicolás Hinrichs, Daniel Polani, Antonio Damasio

机构 * Institute for Advanced Consciousness Studies(先进意识研究所) Monash Centre for Consciousness and Contemplative Studies(莫纳什意识与冥想研究中心) University of Oxford(牛津大学) Topos Institute(拓斯研究所) Allen Discovery Center(艾伦发现中心) Okinawa Institute of Science and Technology(冲绳科学技术研究所) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) University of Hertfordshire(赫特福德郡大学) Brain and Creativity Institute(大脑与创造力研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出物理具身的条件是泛化和关怀的基础,通过稳态驱动和因果建模实现智能体在开放环境中的鲁棒性和可信对齐。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07978 2026-02-16 cs.AI cs.CL cs.LG 67%

VoiceAgentBench: Are Voice Assistants ready for agentic tasks?

VoiceAgentBench: 聊天助手是否准备好处理代理任务?

Dhruv Jain, Harshit Shukla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * OLA Electric(OLA电讯) Krutrim AI(Krutrim人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VoiceAgentBench评估语音模型在代理任务中的表现,发现ASR-LLM在英语任务中表现优于端到端SpeechLMs,但两者在多语言和安全评估中均存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 62%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06980 2026-02-16 cs.CY 57%

Potential Role of Agentic Artificial Intelligence in Toxicologic Pathology

代理人工智能在毒理病理学中的潜在作用

Nasir Rajpoot, Richard Haworth, Xavier Palazzi, Alok Sharma, Manu Sebastian, Stephen Cahalan, Dinesh S. Bangari, Radhakrishna Sura, James Hartke, Marco Tecilla, Krishna Yekkala, Simon Graham, Dang Vu, David Snead, Mostafa Jahanifar, Adnan Khan, Erio Barale-Thomas

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文探讨了代理人工智能在毒理病理学报告中的应用,分析了当前工作流程中的痛点,提出了分阶段的采用路线图,并强调了跨领域协作的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 57%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12395 2026-02-16 cs.CV cs.AI 57%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22977 2026-02-16 cs.AI 57%

Quantifying Model Uniqueness in Heterogeneous AI Ecosystems

在异构AI生态系统中量化模型独特性

Lei You

机构 * Department of Engineering Technology, Technical University of Denmark(技术大学丹麦学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于ISQED的统计框架,用于量化异构AI生态系统中模型的独特性,通过PIER指标评估模型行为的不可约简性,并建立理论基础与实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16371 2026-02-16 cs.CL 57%

The Mediomatix Corpus: Parallel Data for Romansh Language Varieties via Comparable Schoolbooks

中庸语语料库:通过可比教科书构建罗曼什语言变体的平行数据

Zachary Hopton, Jannis Vamvas, Andrin Büchler, Anna Rutkiewicz, Rico Cathomas, Rico Sennrich

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出首个罗曼什方言平行语料库,通过教科书构建,用于罗曼什方言间的机器翻译研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 50%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 安全评测 :safety(abstract)

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05100 2026-02-16 cs.CE cs.CV cs.SC 50%

Rule-Based Spatial Mixture-of-Experts U-Net for Explainable Edge Detection

基于规则的时空专家混合U-Net可解释边缘检测

Bharadwaj Dogga, Kaaustaaub Shankar, Gibin Raju, Wilhelm Louw, Kelly Cohen

机构 * Ph.D. Candidate, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Research Student, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Postdoctoral Researcher, Department of Multidisciplinary Engineering, TA\&M University, \ Station, TX 77843, USA e-mail: Research Associate AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Director AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail

专题命中 安全评测 :safety(abstract)

AI总结 基于规则的时空专家混合U-Net通过融合深度语义特征与启发式边缘信号,实现边缘检测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12443 2026-02-16 cs.SE cs.HC 50%

SHAPR: A Solo Human-Centred and AI-Assisted Practice Framework for Research Software Development

SHAPR:一种面向研究软件开发的独立人类中心化和AI辅助实践框架

Ka Ching Chan

专题命中 安全评测 :alignment(abstract)

AI总结 SHAPR框架为独立人类中心化和AI辅助的研究软件开发提供实践指导,通过整合行动设计研究原则,促进反思学习和方法论严谨性。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏