arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-16 至 2026-02-16 共收录 48 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2602.12846 2026-02-16 cs.LG cs.AI 62%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 62%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00602 2026-02-16 cs.LG cs.SY eess.SY 57%

Multi-Agent Stage-wise Conservative Linear Bandits

多智能体分阶段保守线性老虎机

Amirhossein Afsharrad, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出MA-SCLUCB算法,通过分阶段保守约束实现多智能体在安全保证下的高效分布式学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12638 2026-02-16 eess.SY cs.SY 50%

Safe Controller Synthesis Using Lyapunov-based Barriers for Linear Hybrid Systems with Simplex Architecture

利用Lyapunov基屏障的安全控制器合成用于具有简单架构的线性混合系统

Sunandan Adhikary, Soumyajit Dey

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于Lyapunov基屏障的安全控制器合成方法,旨在通过切换不同执行速率的BSC来实现最大安全性和及时恢复,同时优化控制计算的带宽使用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红队测试 1 篇

2602.13042 2026-02-16 cs.LG 57%

GPTZero: Robust Detection of LLM-Generated Texts

GPTZero:鲁棒的LLM生成文本检测

George Alexandru Adam, Alexander Cui, Edwin Thomas, Emily Napier, Nazar Shmatko, Jacob Schnell, Jacob Junqi Tian, Alekhya Dronavalli, Edward Tian, Dongwon Lee

专题命中 红队测试 :red teaming(abstract);分类 cs.LG

AI总结 GPTZero通过分层多任务架构实现鲁棒的LLM生成文本检测,提供准确可解释的检测方法和负责任的使用教育。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 1 篇

2602.10915 2026-02-16 cs.CR cs.AI 70%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 2 篇

2602.13087 2026-02-16 cs.LG cs.AI 62%

EXCODER: EXplainable Classification Of DiscretE time series Representations

EXCODER: 可解释的时间序列离散表示分类

Yannik Hahn, Antonin Königsfeld, Hasan Tercan, Tobias Meisen

机构 * Institute for Technologies and Management of Digital Transformation (TMDT) University of Wuppertal(数字转型技术与管理研究所(TMDT)乌珀塔尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EXCODER通过将时间序列转换为离散潜在表示,提升分类的可解释性,并提出SSA度量标准验证XAI方法的有效性。

Comments Accepted at PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06014 2026-02-16 cs.CV cs.LG 57%

Post-hoc Probabilistic Vision-Language Models

事后概率视觉-语言模型

Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种无需额外训练的VLMs事后不确定性估计方法,通过贝叶斯后验近似和余弦相似度不确定性量化,提升主动学习效率和预测可靠性。

Comments Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 3 篇

2601.16824 2026-02-16 cs.HC cs.AI cs.CY 62%

Privacy in Human-AI Romantic Relationships: Concerns, Boundaries, and Agency

人机浪漫关系中的隐私:担忧、界限与自主性

Rongjun Ma, Shijing He, Jose Luis Martin-Navarro, Xiao Zhan, Jose Such

机构 * VRAIN, Universitat Politècnica de València(VRAIN,瓦伦西亚理工大学) Aalto University(艾尔沃斯大学) King’s College London(伦敦国王学院) University of Cambridge(剑桥大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了人机浪漫关系中的隐私问题,通过访谈研究发现,AI伴侣具有自主性,影响隐私界限和用户隐私保护策略。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09308 2026-02-16 cs.SE cs.AI cs.LG 62%

A Model-Driven Engineering Approach to AI-Powered Healthcare Platforms

基于模型驱动工程的AI赋能医疗平台方法

Mira Raheem, Amal Elgammal, Michael Papazoglou, Bernd Krämer, Neamat El-Tazi

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于模型驱动工程的医疗AI框架,通过医学互操作性语言和联邦学习实现数据隐私保护与高预测性能。

Comments Disclaimer: This manuscript is currently under review at * MDPI Informatics*

Journal ref Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04614 2026-02-16 cs.AI cs.LG 62%

XGeM: A Multi-Prompt Foundation Model for Multimodal Medical Data Generation

XGeM:一种多提示基础模型,用于多模态医学数据生成

Daniele Molino, Francesco Di Feola, Eliodoro Faiella, Deborah Fazzini, Domiziana Santucci, Linlin Shen, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与辐射物理,乌梅大学) Department of Diagnostic Imaging and Stereotactic Radiosurgey, Centro Diagnostico Italiano S.p.A.(诊断影像与立体放射外科部门,意大利诊断中心股份有限公司) Department of Radiology and Interventional Radiology, Fondazione Policlinico Universitario Campus Bio-Medico(放射科与介入放射科,大学医学中心生物医学校园基金会) Research Unit of Radiology and Interventional Radiology, Department of Medicine and Surgery, Università Campus Bio-Medico di Roma(放射科与介入放射科研究单位,医学与外科系,罗马生物医学大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 XGeM是一种多模态生成模型,通过多提示训练策略实现灵活的医学数据合成,解决多模态数据生成中的临床一致性与数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 15 篇

2508.08236 2026-02-16 cs.CL cs.CY 88%

Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge

通过LLM-as-Judge探索LLM在中文心理健康对话中的安全对齐评估

Yunna Cai, Fan Wang, Haowei Wang, Kun Wang, Kailai Yang, Sophia Ananiadou, Moyan Li, Mingming Fan

机构 * HKUST(GZ)(香港科技大学(广州)) Wuhan Univ.(武汉大学) Univ. of Iowa(爱荷华大学) Univ. of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本文提出PsyCrisis-Bench,通过LLM-as-Judge方法评估LLM在中文心理健康对话中的安全对齐性,提供高质量数据集和可解释的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22620 2026-02-16 cs.CL 83%

Layer-wise Swapping for Generalizable Multilingual Safety

分层交换以实现通用多语言安全

Hyunseo Shin, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出分层交换方法,通过将英语安全专家的安全对齐转移到低资源语言专家,提升多语言安全性能,同时保持通用任务性能。

Comments EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 81%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10661 2026-02-16 cs.CL 79%

Targeted Syntactic Evaluation of Language Models on Georgian Case Alignment

针对格鲁吉亚语的语法评估:变换语义分析

Daniel Gallagher, Gerhard Heyer

机构 * Institute for Applied Informatics (InfAI)(应用信息研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文针对格鲁吉亚语的语法评估,通过生成特定语法测试数据集,评估不同语言模型在处理分裂-反向语态对齐任务中的表现。

Comments To appear in Proceedings of The Second Workshop on Language Models for Low-Resource Languages (LoResLM), EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07117 2026-02-16 cs.AI cs.LG 73%

The Conditions of Physical Embodiment Enable Generalization and Care

物理具身的条件使泛化和关怀成为可能

Leonardo Christov-Moore, Arthur Juliani, Alex Kiefer, Joel Lehman, Nicco Reggente, B. Scot Rousse, Adam Safron, Nicolás Hinrichs, Daniel Polani, Antonio Damasio

机构 * Institute for Advanced Consciousness Studies(先进意识研究所) Monash Centre for Consciousness and Contemplative Studies(莫纳什意识与冥想研究中心) University of Oxford(牛津大学) Topos Institute(拓斯研究所) Allen Discovery Center(艾伦发现中心) Okinawa Institute of Science and Technology(冲绳科学技术研究所) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) University of Hertfordshire(赫特福德郡大学) Brain and Creativity Institute(大脑与创造力研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出物理具身的条件是泛化和关怀的基础,通过稳态驱动和因果建模实现智能体在开放环境中的鲁棒性和可信对齐。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07978 2026-02-16 cs.AI cs.CL cs.LG 67%

VoiceAgentBench: Are Voice Assistants ready for agentic tasks?

VoiceAgentBench: 聊天助手是否准备好处理代理任务?

Dhruv Jain, Harshit Shukla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * OLA Electric(OLA电讯) Krutrim AI(Krutrim人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VoiceAgentBench评估语音模型在代理任务中的表现,发现ASR-LLM在英语任务中表现优于端到端SpeechLMs,但两者在多语言和安全评估中均存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 62%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06980 2026-02-16 cs.CY 57%

Potential Role of Agentic Artificial Intelligence in Toxicologic Pathology

代理人工智能在毒理病理学中的潜在作用

Nasir Rajpoot, Richard Haworth, Xavier Palazzi, Alok Sharma, Manu Sebastian, Stephen Cahalan, Dinesh S. Bangari, Radhakrishna Sura, James Hartke, Marco Tecilla, Krishna Yekkala, Simon Graham, Dang Vu, David Snead, Mostafa Jahanifar, Adnan Khan, Erio Barale-Thomas

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文探讨了代理人工智能在毒理病理学报告中的应用,分析了当前工作流程中的痛点,提出了分阶段的采用路线图,并强调了跨领域协作的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 57%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12395 2026-02-16 cs.CV cs.AI 57%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22977 2026-02-16 cs.AI 57%

Quantifying Model Uniqueness in Heterogeneous AI Ecosystems

在异构AI生态系统中量化模型独特性

Lei You

机构 * Department of Engineering Technology, Technical University of Denmark(技术大学丹麦学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于ISQED的统计框架,用于量化异构AI生态系统中模型的独特性,通过PIER指标评估模型行为的不可约简性,并建立理论基础与实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16371 2026-02-16 cs.CL 57%

The Mediomatix Corpus: Parallel Data for Romansh Language Varieties via Comparable Schoolbooks

中庸语语料库:通过可比教科书构建罗曼什语言变体的平行数据

Zachary Hopton, Jannis Vamvas, Andrin Büchler, Anna Rutkiewicz, Rico Cathomas, Rico Sennrich

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出首个罗曼什方言平行语料库,通过教科书构建,用于罗曼什方言间的机器翻译研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 50%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 安全评测 :safety(abstract)

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05100 2026-02-16 cs.CE cs.CV cs.SC 50%

Rule-Based Spatial Mixture-of-Experts U-Net for Explainable Edge Detection

基于规则的时空专家混合U-Net可解释边缘检测

Bharadwaj Dogga, Kaaustaaub Shankar, Gibin Raju, Wilhelm Louw, Kelly Cohen

机构 * Ph.D. Candidate, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Research Student, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Postdoctoral Researcher, Department of Multidisciplinary Engineering, TA\&M University, \ Station, TX 77843, USA e-mail: Research Associate AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Director AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail

专题命中 安全评测 :safety(abstract)

AI总结 基于规则的时空专家混合U-Net通过融合深度语义特征与启发式边缘信号,实现边缘检测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12443 2026-02-16 cs.SE cs.HC 50%

SHAPR: A Solo Human-Centred and AI-Assisted Practice Framework for Research Software Development

SHAPR:一种面向研究软件开发的独立人类中心化和AI辅助实践框架

Ka Ching Chan

专题命中 安全评测 :alignment(abstract)

AI总结 SHAPR框架为独立人类中心化和AI辅助的研究软件开发提供实践指导,通过整合行动设计研究原则,促进反思学习和方法论严谨性。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 1 篇

2602.12680 2026-02-16 stat.ML cs.LG 57%

A Regularization-Sharpness Tradeoff for Linear Interpolators

线性插值器的正则化-尖锐性权衡

Qingyi Hu, Liam Hodgkinson

机构 * School of Mathematics and Statistics(数学与统计学学院) University of Melbourne(墨尔本大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种针对过参数化线性回归的正则化-尖锐性权衡,通过ℓ^p惩罚分解选择惩罚为正则化项和几何尖锐性项,验证了其在现实数据中的有效性。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 21 篇

2602.12968 2026-02-16 cs.IR cs.AI cs.CL 81%

RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems

RGAlign-Rec: 基于排名引导的潜在查询推理中的对齐方法

Junhua Liu, Yang Jihao, Cheng Chang, Kunrong LI, Bin Fu, Kwan Hui Lim

机构 * Forth AI Singapore(Forth AI新加坡) Shopee Singapore(Shopee新加坡) Singapore Uni. of Tech. and Design(新加坡技术与设计大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 RGAlign-Rec通过闭环对齐框架结合语义推理和增强查询模型,提升电子商务推荐系统的预测准确性和服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11235 2026-02-16 cs.IR 78%

MTFM: A Scalable and Alignment-free Foundation Model for Industrial Recommendation in Meituan

MTFM:一种可扩展且无对齐的工业推荐基础模型

Xin Song, Zhilin Guan, Ruidong Han, Binghao Tang, Tianwen Chen, Bing Li, Zihao Li, Han Zhang, Fei Jiang, Qing Wang, Zikang Xu, Fengyi Li, Chunzhen Jing, Lei Yu, Wei Lin

专题命中 其他安全 :alignment(title,abstract)

AI总结 MTFM是一种基于Transformer的工业推荐基础模型,通过异构标记和多场景样本聚合提升效率,实现无对齐的多场景推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12569 2026-02-16 cs.HC 78%

Editable XAI: Toward Bidirectional Human-AI Alignment with Co-Editable Explanations of Interpretable Attributes

可编辑的可解释性AI:通过可编辑的可解释属性实现双向人机对齐

Haoyang Chen, Jingwen Bai, Fang Tian, Brian Y Lim

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出可编辑的XAI方法CoExplain,通过允许用户编写规则来提升人机对齐,实验表明其在理解和控制方面优于传统只读XAI。

详情

展开后加载摘要…

URL PDF HTML 收藏