arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-18 至 2026-02-18 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2510.03269 2026-02-18 cs.LG cs.AI cs.CL 85%

General Exploratory Bonus for Optimistic Exploration in RLHF

在RLHF中引入乐观探索的通用探索奖金

Wendi Li, Changdae Oh, Sharon Li

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GEB框架,通过理论分析和实验验证,解决了RLHF中乐观探索的偏差问题,提供了一种统一且有效的探索奖金方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15350 2026-02-18 eess.SY cs.AI cs.SY 57%

Fine-Tuning LLMs to Generate Economical and Reliable Actions for the Power Grid

对LLM进行微调以生成经济且可靠的电网动作

Mohamad Chehade, Hao Zhu

机构 * Chandra Family Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 本文提出一种多阶段适应管道,通过微调LLM生成经济且可靠的电网纠正切换计划,显著提高了电网运行效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16779 2026-02-18 cs.HC cs.LG 57%

Improving User Interface Generation Models from Designer Feedback

改进来自设计师反馈的用户界面生成模型

Jason Wu, Amanda Swearngin, Arun Krishna Vajjala, Alan Leung, Jeffrey Nichols, Titus Barik

机构 * Purdue University(普渡大学) Apple(苹果公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于设计师反馈的改进方法,通过评论、草图和直接操作等交互方式提升UI生成模型的质量,实验表明其优于传统排名反馈方法。

Comments Version accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2602.15799 2026-02-18 cs.LG cs.AI 88%

The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety

对齐崩溃的几何学:当微调破坏安全性

Max Springer, Chung Peng Lee, Blossom Metevier, Jane Castleman, Bohdan Turbal, Hayoung Jung, Zeyu Shen, Aleksandra Korolova

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了微调过程中对齐脆弱性是梯度下降在曲面上的固有几何属性,提出四次方定律描述对齐损失随训练时间的增长,并呼吁发展曲率感知方法以提升安全性。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15061 2026-02-18 cs.RO cs.AI 79%

Safe-SDL:Establishing Safety Boundaries and Control Mechanisms for AI-Driven Self-Driving Laboratories

Safe-SDL:建立AI驱动自主实验室的安全边界与控制机制

Zihan Zhang, Haohui Que, Junhan Chang, Xin Zhang, Hao Wei, Tong Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) AI for Science Institute, Beijing(北京人工智能科学研究院) Peking University(北京大学) DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) National Key Laboratory of Advanced Micro and Nano Manufacture Technology, School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学国家先进微纳米制造技术重点实验室,集成电路学院,上海200240,中国)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Safe-SDL通过建立安全边界和控制机制,解决AI驱动自主实验室中的语法到安全间隙问题,确保实验系统的安全性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12444 2026-02-18 cs.LG cs.AI 62%

Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models

通过基于恢复的防护机制实现安全强化学习

Alexander W. Goodall, Francesco Belardinelli

机构 * Imperial College London, Department of Computing(伦敦帝国学院计算机系)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于高斯过程的恢复防护机制,用于在未知非线性系统中实现安全强化学习,通过动态恢复和内部模型采样实现安全与高效的学习。

Comments Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2506.02649 2026-02-18 cs.AI 79%

From Prompts to Protection: Large Language Model-Enabled In-Context Learning for Smart Public Safety UAV

从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida, Zhu Han

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教大学) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) University of Houston(休斯顿大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00565 2026-02-18 cs.AI cs.LG 79%

Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability

迈向更安全的扩散语言模型:发现和缓解提示漏洞

Shojiro Yamabe, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文发现扩散语言模型存在因迭代去噪过程导致的提示漏洞,并提出针对性的安全对齐方法以缓解该问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2602.15228 2026-02-18 cs.SE 50%

An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation

对指令微调模型在代码生成中系统提示效果的实证研究

Zaiyu Cheng, Antonio Mastropaolo

专题命中 提示注入 :alignment(abstract)

AI总结 本研究探讨了系统提示对代码生成模型性能的影响,发现提示具体性与模型规模、编程语言等因素相关,且不同语言对提示敏感性存在差异。

Comments 34 pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2602.15645 2026-02-18 cs.AI cs.CV 70%

CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving

CARE Drive:一种用于评估视觉语言模型在自动驾驶中推理响应性的框架

Lucas Elbert Suryana, Farah Bierenga, Sanne van Buuren, Pepijn Kooij, Elsefien Tulleners, Federico Scari, Simeon Calvert, Bart van Arem, Arkady Zgonnikov

机构 * organization= Department of Transport \& Planning, Faculty of Civil Engineering Geosciences, Delft University of Technology organization= Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology organization= Centre for Meaningful Human Control, Delft University of Technology organization= Faculty of Mechanical Engineering, Delft University of Technology , city= Delft , country= The Netherlands

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CARE Drive提出了一种评估视觉语言模型在自动驾驶中推理响应性的框架,通过受控上下文变化比较基线和增强模型决策,验证人类原因对决策的影响。

Comments 21 pages, on submission to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15554 2026-02-18 cs.CE 50%

Efficient Road Renovation Scheduling under Uncertainty using Lower Bound Pruning

在不确定性下使用下界剪枝进行高效的道路翻新调度

Robbert Bosch, Patricia Rogetzer, Wouter van Heeswijk, Martijn Mes

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种结合机器学习和遗传算法的混合优化方法,用于在不确定性下高效调度大规模基础设施翻新,通过概率性失效模型和渐进式下界评估方法提高解决方案质量。

Comments 24 pages, 14 figures, submitted to Computer-Aided Civil and Infrastructure Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2602.15252 2026-02-18 cs.GT cs.AI cs.LG 73%

Decision Making under Imperfect Recall: Algorithms and Benchmarks

不完美回忆下的决策:算法与基准测试

Emanuel Tewolde, Brian Hu Zhang, Ioannis Anagnostides, Tuomas Sandholm, Vincent Conitzer

机构 * Computer Science Dept., Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学计算机科学系) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Strategy Robot, Inc.(策略机器人公司) Strategic Machine, Inc.(战略机器公司) Optimized Markets, Inc.(优化市场公司)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个不完美回忆决策问题的基准测试集,并引入后悔匹配算法家族,在大规模约束优化中表现优异。

Comments 39 pages, 71 figures, 4 table

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 8 篇

2507.06134 2026-02-18 cs.AI 79%

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06601 2026-02-18 cs.LG cs.AI 62%

Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs

深度无知:过滤预训练数据在开放权重大语言模型中构建抗篡改的安全保障

Kyle O'Brien, Stephen Casper, Quentin Anthony, Tomek Korbak, Robert Kirk, Xander Davies, Ishan Mishra, Geoffrey Irving, Yarin Gal, Stella Biderman

机构 * EleutherAI UK AI Security Institute(英国人工智能安全研究所) University of Oxford(牛津大学) OATML, University of Oxford(OATML,牛津大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过过滤预训练数据中的双用途内容,增强开放权重大语言模型的抗篡改能力,实验显示其在对抗微调攻击上表现优异,且未影响其他能力。

Comments https://deepignorance.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15809 2026-02-18 stat.AP cs.AI 57%

Decision Quality Evaluation Framework at Pinterest

Pinpoint 决策质量评估框架

Yuqi Tian, Robert Paine, Attila Dobi, Kevin O'Sullivan, Aravindh Manickavasagam, Faisal Farooq

机构 * Pinterest

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Pinpoint 提出了一种决策质量评估框架,通过高可信度黄金集和智能采样管道,提升内容安全系统的数据驱动管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15769 2026-02-18 cs.CL 57%

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

ViTaB-A:在视觉表格归因上评估多模态大语言模型

Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 ViTaB-A研究了多模态大语言模型在视觉表格归因中的表现,发现其在证据归因方面存在显著缺陷,影响透明性和可追溯性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15391 2026-02-18 cs.AI 57%

Improving LLM Reliability through Hybrid Abstention and Adaptive Detection

通过混合回避与自适应检测提升大语言模型可靠性

Ankit Sharma, Nachiket Tapas, Jyotiprakash Patra

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于上下文感知的自适应回避框架,通过动态调整安全阈值和级联检测机制,提升大语言模型在安全与效用之间的平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15072 2026-02-18 cs.CV cs.AI 57%

GRAFNet: Multiscale Retinal Processing via Guided Cortical Attention Feedback for Enhancing Medical Image Polyp Segmentation

GRAFNet:通过引导性皮层注意反馈进行多尺度视网膜处理以增强医学图像息肉分割

Abdul Joseph Fofanah, Lian Wen, Alpha Alimamy Kamara, Zhongyi Zhang, David Chen, Albert Patrick Sankoh

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 GRAFNet通过引导性皮层注意反馈模块提升医学图像息肉分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15591 2026-02-18 cs.SE 50%

Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution

Req2Road: 一个用于SDV测试资产生成和车载执行的生成式AI管道

Denesa Zyberaj, Lukasz Mazur, Pascal Hirmer, Nenad Petrovic, Marco Aiello, Alois Knoll

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种生成式AI管道,用于SDV子系统的测试资产生成和车载执行,通过自动化生成Gherkin场景并验证其可执行性。

Comments accepted at CAiSE 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15063 2026-02-18 cs.RO cs.HC 50%

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 1 篇

2509.22211 2026-02-18 cs.CL cs.AI 62%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他安全 5 篇

2602.15676 2026-02-18 cs.LG cs.AI 81%

Relative Geometry of Neural Forecasters: Linking Accuracy and Alignment in Learned Latent Geometry

神经预报器的相对几何:连接准确性和对齐性在学习潜在几何中的联系

Deniz Kucukahmetler, Maximilian Jean Hemmann, Julian Mosig von Aehrenfeld, Maximilian Amthor, Christian Deubel, Nico Scherf, Diaaeldin Taha

机构 * Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) School of Embedded Composite Artificial Intelligence (SECAI)(嵌入式复合人工智能学院) Leipzig University(莱比锡大学) Max Planck Institute for Mathematics in the Sciences(马克斯·普朗克数学研究院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过相对几何方法探讨神经预报器的对齐与准确性关系,揭示了不同模型家族在表示动态结构上的差异及预测性能的关联。

Comments Accepted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15368 2026-02-18 cs.CV cs.AI cs.LG eess.IV 81%

GMAIL: Generative Modality Alignment for generated Image Learning

GMAIL: 生成模态对齐用于生成图像学习

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系) Department of Machine Learning, MBZUAI, UAE(马斯克大学人工智能研究所) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(翰阳大学ERICA人工智能系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GMAIL通过多模态学习方法对齐生成图像与真实图像,提升视觉-语言任务中的生成图像学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15322 2026-02-18 cs.LG cs.AI 62%

On Surprising Effectiveness of Masking Updates in Adaptive Optimizers

自适应优化器中掩码更新的意外有效性

Taejong Joo, Wenhan Xia, Cheolmin Kim, Ming Zhang, Eugene Ie

机构 * Northwestern University(西北大学) Google(谷歌)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Magma通过动量对齐梯度掩码提升自适应优化器性能,显著降低大型语言模型的困惑度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15600 2026-02-18 cs.SI cs.AI econ.EM stat.AP 57%

The geometry of online conversations and the causal antecedents of conflictual discourse

在线对话的几何结构与冲突性言论的因果前因

Carlo Santagiustina, Caterina Cruciani

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在线对话中冲突性语言的因果因素,通过分析时间、对话结构等特征,揭示了回复语气和情感框架的趋同现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00168 2026-02-18 cs.CV 50%

SSL4EO-S12 v1.1: A Multimodal, Multiseasonal Dataset for Pretraining, Updated

SSL4EO-S12 v1.1:一种用于预训练的多模态、多季节数据集,更新版

Benedikt Blumenstiel, Nassim Ait Ali Braham, Conrad M Albrecht, Stefano Maurogiovanni, Paolo Fraccaro

机构 * IBM Research Europe(IBM欧洲研究中心) German Aerospace Center(德国航空航天中心) Julich Supercomputing Centre University of Iceland(朱利奇超级计算中心爱沙尼亚大学)

专题命中 其他安全 :alignment(abstract)

AI总结 SSL4EO-S12 v1.1通过增加多模态数据和改进数据结构,为预训练大规模基础模型提供了更高效、更全面的地球观测数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏