arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-18 至 2026-02-18 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 8 篇

2507.06134 2026-02-18 cs.AI 79%

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06601 2026-02-18 cs.LG cs.AI 62%

Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs

深度无知:过滤预训练数据在开放权重大语言模型中构建抗篡改的安全保障

Kyle O'Brien, Stephen Casper, Quentin Anthony, Tomek Korbak, Robert Kirk, Xander Davies, Ishan Mishra, Geoffrey Irving, Yarin Gal, Stella Biderman

机构 * EleutherAI UK AI Security Institute(英国人工智能安全研究所) University of Oxford(牛津大学) OATML, University of Oxford(OATML,牛津大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过过滤预训练数据中的双用途内容,增强开放权重大语言模型的抗篡改能力,实验显示其在对抗微调攻击上表现优异,且未影响其他能力。

Comments https://deepignorance.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15809 2026-02-18 stat.AP cs.AI 57%

Decision Quality Evaluation Framework at Pinterest

Pinpoint 决策质量评估框架

Yuqi Tian, Robert Paine, Attila Dobi, Kevin O'Sullivan, Aravindh Manickavasagam, Faisal Farooq

机构 * Pinterest

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Pinpoint 提出了一种决策质量评估框架,通过高可信度黄金集和智能采样管道,提升内容安全系统的数据驱动管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15769 2026-02-18 cs.CL 57%

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

ViTaB-A:在视觉表格归因上评估多模态大语言模型

Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 ViTaB-A研究了多模态大语言模型在视觉表格归因中的表现,发现其在证据归因方面存在显著缺陷,影响透明性和可追溯性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15391 2026-02-18 cs.AI 57%

Improving LLM Reliability through Hybrid Abstention and Adaptive Detection

通过混合回避与自适应检测提升大语言模型可靠性

Ankit Sharma, Nachiket Tapas, Jyotiprakash Patra

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于上下文感知的自适应回避框架,通过动态调整安全阈值和级联检测机制,提升大语言模型在安全与效用之间的平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15072 2026-02-18 cs.CV cs.AI 57%

GRAFNet: Multiscale Retinal Processing via Guided Cortical Attention Feedback for Enhancing Medical Image Polyp Segmentation

GRAFNet:通过引导性皮层注意反馈进行多尺度视网膜处理以增强医学图像息肉分割

Abdul Joseph Fofanah, Lian Wen, Alpha Alimamy Kamara, Zhongyi Zhang, David Chen, Albert Patrick Sankoh

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 GRAFNet通过引导性皮层注意反馈模块提升医学图像息肉分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15591 2026-02-18 cs.SE 50%

Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution

Req2Road: 一个用于SDV测试资产生成和车载执行的生成式AI管道

Denesa Zyberaj, Lukasz Mazur, Pascal Hirmer, Nenad Petrovic, Marco Aiello, Alois Knoll

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种生成式AI管道,用于SDV子系统的测试资产生成和车载执行,通过自动化生成Gherkin场景并验证其可执行性。

Comments accepted at CAiSE 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15063 2026-02-18 cs.RO cs.HC 50%

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏