arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3317 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3317 篇

2510.03906 2026-01-27 cs.CV 50%

From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance

从滤波器到视觉语言模型:通过目标检测和分割性能评估去雾方法

Ardalan Aryashad, Parsa Razmara, Amin Mahjoub, Seyedarmin Azizi, Mahdi Salmani, Arad Firouzkouhi

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文通过目标检测和分割性能评估,探讨了去雾方法在真实与合成环境中的有效性,揭示了视觉语言模型在恶劣天气下的应用潜力。

Comments Accepted at WACV 2026 Proceedings (Oral), 5th Workshop on Image, Video, and Audio Quality Assessment in Computer Vision, with a focus on VLM and Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17107 2026-01-27 cs.CV 50%

StealthMark: Harmless and Stealthy Ownership Verification for Medical Segmentation via Uncertainty-Guided Backdoors

StealthMark: 通过不确定性引导后门实现医疗分割的无害且隐蔽的所有权验证

Qinkai Yu, Chong Zhang, Gaojie Jin, Tianjin Huang, Wei Zhou, Wenhui Li, Xiaobo Jin, Bo Huang, Yitian Zhao, Guang Yang, Gregory Y. H. Lip, Yalin Zheng, Aline Villavicencio, Yanda Meng

机构 * Computer Science Department, University of Exeter(埃克塞特大学计算机科学系) Bioengineering Program, Biological and Environmental Science and Engineering Division (BESE), King Abdullah University of Science and Technology (KAUST)(科廷大学科学与技术学院生物工程项目) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学分校高级技术学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) College of Optoelectronic Engineering, Chongqing University(重庆大学光电工程学院) Ningbo Cixi Institute of Biomedical Engineering, Chinese Academy of Sciences(宁波慈溪生物医学工程研究所,中国科学院) School of Bioengineering, Imperial College London(伦敦帝国理工学院生物工程学院) Liverpool Centre for Cardiovascular Science at University of Liverpool, Liverpool John Moores University and Liverpool Heart & Chest Hospital(利物浦大学心血管科学中心,利物浦约翰摩尔斯大学,利物浦心脏和胸科医院) Eye and Vision Department, University of Liverpool(利物浦大学眼科学与视觉科学系)

专题命中 安全训练 :harmlessness(abstract)

AI总结 StealthMark通过不确定性引导后门实现医疗分割模型的隐蔽无害所有权验证,有效提升模型安全性与实用性。

Comments 15 pages,7 figures. Accepted to IEEE Transactions on Image Processing (TIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 50%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 安全训练 :safety(abstract)

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14324 2026-01-22 cs.HC 50%

When Generative AI Is Intimate, Sexy, and Violent: Examining Not-Safe-For-Work (NSFW) Chatbots on FlowGPT

当生成AI变得亲密、性感和暴力:检验FlowGPT上的不适宜内容聊天机器人

Xian Li, Yuanning Han, Di Liu, Pengcheng An, Shuo Niu

专题命中 安全训练 :safety(abstract)

AI总结 研究分析FlowGPT上NSFW聊天机器人的类型及用户互动,揭示虚拟亲密、性幻想、暴力表达等特征,提出对聊天机器人设计和内容审核的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06136 2026-01-22 cs.CR 50%

"Abuse Risks are Often Inherent to Product Features": Exploring AI Vendors' Bug Bounty and Responsible Disclosure Policies

滥用风险往往与产品特性相关

Yangheran Piao, Jingjie Li, Daniel W. Woods

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了AI供应商在漏洞赏金和负责任披露政策中的风险与实践,发现36%的供应商无明确政策,且数据访问等漏洞最常被纳入范围,而劫持等漏洞则被排除。

Comments At USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13057 2026-01-21 eess.SY cs.SY 50%

Convex Model Predictive Control for Safe Output Consensus of Nonlinear Multi-Agent Systems

凸优化模型预测控制用于非线性多智能体系统的安全输出一致性

Chao Wang, Shuyuan Zhang, Lei Wang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于SQP方案的凸模型预测控制方法,通过线性化和凸化非线性约束,有效降低计算复杂度,实现在非线性多智能体系统中的安全输出一致性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12672 2026-01-21 cs.CV 50%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 安全训练 :safety(abstract)

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12634 2026-01-21 cs.CR cs.SE 50%

The Cost of Convenience: Identifying, Analyzing, and Mitigating Predatory Loan Applications on Android

便利的代价:识别、分析和缓解Android上的掠夺性贷款申请

Olawale Amos Akanji, Manuel Egele, Gianluca Stringhini

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了Android上贷款应用的合规性问题,发现大量应用违反国家和谷歌政策,通过分析揭示敏感数据滥用,并建议加强隐私保护和技术保障。

Comments 15 pages, accepted at ACM ASIA CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11983 2026-01-21 cs.CV 50%

An AI-IoT Based Smart Wheelchair with Gesture-Controlled Mobility, Deep Learning-Based Obstacle Detection, Multi-Sensor Health Monitoring, and Emergency Alert System

基于AI-IoT的智能轮椅:具有手势控制移动、深度学习障碍检测、多传感器健康监测和紧急警报系统

Md. Asiful Islam, Abdul Hasib, Tousif Mahmud Emon, Khandaker Tabin Hasan, A. S. M. Ahsanul Sarkar Akib

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Military Institute of Science and Technology(军事科学与技术学院) University of Frontier Technology(前沿技术大学) American International University-Bangladesh(美国国际大学-孟加拉国) Robo Tech Valley(机器人技术谷)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于AI-IoT的智能轮椅系统,结合手势控制、深度学习障碍检测、多传感器健康监测和紧急警报,实现安全导航与健康监测的集成解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08012 2026-01-14 cs.SE 50%

Towards Verifiably Safe Tool Use for LLM Agents

面向LLM代理工具使用的可验证安全性

Aarya Doshi, Yining Hong, Congying Xu, Eunsuk Kang, Alexandros Kapravelos, Christian Kästner

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于STPA的框架,通过形式化规范数据流和工具序列,实现LLM代理的可验证安全性,减少对人工标注的依赖。

Comments 4 pages, 1 figure; accepted to ICSE NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07715 2026-01-13 eess.SY cs.SY 50%

Safe Navigation under Uncertain Obstacle Dynamics using Control Barrier Functions and Constrained Convex Generators

在不确定障碍动态下使用控制屏障函数和约束凸生成器的安全导航

Hugo Matias, Daniel Silvestre

专题命中 安全训练 :safety(abstract)

AI总结 本文提出利用控制屏障函数和约束凸生成器实现安全导航,通过凸优化问题转换障碍物流为CBF,适用于不确定障碍动态的代理导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04334 2026-01-09 cs.RO math.OC 50%

Autonomous Reasoning for Spacecraft Control: A Large Language Model Framework with Group Relative Policy Optimization

自主推理的航天器控制:一种基于大语言模型的框架与群体相对策略优化

Amit Jain, Richard Linares

机构 * Department of Aeronautics \& Astronautics Massachusetts Institute of Technology Cambridge, MA 02139

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于大语言模型和群体相对策略优化的自主推理航天器控制框架,通过两阶段训练方法生成可解释的控制策略,适用于复杂动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00321 2026-01-05 cs.MA 50%

Offline Multi-Agent Reinforcement Learning for 6G Communications: Fundamentals, Applications and Future Directions

离线多智能体强化学习用于6G通信:基础、应用与未来方向

Eslam Eldeeb, Hirley Alves

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于保守Q学习的离线多智能体强化学习算法,用于6G通信中的无线资源管理和无人机网络,旨在解决多智能体环境下的安全高效训练问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22386 2026-01-01 cs.IR 50%

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC: 一种用于电商推荐的指令遵循生成框架

Xuegang Hao, Ming Zhang, Alex Li, Xiangyu Qian, Zhi Ma, Yanlong Zang, Shijie Yang, Zhongxuan Han, Xiaolong Ma, Jinguang Liu, Zhen Li, Zhida Jiang, Shusheng Wang, Ning Tang, Yanchen Qiao, Chenxiang Yang, Chen Sun, Jincheng Yuan, Chunhua Peng, Heng Hu, Peijun Yang, Baopeng Yuan, Caiyun Qiu, Zhaolong Xing, Haofei Yuan, Haipeng Zhang, Yuzhang Guo, Weijie Ding, Jiahua Gao, Hao Huang, Zhen Chen, Tongxuan Liu, Pinghua Gong

专题命中 安全训练 :alignment(abstract)

AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23505 2025-12-30 cs.RO cs.SY eess.SY 50%

Robust Deep Learning Control with Guaranteed Performance for Safe and Reliable Robotization in Heavy-Duty Machinery

具有保证性能的鲁棒深度学习控制:用于重载机械中安全可靠机器人化的关键技术

Mehdi Heydari Shahna

机构 * Business Finland Partnership Project(Business Finland合作伙伴项目) Tampere(塔尔帕)

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出了一种鲁棒深度学习控制框架,旨在提升重型机械在电气化和自主性转型中的安全性和可靠性,通过模块化设计和分层策略实现性能保障。

Comments Doctoral Dissertation, Tampere University

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 50%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13021 2025-12-29 eess.SY cs.SY 50%

Safe Control of Multi-Agent Systems with Minimal Communication

多智能体系统安全控制的最小通信

Mo Yang, Jing Yu, Necmiye Ozay

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种多智能体系统中最小化通信的控制器设计方法,通过秩最小化问题和系统级合成实现安全性和协调性的保障。

Comments to appear at 2025 IEEE Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 50%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 安全训练 :alignment(abstract)

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10392 2025-12-12 eess.SY cs.SY 50%

Collision-Aware Density-Driven Control of Multi-Agent Systems via Control Barrier Functions

考虑碰撞的密度驱动多智能体系统控制方法 via 控制屏障函数

Sungjun Seo, Kooktae Lee

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种结合密度驱动控制与控制屏障函数的多智能体系统控制方法,用于在存在障碍物的环境中实现安全高效的区域覆盖。

Comments 6 pages, 7 figures, Accepted for presentation at the 5th Modeling, Estimation and Control Conference (MECC 2025), Pittsburgh, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06659 2025-12-09 cs.CR 50%

The Evolution of Agentic AI in Cybersecurity: From Single LLM Reasoners to Multi-Agent Systems and Autonomous Pipelines

代理AI在网络安全中的演变:从单一LLM推理者到多代理系统和自主流水线

Vaishali Vinay

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了网络安全中代理AI从单一LLM到多代理系统的发展,分析了五代分类法及各代在推理深度、工具使用等维度的差异,并总结了当前面临的挑战。

Comments Accepted at ICAIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06268 2025-12-09 eess.SY cs.MA cs.SY 50%

A Physics-Informed Fixed Skyroad Model for Continuous UAS Traffic Management (C-UTM)

一种融合物理信息的固定天空路模型用于连续无人机交通管理(C-UTM)

Muhammad Junayed Hasan Zahed, Hossein Rastgoftar

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种融合物理信息的固定天空路模型,用于解决低空无人机交通管理中的动态空域分配问题,通过构建多层天空路结构和连续UTM框架,提高空域利用率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO 50%

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12099 2025-12-01 cs.CV 50%

TinyRS-R1: Compact Multimodal Language Model for Remote Sensing

TinyRS-R1:用于遥感的紧凑多模态语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)

专题命中 安全训练 :alignment(abstract)

AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。

Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20919 2025-11-27 physics.ed-ph hep-ex 50%

Virtual high voltage lab: gamified learning in a safe 3d environment

虚拟高压实验室:在安全3D环境中的游戏化学习

Vladyslav Pliuhin, Yevgen Tsegelnyk, Maria Sukhonos, Ihor Biletskyi, Sergiy Plankovskyy, Taras Sakhoshko

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出一个基于Unreal Engine 5的虚拟高压实验室,通过游戏化和沉浸式技术提升学生在高压工程学习中的参与度和实践技能,增强城市能源系统韧性。

Comments 54 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20617 2025-11-26 cs.SE cs.PL 50%

Translating Large-Scale C Repositories to Idiomatic Rust

将大规模C仓库翻译为idiomatic Rust

Saman Dehghan, Tianran Sun, Tianxiang Wu, Zihan Li, Reyhaneh Jabbarvand

专题命中 安全训练 :safety(abstract)

AI总结 Rustine是一种高效自动化的C到idiomatic Rust翻译工具,实现了高质量的功能等价性,比现有方法更安全、更idiomatic且更易读。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19691 2025-11-26 cs.RO 50%

Multi-Agent gatekeeper: Safe Flight Planning and Formation Control for Urban Air Mobility

多智能体守门人:面向城市空中交通的安全飞行规划与编队控制

Thomas Marshall Vielmetti, Devansh R Agrawal, Dimitra Panagou

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Robotics(机器人学系) Department of Robotics and Department of Aerospace Engineering(机器人学系和航空航天工程系)

专题命中 安全训练 :safety(abstract)

AI总结 多智能体守门人框架通过安全轨迹备份和碰撞避免算法,实现城市空中交通中的安全飞行规划与编队控制。

Comments 13 pages, 4 figures, to appear AIAA SciTech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18617 2025-11-26 cs.RO cs.CV 50%

AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations

AutoFocus-IL:基于视觉语言模型的数据高效视觉模仿学习中的显著性图

Litian Gong, Fatemeh Bahrani, Yutai Zhou, Amin Banayeeanzade, Jiachen Li, Erdem Bıyık

机构 * Department of Electrical and Computer Engineering, University of California, Riverside, USA(电气与计算机工程系,加州大学河滨分校) Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学)

专题命中 安全训练 :alignment(abstract)

AI总结 AutoFocus-IL通过视觉语言模型自动生成显著性图,提升视觉模仿学习的数据效率和泛化能力,无需额外人类标注。

Comments 8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02025 2025-11-26 cs.SE 50%

SAFE: Harnessing LLM for Scenario-Driven ADS Testing from Multimodal Crash Data

SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试

Siwei Luo, Yang Zhang, Yao Deng, Linfeng Liang, Xi Zheng

专题命中 安全训练 :safety(abstract)

AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。

Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19450 2025-11-26 cs.DC 50%

AI-driven Predictive Shard Allocation for Scalable Next Generation Blockchains

基于AI的预测性分片分配用于可扩展下一代区块链

M. Zeeshan Haider, Tayyaba Noreen, M. D. Assuncao, Kaiwen Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出PSAP协议,通过预测性分片分配提升区块链可扩展性,实验显示吞吐量提升2倍,延迟降低35%

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16986 2025-11-25 cs.CV 50%

VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation

VCE:通过视觉对比利用实现安全的自回归图像生成

Feng Han, Chao Gong, Zhipeng Wei, Jingjing Chen, Yu-Gang Jiang

专题命中 安全训练 :DPO(abstract)

AI总结 VCE通过视觉对比利用方法,有效保护自回归图像生成模型,实现对不安全内容的精确擦除并保持安全内容的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏