arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3317 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3317 篇

1811.06083 2018-12-06 stat.ML cs.LG 57%

Learning Optimal Personalized Treatment Rules Using Robust Regression Informed K-NN

Ruidi Chen, Ioannis Paschalidis

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.03728 2018-11-12 cs.LG cs.CR stat.ML 57%

Detecting Backdoor Attacks on Deep Neural Networks by Activation Clustering

Bryant Chen, Wilka Carvalho, Nathalie Baracaldo, Heiko Ludwig, Benjamin Edwards, Taesung Lee, Ian Molloy, Biplav Srivastava

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.01147 2018-11-06 cs.AI 57%

SafeRoute: Learning to Navigate Streets Safely in an Urban Environment

Sharon Levy, Wenhan Xiong, Elizabeth Belding, William Yang Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.03080 2018-09-11 cs.CY 57%

A path to AI

Ion Dronic

专题命中 安全训练 :alignment(abstract);分类 cs.CY

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.09203 2018-03-28 cs.AI cs.RO 57%

Autonomous Ramp Merge Maneuver Based on Reinforcement Learning with Continuous Action Space

Pin Wang, Ching-Yao Chan

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.08757 2018-01-29 cs.AI 57%

Safe Exploration in Continuous Action Spaces

Gal Dalal, Krishnamurthy Dvijotham, Matej Vecerik, Todd Hester, Cosmin Paduraru, Yuval Tassa

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06782 2017-11-21 cs.LG cs.RO 57%

Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning

Benjamin Eysenbach, Shixiang Gu, Julian Ibarz, Sergey Levine

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Videos of our experiments are available at: https://sites.google.com/site/mlleavenotrace/

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03730 2017-09-14 cs.LG cs.HC 57%

Interpreting Shared Deep Learning Models via Explicable Boundary Trees

Huijun Wu, Chen Wang, Jie Yin, Kai Lu, Liming Zhu

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10528 2017-05-31 cs.LG 57%

Constrained Policy Optimization

Joshua Achiam, David Held, Aviv Tamar, Pieter Abbeel

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted to ICML 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.05577 2016-04-20 cs.SE cs.AI cs.MA 57%

Contribution to the Formal Specification and Verification of a Multi-Agent Robotic System

Nadeem Akhtar, Malik M. Saad Missen

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:1501.05120

Journal ref European Journal of Scientific Research, ISSN 1450-216X / 1450-202X Vol.117 No.1 January, 2014, pp. 35-55

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.04725 2015-01-21 cs.PL cs.LG 57%

Learning Invariants using Decision Trees

Siddharth Krishna, Christian Puhrsch, Thomas Wies

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21069 2026-08-24 cs.SE 新提交 56%

Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation

Spike-Killer:面向真实Windows工作站安全性能诊断的证据门控大语言模型辅助方案

Baocheng Zeng, Jinhao Yang

专题命中 安全训练 :trustworthy(abstract);safety(comments)

AI总结 该研究提出Spike-Killer,一种人在环的证据门控工作流,用于安全诊断Windows工作站的帧时间问题,以CS2为目标应用验证了其可审计性,为LLM辅助智能体提供了可信操作模式。

Comments 6 pages. Experience report; no causal CS2 frame-time improvement or autonomous-safety claim is made

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17222 2025-04-07 cs.CV 56%

How Could Generative AI Support Compliance with the EU AI Act? A Review for Safe Automated Driving Perception

Mert Keser, Youssef Shoeb, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学) Continental AG(大陆集团) Technical University of Berlin(柏林工业大学)

专题命中 安全训练 :safety(abstract,journal_ref)

Journal ref 2024 IEEE International Conference on Vehicular Electronics and Safety (ICVES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03284 2024-03-29 eess.SY cs.RO cs.SY 56%

Safe Collective Control under Noisy Inputs and Competing Constraints via Non-Smooth Barrier Functions

Clinton Enwerem, John S. Baras

专题命中 安全训练 :safety(abstract,comments)

Comments Accepted to the 2024 European Control Conference. See Section VI.B (in particular, Theorem 1, Proposition 2, and Remark 2) for updates incorporating new results (from Reference 3) on almost-sure safety of ZCBFs

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01739 2025-11-11 cs.AI cs.LG 54%

Conceptual Belief-Informed Reinforcement Learning

Xingrui Gu, Chuyi Jiang, Laixi Shi

机构 * University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :alignment(comments,journal_ref);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025 Workshop on Models of Human Feedback for AI Alignment

Journal ref ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27009 2026-08-28 cs.CR 新提交 50%

The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions

会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作

Yingjie Zhang, Yuanbo Xie, Kai Chen

专题命中 安全训练 :safety(abstract)

AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-08-28 cs.CV 新提交 50%

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-28 cs.CR 版本更新 50%

QuantGuard: Learnable Rounding for Repairing Quantization-Conditioned Backdoors in LLMs

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen, Shanqing Guo, Kening Zheng

专题命中 安全训练 :alignment(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22932 2026-08-27 eess.SP 版本更新 50%

AirMoE: Realizing Over-the-Air Distributed Mixture-of-Experts Inference at the Wireless Edge

AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理

Huiling Yang, Zhanwei Wang, Kaibin Huang

专题命中 安全训练 :alignment(abstract)

AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-08-27 cs.CR cs.SC 版本更新 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 安全训练 :safety(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22928 2026-08-25 cs.PL cs.CR 新提交 50%

When Can Agents Safely Checkpoint, Fork, Restore, and Merge? Exact Checking for Execution Edits

智能体何时能安全地进行检查点、分叉、恢复与合并?执行编辑的精确检查

Yusheng Zheng, Xiaoyu Song, Yanpeng Hu, Lebin Cheng, Yuxi Huang, Wei Zhang

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对智能体的检查点、分叉等执行编辑操作,提出一种精确判定编辑安全性的算法,通过形式化方法验证,相关成果已在 Lean 中实现并开源。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22868 2026-08-25 cs.CR 新提交 50%

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全

Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

专题命中 安全训练 :safety(abstract)

AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-25 eess.SY cs.SY 版本更新 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-08-25 cs.RO 版本更新 50%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21066 2026-08-24 cs.CV 新提交 50%

Robust Validation to Geometric Perturbations for Autonomous Pose Estimation

面向自主位姿估计的几何扰动鲁棒性验证

Gregoire Theau, Melanie Ducoffe

机构 * Airbus SAS(空中客车公司) IRT Saint-Exupery(圣埃克苏佩里技术研究院)

专题命中 安全训练 :safety(abstract)

AI总结 本文针对自主位姿估计的几何扰动鲁棒性验证问题,提出基于全局利普希茨优化(GLO)的方法,在YOLOv8-Pose模型上验证其可高效定位失效模式并剪枝80%以上搜索空间,为鲁棒自主感知验证提供了新途径。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19557 2026-08-21 cs.DC cs.MA 新提交 50%

When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度

Reza Zakerian

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。

Comments 8 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08154 2026-08-20 cs.CV 50%

Investigating Vision-Language Model for Point Cloud-based Vehicle Classification

Yiqiao Li, Jie Wei, Camille Kamga

机构 * City College of New York(纽约城市学院)

专题命中 安全训练 :safety(abstract)

Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop

Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17349 2026-08-19 cs.DC 新提交 50%

Brief Announcement: Fair Binding for Hidden-State Authorization in Byzantine SMR

简短公告:拜占庭SMR中隐藏状态授权的公平绑定

Arnab Mallick

专题命中 安全训练 :safety(abstract)

AI总结 针对拜占庭SMR中隐藏状态授权问题,提出公平预留/使用协议,满足授权安全性与先到者活性,解决隐藏资源安全动态分配问题。

Comments Accepted at DISC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 50%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 安全训练 :alignment(abstract)

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14877 2026-08-18 cs.NI eess.SP 新提交 50%

Deep Reinforcement Learning for 6G AI-RAN: A Comprehensive Survey

面向6G AI-RAN的深度强化学习:一项综合调查

Jie Lu, Peihao Yan, Qijun Wang, Ruxin Lin, Huacheng Zeng

专题命中 安全训练 :trustworthy(abstract)

AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。

详情

展开后加载摘要…

URL PDF HTML 收藏