arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3317 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3317 篇

2603.21810 2026-03-24 eess.SY cs.MA cs.RO cs.SY 50%

Partial Attention in Deep Reinforcement Learning for Safe Multi-Agent Control

深度强化学习中多智能体控制的安全部分注意力

Turki Bin Mohaya, Peter Seiler

机构 * Department of Electrical Engineering and Computer Science at the University of Michigan(密歇根大学电气工程与计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出在多智能体安全控制中应用注意力机制,设计神经网络控制高速公路汇入场景的自动驾驶车辆,通过部分注意力提升安全性和效率。

Comments This work has been accepted for publication in the proceedings of the 2026 American Control Conference (ACC), New Orleans, Louisiana, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21427 2026-03-24 cs.SE 50%

Dynasto: Validity-Aware Dynamic-Static Parameter Optimization for Autonomous Driving Testing

Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化

Dmytro Humeniuk, Mohammad Hamdaqa, Houssem Ben Braiek, Amel Bennaceur, Foutse Khomh

专题命中 安全训练 :safety(abstract)

AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21142 2026-03-24 cs.RO 50%

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航

Jeffrey Chen, Rohan Chandra

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20658 2026-03-24 cs.RO 50%

Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation

加速补丁:学习一种插件式策略以加快具身操作

Zhichao Wu, Junyin Ye, Zhilong Zhang, Yihao Sun, Haoxin Lin, Jiaheng Luo, Haoxiang Ren, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China School of Artificial Intelligence, Nanjing University, China Mila-Quebec AI Institute \& Université de Montréal, Canada

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Speedup Patch,一种轻量且策略无关的框架,通过仅使用离线数据实现插件式加速,通过约束马尔可夫决策过程优化调度器,提升执行效率而不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20356 2026-03-24 cs.LO cs.CR cs.FL 50%

Agentproof: Static Verification of Agent Workflow Graphs

Agentproof: 静态验证代理工作流图

Melwin Xavier, Vaisakh M A, Melveena Jolly, Midhun Xavier

专题命中 安全训练 :safety(abstract)

AI总结 Agentproof通过提取四个主流代理框架的统一抽象图模型,应用六种结构检查并生成见证轨迹,评估时间安全策略,实现无需手动建模的静态验证,发现工作流中的结构缺陷和政策违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15674 2026-03-24 eess.SY cs.SY 50%

Safe and Stable Formation Control with Autonomous Multi-Agents Using Adaptive Control (Extended Version)

使用自适应控制的自主多智能体安全稳定编队控制(扩展版)

Jose A. Solano-Castellanos, Peter A. Fisher, Anuradha Annaswamy

专题命中 安全训练 :safety(abstract)

AI总结 本文提出结合自适应控制、控制屏障函数和连接图的方法,解决多智能体系统在动态不确定性和通信限制下的稳定与安全编队控制问题,通过自适应控制确保稳定性,安全过滤器生成安全指令,参考模型实现无不确定情况下的编队控制。

Comments Accepted to Modeling, Estimation and Control Conference (MECC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19170 2026-03-20 cs.RO math.OC 50%

ADMM-Based Distributed MPC with Control Barrier Functions for Safe Multi-Robot Quadrupedal Locomotion

基于ADMM的分布式MPC与控制屏障函数用于安全多机器人四足运动

Yicheng Zeng, Ruturaj S. Sambhus, Basit Muhammad Imran, Jeeseop Kim, Vittorio Pastore, Kaveh Akbari Hamed

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) The University of Texas at El Paso(德克萨斯理工大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于ADMM的去中心化MPC框架,结合控制屏障函数约束,用于多机器人腿部系统的安全轨迹规划。通过节点-边分割公式与共识约束,将全局问题分解为独立二次规划问题,实现高效去中心化优化,提升实时性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18658 2026-03-20 eess.SY cs.SY 50%

Mean-field control barrier functions for stochastic multi-agent systems

均场控制屏障函数用于随机多智能体系统

Cinzia Tomaselli, Gian Carlo Maffettone, Samy Wu Fung, Levon Nurbekyan, Mario di Bernardo

专题命中 安全训练 :safety(abstract)

AI总结 本文提出均场控制屏障函数,用于保障随机多智能体系统安全,通过稳定性分析和数值模拟验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09490 2026-03-20 econ.TH 50%

Robust Trust

稳健的信任

Piotr Dworczak, Alex Smolin

专题命中 安全训练 :alignment(abstract)

AI总结 研究者分析了在信息不对称情况下,代理人如何根据私人信息和可能有偏见的顾问建议做出稳健决策,通过信任区域政策最大化最坏情况下的预期收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18059 2026-03-20 cs.CR cs.SE 50%

Guardrails as Infrastructure: Policy-First Control for Tool-Orchestrated Workflows

护栏作为基础设施:面向工具编排工作流的政策优先控制

Akshey Sigdel, Rista Baral

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Policy-First Tooling,通过显式约束、风险感知门控等机制提升工具调用安全性,实验显示其在减少违规行为和降低重试放大方面效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02009 2026-03-20 cs.DC 50%

STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds

STRATUS:一种用于现代云服务自主可靠性工程的多智能体系统

Yinfang Chen, Jiaqi Pan, Jackson Clark, Yiming Su, Noah Zheutlin, Bhavya Bhavya, Rohan Arora, Yu Deng, Saurabh Jha, Tianyin Xu

专题命中 安全训练 :safety(abstract)

AI总结 本文提出STRATUS,一种基于LLM的多智能体系统,用于实现云服务的自主SRE。系统通过状态机组织多个专用智能体,提升故障检测、诊断和缓解的效率,并通过Transactional No-Regression规范提高自主故障缓解的成功率。

Comments 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17339 2026-03-19 cs.DL 50%

citecheck: An MCP Server for Automated Bibliographic Verification and Repair in Scholarly Manuscripts

citecheck: 一种MCP服务器,用于学术手稿中的自动文献验证与修复

Junhyeok Lee

专题命中 安全训练 :safety(abstract)

AI总结 citecheck通过自动化验证和修复学术手稿中的文献错误,包括识别错误、元数据不完整、作者归属错误及预印本与发表版本不一致等问题,提供结构化修复建议和安全诊断。

Comments 6 pages, 1 figure. Software paper on bibliography verification and repair for scholarly manuscripts; includes MCP server implementation and evaluation on repository-backed tests

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20095 2026-03-19 cs.CV 50%

WPT: World-to-Policy Transfer via Online World Model Distillation

WPT: 通过在线世界模型蒸馏实现世界到策略的迁移

Guangfeng Jiang, Yueru Luo, Jun Liu, Yi Huang, Yiyao Zhu, Zhan Qu, Dave Zhenyu Chen, Bingbing Liu, Xu Yan

机构 * University of Science and Technology of China(科学技术大学) CUHK-SZ(香港中文大学(深圳)) HKUST(香港理工大学) Huawei Foundation Model Department(华为基金会模型部)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出WPT方法,通过在线世界模型蒸馏实现策略迁移,提升规划性能并保持实时部署能力,实验表明其在开放环和闭合环基准上表现优异。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15541 2026-03-18 cs.RO 50%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14182 2026-03-17 cs.RO cs.HC 50%

Towards Equitable Robotic Furnishing Agents for Aging-in-Place: ADL-Grounded Design Exploration

迈向老年人独立生活中的公平机器人家具代理:基于日常活动的设计探索

Hansoo Lee, Changhee Seo, Subin Park, Sonya S. Kwak

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了在老年人独立生活背景下,通过基于日常活动的设计探索,开发公平的机器人家具代理,以减少认知和身体负担,提升老年人福祉。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026 Workshop: Equitable Robotics for Wellbeing (Eq-RW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14018 2026-03-17 eess.SY cs.SY 50%

LLM-Guided Safe Reinforcement Learning for Energy System Topology Reconfiguration

基于大型语言模型的安全强化学习用于能源系统拓扑重构

Zongyan Zhang, Chao Shen, Xu Wan, Jie Song, Mingyang Sun

专题命中 安全训练 :safety(abstract)

AI总结 本文提出结合大型语言模型与安全软演员-评论家算法的拓扑控制框架,通过重构电压和热限为平滑安全成本信号,提升电网拓扑重构的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03125 2026-03-17 cs.CV 50%

AWDiff: An a trous wavelet diffusion model for lung ultrasound image synthesis

AWDiff:一种用于肺部超声图像合成的a trous小波扩散模型

Maryam Heidari, Nantheera Anantrasirichai, Steven Walker, Rahul Bhatnagar, Alin Achim

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出AWDiff模型,通过a trous小波变换与BioMedCLIP语义条件,提升肺部超声图像生成的结构精度与临床相关性。

Comments 5 pages5 pages, 4 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13775 2026-03-17 cs.NI 50%

LLM-Based Net Analyzer rApp for Explainable and Safe Automation in O-RAN Non-RT RIC

基于大语言模型的网络分析rApp用于O-RAN非实时RIC中的可解释和安全自动化

Tuan V. Ngo, Mao V. Ngo, Binbin Chen, Tony Q. S. Quek, Tejaswita Kumari, Maziar Nekovee

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于大语言模型的网络分析rApp,用于O-RAN非实时RIC中的可解释和安全自动化,通过事件驱动的批量触发推理框架,实现安全的人工干预自动化,确保操作安全性和可审计性。

Comments Accepted version for presentation at the IEEE ICC Workshop Open, Programmable and AI-Native Radio Access Network, Glasgow, Scotland, UK, May 2026. copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12430 2026-03-16 cs.CV 50%

Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation

Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证

Jian Jiang, Chenxi Lin, Yiming Gu, Zengyi Qin, Zhitao Zeng, Kun Yuan, Yonghao Long, Xiang Xia, Cheng Yuan, Yuqi Wang, Zijie Yue, Kunyi Yang, Yuting Zhang, Zhu Zhuo, Dian Qin, Xin Wang, NG Chi Fai, Brian Anthony, Daguang Xu, Guy Rosman, Ozanan Meireles, Zizhen Zhang, Nicolas Padoy, Hesheng Wang, Qi Dou, Yueming Jin, Yutong Ban

专题命中 安全训练 :safety(abstract)

AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12421 2026-03-16 cs.CV 50%

A Neuro-Symbolic Framework Combining Inductive and Deductive Reasoning for Autonomous Driving Planning

一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划

Hongyan Wei, Wael AbdAlmageed

机构 * Clemson University(克莱姆森大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。

Comments Under review. 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11390 2026-03-13 cs.NI cs.SY eess.SY 50%

SliceFed: Federated Constrained Multi-Agent DRL for Dynamic Spectrum Slicing in 6G

SliceFed: 6G动态频谱切片中的联邦约束多智能体深度强化学习

Hossein Mohammadi, Seyed Bagher Hashemi Natanzi, Ramak Nassiri, Jamshid Hassanpour, Bo Tang, Vuk Marojevic

专题命中 安全训练 :safety(abstract)

AI总结 SliceFed通过联邦约束多智能体深度强化学习框架,解决6G动态频谱切片中的资源分配问题,实现高频谱效率和严格的服务质量要求。

Comments 4 figures, 3 algorithms charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04329 2026-03-13 cs.RO 50%

Safe and Stylized Trajectory Planning for Autonomous Driving via Diffusion Model

通过扩散模型实现自动驾驶的安全且风格化的轨迹规划

Shuo Pei, Yong Wang, Yuanchen Zhu, Chen Sun, Qin Li, Yanan Zhao, Huachun Tan

专题命中 安全训练 :safety(abstract)

AI总结 本文提出SDD Planner,通过结合多源风格感知编码器和风格引导动态轨迹生成器,实现自动驾驶中安全与风格化轨迹规划的平衡,实验表明其在多个基准测试中表现优异。

Comments 12 pages, 7 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10638 2026-03-12 cs.CV 50%

Splat2Real: Novel-view Scaling for Physical AI with 3D Gaussian Splatting

Splat2Real:基于物理AI的新型视角缩放与3D高斯点云技术

Hansol Lim, Jongseong Brad Choi

机构 * Department of Mechanical Engineering, State University of New York(纽约州立大学机械工程系)

专题命中 安全训练 :safety(abstract)

AI总结 Splat2Real通过CN-Coverage策略提升物理AI在新型视角下的鲁棒性,实现更稳定的深度预训练和下游控制代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23162 2026-03-12 cs.RO cs.CV 50%

Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling

Cosmos-H-Surgical: 通过世界建模学习手术机器人策略

Yufan He, Pengfei Guo, Mengya Xu, Zhaoshuo Li, Andriy Myronenko, Dillan Imans, Bingjie Liu, Dongren Yang, Mingxue Gu, Yongnan Ji, Yueming Jin, Ren Zhao, Baiyong Shen, Daguang Xu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Sung Kyun Kwan University(全州大学) Wenzhou Medical University(温州医学院) National University of Singapore(新加坡国立大学) Ruijin Hospital(瑞金医院)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 50%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16158 2026-03-11 cs.HC 50%

Designing Culturally Aligned AI Systems For Social Good in Non-Western Contexts

为非西方语境中的社会公益设计文化契合的AI系统

Deepak Varuvel Dennison, Mohit Jain, Tanuja Ganu, Aditya Vashistha

专题命中 安全训练 :safety(abstract)

AI总结 本文通过分析非西方语境中AI系统的部署案例,提出12条设计指南,强调文化契合与人类资源在构建安全有效AI系统中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01763 2026-03-10 cs.CV 50%

HiconAgent: History Context-aware Policy Optimization for GUI Agents

HiconAgent: 历史上下文感知的GUI代理策略优化

Xurui Zhou, Gongwei Chen, Yuquan Xie, Zaijing Li, Kaiwen Zhou, Shuai Wang, Shuo Yang, Zhuotao Tian, Rui Shao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 HiconAgent通过历史上下文感知策略优化,高效利用历史信息,在GUI导航任务中实现更高的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00121 2026-03-06 cs.MA 50%

Graph-theoretic Agreement Framework for Multi-agent LLM Systems

图论同意框架用于多智能体大语言模型系统

Muhammad Umar Javed

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出图论框架用于分析多智能体大语言模型中的共识稳定性,通过映射Transformer交叉熵到带符号拉普拉斯矩阵,解决不可观测死锁问题,并验证了共识定理和多项式时间算法。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03848 2026-03-06 eess.SY cs.MA cs.RO cs.SY 50%

Dual-Interaction-Aware Cooperative Control Strategy for Alleviating Mixed Traffic Congestion

双交互感知的协同控制策略用于缓解混合交通拥堵

Zhengxuan Liu, Yuxin Cai, Yijing Wang, Xiangkun He, Chen Lv, Zhiqiang Zuo

机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System, School of Electrical and Information Engineering, Tianjin University(天津智能无人群技术与系统重点实验室,电气与信息工程学院,天津大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高等研究院,电子科学与技术大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出双交互感知协同控制策略,通过去中心化决策模块、集中化批评者和奖励设计,提升混合交通瓶颈场景下的交通效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02338 2026-03-06 cs.SE cs.RO 50%

Vision Language Model-based Testing of Industrial Autonomous Mobile Robots

基于视觉语言模型的工业自主移动机器人测试

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali, Thomas Peyrucain

机构 * Simula Research Laboratory and University of Oslo(Simula研究实验室和奥斯陆大学) Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室) PAL Robotics(PAL机器人技术)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于视觉语言模型的测试方法,用于生成违反功能和安全要求的机器人交互场景,以提高自主移动机器人在复杂环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏