arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 176 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 176 篇

2606.29239 2026-08-04 cs.CR 版本更新 50%

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

专题命中 安全训练 :alignment(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07774 2026-08-03 cs.CR 版本更新 50%

ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents

ScopeJudge:用于进攻性安全代理的成本感知预执行门控

Shane Caldwell, Max Harley, Ads Dawson, Michael Kouremetis, Vincent Abruzzo, Will Pearce

专题命中 安全训练 :safety(abstract)

AI总结 研究进攻性安全代理中预执行门控,引入ScopeJudge数据集,含4897个工具调用。评估八个法官模型在五种转录策略下表现,发现静态策略不足,推荐成本敏感和召回优先操作点,以支持自主安全代理的实时监控和可扩展监督。

Comments 22 pages, 4 figures, 4 tables, 1 link to code, 1 link to dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17189 2026-08-03 cs.RO 版本更新 50%

Shepherding UAV Swarm with Action Prediction Based on Movement Constraints

通过基于运动约束的动作预测来引导无人机群

Yusuke Tsunoda, Yusuke Goto, Takao Sato

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于动态窗口方法的三维引导控制律,通过预测自主无人机群的行为来提高引导效率,考虑了运动约束下的可行运动候选生成和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15053 2026-08-03 cs.MA 版本更新 50%

Distributed primal-dual algorithm for constrained multi-agent reinforcement learning under coupled policies

耦合策略下约束多智能体强化学习的分布式原始对偶算法

Pengcheng Dai, He Wang, Dongming Wang, Wenwu Yu

专题命中 安全训练 :safety(abstract)

AI总结 研究耦合环境下的约束多智能体强化学习,针对现有方法不足,提出智能体采用依赖邻居状态和参数的耦合策略及分布式可扩展原始对偶算法,证明算法收敛性,仿真验证其优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10207 2026-07-31 cs.IR 版本更新 50%

LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation

LASAR:潜在自适应语义对齐推理用于生成推荐

Yiwen Chen, Fuwei Zhang, Zehao Chen, Hehan Li, Peizhi Xu, Hanmeng Liu, Shuanglong Li, Xin Pei, Fuzhen Zhuang, Zhao Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 LASAR通过自适应语义对齐推理提升生成推荐性能,解决潜在推理与语义对齐的挑战,实现更高效的推荐质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 50%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19182 2026-07-28 cs.DC 版本更新 50%

ARBITER: Guarded Agentic Control for SLO-Oriented Kubernetes Remediation

ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制

Pooyan Habibi, Alberto Leon-Garcia

专题命中 安全训练 :safety(abstract)

AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 50%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 安全训练 :safety(abstract)

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新 50%

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

专题命中 安全训练 :alignment(abstract)

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06717 2026-07-14 cs.RO 版本更新 50%

SanDRA: Safe Large-Language-Model-Based Decision Making for Automated Vehicles Using Reachability Analysis

SanDRA:基于可达性分析的自动驾驶车辆安全大语言模型决策

Yuanfei Lin, Sebastian Illing, Matthias Althoff

机构 * Department of Computer Engineering, Technical University of Munich(计算机工程系,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(abstract)

AI总结 针对大语言模型用于自动驾驶决策时安全性无法保证的问题,提出SanDRA框架,先描述驾驶场景促使模型生成排序动作,转化为时序逻辑公式并结合可达性分析消除不安全动作,经实验验证能提供安全合规驾驶动作,代码和实验设置公开。

Comments @2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref T-ITS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11549 2026-07-10 cs.HC 版本更新 50%

UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization

UNIPO:统一的交互式可视化用于RL微调策略优化

Aeree Cho, Alexander D. Greenhalgh, Jonathan Bodea, Anthony Peng, Duen Horng Chau

专题命中 安全训练 :alignment(abstract)

AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21858 2026-07-10 math.OC 版本更新 50%

When to Match: A Cost-Balancing Principle for Dynamic Markets

何时匹配:动态市场的成本平衡原则

Jie Liu, Hailun Zhang, Jiheng Zhang

专题命中 安全训练 :safety(abstract)

AI总结 研究动态市场中平台何时匹配的问题,提出成本平衡(CB)规则,在无需预测的情况下,能根据等待成本与当前匹配成本比例决定匹配时机,相比行业标准有成本和延迟优势,是简单高效且最坏情况最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07607 2026-07-08 cs.RO cs.CV 版本更新 50%

EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World

EgoVerse:一个用于机器人学习的视点人类数据集

Ryan Punamiya, Simar Kareer, Zeyi Liu, Josh Citron, Ri-Zhao Qiu, Xiongyi Cai, Alexey Gavryushin, Jiaqi Chen, Davide Liconti, Lawrence Y. Zhu, Patcharapong Aphiwetsa, Baoyu Li, Aniketh Cheluva, Pranav Kuppili, Yangcen Liu, Dhruv Patel, Aidan Gao, Hye-Young Chung, Ryan Co, Renee Zbizika, Jeff Liu, Xiaomeng Xu, Haoyu Xiong, Geng Chen, Sebastiano Oliani, Wenkai Xuan, Chenyu Yang, Xi Wang, James Fort, Richard Newcombe, Josh Gao, Jason Chong, Garrett Matsuda, Aseem Doriwala, Marc Pollefeys, Robert Katzschmann, Xiaolong Wang, Shuran Song, Judy Hoffman, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) University of California San Diego(加州大学圣地亚哥分校) ETH Zürich(苏黎世联邦理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Meta Reality Labs Research(Meta现实实验室) Mecka AI Scale AI

专题命中 安全训练 :alignment(abstract)

AI总结 EgoVerse通过统一的数据收集、处理和访问框架,提供丰富的人类操作行为数据,促进机器人学习,并通过大规模研究验证了人类数据与机器人学习目标的一致性对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17384 2026-07-07 cs.RO cs.CV 版本更新 50%

IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation

IndustryNav:探索动态工业导航中具身智能体的空间推理

Yifan Li, Lichi Li, Anh Dao, Xinyu Zhou, Wenjun Huang, Tianyi Ma, Yicheng Qiao, Zheda Mai, Daeun Lee, Zichen Chen, Pan Wang, Lehan Yang, Tianlong Wang, Zhen Tan, Sheng Li, Mohit Bansal, Yang Ni, Yu Kong

机构 * Michigan State University(密歇根州立大学) Independent Researcher(独立研究者) University of California, Irvine(加州大学尔湾分校) Ohio State University(俄亥俄州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) University of Pittsburgh(匹兹堡大学) University of Virginia(弗吉尼亚大学) Arizona State University(亚利桑那州立大学) Purdue University Northwest(普渡大学西北分校)

专题命中 安全训练 :safety(abstract)

AI总结 针对视觉大语言模型在空间推理的挑战,提出IndustryNav基准,利用动态工业场景评估,给出零样本导航管道及安全指标,研究发现模型在路径规划等方面有缺陷,凸显向主动探索等任务发展的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11907 2026-07-07 cs.RO 版本更新 50%

A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

一种基于前沿势奖励的基于图的强化学习方法用于安全杂乱环境探索

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(计算机科学、电气与航天工程系,吕勒奥技术大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出结合图神经网络探索贪心策略与安全护盾的方法,用近端策略优化算法训练网络,最大化探索效率并减少护盾干预,还提出奖励函数,能在杂乱环境高效安全探索。

Comments 6 pages, 4 figures, accepted at the 24th European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 50%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 安全训练 :alignment(abstract)

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13940 2026-07-03 cs.RO 版本更新 50%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03591 2026-07-02 cs.RO cs.SY eess.SY 版本更新 50%

Manifold-constrained Hamilton-Jacobi Reachability Learning for Decentralized Multi-Agent Motion Planning

流形约束的 Hamilton-Jacobi 可达性学习用于去中心化多智能体运动规划

Qingyi Chen, Ruiqi Ni, Junyoung Kim, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出流形约束的 HJR 学习框架,通过求解流形约束下的 HJR 问题获取任务感知安全条件,并集成到去中心化轨迹优化规划器中,实现安全且任务可行的多智能体运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15614 2026-07-01 cs.RO 版本更新 50%

AION: Aerial Indoor Object-Goal Navigation Using Dual-Policy Reinforcement Learning

AION: 基于双策略强化学习的空中室内目标导航

Zichen Yan, Yuchen Hou, Shenao Wang, Yichao Gao, Rui Huang, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

专题命中 安全训练 :safety(abstract)

AI总结 提出AION,一种端到端双策略强化学习框架,解耦探索与目标到达行为,用于视觉空中目标导航,无需外部定位或全局地图,在AI2-THOR和IsaacSim中验证了优越性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22378 2026-06-23 cs.RO 版本更新 50%

Adaptive vs. Static Robot-to-Human Handover: A Study on Orientation and Approach Direction

自适应与静态机器人-人类交接:关于方向和接近方向的研究

Federico Biagi, Dario Onfiani, Simone Silenzi, Cristina Iani, Luigi Biagiotti

机构 * Department of Engineering "Enzo Ferrari", University of Modena and Reggio Emilia(工程学院"Enzo Ferrari",摩德纳和雷吉奥艾米利亚大学) Department of Surgery, Medicine, Dentistry and Morphological Sciences, University of Modena and Reggio Emilia(外科、医学、牙科和形态学科学学院,摩德纳和雷吉奥艾米利亚大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出了一种自适应框架,通过实时调整物体的交付姿态,提升人类抓取的效率和安全性,实验表明动态对齐能降低用户认知负荷和生理压力,增强对机器人可靠性的信任。

Comments The paper has been accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06495 2026-06-18 cs.CR 版本更新 50%

Graphs Don't Stay Secret: Practical Subgraph Reconstruction Attacks on Defended Graph RAG

图并非保密:对防御图RAG的实用子图重构攻击

Minkyoo Song, Jaehan Kim, Myungchul Kang, Hanna Kim, Seungwon Shin, Sooel Son

专题命中 安全训练 :safety(abstract)

AI总结 提出GRASP攻击,通过多轮查询从防御的图RAG系统中重构子图,达到82.9 F1,并评估防御措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06756 2026-06-17 eess.SY cs.SY 版本更新 50%

Generative AI Enabled Robust Sensor Placement in Cyber-Physical Power Systems: A Graph Diffusion Approach

生成式AI赋能的信息物理电力系统鲁棒传感器布置:一种图扩散方法

Changyuan Zhao, Guangyuan Liu, Bin Xiang, Benoit Delinchant, Dong In Kim

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于图扩散的生成式AI框架,通过经验反馈图扩散算法优化传感器布置,同时提升物理层异常检测和网络层通信韧性,解决信息物理电力系统的NP-hard优化问题。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15459 2026-06-16 cs.RO 版本更新 50%

Neural Minimum-Distance Estimation for Collision-Aware Operation of Multi-Arm Laparoscopy Surgical Robots Through Learning-from-Simulation

基于仿真学习的多臂腹腔镜手术机器人碰撞感知操作的神经最小距离估计

Sarvin Ghiasi, Majid Roshanfar, Jake Barralet, Liane S. Feldman, Amir Hooshiar

机构 * Surgical Performance Enhancement and Robotics (SuPER) Centre, Department of Surgery(外科性能增强与机器人中心(SuPER)中心,外科部) The Wilfred and Joyce Posluns Centre for Image Guided Innovation & Therapeutic Intervention (PCIGITI)(威廉与乔伊斯·波斯伦中心(PCIGITI)影像引导创新与治疗干预中心) The Hospital for Sick Children (SickKids)(儿童医院(SickKids))

专题命中 安全训练 :safety(abstract)

AI总结 提出结合分析建模、实时仿真与深度残差神经网络的框架,用于多臂手术机器人最小距离估计与碰撞预警,模型在验证集上R²=0.940,RMSE=42.0 mm。

Journal ref Sensors 2026, 26(12), 3744

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05727 2026-06-11 cs.DC 版本更新 50%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 安全训练 :alignment(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15422 2026-06-09 cs.SE 版本更新 50%

A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods

生成式人工智能在自动驾驶系统测试场景生成方法中的应用综述

Ji Zhou, Yongqi Zhao, Yixian Hu, Hexuan Li, Zhengguo Gu, Nan Xu, Arno Eichberger

专题命中 安全训练 :safety(abstract)

AI总结 综述生成式AI在自动驾驶测试场景生成中的应用,分析31篇主要研究,提出包含多模态扩展、伦理检查表和ODD覆盖图的分类法,以解决标准化评估缺失等问题。

Comments 40 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17003 2026-06-08 math.OC cs.SY eess.SY 版本更新 50%

Constricting Tubes for Prescribed-Time Safe Control

为指定时间安全控制设计的约束管

Darshan Gadginmath, Ahmed Allibhoy, Fabio Pasqualetti

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种约束控制屏障函数框架,用于具有输入约束的控制仿射系统指定时间控制。通过构造一个随时间变化的安全管,从包含初始条件的放松集缩小到目标集,确保在用户指定的截止时间内恢复。框架通过单个仿射约束每时间步,实现可扩展性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏