arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3317 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3317 篇

2604.13801 2026-04-16 cs.IR 50%

DUET: Joint Exploration of User Item Profiles in Recommendation System

DUET:推荐系统中用户和物品轮廓的联合探索

Yue Chen, Yifei Sun, Lu Wang, Fangkai Yang, Pu Zhao, Minjie Hong, Yifei Dong, Minghua He, Nan Hu, Jianjin Zhang, Zhiwei Dai, Yuefeng Zhan, Weihao Han, Hao Sun, Qingwei Lin, Weiwei Deng, Feng Sun, Qi Zhang, Saravan Rajmohan, Dongmei Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出DUET,一种基于用户历史和物品证据的交互感知轮廓生成器,通过三阶段流程实现用户和物品轮廓的联合生成与优化,实验表明其在推荐任务中优于现有基线方法。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 50%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13245 2026-04-16 cs.RO cs.SY eess.SY 50%

Capability-Aware Heterogeneous Control Barrier Functions for Decentralized Multi-Robot Safe Navigation

具备能力的异构控制屏障函数用于去中心化多机器人安全导航

Joonkyung Kim, Yanze Zhang, Wenhao Luo, Yiwei Lyu

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CA-HCBF框架,通过统一动力学模型和能力度量,实现异构机器人团队的安全一致性和能力感知协调,提升安全性和任务效率。

Comments 8 pages, 3 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13098 2026-04-16 cs.MA cs.CV cs.RO 50%

C$^2$T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination

C$^2$T:基于图像描述与大语言模型对齐的常识奖励学习用于交通-车辆协调

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li

机构 * The State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学) Computer and Information Science, University of Macau(澳门大学计算机与信息科学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出C2T框架,通过从交通-车辆动态中学习常识协调模型,结合大语言模型的常识知识,提升交通协调系统的效率、安全性和舒适性。

Comments Accepted to CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 50%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 安全训练 :alignment(abstract)

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12639 2026-04-14 cs.CV 50%

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

RoboStereo: 双塔4D具身世界模型用于统一策略优化

Ruicheng Zhang, Guangyu Chen, Zunnan Xu, Zihao Liu, Zhizhou Zhong, Mingyang Zhang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot HKUST(香港科技大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RoboStereo,通过双塔4D具身世界模型实现统一策略优化,解决几何幻觉和缺乏统一优化框架的问题,实验显示在细粒度操作任务中平均相对提升超过97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01241 2026-04-14 cs.CR 50%

Peering Behind the Shield: Guardrail Identification in Large Language Models

窥视屏障之后:大型语言模型中的屏障识别

Ziqing Yang, Yixin Wu, Rui Wen, Michael Backes, Yang Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AP-Test方法,通过对抗性提示检测黑盒AI代理中的屏障,解决安全对齐LLM和缺乏决策策略的问题,实验显示其在多种场景下实现完美分类准确率。

Comments To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 50%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07299 2026-04-14 cs.NE cs.SY eess.SY 50%

Optimizing Chlorination in Water Distribution Systems via Surrogate-assisted Neuroevolution

通过代理辅助神经进化优化水分配系统中的氯化

Rivaaj Monsia, Daniel Young, Olivier Francon, Risto Miikkulainen

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于神经进化、多目标优化和代理建模的框架,用于优化水分配系统中氯气的投放策略,通过进化神经网络实现氯气在关键节点的投放,以减少总投放量并保持浓度均匀,优于传统强化学习方法。

Comments 13 pages, 9 figures, GECCO '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09493 2026-04-13 cs.NI 50%

Policy-Aware Edge LLM-RAG Framework for Internet of Battlefield Things Mission Orchestration

面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架,结合轻量检索模块与本地LLM进行任务规划,并通过JudgeLLM验证用户指令以提高可靠性。

Comments 10 pages, 5 figures, Accepted at AIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 50%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24499 2026-04-10 cs.CV 50%

Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning

Reason-SVG:通过强化学习增强向量图形生成的结构化推理

Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(abstract)

AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。

Comments Accepted by CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06972 2026-04-09 cs.RO cs.MA 50%

Differentiable Environment-Trajectory Co-Optimization for Safe Multi-Agent Navigation

可微环境-轨迹联合优化用于安全多智能体导航

Zhan Gao, Gabriele Fadini, Stelian Coros, Amanda Prorok

机构 * University of Cambridge(剑桥大学) Zurich University of Applied Sciences, ZHAW(苏黎世应用科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种可微环境-轨迹联合优化方法,通过双层优化问题提升多智能体导航的安全性和效率,实验验证了其在物流和交通场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06873 2026-04-09 cs.MA 50%

Generating Local Shields for Decentralised Partially Observable Markov Decision Processes

为去中心化部分可观测马尔可夫决策过程生成局部护盾

Haoran Yang, Nobuko Yoshida

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种护盾过程代数,用于在无通信的Dec-POMDP中指定安全全局行为,通过编译过程自动机和全局Mealy机,生成局部Mealy机以减少碰撞。

Comments In Proceedings PLACES 2026, arXiv:2604.05737

Journal ref EPTCS 444, 2026, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06804 2026-04-09 cs.DB 50%

LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO

LASER: 一种数据驱动的低成本高效SQL重写方法基于SQL-GRPO

Jiahui Li, Tongwang Wu, Yuren Mao, Rong Kang, Tieying Zhang, Yunjun Gao

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出LASER,一种数据驱动的SQL重写方法,通过构建SQL-MCTS大规模语料库和SQL-GRPO专用对齐策略,提升小模型在SQL优化中的执行效率和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05448 2026-04-08 cs.HC 50%

Foreign Domestic Workers' Perspectives on an LLM-Based Emotional Support tool for Caregiving Burden

外国家庭佣工对基于大语言模型的情感支持工具在照护负担中的看法

Shin Shoon Nicholas Teng, Kenny Tsu Wei Choo

专题命中 安全训练 :safety(abstract)

AI总结 研究探讨了新加坡外国家庭佣工使用基于大语言模型的聊天机器人作为日常非临床情感支持工具的体验,发现其在心理安全、语言无障碍和多功能资源方面的设计启示。

Comments 5 pages, Accepted at CHI 2026 Posters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04479 2026-04-08 cs.HC 50%

How can LLMs Support Policy Researchers? Evaluating an LLM-Assisted Workflow for Large-Scale Unstructured Data

大型语言模型如何支持政策研究?评估一个用于大规模非结构化数据的LLM辅助工作流

Yuhan Liu, Shuyao Zhou, Jakob Kaiser, Ella Colby, Jennifer Okwara, Maggie Wang, Varun Nagaraj Rao, Andrés Monroy-Hernández

专题命中 安全训练 :alignment(abstract)

AI总结 本文评估了LLM辅助工作流在处理大规模非结构化数据中的应用,探讨了其在政策研究中的可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04499 2026-04-07 eess.SY cs.SY math.OC 50%

Distributed Covariance Steering via Non-Convex ADMM for Large-Scale Multi-Agent Systems

通过非凸ADMM实现分布式协方差控制用于大规模多智能体系统

Augustinos D. Saravanos, Isin M. Balci, Arshiya Taj Abdul, Efstathios Bakolas, Evangelos A. Theodorou

专题命中 安全训练 :safety(abstract)

AI总结 本文研究在概率碰撞避免约束下,通过非凸ADMM实现分布式协方差控制,提出三种方法在保守性和计算效率间平衡,验证了算法的收敛性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15858 2026-04-07 cs.PL cs.SE 50%

Search-Based Multi-Trajectory Refinement for Safe C-to-Rust Translation with Large Language Models

基于搜索的多轨迹优化用于大型语言模型驱动的安全C到Rust转换

HoHyun Sim, Hyeonjoong Cho, Yeonghyeon Go, Sadegh AlMahdi Kazemi Zarkouei, Zhoulai Fu, Ali Shokri, Binoy Ravindran

专题命中 安全训练 :safety(abstract)

AI总结 本文提出LAC2R方法,利用MCTS系统探索多轨迹优化,提升C到Rust转换的安全性和准确性,实验表明其在大规模和小规模基准测试中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03995 2026-04-07 cs.CV cs.SD 50%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02265 2026-04-03 cs.CV 50%

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

模块化能量引导用于基础模型的安全文本到图像生成

Yaoteng Tan, Zikui Cai, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) University of Maryland(马里兰大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于梯度反馈的引导框架,利用预训练基础模型的潜在估计实现安全可控的文本到图像生成,适用于扩散和流匹配模型,提升生成质量与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27051 2026-04-02 eess.SY cs.SY 50%

Proprioceptive feedback paradigm for safe and resilient motion control

本体反馈范式用于安全且稳健的运动控制

Mrdjan Jankovic

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种类本体反馈机制用于运动控制系统,通过快速反馈环路补偿意外响应,分析了可管理的损伤程度,并提供了全MPF和分MPF两种方案。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22690 2026-04-02 cs.CV 50%

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

专题命中 安全训练 :alignment(abstract)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01228 2026-04-01 cs.CV 50%

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

面向政策适应的图像防护:基准与方法

Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tencent(腾讯) Peking University(北京大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出SafeGuard-VL方法,通过强化学习与可验证奖励提升图像防护的政策适应能力,并通过SafeEditBench基准测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 50%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27583 2026-03-31 cs.RO cs.SY eess.SY 50%

LLM-Enabled Low-Altitude UAV Natural Language Navigation via Signal Temporal Logic Specification Translation and Repair

基于大语言模型的低空无人机自然语言导航:通过信号时序逻辑规范翻译与修复

Yuqi Ping, Huahao Ding, Tianhao Liang, Longyu Zhou, Guangyu Lei, Xinglin Chen, Junwei Wu, Jieyu Zhou, Tingting Zhang

机构 * Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing, Harbin Institute of Technology, Shenzhen(广东省空天网络与智能感知重点实验室,哈尔滨工业大学(深圳)) Peng Cheng Laboratory (PCL), Shenzhen(鹏城实验室) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系) School of Computer Science and Engineering, Central South University, Changsha(中南大学计算机科学与工程学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种统一框架,通过将自然语言指令转换为信号时序逻辑规范并利用混合整数线性规划生成轨迹,提升低空无人机在复杂环境中的安全导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10300 2026-03-30 cs.CV 50%

From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification

从模仿到直觉:用于开放实例视频分类的内在推理

Ke Zhang, Xiangchen Zhao, Yunjie Tian, Jiayu Zheng, Vishal M. Patel, Di Fu

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance Inc(字节跳动公司)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出DeepIntuit框架,通过冷启动监督对齐和GRPO优化,将视频分类从模仿转向直觉推理,提升开放实例分类性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24931 2026-03-27 cs.RO 50%

COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems

COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统

Yifeng Zhang, Jieming Chen, Tingguang Zhou, Tanishq Duhan, Jianghong Dong, Yuhong Cao, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 50%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract)

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23880 2026-03-26 cs.SI 50%

ProcureGym: A Multi-Agent Markov Game Framework for Modeling National Volume-based Drug Procurement

ProcureGym: 一个用于建模国家基于体积的药品采购的多智能体马尔可夫游戏框架

Jia Wang, Qian Xu, Xuanwen Ding, Zhuangqi Li, Chao He, Bao Liu, Zhongyu Wei

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出ProcureGym,通过真实数据模拟中国基于体积的药品采购,评估RL、LLM等智能体模型,发现RL在收益和利润上表现更优,揭示最大有效报价和采购量对战略结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏