arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2505.21676 2026-03-18 cs.RO cs.NI 50%

Real-World Deployment of Cloud-based Autonomous Mobility Systems for Outdoor and Indoor Environments

云原生自主移动系统在户外和室内环境中的实际部署

Yufeng Yang, Minghao Ning, Keqi Shu, Aladdin Saleh, Ehsan Hashemi, Amir Khajepour

机构 * Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系) Technology Partnerships and Innovations, Rogers Communications, Canada Inc.(罗杰斯通讯加拿大有限公司技术伙伴关系与创新部) Mechanical Engineering Department, University of Alberta(阿尔伯塔大学机械工程系)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出云原生自主移动框架,通过基础设施智能传感与云计算协调提升自主操作能力,实验证明在城市环岛和医院类室内环境中的感知鲁棒性和安全性提升。

Comments This paper has been submitted to IEEE Robotics and Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15691 2026-03-18 cs.SE 50%

VibeContract: The Missing Quality Assurance Piece in Vibe Coding

VibeContract: vibe编码中缺失的质量保证环节

Song Wang

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出VibeContract框架,通过将高层次自然语言意图分解为任务序列并生成任务级合同,以提升LLM生成代码的正确性、鲁棒性和可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14908 2026-03-17 cs.RO cs.CV 50%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14888 2026-03-17 cond-mat.other physics.comp-ph physics.ed-ph 50%

Demonstration of AI-Assisted Scientific Workflow on Canonical Benchmarks

在经典基准上展示AI辅助的科学工作流

Kin Hung Fung

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文通过经典基准问题展示AI辅助科学工作流,涵盖解析和数值方法,验证了AI在推导、实现、验证和论文准备中的应用价值。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14393 2026-03-17 cs.RO 50%

From Scanning Guidelines to Action: A Robotic Ultrasound Agent with LLM-Based Reasoning

从扫描指南到行动:基于LLM的机器人超声代理

Yuan Bi, Yiping Zhou, Pei Liu, Feng Li, Zhongliang Jiang, Nassir Navab

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种基于LLM的自主机器人超声扫描框架,通过动态调用软件工具实现自主扫描,提升适应性和透明度。

Comments Code: https://github.com/yuan-12138/RUSSAgent; Video: https://youtu.be/pfMOc4e2IGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 50%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 安全评测 :safety(abstract)

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14236 2026-03-17 cs.RO cs.DC 50%

AeroGen: Agentic Drone Autonomy through Single-Shot Structured Prompting & Drone SDK

AeroGen:通过单次结构提示与无人机SDK实现代理无人机自主性

Kautuk Astu, Yogesh Simmhan

专题命中 安全评测 :safety(abstract)

AI总结 本文提出AeroGen框架,通过结构化提示和AeroDaaS SDK实现无人机自主控制程序的可靠生成,验证了其在多种环境下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 50%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02384 2026-03-17 cs.CR cs.CV 50%

Secure and Robust Watermarking for AI-generated Images: A Comprehensive Survey

面向AI生成图像的安全可靠水印技术:全面综述

Jie Cao, Qi Li, Zelin Zhang, Jianbing Ni, Rongxing Lu

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了AI生成图像水印技术,从系统形式化、方法比较、评估指标、安全漏洞及未来挑战等方面系统分析,为研究者提供全面理解以推动安全可信的AI生成内容发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13717 2026-03-17 cs.HC 50%

"It Became My Buddy, But I'm Not Afraid to Disagree": A Multi-Session Study of UX Evaluators Collaborating with Conversational AI Assistants

它成了我的伙伴,但我并不害怕反对:对UX评估者与对话式AI助手多会话研究

Emily Kuang, Ehsan Jahangirzadeh Soure, Luyao Shen, Nitesh Goyal, Mingming Fan, Kristen Shinohara

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨了AI专家形象如何影响评估者分析策略和信任随时间变化,发现评估者在初期表现出新颖效应,随后信任下降但逐渐恢复,效率提升源于从双轮检查到单轮检查的转变,最终评估者认为经验型AI更高效、可信和全面。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13151 2026-03-16 cs.CR 50%

Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents

为OpenClaw设计的可辩护性设计:保障自主工具调用代理的安全性

Zongwei Li, Wenkai Li, Xiaoqi Li

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种可辩护性设计框架,旨在通过风险分类、安全工程原则和研究议程,提升自主代理的安全性,推动系统化防御工程和稳健部署实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12657 2026-03-16 cs.CV 50%

VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors

VFM-Recon:通过尺度对齐基础先验解锁跨域场景级神经重建

Yuhang Ming, Tingkang Xi, Xingrui Yang, Lixin Yang, Yong Peng, Cewu Lu, Wanzeng Kong

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) CARDC(中国电子科技研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出VFM-Recon,通过引入轻量级尺度对齐阶段和任务特定适配器,解决跨域场景级神经重建中的尺度一致性问题,实现跨域鲁棒性与重建性能的提升。

Comments 19 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12624 2026-03-16 cs.CV eess.IV 50%

Prompt-Driven Lightweight Foundation Model for Instance Segmentation-Based Fault Detection in Freight Trains

基于提示的轻量级基础模型用于基于实例分割的货运列车故障检测

Guodong Sun, Qihang Liang, Xingyu Pan, Moyun Liu, Yang Zhang

机构 * School of Mechanical Engineering, Hubei University of Technology(湖北工业大学机械工程学院) Hubei Key Laboratory of Modern Manufacturing Quality Engineering, Hubei University of Technology(湖北工业大学现代制造质量工程重点实验室) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种轻量级自提示实例分割框架,用于货运列车故障检测,通过自提示生成模块实现基础模型到领域任务的知识迁移,并采用轻量级视觉Transformer backbone,实现低计算成本的高效部署。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05872 2026-03-16 cs.CR 50%

Evolving Deception: When Agents Evolve, Deception Wins

进化欺骗:当代理进化时,欺骗获胜

Zonghao Ying, Haowen Dai, Tianyuan Zhang, Yisong Xiao, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV 50%

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

专题命中 安全评测 :alignment(abstract)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV 50%

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV 50%

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

专题命中 安全评测 :alignment(abstract)

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11968 2026-03-13 hep-ph hep-ex hep-th quant-ph 50%

From vacuum amplitudes to qubits

从真空幅值到量子比特

Germán Rodrigo

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了利用对撞机物理进行量子模拟的可能性,重点介绍多环真空幅值中的因果结构识别及高维函数积分与采样技术,旨在实现高阶量子事件生成器。

Comments Presented at 17th International Symposium on Radiative Corrections: Applications of Quantum Field Theory to Phenomenology (RADCOR2025), 5-10 October 2025, Puri, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11853 2026-03-13 cs.CR 50%

OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents

OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理

Frank Li

专题命中 安全评测 :prompt injection(abstract)

AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。

Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV 50%

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

专题命中 安全评测 :alignment(abstract)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10365 2026-03-13 cs.CV 50%

Geometric Autoencoder for Diffusion Models

几何自编码器用于扩散模型

Hangyu Liu, Jianyong Wang, Yutao Sun

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出几何自编码器GAE,通过优化低维语义监督目标和潜在规范化,提升扩散模型在生成质量、压缩与稳健重建之间的平衡,实现更高效的高分辨率视觉生成。

Comments Code and models are publicly available at https://github.com/sii-research/GAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 50%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract)

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10940 2026-03-12 cs.SE cs.RO 50%

STADA: Specification-based Testing for Autonomous Driving Agents

STADA:基于规范的自动驾驶代理测试

Joy Saha, Trey Woodlief, Sebastian Elbaum, Matthew B. Dwyer

专题命中 安全评测 :safety(abstract)

AI总结 STADA是一种基于规范的自动驾驶代理测试生成框架,通过形式规范生成多样化的测试场景,提高测试覆盖率并减少模拟次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV 50%

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

专题命中 安全评测 :safety(abstract)

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09497 2026-03-11 cs.SE 50%

EmbC-Test: How to Speed Up Embedded Software Testing Using LLMs and RAG

EmbC-Test: 如何利用LLMs和RAG加速嵌入式软件测试

Maximilian Harnot, Sebastian Komarnicki, Michal Polok, Timo Oksanen

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出利用LLMs和RAG技术,通过生成自动测试用例,显著提高嵌入式软件测试效率,节省66%的测试时间并每小时生成270个测试用例。

Journal ref Technical University of Munich. 2026. ISBN 978-3-911430-12-8. https://mediatum.ub.tum.de/1846559

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18315 2026-03-11 cs.NI 50%

CovertComBench: A First Domain-Specific Testbed for LLMs in Wireless Covert Communication

CovertComBench: 一个用于无线隐蔽通信中LLM的首个领域特定测试平台

Zhaozhi Liu, Jiaxin Chen, Yuanai Xie, Yuna Jiang, Minrui Xu, Xiao Zhang, Pan Lai, Zan Zhou

专题命中 安全评测 :trustworthy(abstract)

AI总结 CovertComBench是首个用于评估LLM在无线隐蔽通信中安全约束优化能力的领域特定测试平台,揭示了LLM在高阶数学推导上的不足,强调需通过外部工具增强构建可信无线AI系统。

Comments 6 pages, corrected a typo: "DeepSeek-R1:70B" was previously incorrectly written as "DeepSeek-V3.2:70B"

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08008 2026-03-11 cs.CV 50%

A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects

关于Wi-Fi感知通用性的综述:分类、技术、数据集与未来研究前景

Fei Wang, Tingting Zhang, Wei Xi, Han Ding, Ge Wang, Di Zhang, Yuanhao Cui, Fan Liu, Jinsong Han, Jie Xu, Tony Xiao Han

机构 * School of Software Engineering and the State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(软件工程学院和人机混合增强智能国家重点实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Information and Communication Engineering,Beijing University of Posts and Telecommunications(信息与通信工程,北京邮电大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文综述了Wi-Fi感知通用性研究,涵盖技术分类、数据集及未来方向,旨在提升系统在不同环境下的适应能力。

Comments Accepted for publication in IEEE Communications Surveys & Tutorials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09012 2026-03-11 cs.HC 50%

"Who wants to be nagged by AI?": Investigating the Effects of Agreeableness on Older Adults' Perception of LLM-Based Voice Assistants' Explanations

谁想被AI nag?:探究 agreeableness 对老年人感知基于LLM的语音助手解释的影响

Niharika Mathur, Hasibur Rahman, Smit Desai

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨了agreeableness对老年人感知基于LLM的语音助手解释的影响,发现高 agreeableness 助手在日常场景中更受信任,但在紧急情况下清晰度更重要,且可接受的老年人更严厉惩罚低 agreeableness 助手。

Comments To be published as a poster extended abstract at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08744 2026-03-11 cs.DC cs.SE 50%

Extension of ACETONE C code generator for multi-core architectures

ACETONE C代码生成器在多核架构上的扩展

Yanis Aït-Aïssa, Thomas Carle, Sergei Chichin, Benjamin Lesage, Claire Pagetti

专题命中 安全评测 :safety(abstract)

AI总结 本文提出通过形式化定义处理器分配问题,扩展ACETONE以生成并行代码,并评估框架各层的最坏执行时间。

Journal ref 13th European Congress of Embedded Real Time Systems (ERTS), Feb 2026, Toulouse, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03733 2026-03-11 cs.CV 50%

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

RegionReasoner: 基于区域的多轮视觉推理

Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Anhui University(安徽大学) Westlake University(西湖大学)

专题命中 安全评测 :alignment(abstract)

AI总结 RegionReasoner通过强化学习框架,结合接地保真度和全局-局部语义对齐,提升多轮视觉推理的准确性和一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏