arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2604.12411 2026-04-15 cs.CV 78%

DeferredSeg: A Multi-Expert Deferral Framework for Trustworthy Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments 27 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 78%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08089 2026-04-10 cs.SE 78%

GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair

GALA: 多模态图对齐用于自动化程序修复中的缺陷定位

Zhuoyao Liu, Zhengran Zeng, Shu-Dong Huang, Yang Liu, Shikun Zhang, Wei Ye

专题命中 安全评测 :alignment(title,abstract)

AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。

Comments Code available at: https://github.com/lzyyyyy666/GALA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04772 2026-04-07 math.OC cs.SY eess.SY 78%

Collaborative Altruistic Safety in Coupled Multi-Agent Systems

耦合多智能体系统中的协作利他安全

Brooks A. Butler, Xiao Tan, Aaron D. Ames, Magnus Egerstedt

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出一种基于协作控制屏障函数的框架,通过协作控制确保动态耦合多智能体系统的安全性,利用哈密顿规则定义利他安全条件,提升系统整体安全性和鲁棒性。

Comments This work is to appear at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 78%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03341 2026-04-07 stat.AP physics.ao-ph stat.ML 78%

Generative Unsupervised Downscaling of Climate Models via Domain Alignment: Application to Wind Fields

通过域对齐生成无监督降尺度:应用于风场

Julie Keisler, Boutheina Oueslati, Anastase Charantonis, Yannig Goude, Claire Monteleoni

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出基于域对齐的生成模型,用于多变量风场降尺度与偏差校正,提升空间一致性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 78%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23304 2026-03-25 cs.CR 78%

Security Barriers to Trustworthy AI-Driven Cyber Threat Intelligence in Finance: Evidence from Practitioners

可信AI驱动的金融网络安全威胁情报中的安全障碍:来自实践者的证据

Emir Karaosman, Advije Rizvani, Irdin Pekaric

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 研究探讨金融机构在使用AI驱动的威胁情报时面临的安全障碍,结合文献综述、访谈和调查,识别出四个阻碍可信AI部署的社会技术失败模式,并提出三种安全操作保障措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23814 2026-03-24 cs.CR 78%

Beyond the TESSERACT:Trustworthy Dataset Curation for Sound Evaluations of Android Malware Classifiers

超越TESSERACT:为Android恶意软件分类器提供可信的数据集编纂

Theo Chow, Mario D'Onghia, Lorenz Linhardt, Zeliang Kan, Daniel Arp, Lorenzo Cavallaro, Fabio Pierazzi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文探讨了Android恶意软件分类器评估中数据集编纂的重要性,识别了五个影响性能差异的新因素,提出了可信数据集编纂的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 78%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 78%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 78%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 78%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15655 2026-03-18 cs.LG cs.AI cs.CL cs.IT cs.MA math.IT 78%

Beyond Reward Suppression: Reshaping Steganographic Communication Protocols in MARL via Dynamic Representational Circuit Breaking

超越奖励压制:通过动态表示电路断开重塑MARL中的隐写通信协议

Liu Hung Ming

机构 * PARRAWA AI(PARRAWA人工智能)

专题命中 安全评测 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态表示电路断开机制,用于检测MARL中的隐写协作,通过统计对象转换和动态干预提升观测准确性并降低波动性。

Comments 38 pages, includes 5 figures and 8 tables, preliminary version, AI safety / multi-agent reinforcement learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20744 2026-03-12 cs.SE 78%

From Law to Gherkin: A Human-Centred Quasi-Experiment on the Quality of LLM-Generated Behavioural Specifications from Food-Safety Regulations

从法律到Gherkin:一项以人类为中心的准实验,探讨LLM生成的行为规范质量

Shabnam Hassani, Mehrdad Sabetzadeh, Daniel Amyot

专题命中 安全评测 :safety(title,abstract)

AI总结 本文通过准实验评估LLMs从法律文本生成Gherkin规范的能力,发现其在相关性和清晰性方面表现良好,但需人类监督以纠正遗漏和幻觉。

Comments This article has been accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07134 2026-03-10 cs.HC 78%

More Than 1v1: Human-AI Alignment in Early Developmental Communities with Multimodal LLMs

多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。

Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05936 2026-03-09 cs.CV 78%

OD-RASE: Ontology-Driven Risk Assessment and Safety Enhancement for Autonomous Driving

基于本体的风险评估与安全增强:面向自动驾驶

Kota Shimomura, Masaki Nambata, Atsuya Ishikawa, Ryota Mimura, Takayuki Kawabuchi, Takayoshi Yamashita, Koki Inoue

机构 * Chubu University(楚鸟大学) Elith Inc.(Elith公司) Honda R&D Co., Ltd.(本田研发公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 OD-RASE通过本体驱动的数据过滤和视觉语言模型生成,提升自动驾驶系统对事故诱因道路结构的预测和改进能力,增强交通环境的安全性。

Comments Accepted ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22773 2026-03-09 cs.SE 78%

A Structured Approach to Safety Case Construction for AI Systems

面向AI系统的安全案例构建的结构化方法

Sung Une Lee, Liming Zhu, Md Shamsujjoha, Liming Dong, Qinghua Lu, Jieshan Chen, Lionel Briand

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。

Comments 45 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05255 2026-03-06 cs.CV 78%

CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception

CATNet:用于协作感知的协同对齐与变换网络

Gong Chen, Chaokun Zhang, Tao Tang, Pengcheng Lv, Feng Li, Xin Xie

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学) School of Cybersecurity, Tianjin University(网络安全学院,天津大学) School of Future Technology, Tianjin University(未来技术学院,天津大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 CATNet通过时空同步、小波去噪和自适应选择器提升多代理协作感知的鲁棒性和适应性。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03978 2026-03-05 cs.RO cs.GR 78%

Map-Agnostic And Interactive Safety-Critical Scenario Generation via Multi-Objective Tree Search

基于多目标树搜索的无地图交互式安全关键场景生成

Wenyun Li, Zejian Deng, Chen Sun

机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出一种基于多目标树搜索的无地图交互式安全关键场景生成方法,通过统一评估函数平衡探索与风险,生成真实且多样化的碰撞事件以提升自动驾驶系统的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03811 2026-03-05 cs.SD cs.MM eess.AS 78%

Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement

鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化

Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) AI Center, OPPO, China(OPPO人工智能中心) Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出AVUR-LLM,通过稀疏模态对齐和视觉单元引导细化,提升音频视觉语音识别的鲁棒性,在LRS3数据集上取得显著性能提升。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03126 2026-03-04 cs.DL cs.DB cs.IR cs.SI 78%

The Science Data Lake: A Unified Open Infrastructure Integrating 293 Million Papers Across Eight Scholarly Sources with Embedding-Based Ontology Alignment

科学数据湖:整合29300万篇论文的统一开放基础设施

Jonas Wilinski

专题命中 安全评测 :alignment(title,abstract)

AI总结 科学数据湖通过整合29300万篇论文,利用嵌入本体对齐技术实现跨来源数据统一,提升学术数据整合与分析效率。

Comments 18 pages, 8 figures, 7 tables. Dataset DOI: 10.57967/hf/7850. Code: https://github.com/J0nasW/science-datalake

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01022 2026-03-03 cs.CE 78%

GeoMCP: A Trustworthy Framework for AI-Assisted Analytical Geotechnical Engineering

GeoMCP:一种可信的AI辅助分析土木工程框架

Yared W. Bekele

专题命中 安全评测 :trustworthy(title);safety(abstract)

AI总结 GeoMCP通过将工程方法表示为结构化数据,构建了一个可信的AI辅助分析土木工程框架,确保计算透明性和安全性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 78%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21595 2026-02-26 cs.RO 78%

SPOC: Safety-Aware Planning Under Partial Observability And Physical Constraints

SPOC:在部分可观测性和物理约束下安全意识的规划

Hyungmin Kim, Hobeom Jeon, Dohyung Kim, Minsu Jang, Jeahong Kim

机构 * 1 ETRI School, University of Science Technology, South Korean 2 Social Robotics Laboratory, Electronics

专题命中 安全评测 :safety(title,abstract)

AI总结 SPOC是一个用于评估安全意识具身任务规划的基准测试,通过整合部分可观测性、物理约束和逐步规划,解决现实环境中安全与可行性评估的问题。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01856 2026-02-25 eess.SY cs.SY 78%

Hierarchical Multi-Agent MCTS for Safety-Critical Coordination in Mixed-Autonomy Roundabouts

分层多智能体MCTS用于混合自主性环形路口的安全协调

Zhihao Lin, Jianglin Lan, Shuo Liu, Zhen Tian, Dezong Zhao, Chongfeng Wei

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种分层多智能体MCTS框架,用于混合自主性环形路口的安全协调,通过车道特定不确定性模型和安全意识修剪,有效降低轨迹偏移和PET违规率。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 78%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO 78%

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 78%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 安全评测 :safety(title,abstract)

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11717 2026-02-12 cs.RO cs.SY eess.SY 78%

Safety with Agency: Human-Centered Safety Filter with Application to AI-Assisted Motorsports

安全与代理:以人为中心的安全过滤器及其在AI辅助赛车中的应用

Donggeon David Oh, Justin Lidard, Haimin Hu, Himani Sinhmar, Elle Lazarski, Deepak Gopinath, Emily S. Sumner, Jonathan A. DeCastro, Guy Rosman, Naomi Ehrich Leonard, Jaime Fernández Fisac

机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Department of Mechanical and Aerospace Engineering, Princeton University(普林斯顿大学机械与航空航天工程系) Toyota Research Institute(丰田研究院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种以人为中心的安全过滤器,通过神经安全价值函数和状态-动作控制障碍函数,提升AI辅助赛车中的安全性和用户体验。

Comments Accepted to Robotics: Science and Systems (R:SS) 2025, 22 pages, 16 figures, 7 tables Updates for v4: typos in Appendix Subsection A revised

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏