arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2606.11546 2026-06-11 cs.CV 新提交 50%

VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio

VL-DINO: 利用CLIP视觉-语言知识进行开放词汇目标检测

Hao Zhang, Qinran Lin, Linqi Song, Yong Li

机构 * Chongqing University(重庆大学) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出VL-DINO,通过QPSC模块构建高质量正样本增强视觉-语言对齐,VSE模块蒸馏CLIP视觉知识,ORSA模块对齐区域特征与文本嵌入,在LVIS零样本检测上达到36.3/38.1 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10484 2026-06-10 cs.CR 新提交 50%

AgentCanary: A Security Evaluation Framework for Autonomous AI Agents in Real Executable Environments

AgentCanary:真实可执行环境中自主AI智能体的安全评估框架

Peiyang Li, Songping Wang, Yi Huang, Yanhua Shi, Chenhao Zhang, Qi Li, Yueming Lyu, Caifeng Shan, Fengting Li, Chao Feng, Chuanqun Zhu, Liang Chen

专题命中 安全评测 :safety(abstract)

AI总结 提出AgentCanary框架,通过正交风险分类、高保真执行环境和轨迹多维度评估,解决现有安全评估中风险覆盖碎片化、环境静态低保真及指标单一粗粒度的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10142 2026-06-10 cs.CV 新提交 50%

DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估

Nanshan Jia, Zhenyu Zhao, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) Roblox Corporation(Roblox公司)

专题命中 安全评测 :alignment(abstract)

AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。

Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24088 2026-06-10 cs.MA 版本更新 50%

CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems

CORRECT: 多智能体系统中基于知识迁移的浓缩错误识别

Yifan Yu, Moyan Li, Shaoyuan Xu, Jinmiao Fu, Xinhai Hou, Fan Lai, Bryan Wang

专题命中 安全评测 :alignment(abstract)

AI总结 提出CORRECT框架,利用在线缓存蒸馏错误模式,实现轻量级、免训练的错误定位,在多智能体系统中提升错误识别效率,并在七个应用上取得最高19.8%的步骤级错误定位提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09738 2026-06-09 cs.CV 新提交 50%

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents

HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言

Letian Li, Chao Shen, Shuzhao Xie, Chenghao Gu, ZhengXiao He, Yu Meng, Xin Yang, Wenyuan Jiang, Zhi Wang

机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) Nankai University(南开大学) University of Arizona(亚利桑那大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09332 2026-06-09 eess.SP 新提交 50%

Wearable Single-Lead ECG Detects Fine-Grained Structural Heart Disease Through Echo-Report Supervision

可穿戴单导联心电图通过超声报告监督检测细粒度结构性心脏病

Chenyang He, Qinghao Zhao, Shun Huang, Jun Li, Gongzheng Tang, Hao Zhang, Tong Liu, Zhengkai Xue, Jian Liu, Kangyin Chen, Cheng Ding, Shenda Hong

专题命中 安全评测 :alignment(abstract)

AI总结 提出AnyECG-Echo框架,利用单导联心电图与超声报告对比预训练,在外部队列中检测13种细粒度结构性心脏病亚型,实现高AUROC并具备双轴可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08738 2026-06-09 cs.NI cs.RO 新提交 50%

Systems-Level Planning and Coordination of Truck-Drone Collaborative Delivery Networks

卡车-无人机协同配送网络的系统级规划与协调

Didem Cicek, Burak Kantarci

机构 * School of Electrical Engineering and Computer Science at the University of Ottawa(渥太华大学电气工程与计算机科学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 针对城市最后一英里配送,提出分层规划与协调框架,通过任务编排与智能体同步,实现卡车-无人机协同配送,相比纯卡车模式,总配送时间减少42.4%,能耗降低44.2%。

Comments 6 pages, 4 figures, Accepted to 2026 IEEE HPSR on Network Architectures and Intelligence for Smart Mobility and Autonomous Systems (TRAVERSAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08170 2026-06-09 cs.RO 新提交 50%

Learning from Human Driving: A Human-in-the-Loop Online Behavior Cloning Framework for Autonomous Driving

从人类驾驶中学习:一种用于自动驾驶的人机协同在线行为克隆框架

Yuhong Shi, Jianyi Liu, Lihang Sun, Li Li, Xudong Dong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 提出人机协同在线行为克隆框架HiL-OBC,通过人类干预初始化策略、贝叶斯潜在行为建模和在线更新,结合大模型感知与人类驾驶智能,在CARLA基准上显著提升驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08126 2026-06-09 cs.CV 新提交 50%

One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

一石三鸟:面向多VLM选择、自适应与集成的自适应最优传输

Qiyu Xu, Zhanxuan Hu, Yu Duan, Yonghang Tai, Huafeng Li, Quanxue Gao, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Yunnan Normal University(云南师范大学) Xidian University(西安电子科技大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出无训练框架OSTB,通过自适应最优传输估计共识样本-类别结构,同时解决多VLM的模型选择、目标域自适应和预测集成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00793 2026-06-09 cs.CV 版本更新 50%

MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

MBench: 视频世界模型记忆能力的综合基准

Shengjun Zhang, Zhang Zhang, Simin Huang, Zhenyu Tang, Hanyang Wang, Chensheng Dai, Min Chen, Yifan Li, Yuxin Li, Yingjie Chen, Hao Liu, Chen Li, Jing Lyu, Yueqi Duan

机构 * Tsinghua University(清华大学) WeChat Vision, Tecent Inc.(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MBench基准,通过实体一致性、环境一致性和因果一致性三个核心维度及其12个子维度,系统评估视频世界模型的长期记忆能力,并揭示现有方法在长期状态保持上的关键局限。

Comments Project Page: https://peanutup.github.io/MBench-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24388 2026-06-09 cs.CV 版本更新 50%

Causal Transfer in Medical Image Analysis

医学图像分析中的因果迁移

Mohammed M. Abdelsamea, Daniel Tweneboah Anyimadu, Tasneem Selim, Saif Alzubi, Lei Zhang, Ahmed Karam Eldaly, Xujiong Ye

机构 * University of Waterloo(滑铁卢大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨了医学图像分析中因果迁移方法,整合因果推理与跨域表示学习,以解决领域偏移问题,提升临床AI的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09506 2026-06-09 cs.CE 50%

Beyond Knowledge to Agency: Evaluating Expertise, Autonomy, and Integrity in Finance with CNFinBench

超越知识到能动性:用CNFinBench评估金融领域的专业知识、自主性和完整性

Jinru Ding, Chao Ding, Yidong Jiang, Wenrao Pang, Boyi Xiao, Zhiqiang Liu, Jiayuan Chen, Yun Zhong, Tiantian Yuan, Junming Guan, Dawei Cheng, Jie Xu

专题命中 安全评测 :safety(abstract)

AI总结 提出CNFinBench基准,通过专业知识、自主性和完整性三维度评估LLM在金融领域的代理能力,并引入HICS指标量化多轮对抗攻击下的安全退化。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06968 2026-06-08 cs.CR 新提交 50%

HAVE: Host Active Verification Engine for Closing the Contextual Reality Gap in Security Digital Twins

HAVE:用于弥合安全数字孪生中上下文现实差距的主机主动验证引擎

Vincenzo Sammartino, Marco Pasquini

专题命中 安全评测 :safety(abstract)

AI总结 提出HAVE引擎,通过安全约束主机代理进行最大似然估计,测量经验妥协概率,利用Wilson区间置信权重和贝叶斯混合规则修正CVSS评分导致的上下文现实差距,实验显示在误报和漏报场景中分别降低38.2%和提升132.4%的到达概率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11890 2026-06-08 cs.SE 版本更新 50%

QUARE: Quality-Aware Requirements Analysis through Multi-Agent Dialectical Negotiation

QUARE:通过多智能体辩证协商进行质量感知的需求分析

Haowei Cheng, Milhan Kim, Foutse Khomh, Teeradaj Racharak, Nobukazu Yoshioka, Naoyasu Ubayashi, Hironori Washizaki

专题命中 安全评测 :safety(abstract)

AI总结 QUARE通过多智能体辩证协商解决需求质量分析中的多属性冲突,生成高质量需求规格,提升合规性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05708 2026-06-05 cs.CV 50%

Real-Time Threat Detection from Surveillance Cameras using Machine Learning

基于机器学习的监控摄像头实时威胁检测

Gajendra Mandal, J. P. Patra, Priyansh Mahant

专题命中 安全评测 :safety(abstract)

AI总结 提出基于YOLOv8的实时目标检测框架,利用自定义钝器数据集与公开枪支刀具数据集训练模型,实现监控场景下枪支、刀具和钝器的有效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05499 2026-06-05 cs.SE 50%

STMutants: A Mutation Testing Dataset for Structured Text Programs in Industrial Automation

STMutants:工业自动化中结构化文本程序的变异测试数据集

Md Humaun Kabir, Md Rakibul Islam, Helen H. Lou

专题命中 安全评测 :safety(abstract)

AI总结 针对IEC 61131-3结构化文本程序缺乏公开变异测试基准的问题,构建了包含108个一阶变异体的数据集STMutants,涵盖七类变异算子,并评估了三个大语言模型在测试套件生成和变异检测中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25956 2026-06-05 cs.CV 50%

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

RAPTOR+: 一种基于视觉的视觉-语言框架,用于提高自动化癌症转诊处理中的临床信任度和可审计性

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Adam Byfield, Lukman Akanbi, Muhammad Bilal

机构 * Birmingham City University(伯明翰城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University Hospitals Birmingham NHS Foundation Trust(伯明翰大学医院 NHS 基础信托) NHS England(英格兰国家卫生服务体系)

专题命中 安全评测 :safety(abstract)

AI总结 提出RAPTOR+多模态框架,通过微调视觉-语言模型实现端到端转诊理解,在结直肠癌转诊表单上显著提升提取准确性和证据定位能力。

Comments 12 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04792 2026-06-04 cs.CV 50%

A Pathology Foundation Model for Gastric Cancer with Real-World Validation

用于胃癌的病理基础模型及真实世界验证

Ling Liang, Jiabo Ma, Zhengyu Zhang, Fengtao Zhou, Yingxue Xu, Yihui Wang, Cheng Jin, Zhengrui Guo, On Ki Tang, Zhijian Cen, Zhen Wang, Qi Xie, Chengyu Lu, Chenglong Zhao, Feifei Wang, Yu Cai, Hongyi Wang, Jing Zhang, Yaping Ye, Shijun Sun, Shenglei Li, Yu Wang, Zhenhui Li, Ronald Cheong Kin Chan, Xiuming Zhang, Zhe Wang, Hao Chen, Li Liang

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国) Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(病理学系,南方医科大学南芳医院,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(病理学系,南方医科大学基础医学学院,广州,中国) Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong, Hong Kong SAR, China(解剖学与细胞病理学系,香港中文大学,香港特别行政区,中国) Pathology Artificial Intelligence Development and Assessment Laboratory, State Key Laboratory of Translational Oncology, The Chinese University of Hong Kong, Hong Kong SAR, China(病理人工智能发展与评估实验室,转化肿瘤学国家重点实验室,香港中文大学,香港特别行政区,中国)

专题命中 安全评测 :safety(abstract)

AI总结 提出胃癌专用基础模型GRACE,基于多中心HE染色全切片图像,在28项临床任务中优于通用PFM,并通过前瞻性验证和读者研究证实其辅助诊断效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04431 2026-06-04 cs.HC 50%

When Chatbots Accommodate: What AI Companions Optimize for in Vulnerable Conversations

当聊天机器人迁就:AI伴侣在脆弱对话中的优化目标

Minh Duc Chu, Yifan Wu, Zhiyi Chen, Angel Hsing-Chi Hwang, Luca Luceri

专题命中 安全评测 :safety(abstract)

AI总结 通过逆强化学习分析GPT-4.1、Character.AI和Replika在约4.8万轮真实对话中的响应策略,揭示AI伴侣在脆弱对话中优先提供建议、分散策略或持续提问,但均弱化纠正性反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04158 2026-06-04 cs.RO 50%

Multi-Agent Next-Best-View Optimization for Risk-Averse Planning

多智能体风险规避规划中的下一最佳视角优化

Amirhossein Mollaei Khass, Vivek Pandey, Guangyi Liu, Athanasios Cosse, Emrah Bayrak, Nader Motee

机构 * Department of Mechanical Engineering and Mechanics, Lehigh University(莱文大学机械工程与力学系) Amazon Robotics(亚马逊机器人)

专题命中 安全评测 :safety(abstract)

AI总结 提出一种分布式、风险感知的多智能体下一最佳视角框架,通过共识ADMM优化信息增益并建模碰撞风险,在降低通信开销的同时接近集中式方法的映射质量和轨迹安全性。

Comments 8 pages, 5 figures. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21094 2026-06-04 cs.CV 50%

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

T2AV-Compass:迈向文本到音频-视频生成的统一评估

Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jiahao Wang, Jialu Chen, Miao Deng, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 提出T2AV-Compass基准,通过分类学驱动的500个复杂提示和双层次评估框架(客观信号指标+主观MLLM评判),系统评估文本到音频-视频生成模型,发现现有模型在跨模态对齐和指令遵循方面显著不足。

Comments 41 pages, 13 figures, 12 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10277 2026-06-04 eess.SY cs.SY 50%

Autonomous Systems -- An Architectural Characterization

自主系统——一种架构特征

Joseph Sifakis

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种结合系统架构模型和智能体模型的通用计算模型,旨在解决自主系统设计中的核心问题,强调自主系统的功能性和适应性,而非特定技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03872 2026-06-03 eess.SY cs.SY 50%

NeuroSymbolic Robustness Analysis for Discrete Systems with Respect to Transition Deviations

针对转移偏差的离散系统神经符号鲁棒性分析

Shih-Jie Shih, Jonghan Lim, Ilya Kovalenko, Rômulo Meira-Góes

专题命中 安全评测 :safety(abstract)

AI总结 提出一种神经符号计算框架,利用大语言模型推断可行偏差转移集,再通过符号层计算离散鲁棒性保证,以解决传统方法可扩展性差和保守性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03417 2026-06-03 cs.CV 50%

A unified multi-task framework enables interpretable chest radiograph analysis

统一多任务框架实现可解释的胸部X光片分析

Lijian Xu, Ziyu Ni, Xinglong Liu, Xiaosong Wang, Hongsheng Li, Shaoting Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出IMT-CXR框架,通过统一Transformer架构模拟放射科医生诊断流程,实现疾病识别、属性表征和可追溯报告生成,在十个基准上表现优异,且临床评估中66%的AI报告达到或超越原始报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01624 2026-06-03 cs.CV cs.SE 50%

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

下一步测试什么:驾驶视觉语言模型中可解释的覆盖缺口发现

Abhishek Aich, Sparsh Garg, Vijay Kumar BG, Turgun Yusuf Kashgari, Manmohan Chandraker

专题命中 安全评测 :safety(abstract)

AI总结 提出 SliceScorer 和 SliceNav 方法,通过结合暴露先验和邻居失败先验的确定性评分规则,在驾驶视觉语言模型中有效发现高风险覆盖缺口,并支持可解释和可审计的验证流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30915 2026-06-03 cs.CV 50%

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent

DiTTo: 可扩展的排序感知全能图像修复智能体

Seungho Choi, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) David S. Hippocampus Department of Computer Science Cranberry-Lemon University(Cranberry-Lemon 大学 计算机科学系 Hippocampus 教授)

专题命中 安全评测 :alignment(abstract)

AI总结 提出DiTTo框架,通过模拟器高效构建最优修复轨迹数据集,并采用排序感知对齐实现修复专家的即插即用扩展,在多退化图像修复中达到最优性能。

Comments Please visit our project page at https://cmlab-korea.github.io/DiTTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
1007.2738 2026-06-03 math.OC cs.SY eess.SY 50%

Consensus Computation in Unreliable Networks: A System Theoretic Approach

不可靠网络中的共识计算:系统论方法

Fabio Pasqualetti, Antonio Bicchi, Francesco Bullo

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对线性共识网络中行为异常代理的检测与识别问题,采用未知输入系统理论框架,给出了可检测与可识别的条件、最坏情况界限及三种算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02258 2026-06-02 cs.CE 50%

Matter to Mechanism: A Benchmark for AI Co-Scientists in Materials and Battery Research

物质到机制:材料与电池研究中AI合作科学家的基准

Shashwat Sourav, Tanjin. He, Maria K. Y. Chan, Anubhav Jain, Tirthankar Ghosal

专题命中 安全评测 :alignment(abstract)

AI总结 提出Matter to Mechanism基准,通过结构化问题-假设推理任务评估AI合作科学家在材料科学(特别是电池研究)中的表现,并引入复合评分体系。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03384 2026-06-02 cs.CR cs.SD 50%

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

DECKER: 跨键盘提取与识别的域不变嵌入

Bikrant Bikram Pratap Maurya, Nitin Choudhury, Daksh Agarwal, Arun Balaji Buduru

机构 * IIIT-Delhi(印度德里理工学院) Guru Gobind Singh Indraprastha University(戈克辛格印度教大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对键盘声学侧信道攻击的跨键盘、跨用户和噪声环境泛化问题,提出包含四阶段域不变击键推理框架DECKER,并构建了多维度数据集HEAR,实验表明该方法在跨键盘和跨用户场景下显著提升击键识别性能。

Comments Accepted to AsiaCCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00782 2026-06-02 cs.CV 50%

FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection

FlowOVD: 学习生成式潜在流用于零样本开放词汇检测

Yao Wei, Andrea Cavallaro, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院) EPFL(瑞士联邦理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出FlowOVD,基于修正流的文本条件查询生成框架,通过连续潜在查询动态实现开放词汇检测,在COCO和LVIS上分别达到49.5 AP和31.5 AP,优于GroundingDINO。

详情

展开后加载摘要…

URL PDF HTML 收藏