arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

至 收录 11868
2605.09768 2026-06-24 cs.MA

SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

SAGE: 可扩展的代理基于地面评估用于作物疾病诊断

Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen, Dinakaran Elango, Shivani Chiranjeevi, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Arti Singh, Soumik Sarkar

AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。

Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

URL PDF HTML 收藏
2403.03739 2026-06-24 cs.LG cs.AI

A&B BNN: Add&Bit-Operation-Only Hardware-Friendly Binary Neural Network

A&B BNN:仅加法与位运算的硬件友好二进制神经网络

Ruichen Ma, Guanchao Qiao, Yian Liu, Liwei Meng, Ning Ning, Yang Liu, Shaogang Hu

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出A&B BNN,通过移除传统二进制神经网络中的乘法操作并替换为位运算,引入mask层和量化RPReLU结构,提升了硬件友好性,在CIFAR-10、CIFAR-100和ImageNet数据集上达到92.30%、69.35%和66.89%的准确率。

Comments CVPR 2024 Accepted

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024, pp. 5704-5713

URL PDF HTML 收藏
2606.22959 2026-06-23 cs.AI cs.CV 新提交

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production

VAE设计对基于扩散的手语生成中潜在姿态表示的影响

Guilhem Fauré, Mostafa Sadeghi, Sam Bigeard, Slim Ouni

机构 * CNRS(国家科学研究中心) Inria(法国国家信息与自动化技术研究所) LORIA(洛林信息与自动化研究所)

AI总结 研究变分自编码器(VAE)架构和训练目标设计如何影响潜在空间结构,进而影响基于潜在扩散模型的手语生成性能,发现潜在空间特性比重建精度更能解释生成性能差异。

Journal ref GenSign Generative AI for Sign Language CVPR 2026 Workshop, Jun 2026, Denver (Colorado, USA), France. pp. 10631-10640

URL PDF HTML 收藏
2606.22363 2026-06-23 cs.AI cs.LG cs.RO 新提交

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

基于世界模型的视频生成中物理一致性的无参考评估

Yun Oh, Sukmin Yun

机构 * Hanyang University ERICA(汉阳大学ERICA校区)

AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。

Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

URL PDF HTML 收藏
2606.21838 2026-06-23 cs.CV cs.LG 新提交

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

超越平面标签:面向层次细粒度视觉分类的层级限制对比学习

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Neuromatch Boston University(波士顿大学)

AI总结 针对多模态对比学习在层次标签空间中预测不一致的问题,提出层级限制对比学习,仅在同一层级内进行对比,并采用组平衡设计,显著提升层次一致性和分类精度。

Comments Accepted to CVPR 2026 FGVC Workshop

URL PDF HTML 收藏
2606.21753 2026-06-23 cs.GR cs.AI cs.CV 新提交

Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats

基于3D高斯散点的场景级异构物理仿真

Xiaoyang Liu, Shangzhe Wu, Kai Han

机构 * The University of Hong Kong(香港大学) University of Cambridge(剑桥大学)

AI总结 提出一种表示抽象框架,将3D高斯散点、虚拟网格和流体等异构资产统一为物理粒子集,实现场景级、多求解器的物理仿真,支持3DGS资产的非刚性变形与复杂双向交互。

Comments Accepted to CVPR 2026 Findings

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 6456-6465

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

URL PDF HTML 收藏
2606.21613 2026-06-23 cs.CV cs.AI 新提交

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

跨模态验证实现无标注野生动物监测

Bharath Pillai, Varun Viswapriyan, Christopher Stewart, Tanya Berger-Wolf, Jenna Kline

机构 * The Ohio State University(俄亥俄州立大学)

AI总结 提出利用物种活动模式专家知识作为无标注验证信号,通过视觉和声学管道独立恢复活动模式并与行为先验三方一致,实现无需人工标注的野生动物监测。

Comments Presented at the 2026 CV4Animals Workshop, colocated with CVPR

URL PDF HTML 收藏
2606.21398 2026-06-23 cs.RO 新提交

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav: 具身导航的脑启发轨迹记忆

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

AI总结 提出BIT-Nav框架,通过轻量级学习轨迹记忆增强冻结的视觉-语言模型导航,解决长序列中帧采样稀疏问题,以恒定token成本编码结构化运动历史。

Comments Accepted to CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

URL PDF HTML 收藏
2512.02172 2026-06-23 cs.CV cs.GR cs.LG

SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting

SplatSuRe:多视角一致3D高斯点溅的选择性超分辨率

Pranav Asthana, Alex Hanson, Allen Tu, Tom Goldstein, Matthias Zwicker, Amitabh Varshney

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

AI总结 SplatSuRe通过选择性超分辨率技术,在多视角一致的3D高斯点溅中提升渲染质量,通过相机姿态与场景几何关系指导超分辨率内容的添加,提升局部前景细节的清晰度和一致性。

Comments Project Page: https://splatsure.github.io/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

URL PDF HTML 收藏
2602.21877 2026-06-23 cs.CV

How to Take a Memorable Picture? Empowering Users with Actionable Feedback

如何拍摄令人难忘的照片?通过可操作反馈赋能用户

Francesco Laiti, Davide Talon, Jacopo Staiano, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Travelbrain srl(Travelbrain公司) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

AI总结 本文提出MemFeed任务,通过MemCoach利用多模态大语言模型提供自然语言建议,提升图像回忆性,展示其在多个模型上的有效性。

Comments Accepted @ CVPR 2026. Project page: https://laitifranz.github.io/MemCoach/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 29738-29749

URL PDF HTML 收藏
2602.20208 2026-06-23 cs.LG cs.AI 版本更新

Model Merging in the Essential Subspace

本质子空间中的模型合并

Longhua Li, Lei Qi, Qi Tian, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用国家重点实验室(东南大学),中华人民共和国,中国) Huawei Technologies, Shanghai, China(华为技术有限公司,上海,中国)

AI总结 提出ESM框架,通过对参数更新引起的特征偏移进行主成分分析,提取本质子空间进行低秩分解,并采用多级极化缩放策略,有效缓解任务干扰,实现多任务模型合并的最优性能。

Comments Accepted by CVPR 2026

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

URL PDF HTML 收藏
2309.13855 2026-06-23 math.OC math.CO

Adaptive Softassign via Hadamard-Equipped Sinkhorn

自适应软分配 via 希尔伯特-装备 Sinkhorn

Binrui Shen, Qiang Niu, Shengxin Zhu

AI总结 本文提出一种自适应软分配方法,通过分析目标得分与参数的关系,自动调整参数以保证准确性,提升图匹配的精度和效率。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024, pp. 17638-17647

URL PDF HTML 收藏
2304.12319 2026-06-23 eess.IV cs.CV 版本更新

LVQAC: Lattice Vector Quantization Coupled with Spatially Adaptive Companding for Efficient Learned Image Compression

LVQAC: 结合空间自适应压扩的格矢量量化用于高效学习图像压缩

Xi Zhang, Xiaolin Wu

机构 * Shanghai Jiao Tong University(上海交通大学) McMaster University(麦 master 大学)

AI总结 提出一种格矢量量化与空间自适应压扩(LVQAC)方案,替代均匀量化器,在几乎不增加复杂度的情况下提升端到端图像压缩的率失真性能。

Comments Accepted by CVPR 2023

URL PDF HTML 收藏
2606.19901 2026-06-19 cs.CV 新提交

Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution

基于语义调制的线性递归单元用于图像超分辨率

Mingyu Choi, Woo Kyoung Han, Sunghoon Im, Kyong Hwan Jin

机构 * Korea University(高丽大学) DGIST(大邱庆北科学技术院)

AI总结 提出一种结合语义调制单元的线性递归网络,通过调制、空间分类和原型增强实现高效图像超分辨率,性能超越现有方法。

Comments Accepted to CVPR 2026 Findings

URL PDF HTML 收藏
2605.31393 2026-06-19 cs.CL cs.AI 版本更新

Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models

面向手语翻译的大语言模型目标端释义增强

Pedro Dal Bianco, Jean Paul Nunes Reinhold, Oscar Stanchi, Facundo Quiroga, Franco Ronchetti, Ulisses Brisolara Corrêa

机构 * III-LIDI Universidad Nacional de La Plata(III-LIDI国立拉普拉塔大学) CDTEC, Federal University of Pelotas(CDTEC,联邦 Pelotas 大学) CONICET III-LIDI Comision de Investigaciones Cientificas Universidad Nacional de La Plata(科学委员会国立拉普拉塔大学) Universidade Federal de Pelotas(联邦 Pelotas 大学)

AI总结 针对手语翻译中平行语料稀缺和目标词汇长尾分布的问题,提出利用GPT-4o生成参考句子的受控释义变体进行目标端增强,并在三种手语数据集上验证了方法的有效性。

Comments Accepted at GenSign @ CVPR 2026. Non-Proceedings Track (https://genai4sl.github.io/)

URL PDF HTML 收藏
2604.19196 2026-06-19 cs.CV 版本更新

Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing

面向域泛化人脸反欺骗的视觉基础模型基准测试

Mika Feng, Pierre Gallin-Martel, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University, Japan(东北大学信息科学研究生院,日本)

AI总结 本文系统评估15种预训练视觉模型在人脸反欺骗域泛化中的表现,发现自监督ViT(尤其是DINOv2+Registers)结合数据增强和注意力损失在MICO协议上达到最优,且计算高效。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

URL PDF HTML 收藏
2505.17006 2026-06-19 cs.CV cs.RO 版本更新

CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

CoMo: 从互联网视频中学习连续潜在运动以实现可扩展的机器人学习

Jiange Yang, Yansong Shi, Haoyi Zhu, Mingyu Liu, Kaijing Ma, Yating Wang, Gangshan Wu, Tong He, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 提出CoMo方法,通过早期时间差分和时序对比学习从互联网视频中学习连续潜在运动,避免离散化信息损失,实现零样本泛化生成伪动作标签,联合训练策略在仿真和真实实验中表现优异。

Comments CVPR 2026

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

URL PDF HTML 收藏
2606.18783 2026-06-18 cs.CV 新提交

SCR-Guided Difficulty-Aware Optimization for Infrared Small Target Detection

SCR引导的困难感知优化用于红外小目标检测

Yunus Sevim, Behçet Uğur Töreyin

机构 * Aselsan(阿塞尔桑公司) Istanbul Technical University(伊斯坦布尔理工大学)

AI总结 提出REEM框架,利用信杂比作为可见性先验,通过可微调制软IoU损失,提升低可见性目标检测性能,无需额外参数或推理开销。

Comments Accepted at CVPR 2026 Workshops (PBVS). Published version: https://openaccess.thecvf.com/content/CVPR2026W/PBVS/html/Sevim_SCR-Guided_Difficulty-Aware_Optimization_for_Infrared_Small_Target_Detection_CVPRW_2026_paper.html

URL PDF HTML 收藏
2606.18676 2026-06-18 cs.LG cs.CV 新提交

InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Search

InTrain: 面向零成本神经架构搜索的内在可训练性

Qinqin Zhou, Fuhai Chen, Jipeng Wu, Zhiwei Chen, Zhikai Hu, Weiwei Cai

机构 * School of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) School of Computer and Data Science, Minjiang University(闽江学院计算机与数据科学学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院) Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系) School of Interdisciplinary Medicine and Engineering, Harbin Medical University(哈尔滨医科大学跨学科医学与工程学院)

AI总结 提出统一理论代理InTrain,通过几何容量和优化韧性两个协同成分形式化架构的可训练性,在NAS基准上达到与集成方法相当的排序相关性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

URL PDF HTML 收藏
2605.16385 2026-06-18 cs.CV cs.AI cs.CL 版本更新

Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning

Hilbert-Geo:通过神经符号推理解决立体几何问题

Ruoran Xu, Haoyu Cheng, Bin Dong, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Ricoh Software Research Center Beijing Co.,Ltd(Ricoh 软件研究中心北京有限公司)

AI总结 提出Hilbert-Geo框架和Parse2Reason方法,利用条件描述语言和定理库实现立体几何问题的严格推理,在SolidFGeo2k和MathVerse-Solid上达到SOTA性能。

Comments Computer Vision and Pattern Recognition (CVPR), 2026

URL PDF HTML 收藏
2603.05010 2026-06-18 cs.CV 版本更新

How far have we gone in Generative Image Restoration? A study on its capability, limitations and evaluation practices

生成式图像恢复进展:能力、局限性与评估实践研究

Xiang Yin, Jinfan Hu, Zhiyuan You, Kainan Yan, Yu Tang, Chao Dong, Jinjin Gu

机构 * Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of the Chinese Academy of Sciences(中国科学院大学) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 通过多维度评估管道系统比较扩散、GAN等生成式模型与PSNR导向模型,揭示从细节不足到细节质量与语义控制的范式转变,并训练了更符合人类感知的IQA模型。

Comments Accepted by CVPR 2026 Findings

URL PDF HTML 收藏
2602.07544 2026-06-18 cs.CV 版本更新

MUFASA: A Multi-Layer Framework for Slot Attention

MUFASA: 一种用于槽注意力的多层框架

Sebastian Bock, Leonie Schüßler, Krishnakant Singh, Simone Schaub-Meyer, Stefan Roth

机构 * TU Darmstadt(图宾根大学) Zuse School ELIZA(泽尼特学校ELIZA)

AI总结 提出MUFASA,一种轻量级即插即用框架,通过跨ViT编码器多层计算槽注意力并融合,提升无监督对象中心学习的分割性能,达到新最优。

Comments CVPR 2026. Authors Sebastian Bock and Leonie Schüßler contributed equally. Project page: https://visinf.github.io/mufasa/

URL PDF HTML 收藏