arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2312.16476 2026-04-21 cs.CV cs.AI

SVGDreamer: Text Guided SVG Generation with Diffusion Model

SVGDreamer:基于扩散模型的文本引导SVG生成

Ximing Xing, Haitao Zhou, Chuang Wang, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北航) The University of Hong Kong(香港大学)

AI总结 SVGDreamer提出一种基于扩散模型的文本引导SVG生成方法,通过引入语义驱动的图像向量化过程和向量粒子基于的分数蒸馏技术,提升生成的可编辑性、视觉质量和多样性。

Comments Accepted by CVPR 2024. Project Page: https://ximinng.github.io/SVGDreamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17818 2026-04-21 cs.CV

AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion

AnyLift: 通过2D扩散模型从互联网视频中扩展运动重建

Hongjie Li, Heng Yu, Jiaman Li, Hong-Xing Yu, Ehsan Adeli, C. Karen Liu, Jiajun Wu

机构 * Stanford University(斯坦福大学)

AI总结 本文提出AnyLift框架,利用2D扩散模型从互联网视频中重建3D人体运动和人-物交互,通过合成多视角2D运动数据和训练相机条件多视角2D运动扩散模型,提升动态摄像下运动重建的准确性和鲁棒性。

Comments CVPR 2026. Project website: https://awfuact.github.io/anylift/ The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17570 2026-04-21 cs.CV cs.AI

PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)

AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。

Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17455 2026-04-21 cs.CV

From Adaptation to Generalization: Adaptive Visual Prompting for Medical Image Segmentation

从适应到泛化:面向医学图像分割的自适应视觉提示

Evren Çetinkaya, Sangmin Lee, Jung Uk Kim, Hong Joo Lee, Nassir Navab

机构 * Technical University of Munich(慕尼黑技术大学) Korea University(韩国大学) Kyung Hee University(庆熙大学) Seoul National University of Science and Technology(首尔科学技术大学)

AI总结 本文提出APEX框架,通过学习可微的提示记忆来提取输入特定的提示,以提升医学图像分割在跨域和内域变化中的泛化能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17286 2026-04-21 cs.CV

Depth Adaptive Efficient Visual Autoregressive Modeling

深度自适应高效视觉自回归建模

Chunliang Li, Tianze Cao, Sanyuan Zhao

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 本文提出DepthVAR,通过自适应分配每个token的计算深度,提升高分辨率图像生成效率,实验表明在质量损失小的情况下实现2.3-3.1倍加速。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17190 2026-04-21 cs.CV

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12518 2026-04-21 cs.CL

Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis

增强后再平衡模态协作用于鲁棒多模态情感分析

Kang He, Yuzhe Ding, Xinrong Wang, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算教育部重点实验室,网络安全科学与工程学院,武汉大学)

AI总结 本文提出EBMC框架,通过语义解耦和跨模态增强提升表示质量,结合能量引导模态协调机制和实例感知模态信任蒸馏,解决多模态情感分析中的模态不平衡问题,实验显示其在缺失模态情况下表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22639 2026-04-21 cs.CV cs.NA math.NA math.OC

QuadSync: Quadrifocal Tensor Synchronization via Tucker Decomposition

QuadSync: 通过Tucker分解进行四焦点张量同步

Daniel Miao, Gilad Lerman, Joe Kileel

机构 * School of Mathematics, University of Minnesota(明尼苏达大学数学系) Department of Mathematics and Oden Institute for Computational Engineering and Sciences, University of Texas at Austin(德克萨斯大学奥斯汀分校数学系和计算工程与科学学院)

AI总结 本文提出通过Tucker分解实现四焦点张量同步的新框架,展示了其在多相机恢复中的有效性,并建立了四焦点、三焦点和二焦点张量之间的关系。

Comments 30 pages, accepted to CVPR 2026 as an Oral Presentation. Complementary code can be found at github.com/dmiao153/QuadSync

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13707 2026-04-21 cs.CV cs.AI cs.LG

Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs

注意力空间对比引导用于高效缓解大视觉-语言模型中的幻觉

Yujin Jo, Sangyoon Bae, Taesup Kim

机构 * Seoul National University(首尔国立大学)

AI总结 本文提出Attention-space Contrastive Guidance方法,通过对比引导生成更视觉一致且语义忠实的文本,实验表明在CHAIR和POPE数据集上提升了忠实度并降低了延迟。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16857 2026-04-21 cs.CV cs.RO

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25210 2026-04-21 cs.LG cs.AI physics.ao-ph

STCast: Adaptive Boundary Alignment for Global and Regional Weather Forecasting

STCast:面向全球和区域天气预报的自适应边界对齐

Hao Chen, Tao Han, Jie Zhang, Song Guo, Lei Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 STCast提出一种新型AI框架,通过空间对齐注意力机制和时间混合专家模块,实现自适应区域边界优化和动态月度预报分配,提升天气预报的准确性和泛化能力。

Comments This paper has already been accepted by CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.08818 2026-04-21 cs.CV

(De)Constructing Bias on Skin Lesion Datasets

解构皮肤病变数据集中的偏见

Alceu Bissoto, Michel Fornaciali, Eduardo Valle, Sandra Avila

机构 * Institute of Computing (IC)(计算学院) School of Electrical and Computing Engineering (FEEC)(电气与计算工程学院) RECOD Lab.(RECOD实验室) University of Campinas (UNICAMP)(坎皮纳斯大学)

AI总结 本文研究皮肤病变数据集中存在的正负偏见,发现模型在无临床信息时仍能高准确率分类,表明存在虚假相关性,而增加临床信息未提升性能,暗示真实相关性被破坏。

Comments 9 pages, 6 figures. Paper accepted at 2019 ISIC Skin Image Anaylsis Workshop @ IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17087 2026-04-21 cs.CV cs.LG

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

EvoComp: 通过语义引导的进化标注学习多模态大语言模型的视觉令牌压缩

Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na

机构 * OPPO CTG

AI总结 本文提出EvoComp框架,通过语义引导的进化标注策略,有效压缩视觉令牌数量,同时保持任务精度,实验显示在3倍压缩下保持99.3%的准确率,并在移动设备上提升1.6倍速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17082 2026-04-21 cs.CV

D-Prism: Differentiable Primitives for Structured Dynamic Modeling

D-Prism:用于结构动态建模的可微原始体

Xingyuan Yu, Yijin Li, Chong Zeng, Yuhang Ming, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Stanford University(斯坦福大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出D-Prism框架,通过扩展可微原始体到动态领域,实现高保真的结构动态建模,结合3DGS和原始体的优势,引入变形网络和自适应控制策略,提升结构动态建模的精度和效率。

Comments Accepted to CVPR 2026. Project page: https://zju3dv.github.io/d-prism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17078 2026-04-21 cs.AI

Understanding and Enforcing Weight Disentanglement in Task Arithmetic

理解并强制任务算术中的权重解耦

Shangge Liu, Yuehan Yin, Lei Wang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao, Dacheng Tao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) University of Wollongong, Australia(沃林根大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出Task-Feature Specialization(TFS)作为权重解耦的根本原理,通过促进权重向量的正交性,提出OrthoReg正则化方法以提升任务算术方法的性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17052 2026-04-21 cs.CV

OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning

OASIS:按需分层事件记忆用于流媒体视频推理

Zhijia Liang, Jiaming Li, Weikai Chen, Yanhao Zhang, Haonan Lu, Guanbin Li

机构 * Sun Yat-sen University(中山大学) OPPO AI Center(OPPO人工智能中心) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

AI总结 OASIS通过结构化按需检索解决流媒体视频推理中记忆检索的挑战,提升长周期准确性和组合推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17041 2026-04-21 cs.CV

SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models

SIF:用于大视觉-语言模型的语义内分布指纹

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中央佛罗里达大学)

AI总结 本文提出SIF,一种无需参数修改的非侵入性所有权验证框架,通过语义对齐指纹蒸馏和鲁棒指纹优化,提升大视觉-语言模型的版权保护能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16748 2026-04-21 cs.CV cs.AI

TriTS: Time Series Forecasting from a Multimodal Perspective

TriTS:从多模态视角进行时间序列预测

Xiang Ao

机构 * School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院)

AI总结 TriTS从多模态视角提出新的跨模态解耦框架,通过时间、频率和2D视觉空间投影,结合周期感知重塑策略和视觉Mamba,实现高效的时间序列预测,实验表明其在多个基准数据集上达到SOTA性能。

Comments 9 pages, 3 figures. Accepted by the A2A-MML Workshop in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16680 2026-04-21 cs.CV

C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

C-GenReg:基于多视角一致的几何到图像生成的无训练3D点云配准

Yuval Haitman, Amit Efraim, Joseph M. Francos

机构 * Ben-Gurion University(本·古里安大学)

AI总结 C-GenReg通过多视角一致的几何到图像生成,结合概率模态融合,实现无训练的3D点云配准,解决了跨模态、采样差异和环境的泛化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16562 2026-04-21 cs.CV cs.AI

See Through the Noise: Improving Domain Generalization in Gaze Estimation

穿透噪声:改进 gaze 估计中的领域泛化

Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室)

AI总结 本文提出 SeeTN 框架,通过缓解标签噪声提升 gaze 估计的领域泛化能力,通过构建语义嵌入空间和引入新的亲和力正则化,增强语义结构对齐和领域不变 gaze 关系,提升鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16540 2026-04-21 cs.CV cs.AI

PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems

视角污染:跨多种3D重建系统的视角初始化污染

Weijie Wang, Songlong Xing, Zhengyu Zhao, Nicu Sebe, Bruno Lepri

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出PoInit-of-View方法,通过优化对抗扰动在不同3D重建系统中引发视角污染,破坏关键点检测和特征匹配,从而降低重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16482 2026-04-21 cs.CV cs.RO

A Survey of Spatial Memory Representations for Efficient Robot Navigation

一种用于高效机器人导航的空间记忆表示综述

Ma. Madecheen S. Pangaliman, Steven S. Sison, Erwin P. Quilloy, Rowel Atienza

机构 * University of the Philippines Diliman(菲律宾大学杜马扬分校) University of Santo Tomas(圣托马斯大学)

AI总结 本文综述了88篇文献,探讨了空间记忆效率问题,提出α指标评估部署可行性,揭示了内存架构对实际部署的影响。

Comments Accepted at the Women in Computer Vision (WiCV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16479 2026-04-21 cs.CV cs.AI

Latent-Compressed Variational Autoencoder for Video Diffusion Models

视频扩散模型的潜在压缩变分自编码器

Jiarui Guan, Wenshuai Zhao, Zhengtao Zou, Juho Kannala, Arno Solin

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学)

AI总结 本文提出一种潜在压缩方法,通过去除视频潜在表示中的高频成分而非直接减少通道数,提升视频生成质量与压缩效率。

Comments Accepted to CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16406 2026-04-21 cs.AI cs.LG cs.MA cs.RO

Heterogeneous Self-Play for Realistic Highway Traffic Simulation

异质自博弈用于逼真高速公路交通模拟

Jinkai Qiu, Alessandro Saviolo, Chaojie Wang, Mingke Wang, Xiaoyu Huang

机构 * PlusAI

AI总结 本文提出PHASE框架,通过自博弈生成逼真高速公路场景,支持不同车辆类型并提升交互真实性,实现零样本迁移至512个真实场景。

Comments 8 pages, 2026 CVPR SAD Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16363 2026-04-21 cs.CR cs.AI cs.CV

CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

CSF:通过组合语义进行文本到图像模型的黑盒指纹识别

Junhoo Lee, Mijin Koo, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

AI总结 本文提出CSF,一种基于组合语义的黑盒指纹识别方法,用于在不接触模型内部的情况下,通过查询访问确定文本到图像模型的版权归属。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19857 2026-04-21 cs.SD cs.CV

FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts

FoleyDirector: 通过结构化脚本实现视频到音频生成的细粒度时间控制

You Li, Dewei Zhou, Fan Ma, Fu Li, Dongliang He, Yi Yang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能State Key Lab) ReLER, CCAl, Zhejiang University(浙江大学ReLER, CCAl) Intelligent Creation, ByteDance, China(字节跳动智能创作)

AI总结 本文提出FoleyDirector框架,通过结构化时间脚本提升视频到音频生成的细粒度时间控制能力,同时保持音频质量并支持无缝切换生成与受控合成。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13740 2026-04-21 cs.CV

Sky2Ground: A Benchmark for Site Modeling under Varying Altitude

Sky2Ground:一种适用于不同海拔的场地建模基准

Zengyan Wang, Sirshapan Mitra, Rajat Modi, Grace Lim, Yogesh Rawat

机构 * Center for Research In Computer Vision(计算机视觉研究中心) University of Central Florida(佛罗里达大学)

AI总结 本文提出Sky2Ground基准,结合合成与真实图像,评估多视角定位与重建方法,发现卫星影像会降低性能,并提出SkyNet模型提升跨视角一致性,取得显著改进。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09721 2026-04-21 cs.CV

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

FrameDiT:基于矩阵注意力的扩散变换器用于高效视频生成

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能倡议,澳大利亚) FPT Smart Cloud, Vietnam(越南FPT智能云) Deakin University, Australia(德肯大学,澳大利亚)

AI总结 本文提出Matrix Attention,通过将帧视为矩阵来处理视频生成中的时空动态,结合FrameDiT-G和FrameDiT-H模型,在保持效率的同时提升了视频质量和时间一致性。

Comments Code: https://github.com/minhkhoale/FrameDiT Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02618 2026-04-21 cs.CV

Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs

注意你选择负样本的方式:在使用VLMs进行OOD检测时追求距离一致性

Zhikang Xu, Qianqian Xu, Zitai Wang, Cong Hua, Sicong Li, Zhiyong Yang, Qingming Huang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出InterNeg框架,通过统一的跨模态距离增强提升OOD检测性能,实验显示在ImageNet和Near-OOD基准上取得显著改进。

Comments Accepted by the main track of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02378 2026-04-21 cs.CR cs.CV cs.MM eess.IV

Authenticated Contradictions from Desynchronized Provenance and Watermarking

认证矛盾源于脱同步的溯源与水印

Alexander Nemecek, Hengzhi He, Guang Cheng, Erman Ayday

机构 * Case Western Reserve University(凯斯西储大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 研究揭示了溯源和水印验证层之间的矛盾,通过元数据清洗流程生成伪造内容,提出跨层审计协议实现100%准确分类。

Comments Accepted at CVPR 2026 Workshop Authenticity & Provenance in the Age of AI (APAI)

详情

展开后加载摘要…

URL PDF HTML 收藏