arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.10023 2026-04-14 cs.CV cs.AI

FREE-Switch: Frequency-based Dynamic LoRA Switch for Style Transfer

FREE-Switch: 基于频率的动态LoRA切换用于风格迁移

Shenghe Zheng, Minyu Zhang, Tianhao Liu, Hongzhi Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出FREE-Switch方法,通过频率域重要性驱动动态LoRA切换,结合不同对象和风格的适配器,降低高质量定制生成的训练成本。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10017 2026-04-14 cs.CV

What and Where to Adapt: Structure-Semantics Co-Tuning for Machine Vision Compression via Synergistic Adapters

在何处以及何物进行适应:通过协同适配器实现机器视觉压缩的结构-语义协同调节

Shaobo Liu, Haobo Xiong, Kai Liu, Yuna Lin

机构 * Xidian University(西安电子科技大学)

AI总结 本文提出S2-CoT框架,通过结构和语义协同适配器提升图像压缩性能,实现高效参数调节与高质量编码。

Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09955 2026-04-14 cs.CV

Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation

可学习的运动聚焦分块化方法用于高效且有效的视频无监督领域自适应

Tzu Ling Liu, Ian Stavness, Mrigank Rochan

机构 * University of Saskatchewan(萨斯喀彻温大学)

AI总结 本文提出LMFT方法,通过学习去除低运动冗余分块,保留动作相关分块,提升视频无监督领域自适应的效果与效率。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09862 2026-04-14 cs.CV

FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

FF3R:从无约束视角实现前馈特征三维重建

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang

机构 * Microsoft(微软) Clemson University(克莱姆森大学) Texas A&M University(德克萨斯A&M大学)

AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。

Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09817 2026-04-14 cs.LG

NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

NeuroFlow:迈向从神经活动统一的视觉编码和解码

Weijian Mai, Mu Nan, Yu Zhu, Jiahang Cao, Rui Zhang, Yuqin Dai, Chunfeng Song, Andrew F. Luo, Jiamin Wu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) Chinese University of Hong Kong(香港中文大学)

AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。

Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09710 2026-04-14 cs.CV cs.LG

Robust Fair Disease Diagnosis in CT Images

在CT图像中实现鲁棒的公平疾病诊断

Justin Li, Daniel Ding, Asmita Yuki Pritha, Aryana Hou, Xin Wang, Shu Hu

机构 * Carmel High School(卡梅尔高中) Capstone School Dhaka(达卡顶点学校) Clarkstown High School South(克拉克镇南部高中) University at Albany, State University of New York(纽约州立大学奥尔巴尼分校) Purdue University(普渡大学)

AI总结 本文提出双层目标解决CT图像中因数据不平衡和群体代表性不足导致的诊断不公问题,通过样本级和群体级损失函数提升模型公平性与准确性。

Comments 8 pages, 3 figures, 2 tables. Accepted at the 3rd Workshop on New Trends in AI-Generated Media and Security (AIMS) @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09706 2026-04-14 cs.CV cs.AI

The Deployment Gap in AI Media Detection: Platform-Aware and Visually Constrained Adversarial Evaluation

AI媒体检测中的部署差距:平台感知与视觉受限的对抗评估

Aishwarya Budhkar, Trishita Dhara, Siddhesh Sheth

机构 * Indiana University(印第安纳大学) Upper Hand Ace Rent a Car

AI总结 本文提出平台感知的对抗评估框架,揭示实验室环境下的高准确率在实际部署中显著下降,强调需考虑图像处理对检测性能的影响。

Comments Accepted at CVPR AIMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09685 2026-04-14 cs.CV cs.LG

A Modular Zero-Shot Pipeline for Accident Detection, Localization, and Classification in Traffic Surveillance Video

一种用于交通监控视频事故检测、定位和分类的模块化零样本流水线

Amey Thakur, Sarvesh Talele

机构 * Independent Researcher(独立研究员)

AI总结 本文提出一种零样本流水线,通过三个独立模块分别实现交通事故的时间定位、位置确定和类型分类,无需真实世界标注数据。

Comments 9 pages, 7 figures, 2 tables. Submitted to the ACCIDENT @ CVPR 2026 Workshop. Source code and notebook available at https://www.kaggle.com/code/ameythakur20/zero-shot-cctv-traffic-accident-understanding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09651 2026-04-14 cs.CV cs.LG cs.RO

FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击

Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang

机构 * Zhejiang University(浙江大学) Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02003 2026-04-14 cs.CV

ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction

ProDiG:渐进式扩散引导高斯点云法用于空到地重建

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(中佛罗里达大学计算机视觉研究中心)

AI总结 本文提出ProDiG方法,通过扩散引导逐步将空视图转换为地面级视图,利用几何感知因果注意力模块和距离自适应高斯模块,实现高斯点云的渐进式优化,提升重建的几何一致性和鲁棒性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27383 2026-04-14 cs.CV

Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression

分解、混合、适应:一种统一的框架用于参数高效神经网络重组与压缩

Nazia Tasnim, Shrimai Prabhumoye, Bryan A. Plummer

机构 * Boston University(波士顿大学) NVIDIA(英伟达)

AI总结 本文提出CRISP框架,通过分解预训练权重为基矩阵和混合投影,实现参数高效重组与压缩,优于现有方法4-5%,并在PEFT和PEFT+MC组合中表现更优。

Comments Accepted in CVPR, 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08942 2026-04-14 cs.CV cs.AI cs.CL cs.LG

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

BiCLIP:通过结构几何变换实现领域规范化

Pranav Mantini, Shishir K. Shah

机构 * University of Houston(休斯顿大学) The University of Oklahoma(俄克拉荷马大学)

AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。

Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02123 2026-04-14 cs.AI cs.CV

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

Nano-EmoX:从感知到共情的多模态情感智能统一框架

Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen

机构 * Fujian Normal University(福建师范大学) RMIT University(皇家墨尔本理工大学) Minjiang University(闽江学院)

AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06993 2026-04-14 cs.CV

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18329 2026-04-14 cs.CV

SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters

SciPostLayoutTree:用于科学海报结构分析的数据集

Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

AI总结 本文提出SciPostLayoutTree数据集,用于研究科学海报的结构分析,通过标注阅读顺序和父子关系,提升结构感知界面的准确性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16428 2026-04-14 cs.CV

CylinderDepth: Cylindrical Spatial Attention for Multi-View Consistent Self-Supervised Surround Depth Estimation

CylinderDepth:多视角一致自监督周围深度估计的圆柱空间注意力

Samer Abualhanud, Christian Grannemann, Max Mehltretter

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)

AI总结 本文提出一种几何引导方法,通过圆柱空间注意力机制提升多视角自监督周围深度估计的精度和一致性。

Comments Accepted at 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18976 2026-04-14 cs.CV cs.HC

Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking

Ninja Codes: 由神经生成的隐匿式六自由度跟踪标记

Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato

机构 * Osaka University(大阪大学) Kyoto University(京都大学)

AI总结 本文提出Ninja Codes,一种由神经网络生成的隐匿式标记,能自然融入真实环境,通过编码网络将任意图像转换为标记,用于机器人和增强现实等领域的隐匿六自由度跟踪。

Comments CVPR 2026 Findings; Project page: https://sento.net/research/ninjacodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05217 2026-04-14 cs.CV

Organizing Unstructured Image Collections using Natural Language

用自然语言组织无结构图像集合

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) Hefei University of Technology(合肥工业大学) University of Bergamo(贝加莫大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。

Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09527 2026-04-13 cs.CV cs.AI cs.LG

Envisioning the Future, One Step at a Time

逐步展望未来

Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Netflix

AI总结 本文提出通过稀疏点轨迹逐步推断来预测开放集未来场景动态,提升大规模探索效率,同时引入OWM基准测试预测准确性与现实不确定性下的多样性。

Comments CVPR 2026. For code and models, see http://compvis.github.io/myriad

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09473 2026-04-13 cs.CV

Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement

实现沉浸式体积分量视频:一种多模态框架用于6自由度VR互动

Zhengxian Yang, Shengqi Wang, Shi Pan, Hongshuai Li, Haoxiang Wang, Lin Li, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Migu Beijing Research Institute(咪咕北京研究院) School of Architecture, Tsinghua University(清华大学建筑学院) Department of Automation, Tsinghua University(清华大学自动化系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本文提出了一种多模态框架,用于构建沉浸式体积分量视频,通过多视角多模态数据集和动态光场重建框架,实现高分辨率、高帧率的动态内容,支持6自由度VR交互。

Comments Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09425 2026-04-13 cs.CV

Do Vision Language Models Need to Process Image Tokens?

视觉语言模型是否需要处理图像标记?

Sambit Ghosh, R. Venkatesh Babu, Chirag Agarwal

机构 * IBM Indian Institute of Science(印度科学研究所) University of Virginia(弗吉尼亚大学)

AI总结 本文研究了视觉语言模型中图像标记的功能,发现视觉表示快速收敛至有限复杂度,而文本表示持续重构。视觉表示在不同层间可互换,任务依赖性影响视觉处理的必要性。

Comments Accepted (Oral) at TRUE-V Workshop CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09415 2026-04-13 cs.CV cs.AI cs.LG cs.RO

PhysInOne: Visual Physics Learning and Reasoning in One Suite

PhysInOne:一套视觉物理学习与推理系统

Siyuan Zhou, Hejun Wang, Hu Cheng, Jinxi Li, Dongsheng Wang, Junwei Jiang, Yixiao Jin, Jiayue Huang, Shiwei Mao, Shangjia Liu, Yafei Yang, Hongkang Song, Shenxing Wei, Zihui Zhang, Peng Huang, Shijie Liu, Zhengli Hao, Hao Li, Yitian Li, Wenqi Zhou, Zhihan Zhao, Zongqi He, Hongtao Wen, Shouwang Huang, Peng Yun, Bowen Cheng, Pok Kazaf Fu, Wai Kit Lai, Jiahao Chen, Kaiyuan Wang, Zhixuan Sun, Ziqi Li, Haochen Hu, Di Zhang, Chun Ho Yuen, Bing Wang, Zhihua Wang, Chuhang Zou, Bo Yang

机构 * vLAR Group(vLAR 研究组) The Hong Kong Polytechnic University(香港理工大学) Syai Singapore(Syai 新加坡) Meta

AI总结 PhysInOne通过大规模合成数据提升AI系统对物理现象的理解,包含200万视频和15万动态3D场景,涵盖71种基本物理现象,用于物理感知视频生成、未来帧预测、物理属性估计和运动转移等应用。

Comments CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06656 2026-04-13 cs.CV

ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering

ClusterMark:面向自回归图像生成器的鲁棒水印技术:基于视觉token聚类

Denis Lukovnikov, Andreas Müller, Erwin Quiring, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学) _fbeta

AI总结 本文提出ClusterMark,通过视觉token聚类提升自回归图像生成器的水印鲁棒性,有效对抗图像扰动和再生攻击,同时保持图像质量,优于现有基线方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04676 2026-04-13 cs.CV cs.AI cs.LG cs.MA

Gen-n-Val: Agentic Image Data Generation and Validation

Gen-n-Val:代理图像数据生成与验证

Jing-En Huang, I-Sheng Fang, Tzuhsuan Huang, Yu-Lun Liu, Chih-Yu Wang, Jun-Cheng Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)

AI总结 针对计算机视觉任务中数据稀缺、标签噪声和长尾类别不平衡问题,Gen-n-Val引入基于Layer Diffusion和大语言模型的代理生成框架,有效提升实例分割和目标检测的合成数据质量与性能。

Comments Accepted to the CVPR 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09206 2026-04-13 cs.CV

Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception

Long-SCOPE:完全稀疏的长距离协作3D感知

Jiahao Wang, Zikun Xu, Yuner Zhang, Zhongwei Jiang, Chenyang Lu, Shuocheng Yang, Yuxuan Wang, Jiaru Zhong, Chuang Zhang, Shaobing Xu, Jianqiang Wang

机构 * Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出Long-SCOPE框架,通过几何引导查询生成模块和上下文感知关联模块,解决远距离协作3D感知中的计算复杂性和特征关联问题,实现高精度低开销的长距离感知。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09199 2026-04-13 cs.CV

Globally Optimal Pose from Orthographic Silhouettes

从正交轮廓确定全局最优姿态

Agniva Sengupta, Dilara Kuş, Jianning Li, Stefan Zachow

机构 * Freie Universität Berlin(柏林自由大学) Zuse Institute Berlin(柏林祖斯研究所)

AI总结 本文提出利用轮廓面积连续性特性,通过预计算的轮廓签名响应面实现全局最优姿态估计,无需对应关系,适用于任意形状。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026. Denver, Colorado

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09101 2026-04-13 cs.CR cs.AI cs.CV cs.LG

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

机构 * IIIT Delhi(印度德里国际信息技术学院) IIT Delhi(印度德里理工学院)

AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。

Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09076 2026-04-13 cs.CV

Cross-Modal Knowledge Distillation from Spatial Transcriptomics to Histology

从空间转录组到组织学的跨模态知识蒸馏

Arbel Hizmi, Artemii Bakulin, Shai Bagon, Nir Yosef

机构 * Weizmann Institute of Science(魏茨曼科学研究所) Reichman University(赖希曼大学)

AI总结 本文提出利用空间转录组与H&E数据进行跨模态蒸馏,将转录组学的 niches 结构转移到仅依赖组织学的模型中,提升与转录组学 niches 结构的一致性,并通过细胞类型分析验证生物意义的邻近组成。

Comments Accepted to the CVMI Workshop at CVPR 2026. Project page: https://cross-modal-distillation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏