arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.19026 2026-03-20 cs.CV

Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token

重新思考MLLM本身作为分割器:仅用一个分割标记

Anqi Zhang, Xiaokang Ji, Guangyu Gao, Jianbo Jiao, Chi Harold Liu, Yunchao Wei

机构 * Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学) Beijing Jiaotong University(北京交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出SELF1E方法,通过保留原始图像分辨率并利用残差特征提升分割精度,无需外部解码器即可实现与专业解码器相当的分割性能。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18834 2026-03-20 cs.CV

Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging

基于统计特征的去噪方法用于快速高分辨率透射电子显微镜成像

Hesong Li, Ziqi Wu, Ruiwen Shao, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 本文提出一种统计特征引导的去噪网络,通过空间和频域特征指导去噪过程,提升HRTEM图像质量,实验表明其在去噪和定位任务中优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18757 2026-03-20 cs.CV

DA-Mamba: Learning Domain-Aware State Space Model for Global-Local Alignment in Domain Adaptive Object Detection

DA-Mamba: 基于全局-局部对齐的领域感知状态空间模型学习用于领域自适应目标检测

Haochen Li, Rui Zhang, Hantao Yao, Xin Zhang, Yifan Hao, Shaohui Peng, Yongwei Zhao, Ling Li

机构 * Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学校)

AI总结 DA-Mamba通过结合CNN与状态空间模型,提升领域自适应目标检测的全局与局部对齐能力,有效解决传统方法在全局特征提取和计算效率上的不足。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18671 2026-03-20 cs.CV

Towards High-Quality Image Segmentation: Improving Topology Accuracy by Penalizing Neighbor Pixels

迈向高质量图像分割:通过惩罚邻近像素提高拓扑准确性

Juan Miguel Valverde, Dim P. Papadopoulos, Rasmus Larsen, Anders Bjorholm Dahl

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出SCNP方法,通过惩罚最差分类的邻近像素 logits 来提升拓扑准确性,已在13个数据集上验证有效性,并集成至三种分割框架。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19195 2026-03-20 cs.CV

All-in-One Slider for Attribute Manipulation in Diffusion Models

用于扩散模型属性操控的全能滑块

Weixin Ye, Hongguang Zhu, Wei Wang, Yahui Liu, Mengyu Wang, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作联合实验室) City University of Macau(澳门城市大学) Kuaishou(快手) Meitu(美图)

AI总结 本文提出All-in-One滑块模块,通过分解文本嵌入空间实现高效的属性操控,支持多属性组合与零样本操控,提升扩散模型的属性操控精度和可扩展性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18753 2026-03-20 cs.CV

CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Mississippi(密西西比大学) ASUS Intelligent Cloud Services(ASUS智能云服务)

AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18541 2026-03-20 cs.CV

Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection

矫正目标域色散以提升跨域少样本目标检测

Yongwei Jiang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

AI总结 本文针对跨域少样本目标检测中目标域色散问题,提出生物启发的注意力细化框架,通过正负模式细化和文本语义对齐模块提升检测精度,实验证明在六个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18495 2026-03-20 cs.AI

Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning

跨领域演示到代码的神经符号反事实推理

Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(Sungkyunkwan 大学计算机科学与工程系)

AI总结 本文提出NeSyCR框架,通过神经符号反事实推理解决跨领域机器人编程中的过程不匹配问题,提升任务成功率31.14%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18461 2026-03-20 cs.CV

Cell-Type Prototype-Informed Neural Network for Gene Expression Estimation from Pathology Images

基于细胞类型原型的神经网络用于从病理图像估计基因表达

Kazuya Nishimura, Ryoma Bise, Shinnosuke Matsuo, Haruka Hirose, Yasuhiro Kojima

机构 * The University of Osaka, Japan(大阪大学) Kyushu University(九州大学) National Cancer Center Japan(日本国立癌症中心)

AI总结 本文提出CPNN模型,利用单细胞RNA测序数据估计病理图像中基因表达,通过细胞类型原型指导提升预测精度和可解释性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06450 2026-03-20 cs.CV

What Is Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self-Evolution

合成数据在场景文本识别中有什么问题?一个强大的合成引擎与多样化的模拟和自我进化

Xingsong Ye, Yongkun Du, JiaXin Zhang, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯公司微信视觉团队)

AI总结 本文提出UnionST合成引擎,通过多样化的模拟和自我进化框架,提升合成数据的现实性和有效性,实验表明其在复杂场景中优于现有合成数据。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22184 2026-03-20 cs.CV

Shoe Style-Invariant and Ground-Aware Learning for Dense Foot Contact Estimation

具有鞋款不变性和地面感知的学习用于密集脚部接触估计

Daniel Sungho Jung, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(电子工程与智能机器人研究所,首尔国立大学)

AI总结 本文提出FECO框架,通过鞋款不变性和地面感知学习,解决单张RGB图像中密集脚部接触估计的鞋款多样性与地面特征提取问题。

Comments Accepted at CVPR 2026. Project page: https://feco-release.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16861 2026-03-20 cs.CV cs.AI

Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测

Xiang Li, Zhangchi Hu, Xiao Xu, Bin Kong

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。

Comments accepted to cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13387 2026-03-20 cs.CV

TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast

TR2M: 通过语言描述和双级尺度导向对比转移单目相对深度到度量深度

Beilei Cui, Yiming Huang, Long Bai, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出TR2M框架,通过语言描述和图像输入,利用双级尺度导向对比学习,解决相对深度到度量深度的转换问题,实现跨域的零样本性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17995 2026-03-19 cs.CV cs.GR cs.LG

LoST: Level of Semantics Tokenization for 3D Shapes

LoST:3D形状的语义层次标记化

Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

AI总结 本文提出LoST,通过语义显著性对3D形状进行标记化,实现高效的自回归生成。实验表明LoST在几何和语义重建上优于现有方法,并提升下游任务性能。

Comments CVPR 2026; Project website-- https://lost3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17910 2026-03-19 cs.CV

SpiderCam: Low-Power Snapshot Depth from Differential Defocus

SpiderCam: 低功耗差分模糊拍摄深度

Marcos A. Ferreira, Tianao Li, John Mamish, Josiah Hester, Yaman Sangar, Qi Guo, Emma Alexander

机构 * Northwestern University(西北大学) Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学)

AI总结 SpiderCam通过FPGA实现低功耗差分模糊拍摄深度,实时生成480x400稀疏深度图,功耗仅624mW,首次实现被动FPGA 3D相机亚瓦特总功耗。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17828 2026-03-19 cs.CV

TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

TINA:无文本逆向攻击用于未学习的文本到图像扩散模型

Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) Peng Cheng Laboratory(鹏城实验室) Shandong University(山东大学)

AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。

Comments 16 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17809 2026-03-19 cs.CV cs.AI

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17684 2026-03-19 cs.CV

Does YOLO Really Need to See Every Training Image in Every Epoch?

YOLO真的需要在每个epoch中都看到每张训练图像吗?

Xingxing Xie, Jiahua Dong, Junwei Han, Gong Cheng

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院)

AI总结 本文提出反遗忘采样策略(AFSS),通过动态选择训练图像以提高YOLO检测器的训练效率和准确性,在多个数据集上实现了超过1.43倍的加速。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17651 2026-03-19 cs.CV cs.AI

Anchoring and Rescaling Attention for Semantically Coherent Inbetweening

锚定与重缩放注意力以实现语义一致的中间帧生成

Tae Eun Choi, Sumin Shim, Junhyeok Kim, Seong Jae Hwang

机构 * Yonsei University(延世大学)

AI总结 本文提出通过关键帧和文本锚定注意力偏差,提升生成中间帧的语义一致性和时间稳定性,同时引入重缩放时间RoPE增强帧一致性,建立首个文本条件的GI评估基准TGI-Bench。

Comments Accepted to CVPR 2026; Code is released at https://github.com/teunchoi/TGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15026 2026-03-19 cs.CV cs.LG

Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

无需训练的生成视频检测方法:时空似然方法

Omer Ben Hayun, Roy Betser, Meir Yossef Levi, Levi Kassel, Guy Gilboa

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05059 2026-03-19 cs.LG cs.AI cs.CV

Learning from Oblivion: Predicting Knowledge Overflowed Weights via Retrodiction of Forgetting

从遗忘中学习:通过遗忘的逆向预测知识溢出的权重

Jinhyeok Jang, Jaehong Kim, Jung Uk Kim

机构 * ETRI UST Kyung Hee University(庆北大学)

AI总结 本文提出KNOW预测方法,通过结构化遗忘与逆向建模合成知识丰富的权重,提升下游任务性能。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17605 2026-03-19 cs.CV

ReLaGS: Relational Language Gaussian Splatting

ReLaGS:关系语言高斯点云

Yaxu Xie, Abdalla Arafa, Alireza Javanmardi, Christen Millerdurai, Jia Cheng Hu, Shaoxiang Wang, Alain Pagani, Didier Stricker

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU University Kaiserslautern-Landau(科布伦茨-兰道大学(RPTU)) University of Modena and Reggio Emilia(摩德纳和雷吉奥-艾米利亚大学)

AI总结 ReLaGS通过构建层次化的语言蒸馏高斯场景和3D语义场景图,实现无需场景特定训练的统一3D感知与推理,结合多视角语言对齐策略和图神经网络进行关系推理。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17583 2026-03-19 cs.CV cs.AI

Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing

Edit-As-Act:面向开放词汇3D室内场景编辑的目标回归规划

Seongrae Noh, SeungWon Seo, Gyeong-Moon Park, HyeongYeop Kang

机构 * Korea University(韩国大学)

AI总结 本文提出Edit-As-Act框架,通过目标回归规划实现开放词汇3D室内场景编辑,解决传统方法在生成和物理一致性上的不足,实验表明其在多个编辑任务中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17571 2026-03-19 cs.CV

PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery

PanoVGGT:从全景影像进行前馈3D重建

Yijing Guo, Mengjun Chao, Luo Wang, Tianyang Zhao, Haizhao Dai, Yingliang Zhang, Jingyi Yu, Yujiao Shi

机构 * ShanghaiTech University(上海科技大学) Sudo

AI总结 本文提出PanoVGGT模型,通过单次前向传递从单或多张全景影像联合预测相机姿态、深度图和3D点云,采用球面感知位置嵌入和全景特定三轴SO(3)旋转增强,解决全局框架模糊问题,并贡献PanoCity大规模户外全景数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏