arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2602.04268 2026-03-12 cs.CV

KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing

KVSmooth: 通过键值平滑缓解多模态大语言模型中的幻觉

Siyu Jiang, Feiyang Chen, Xiaojin Zhang, Kun He

AI总结 KVSmooth通过键值平滑技术有效缓解多模态大语言模型中的幻觉问题,提升生成精度和召回率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13093 2026-03-12 cs.RO cs.LG

PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representations

PvP: 通过体感优先对比表示实现数据高效的类人机器人学习

Mingqi Yuan, Tao Yu, Haolin Song, Bo Li, Xin Jin, Hua Chen, Wenjun Zeng

机构 * HK PolyU(香港理工大学) LimX Dynamics EIT, Ningbo(宁波工程学院) USTC(中国科学技术大学) ZJU-UIUC(浙江大学-UIUC) ZGCA(浙江工业大学)

AI总结 PvP通过体感优先对比学习提升类人机器人学习的样本效率和性能。

Comments 15 pages, 17 figures

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12229 2026-03-12 cs.CV

Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder

超低比特率感知图像压缩与浅层编码

Tianyu Zhang, Dong Liu, Chang Wen Chen

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出了一种非对称极值图像压缩框架,利用浅层编码器和单步扩散解码器实现超低比特率下的高保真度重建,同时提升编码效率和解码速度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21145 2026-03-12 cs.CV

TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models

TEAR:面向文本到视频模型的时序感知自动化红队测试

Jiaming He, Guanyu Hou, Hongwei Li, Zhicong Huang, Kangjie Chen, Yi Yu, Wenbo Jiang, Guowen Xu, Tianwei Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of Manchester(曼彻斯特大学) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Jilin University(吉林大学)

AI总结 TEAR通过时序感知自动化红队测试框架,有效识别文本到视频模型中的安全风险,实验显示攻击成功率高达80%

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14918 2026-03-12 cs.CV

X-WIN: Building Chest Radiograph World Model via Predictive Sensing

X-WIN:通过预测感知构建胸片世界模型

Zefan Yang, Ge Wang, James Hendler, Mannudeep K. Kalra, Pingkun Yan

AI总结 X-WIN通过预测感知构建胸片世界模型,利用体积数据提炼3D解剖知识,提升CXR的表示学习和诊断能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07516 2026-03-12 cs.CV

Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again

重新思考指认多目标跟踪中的两阶段指认跟踪:使其更强大

Weize Li, Yunhao Du, Qixiang Yin, Zhicheng Zhao, Fei Su

AI总结 本文提出FlexHook,一种改进的两阶段指认跟踪框架,通过改进特征构建和对应关系建模,实现了对当前最先进方法的全面超越。

Comments Accepted to the CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09826 2026-03-11 cs.CV

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09673 2026-03-11 cs.CV

VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM

VarSplat: 一种具有不确定性的3D高斯点划法用于鲁棒的RGB-D SLAM

Anh Thuan Tran, Jana Kosecka

机构 * Department of Computer Science(计算机科学系)

AI总结 VarSplat通过显式学习每个点划的外观方差,提升RGB-D SLAM的鲁棒性和稳定性,实现更可靠的跟踪与建图。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09611 2026-03-11 cs.CV

ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis

ParTY: 部分引导用于表达性文本到运动合成

KunHo Heo, SuYeon Kim, Yonghyun Gwon, Youngbin Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

AI总结 ParTY通过部分引导网络、部分感知文本定位和整体-部分融合,提升文本到运动合成中部分表现力和动作连贯性。

Comments Accepted by CVPR 2026. Code: https://github.com/VisualScienceLab-KHU/ParTY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09582 2026-03-11 cs.CV

BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers

BinaryAttention: 一比特QK-注意力用于视觉和扩散变换器

Chaodong Xiao, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 BinaryAttention通过1比特QK-注意力实现视觉和扩散变换器的高效加速,有效提升计算效率并保持准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09408 2026-03-11 cs.CV cs.AI cs.LG

Reviving ConvNeXt for Efficient Convolutional Diffusion Models

复兴 ConvNeXt 以实现高效的卷积扩散模型

Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius Azevedo

机构 * KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) ISTI-CNR(意大利国家研究理事会信息与自动化研究所) University of Pisa(比萨大学)

AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。

Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09277 2026-03-11 cs.CV

Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists

用更短的高斯列表加速3D高斯学习

Jiaqi Liu, Zhizhong Han

机构 * Machine Perception Lab, Wayne State University(机器感知实验室,韦恩州立大学)

AI总结 通过缩短高斯列表提升3D高斯学习效率,采用尺度重置和熵约束优化渲染效率。

Comments Accepted to CVPR 2026. Project page: https://github.com/MachinePerceptionLab/ShorterSplatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09259 2026-03-11 cs.CV cs.RO

Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos

从网络视频中隐式几何表示的视觉-语言导航

Mingfei Han, Haihong Hao, Liang Ma, Kamila Zhumakhanova, Ekaterina Radionova, Jingyi Zhang, Xiaojun Chang, Xiaodan Liang, Ivan Laptev

机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区)

AI总结 本研究提出基于网络视频的隐式几何表示方法,用于视觉-语言导航,通过提升数据利用率和鲁棒性,实现更广泛的应用。

Comments Extension of CVPR 2025 RoomTour3D with implicit geometric representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09173 2026-03-11 cs.CV

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24146 2026-03-11 cs.CV

Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning

通过方向解耦对齐缓解偏好模式崩溃在扩散强化学习中

Chubin Chen, Sujie Hu, Jiashu Zhu, Meiqi Wu, Jintao Chen, Yanxun Li, Nisha Huang, Chengyu Fang, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)

AI总结 本文提出D²-Align框架,通过方向解耦对齐缓解扩散强化学习中的偏好模式崩溃,提升生成多样性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21192 2026-03-11 cs.CV cs.AI

When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

当机器人服从补丁:对视觉-语言-动作模型的通用可转移补丁攻击

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Qixin Zhang, Bingquan Shen, Alex C. Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University(罗思实验室,跨学科研究生项目,南洋理工大学) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(罗思实验室,电子与电气工程学院,南洋理工大学) CCDS, Nanyang Technological University(CCDS,南洋理工大学) DSO National Laboratories(国防科学局实验室)

AI总结 本文提出UPA-RFAS框架,通过鲁棒特征、注意和语义方法,实现对视觉-语言-动作模型的通用可转移补丁攻击,揭示了基于补丁的攻击面并为未来防御提供基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20223 2026-03-11 cs.CV

V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

V-Attack:针对解耦价值特征的可控对抗攻击LVLMs

Sen Nie, Jie Zhang, Jianxin Yan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06702 2026-03-11 cs.CV

SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection

SPAN: 用于单目3D目标检测的空间-投影对齐

Yifan Wang, Yian Zhao, Fanqi Pu, Xiaochen Yang, Yang Tang, Xi Chen, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院) Basic Algorithm Center, PCG, Tencent(腾讯计算机系统有限公司基础算法中心)

AI总结 SPAN通过空间点对齐和3D-2D投影对齐解决单目3D目标检测中几何一致性不足的问题,提升检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21147 2026-03-11 cs.LG

Semi-Supervised Conformal Prediction With Unlabeled Nonconformity Score

半监督置信预测与未标记非一致性评分

Xuanning Zhou, Zihao Shi, Hao Zeng, Xiaobo Xia, Bingyi Jing, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出SemiCP,通过结合标记和未标记数据提升置信预测的覆盖性能,实验表明在有限标记数据下可显著降低覆盖差距。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21622 2026-03-11 cs.CV

The MVTec AD 2 Dataset: Advanced Scenarios for Unsupervised Anomaly Detection

MVTec AD 2数据集:面向无监督异常检测的高级场景

Lars Heckler-Kram, Jan-Hendrik Neudeck, Ulla Scheler, Rebecca König, Carsten Steger

AI总结 MVTec AD 2数据集提供8000张高分辨率图像,包含工业检测中未被考虑的挑战性场景,用于评估无监督异常检测方法的性能和鲁棒性。

Comments paper under review; dataset first released for the VAND3.0 challenge @ CVPR 2025 https://sites.google.com/view/vand30cvpr2025/challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17135 2026-03-11 cs.CV

TIMotion: Temporal and Interactive Framework for Efficient Human-Human Motion Generation

TIMotion: 时空交互框架用于高效的人机运动生成

Yabiao Wang, Shuo Wang, Jiangning Zhang, Ke Fan, Jiafu Wu, Zhucun Xue, Yong Liu

机构 * Zhejiang University(浙江大学) Youtu Lab, Tencent(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 TIMotion提出一种高效框架,通过因果交互注入、角色演变扫描和局部模式放大,实现高效的人类交互运动生成。

Comments Accepted to CVPR 2025. Project page: https://aigc-explorer.github.io/TIMotion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08921 2026-03-11 cs.CV cs.LG

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

视觉-语言模型编码临床指南以实现基于概念的医学推理

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi

机构 * Queen’s University(女王大学) University of British Columbia(不列颠哥伦比亚大学) McMaster University(麦马斯特大学) Vector Institute(向量研究所)

AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08674 2026-03-10 cs.CV

Talking Together: Synthesizing Co-Located 3D Conversations from Audio

Talking Together: 从音频流合成共处的3D对话

Mengyi Shan, Shouchieh Chang, Ziqian Bai, Shichen Liu, Yinda Zhang, Luchuan Song, Rohit Pandey, Sean Fanello, Zeng Huang

机构 * University of Washington(华盛顿大学) Google(谷歌) University of Rochester(罗切斯特大学)

AI总结 本文提出了一种双流架构,通过文本描述控制相对头部姿态,生成逼真且空间感知的双人3D对话动画。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08620 2026-03-10 cs.CV

StreamReady: Learning What to Answer and When in Long Streaming Videos

StreamReady: 在长视频流中学习何时回答

Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院)

AI总结 StreamReady通过引入答案准备度评分,统一时间推理与及时回答,实现对长视频流中何时回答的高效学习与准确判断。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏