arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-28 至 2026-04-28 共收录 37
2604.24419 2026-04-28 cs.CV

BMD-45: A Large-Scale CCTV Vehicle Detection Dataset for Urban Traffic in Developing Cities

BMD-45:一个大规模城市交通CCTV车辆检测数据集

Akash Sharma, Chinmay Mhatre, Sankalp Gawali, Ruthvik Bokkasam, Brij Sharma, Vishwajeet Pattanaik, Punit Rathore, Raghu Krishnapuram, Vijay Gopal Kovvali, Anirban Chakraborty, Yogesh Simmhan

机构 * Department of Computational and Data Sciences (CDS)(计算与数据科学系) Robert Bosch Center for Cyber Physical Systems (RBCCPS)(罗伯特·博世中心(RBCCPS)) Center of Data for Public Good (CDPG)(公共数据中心(CDPG)) Centre for Infrastructure, Sustainable Transportation & Urban Planning (CiSTUP)(基础设施、可持续交通与城市规划中心(CiSTUP)) Indian Institute of Science, Bengaluru, India(印度科学研究院,班加罗尔,印度)

AI总结 BMD-45数据集针对发展中国家城市交通的复杂场景,包含14种细粒度车辆类别,通过大规模标注揭示模型在不同领域间的性能差距,为鲁棒感知系统开发提供基准。

Comments Accepted at CVPR 2026 Findings Track. To appear in the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24393 2026-04-28 cs.LG cs.CV

Complexity of Linear Regions in Self-supervised Deep ReLU Networks

自监督深度ReLU网络中线性区域的复杂性

Mufhumudzi Muthivhi, Terence L. van Zyl

机构 * University of Johannesburg(约翰内斯堡大学)

AI总结 研究自监督学习中线性区域的局部分布,通过SplineCam提取多边形,分析数量、面积、 eccentricity 和边界变化,发现自监督方法在准确率上与监督方法相当但生成更少区域,对比方法快速扩张区域,自蒸馏方法则倾向于合并邻近区域。

Comments Accepted for publication in 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24276 2026-04-28 cs.CV

Instance Awareness of Multi-class Semantic Segmentation Loss Functions

多类语义分割损失函数的实例意识

Soumya Snigdha Kundu, Florian Kofler, Marina Ivory, Hendrik Moller, Jonathan Shapey, Tom Vercauteren

机构 * King’s College London(伦敦国王学院) University of Tübingen(图宾根大学) Technical University of Munich(慕尼黑技术大学) King’s College Hospital(国王学院医院)

AI总结 本文提出通过一对多类分解扩展实例敏感损失以解决多类不平衡问题,改进多类CC损失和blob损失,在BraTS-METS 2025数据集上提升了稀有类Dice分数和Panoptic质量。

Comments 8 pages, 4 Figures, Accepted as Poster at CV4CLINIC workshop at CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21728 2026-04-28 cs.CV cs.LG

Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection

Ramen: 通过主动样本选择实现视觉语言模型的鲁棒性测试时适应

Wenxuan Bao, Yanjun Zhao, Xiyuan Yang, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出Ramen框架,通过主动样本选择实现视觉语言模型在混合域下的鲁棒测试时适应,通过领域一致性与预测平衡准则提升适应性能,实验表明其在多种图像退化和领域偏移基准上表现优异。

Comments Accepted by CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15941 2026-04-28 cs.CV

Towards Fair and Robust Volumetric CT Classification via KL-Regularised Group Distributionally Robust Optimisation

迈向公平且鲁棒的体积CT分类:通过KL正则化组分布鲁棒优化

Samuel Johnny, Blessed Guda, Goodness Obasi, Aaron Emmanuel, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出通过KL正则化组分布鲁棒优化方法,解决多站点CT体积中二分类新冠和性别公平的肺部病理识别问题,提升模型鲁棒性和公平性。

Comments CVPR 2026 Medical Imaging & Healthcare Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19339 2026-04-28 cs.CV

POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse

POUR:一种通过神经坍塌进行表示去学习的可证明最优方法

Anjie Le, Can Peng, Yuyuan Liu, J. Alison Noble

机构 * Institute of Biomedical Engineering, University of Oxford, UK(牛津大学生物医学工程研究所)

AI总结 本文提出POUR方法,通过神经坍塌理论,设计可证明最优的表示去学习算法,有效去除特定概念或训练图像的影响,同时保留保留知识,优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24171 2026-04-28 cs.CV

POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation

POCA:基于视觉文本生成的帕累托最优课程对齐

Yaohou Fan, Qingzhong Wang, Yongsong Huang, Junyi Liu, Tomo Miyazaki, Shinichiro Omachi

机构 * Tohoku University(东大大学) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出POCA框架,通过多目标优化解决视觉文本生成中文本准确性和图像一致性之间的平衡问题,采用帕累托最优集和自适应课程对齐策略提升生成效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24082 2026-04-28 cs.CR cs.AI cs.CL

Jailbreaking Frontier Foundation Models Through Intention Deception

通过意图欺骗突破前沿基础模型

Xinhe Wang, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。

Comments Accepted at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24044 2026-04-28 cs.CV

CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang

机构 * Wuhan University of Technology(武汉理工大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) Wuhan University(武汉大学) Southwest Jiaotong University(西南交通大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。

Comments accepted by 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-04-28 cs.CV

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23803 2026-04-28 cs.CV

Bringing a Personal Point of View: Evaluating Dynamic 3D Gaussian Splatting for Egocentric Scene Reconstruction

融入个人视角:评估动态3D高斯散射在眼动场景重建中的应用

Jan Warchocki, Xi Wang, Jonas Kulhanek, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学) TUM/MCML(慕尼黑工业大学/麦克斯·普朗克研究所) Czech Technical University in Prague(布拉格捷克技术大学)

AI总结 本文评估了动态单目3DGS模型在眼动和非眼动视频中的重建效果,发现眼动视角重建质量较低,原因在于模型更擅长静态内容而非动态场景。

Comments Accepted at the EgoVis Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23604 2026-04-28 cs.CV cs.RO

Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation

学习识别分布外对象以进行3D激光雷达异常分割

Simone Mosco, Daniel Fusaro, Alberto Pretto

机构 * University of Padova(帕多瓦大学)

AI总结 本文提出了一种高效方法,直接在特征空间中操作,通过建模内类特征分布来约束异常样本,同时引入混合真实-合成数据集以解决3D激光雷达异常分割中的领域差距问题。

Comments This paper has been accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05621 2026-04-28 cs.CV

FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos

FunRec:从第一人称交互视频重建功能3D场景

Alexandros Delitzas, Chenyangguang Zhang, Alexey Gavryushin, Tommaso Di Mario, Boyang Sun, Rishabh Dabral, Leonidas Guibas, Christian Theobalt, Marc Pollefeys, Francis Engelmann, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) Stanford University(斯坦福大学) Microsoft(微软) USI Lugano(USI卢加诺)

AI总结 FunRec通过直接从第一人称RGB-D交互视频重建室内场景的3D数字双胞胎,实现了无需控制环境或多状态采集的交互式3D场景重建,提升了部分分割和重建精度。

Comments CVPR 2026. Project page: https://functionalscenes.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16046 2026-04-28 cs.RO cs.CV

DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

DextER:基于语言的灵巧抓取生成与具身推理

Junha Lee, Eunha Park, Minsu Cho

机构 * Pohang University of Science and Technology(釜山科学技术大学) RLWRLD

AI总结 DextER通过具身推理生成灵巧抓取,结合任务语义与物理约束,提升抓取成功率与意图对齐度。

Comments CVPR 2026, Project page: https://junha-l.github.io/dexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10362 2026-04-28 cs.CV cs.AI

Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models

视觉漏斗:缓解多模态大语言模型中的上下文盲区

Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of AI, Chung-Ang University(Chung-Ang 大学人工智能系)

AI总结 本文提出视觉漏斗方法,通过上下文锚定和熵缩放投资组合缓解多模态大语言模型中的上下文盲区问题,通过动态调整裁剪尺寸和中心点,提升视觉细节与全局上下文的关联性。

Comments Accepted to CVPR 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07834 2026-04-28 cs.CV

Voxify3D: Pixel Art Meets Volumetric Rendering

Voxify3D:像素艺术与体素渲染的结合

Yi-Chuan Huang, Jiewen Chan, Hao-Jen Chien, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

AI总结 本文提出Voxify3D框架,通过结合3D网格优化与2D像素艺术监督,解决体素艺术中语义保留、像素美学和离散优化的挑战,实验显示其在多样角色和可控抽象上的优越性能。

Comments CVPR 2026. Project page: https://yichuanh.github.io/Voxify-3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00995 2026-04-28 cs.CV

S2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds

S2AM3D: 可缩放部分的3D点云分割

Han Su, Tianyu Huang, Zichen Wan, Xiaohe Wu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学)

AI总结 本文提出S2AM3D,通过结合2D分割先验与3D一致监督,解决3D点云分割中数据稀缺和视图不一致的问题,实现对复杂结构的鲁棒分割。

Comments Accepted by CVPR 2026(Oral). Project page:https://sumuru789.github.io/S2AM3D-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23344 2026-04-28 cs.CV

Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection

探索开放词汇目标检测中的层次一致性与无偏目标性

Sanghoon Lee, Geon Lee, Hyekang Park, Bumsub Ham

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

AI总结 本文提出一种新颖的伪标签框架,通过层次一致性校准和LoCLIP模型提升开放词汇目标检测的准确性与可靠性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23314 2026-04-28 cs.CV

Learning from Noisy Prompts: Saliency-Guided Prompt Distillation for Robust Segmentation with SAM

从噪声提示中学习:基于显著性的提示蒸馏用于具有SAM的鲁棒分割

Jingxuan Kang, Ziqi Zhang, Shaoming Zheng, Shuang Li, Uday Bharat Patel, Alexander Harry Fitzhugh, Phillip Lung, Yusuf Kiberu, Nikesh Jathanna, Shahnaz Jamil-Copley, Bernhard Kainz, Chen Qin

机构 * Imperial College London(伦敦帝国学院) Beihang University(北航) National Health Service(国家卫生服务) University of Nottingham(诺丁汉大学)

AI总结 本文提出SPD框架,通过数据驱动的解剖先验知识和上下文提示蒸馏,提升在噪声提示下的分割鲁棒性,实验表明其在MRI和CT基准上优于现有方法。

Comments Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23274 2026-04-28 cs.CV

SemiGDA: Generative Dual-distribution Alignment for Semi-Supervised Medical Image Segmentation

SemiGDA: 生成双分布对齐用于半监督医学图像分割

Kaiwen Huang, Yi Zhou, Yizhe Zhang, Jingxiong Li, Tao Zhou

机构 * Nanjing University of Science and Technology(南京理工大学) Southeast University(东南大学)

AI总结 SemiGDA通过双分布对齐模块和一致性驱动跳过适配器提升半监督医学图像分割的语义学习和场景适应性,实验表明其优于现有方法。

Comments This paper have been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23264 2026-04-28 cs.CV

MotionHiFlow: Text-to-motion via hierarchical flow matching

MotionHiFlow:通过分层流匹配实现文本到运动

Heng Li, Xiaotong Lin, Ling-An Zeng, Yulei Kang, Shuai Li, Jian-Fang Hu

机构 * Sun Yat-sen University(中山大学) Shandong University(山东大学) Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

AI总结 MotionHiFlow通过分层流匹配框架生成运动,结合文本-运动扩散变压器和拓扑感知运动VAE,实现结构依赖建模,提升语义对齐和细节精度。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23010 2026-04-28 cs.CV cs.RO

GenAssets: Generating in-the-wild 3D Assets in Latent Space

GenAssets:在真实世界中生成3D资产的潜在空间

Ze Yang, Jingkang Wang, Haowei Zhang, Sivabalan Manivasagam, Yun Chen, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

AI总结 本文提出一种基于潜在空间的3D生成模型,利用真实世界LiDAR和相机数据生成高质量3D资产,通过重建-生成方法提升模拟中的多样性和可扩展性。

Comments CVPR 2025. Project page: https://waabi.ai/genassets

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22984 2026-04-28 cs.CV cs.GR

BrickNet: Graph-Backed Generative Brick Assembly

BrickNet:基于图的生成积木组装

Peter Kulits, Cordelia Schmid

机构 * Inria, Ècole Normale Supèrieure, CNRS, PSL Research University(法国国家科学研究中心、巴黎高等师范学校、CNRS、巴黎萨克雷大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所)

AI总结 BrickNet通过图结构生成积木构建序列,解决物理约束下的结构生成问题,提升生成序列的物理合理性。

Comments CVPR 2026; project page: https://kulits.github.io/BrickNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22865 2026-04-28 cs.CV

MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction

MeshLAM:基于前馈的单次可动画纹理网格人像重建

Yisheng He, Steven Hoi

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 MeshLAM通过单次前馈过程从单张图像生成高保真、可动画的3D人脸网格人像,采用双形状和纹理映射架构及改进的纹理指导机制,提升重建质量与动画能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22832 2026-04-28 cs.CV cs.AI cs.LG

Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics

基于影像表型和扰动转录组的干预感知多尺度表征学习

Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学)

AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。

Comments CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07990 2026-04-28 cs.CV

SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集

Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)

AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20738 2026-04-28 cs.CV

SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross-Subject EEG-to-Image Retrieval

SATTC: 结构感知的无标签测试时校准用于跨主体EEG到图像检索

Qunjie Huang, Weina Zhu

机构 * Yunnan University(云南大学)

AI总结 本文提出SATTC,一种无标签测试时校准方法,通过结合几何专家和结构专家,提升跨主体EEG到图像检索的准确性与稳定性。

Comments Accepted to CVPR 2026. Official code: https://github.com/QunjieHuang/SATTC-CVPR2026. This version corrects the dataset naming in the paper text and abstract: the experiments were conducted on THINGS-EEG2, whereas the previous version referred to it as THINGS-EEG in parts of the paper. Citations were already correct. Results are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏