arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-01 至 2026-05-01 共收录 20
2604.28169 2026-05-01 cs.CV cs.AI cs.LG

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28025 2026-05-01 cs.CV

ResiHMR: Residual-Limb Aware Single-Image 3D Human Mesh Recovery for Individuals with Limb Loss

ResiHMR: 基于残肢意识的单图像3D人体网格恢复用于残肢者

Jiaying Ying, Heming Du, Kaihao Zhang, Sean M. Tweedy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian National University(澳大利亚国立大学) The University of Adelaide(阿德莱德大学)

AI总结 本文提出ResiHMR框架,通过引入残肢关键点和两个组件,实现残肢意识的人体网格恢复,提升残肢者3D模型重建质量。

Comments Highlight in CVPR 2026. Project at https://akitaraphael.github.io/ResiHMR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28024 2026-05-01 cs.LG

FedHarmony: Harmonizing Heterogeneous Label Correlations in Federated Multi-Label Learning

FedHarmony: 谐调联邦多标签学习中异质标签相关性

Zhiqiang Kou, Junxiang Wu, Wenke Huang, Wenwen He, Ming-Kun Xie, Changwei Wang, Yuheng Jia, Di Jiang, Yang Liu, Xin Geng, Qiang Yang

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,中国南京) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),教育部,中国) Wuhan University, China(武汉大学,中国) RIKEN Center for Advanced Intelligence Project, Japan(日本RIKEN先进人工智能项目中心) Qilu University of Technology (Shandong Academy of Sciences), China(齐鲁工业大学(山东省科学院),中国) Academy for Artificial Intelligence, Hong Kong Polytechnic University, Hong Kong, China(香港理工大学人工智能学院,中国香港,中国)

AI总结 FedHarmony通过引入共识相关性,谐调联邦多标签学习中异质标签相关性,提升模型收敛速度和准确性。

Comments Accepted by CVPR 2026. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27833 2026-05-01 cs.CV cs.LG

Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning

抑制噪声诱导的原型退化以实现隐私保护的个性化联邦微调

Yuhua Wang, Qinnan Zhang, Xiaodong Li, Huan Zhang, Yifan Sun, Wangjie Qiu, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Statistics, Renmin University of China(中国人民大学统计学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文提出VPDR,通过引入自适应原型扰动和蒸馏引导裁剪正则化,改进原型基于个性化联邦学习,提升隐私保护与模型性能的平衡。

Comments Accepted by CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27759 2026-05-01 cs.CV cs.AI

Learning to Reason: Targeted Knowledge Discovery and Fuzzy Logic Update for Robust Image Recognition

学习推理:面向知识发现和模糊逻辑更新的鲁棒图像识别

Gurucharan Srinivas, Joshua Niemeijer, Frank Köster

机构 * German Aerospace Center (DLR)(德国航空航天中心(DLR))

AI总结 本文提出一种针对知识发现和模糊逻辑更新的方法,通过可微知识单元调节分类器logits,提升图像识别鲁棒性,实验表明在多个数据集上表现优于基线。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10955 2026-05-01 cs.CV

Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization

Omni-Attribute: 用于视觉概念个性化的第一款开放词汇属性编码器

Tsai-Shien Chen, Aliaksandr Siarohin, Gordon Guocheng Qian, Kuan-Chieh Jackson Wang, Egor Nemchinov, Moayed Haji-Ali, Riza Alp Guler, Willi Menapace, Ivan Skorokhodov, Anil Kag, Jun-Yan Zhu, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校) CMU(卡内基梅隆大学)

AI总结 本文提出Omni-Attribute,通过联合设计数据与模型,学习高保真属性特定表示,解决现有方法中属性混杂的问题,提升开放词汇属性检索与生成性能。

Comments CVPR 2026. Project page: https://snap-research.github.io/omni-attribute

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10941 2026-05-01 cs.CV cs.AI

Mull-Tokens: Modality-Agnostic Latent Thinking

Mull-Tokens: 通用模态的潜在思考

Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

机构 * Google(谷歌) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。

Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10881 2026-05-01 cs.CV

MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos

MoCapAnything:统一的单目视频任意骨骼3D动作捕捉

Kehong Gong, Zhengyu Wen, Weixia He, Mingxi Xu, Qi Wang, Ning Zhang, Zhengyu Li, Dongze Lian, Wei Zhao, Xiaoyu He, Mingyuan Zhang

机构 * Huawei International Pte. Ltd.(华为国际有限公司) Huawei Central Media Technology Institute(华为中央媒体技术研究院)

AI总结 本文提出MoCapAnything,通过参考引导和分解框架实现任意骨骼的3D动作捕捉,利用三个可学习模块和轻量IK阶段生成高质量骨骼动画,并在真实数据集上验证了其跨物种重定向能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14070 2026-05-01 eess.IV cs.CV

ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders

ELiC:通过跨位深度特征传播和编码器袋方案实现高效的激光雷达几何压缩

Junsik Kim, Gun Bang, Soowoong Kim

机构 * Electronics and Telecommunications Research Institute(电子电信研究院)

AI总结 ELiC通过跨位深度特征传播和编码器袋方案,提升激光雷达几何压缩效率,实现实时高吞吐量压缩,达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27596 2026-05-01 cs.CV

SECOS: Semantic Capture for Rigorous Classification in Open-World Semi-Supervised Learning

SECOS:面向开放世界半监督学习的语义捕获用于严格分类

Hezhao Liu, Jiacheng Yang, Junlong Gao, Mengke Li, Yiqun Zhang, Shreyank N Gowda, Yang Lu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

AI总结 SECOS通过外部知识提取并对齐多模态语义表示,为新类别提供显式监督信号,提升开放世界半监督学习中的分类性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27562 2026-05-01 cs.LG

Online semi-supervised perception: Real-time learning without explicit feedback

在线半监督感知:无需显式反馈的实时学习

Branislav Kveton, Michal Valko, Matthai Phillipose, Ling Huang

机构 * Intel Labs(英特尔实验室) Department of Computer Science(计算机科学系) University of Pittsburgh(匹兹堡大学)

AI总结 本文提出一种无需显式反馈的实时学习算法,结合图上半监督学习和在线学习,通过迭代构建世界图表示并更新,利用离线标注数据和在线未标注数据提升性能,在实时人脸识别中取得优越精度和召回率。

Comments IEEE Computer Vision and Pattern Recognition Workshop on Online Learning for Computer Vision (CVPR 2010 OLCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27504 2026-05-01 cs.CV

REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancement

REVIVE 3D:通过编码的体积膨胀先验进行体积增强的细化

Hankyeol Lee, Wooyeol Baek, Seongdo Kim, Jongyoo Kim

机构 * Yonsei University(延世大学)

AI总结 本文提出REVIVE 3D框架,通过两阶段流程从二维图像生成体积丰富的3D资产,结合膨胀先验和3D潜在细化,引入紧凑性与法向异性指标评估体积与表面平滑度,实现高质量3D生成。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27445 2026-05-01 cs.CV

Context as Prior: Bayesian-Inspired Intent Inference for Non-Speaking Agents with a Household Cat Testbed

上下文作为先验:一种基于贝叶斯的意图推断方法用于非说话智能体的家用猫测试平台

Wenqian Zhang, Zehao Wang

机构 * University of California, Riverside(加州大学河滨分校)

AI总结 本文提出CatSignal框架,通过将空间上下文作为先验约束和行为观测作为证据,实现多模态意图推断,提升非说话智能体的意图识别精度。

Comments Accepted to the CVPR 2026 Animal Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27437 2026-05-01 cs.CV

Softmax-GS: Generalized Gaussians Learning When to Blend or Bound

Softmax-GS: 通用高斯学习何时融合或边界

Chen Ziwen, Peng Wang, Hao Tan, Zexiang Xu, Li Fuxin

机构 * Adobe Research(Adobe研究院) Tripo AI(Tripo人工智能公司) Hillbot(Hillbot公司) Oregon State University(俄勒冈州立大学)

AI总结 Softmax-GS通过在重叠区域引入softmax竞争机制,解决3D GS中的视图不一致和模糊边界问题,提升重建质量和参数效率。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27335 2026-05-01 cs.CV

Iterative Definition Refinement for Zero-Shot Classification via LLM-Based Semantic Prototype Optimization

基于LLM的语义原型优化的零样本分类迭代定义细化

Naeem Rehmat, Muhammad Saad Saeed, Ijaz Ul Haq, Khalid Malik

机构 * University of Michigan-Flint(密歇根大学弗林特分校)

AI总结 本文提出一种无需训练的迭代定义优化框架,通过优化类别定义提升零样本网页内容分类性能,引入三种定义优化策略,并在13种前沿嵌入模型上验证了定义质量对分类效果的关键影响。

Comments Accepted at CVPR NeXD Workshop (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06715 2026-05-01 cs.CV cs.AI

HQF-Net: A Hybrid Quantum-Classical Multi-Scale Fusion Network for Remote Sensing Image Segmentation

HQF-Net:一种用于遥感图像分割的混合量子-经典多尺度融合网络

Md Aminur Hossain, Ayush V. Patel, Siddhant Gole, Sanjay K. Singh, Biplab Banerjee

机构 * Space Applications Centre, ISRO, India(印度航天研究组织空间应用中心) Indian Institute of Technology Bombay(印度班加罗尔理工学院)

AI总结 本文提出HQF-Net,通过融合多尺度语义指导和量子增强机制,提升遥感图像分割的精度与性能。

Comments 17 pages

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06394 2026-05-01 cs.CV cs.AI

Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification

语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量

Ahmed Abdelkawy, Ahmed Elsayed, Asem Ali, Aly Farag, Thomas Tretter, Michael McIntyre

机构 * University of Louisville(路易斯维尔大学)

AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。

Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10267 2026-05-01 cs.CV

Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction

Long-LRM++:在前馈宽覆盖重建中保留细节

Chen Ziwen, Hao Tan, Peng Wang, Zexiang Xu, Li Fuxin

机构 * Adobe Research(Adobe研究院) Tripo AI(Tripo人工智能) Hillbot(Hillbot公司) Oregon State University(俄勒冈州立大学)

AI总结 Long-LRM++通过半显式场景表示与轻量解码器,在保持LaCT渲染质量的同时实现实时14FPS的A100 GPU性能,且能扩展至64输入视角,并在ScanNetv2上优于直接从高斯生成深度预测。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02671 2026-05-01 cs.CV

Test-Time Distillation for Continual Model Adaptation

测试时蒸馏用于持续模型适应

Xiao Chen, Jiazhen Huang, Zhiming Liu, Qinting Jiang, Fanding Huang, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen Technology University(深圳技术大学)

AI总结 本文提出CoDiRe框架,通过动态融合VLM和目标模型预测构建鲁棒教师,利用MSP缓解熵偏见,通过最优传输对齐预测,实现稳定持续适应,优于现有方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏