arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2602.18873 2026-03-03 cs.CV cs.AI

BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation

BiMotion: B-spline 动作 for 文本引导的动态 3D 人物生成

Miaowei Wang, Qingxuan Yan, Zhi Cao, Yayuan Li, Oisin Mac Aodha, Jason J. Corso, Amir Vaxman

机构 * University of Edinburgh(爱丁堡大学) Cornell University(康奈尔大学) University of Michigan(密歇根大学) Voxel51

AI总结 BiMotion 通过 B-spline 曲线生成高质量文本引导的动态 3D 人物动作,提升动作生成的表现力和质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01759 2026-03-03 cs.LG

Meta-Learning Hyperparameters for Parameter Efficient Fine-Tuning

元学习超参数用于参数高效微调

Zichen Tian, Yaoyao Liu, Qianru Sun

机构 * Singapore Management University(新加坡管理大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 MetaPEFT通过元学习动态调整超参数,提升遥感图像微调的性能和尾部类别准确性。

Comments Accepted by CVPR 2025 (Highlight). Code is available at: https://github.com/doem97/metalora

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 23037-23047

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01623 2026-03-03 cs.CV cs.LG

Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration

自适应频谱特征预测用于扩散采样加速

Jiaqi Han, Juntong Shi, Puheng Li, Haotian Ye, Qiushan Guo, Stefano Ermon

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

AI总结 本文提出Spectrum方法,通过切比雪夫多项式近似实现全局长距离特征重用,提升扩散采样速度并保持高质量样本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01361 2026-03-03 cs.CV cs.AI

MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention

MixerCSeg: 一种高效的Mixer架构用于通过解耦Mamba注意力进行裂缝分割

Zilong Zhao, Zhengming Ding, Pei Niu, Wenhao Sun, Feng Guo

机构 * School of Qilu Transportation, Shandong University, China(山东大学齐鲁交通学院) Department of Computer Science, Tulane University, USA(路易斯安那大学计算机科学系)

AI总结 MixerCSeg通过解耦Mamba注意力机制,高效分割裂缝,实现高精度与低计算开销的平衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01284 2026-03-03 cs.CV

FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration

FoSS:通过傅里叶状态空间整合建模长距离依赖性和多模态不确定性在轨迹预测中

Yizhou Huang, Gengze Jiang, Yihua Cheng, Kezhi Wang

机构 * Brunel University of London(伦敦布鲁内尔大学) University of Birmingham(伯明翰大学)

AI总结 FoSS通过结合频域和时域建模,有效提升轨迹预测的准确性和效率,减少计算与参数消耗,实现多模态不确定性建模。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01194 2026-03-03 cs.CV

RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

RnG:一种统一的Transformer,用于从有限观测中完整建模3D结构

Mochu Xiang, Zhelun Shen, Xuesong Li, Jiahui Ren, Jing Zhang, Chen Zhao, Shanshan Liu, Haocheng Feng, Jingdong Wang, Yuchao Dai

机构 * Northwestern Polytechnical University(西北工业大学) Baidu Inc.(百度公司) Australian National University(澳大利亚国立大学) CSIRO(澳大利亚联邦科学与工业研究组织)

AI总结 RnG提出了一种统一的Transformer模型,通过隐式3D表示实现从有限观测中完整重建3D结构并生成新视角。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01163 2026-03-03 cs.CV

BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling

BeautyGRPO: 通过动态路径引导和细粒度偏好建模实现面部修饰的美观对齐

Jiachen Yang, Xianhui Lin, Yi Dong, Zebiao Zheng, Xing Liu, Hong Gu, Yanmei Fang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学计算机科学与技术学院,深圳校区) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd., China(vivo蓝影实验室,vivo移动通信有限公司)

AI总结 BeautyGRPO通过动态路径引导和细粒度偏好建模,解决面部修饰中保真度与审美偏好对齐的难题,实现更高质量的图像编辑效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01082 2026-03-03 cs.CV cs.IR

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20089 2026-03-03 cs.CV cs.AI

StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues

StructXLIP: 通过多模态结构线索增强视觉-语言模型

Zanxi Ruan, Songqun Gao, Qiuyu Kong, Yiming Wang, Marco Cristani

AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18942 2026-03-03 cs.CV

VeCoR -- Velocity Contrastive Regularization for Flow Matching

VeCoR -- 速度对比正则化用于流匹配

Zong-Wei Hong, Jing-lun Li, Lin-Ze Li, Shen Zhang, Yao Tang

机构 * JIIOV Technology(JIIOV技术公司)

AI总结 VeCoR通过引入速度对比正则化,提升流匹配模型的稳定性与生成质量,尤其在低步数和轻量级设置中表现优异。

Comments Accepted to Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03113 2026-03-03 cs.CV cs.CL

Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection

通过基于梯度的自我反思缓解多模态幻觉

Shan Wang, Maying Shen, Nadine Chang, Chuong Nguyen, Hongdong Li, Jose M. Alvarez

机构 * NVIDIA Australian National University(澳大利亚国立大学) Data61, CSIRO(Data61,CSIRO)

AI总结 本文提出GACD方法,通过梯度分析缓解多模态模型的幻觉问题,提升输出的视觉基础性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13305 2026-03-03 cs.CV

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架

Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Yafei Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Sichuan University(四川大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04097 2026-03-03 cs.LG

Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击

Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23359 2026-03-03 cs.CV

VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion

VideoFusion: 一种用于多模态视频融合的时空协作网络

Linfeng Tang, Yeda Wang, Meiqi Gong, Zizhuo Li, Yuxin Deng, Xunpeng Yi, Chunyu Li, Han Xu, Hao Zhang, Jiayi Ma

机构 * School of Robotics, Wuhan University, Wuhan, China(机器人学院,武汉大学,武汉,中国) Electronic Information School, Wuhan University, Wuhan, China(电子信息学院,武汉大学,武汉,中国) Southeast University, Nanjing, China(东南大学,南京,中国)

AI总结 VideoFusion通过时空协作网络实现多模态视频融合,利用跨模态互补性和时间动态性提升视频一致性。

Comments Accepted to CVPR 2026. The dataset and code are available at https://github.com/Linfeng-Tang/VideoFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01040 2026-03-03 cs.LG

Fed-ADE: Adaptive Learning Rate for Federated Post-adaptation under Distribution Shift

Fed-ADE: 在分布偏移下适应性学习率的联邦后适应

Heewon Park, Mugon Joe, Miru Kim, Kyungjin Im, Minhae Kwon

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(电气与计算机工程系,成均馆大学,大韩民国) Soongsil University, Seoul, Republic of Korea(顺世大学,首尔,大韩民国)

AI总结 Fed-ADE通过估计分布动态,为联邦学习中的非平稳数据提供自适应学习率,提升模型在分布偏移下的鲁棒性和有效性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00920 2026-03-03 eess.IV

Spectral Super-Resolution via Adversarial Unfolding and Data-Driven Spectrum Regularization: From Multispectral Satellite Data to NASA Hyperspectral Image

通过对抗展开和数据驱动的光谱正则化实现光谱超分辨率:从多光谱卫星数据到NASA超光谱图像

Si-Sheng Young, Chia-Hsiang Lin

AI总结 本研究提出了一种基于对抗展开和数据驱动光谱正则化的深度学习框架,实现从12到186波段的光谱超分辨率,并统一Sentinel-2数据的空间分辨率至5米。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00912 2026-03-03 cs.CV

VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection

VGGT-Det:挖掘VGGT内部先验用于无传感器几何多视角室内3D目标检测

Yang Cao, Feize Wu, Dave Zhenyu Chen, Yingji Zhong, Lanqing Hong, Dan Xu

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Huawei(华为) Sun Yat-Sen University(孙中山大学)

AI总结 VGGT-Det通过整合VGGT编码器和引入AG、QD组件,实现无传感器几何的多视角室内3D目标检测,提升检测性能。

Comments Accepted by CVPR 2026. Code Page: https://github.com/yangcaoai/VGGT-Det-CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00882 2026-03-03 eess.IV cs.CV eess.SP

Solving a Nonlinear Blind Inverse Problem for Tagged MRI with Physics and Deep Generative Priors

求解带标签MRI的非线性盲逆问题:结合物理和深度生成先验

Zhangxing Bian, Shuwen Wei, Samuel W. Remedios, Junyu Chen, Aaron Carass, Blake E. Dewey, Jerry L. Prince

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins School of Medicine(约翰霍普金斯医学院)

AI总结 本文提出了一种结合物理和深度生成先验的非线性盲逆框架,用于带标签MRI,实现了解剖恢复、高分辨率 cine 图像合成和运动估计的统一处理。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00805 2026-03-03 cs.CV cs.MA

NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code

NERFIFY:一个将NeRF论文转化为代码的多智能体框架

Seemandhar Jain, Keshav Gupta, Kunal Gupta, Manmohan Chandraker

机构 * University of California, San Diego(加州大学圣地亚哥分校)

AI总结 NERFIFY通过多智能体框架将NeRF论文转化为可训练的代码,提升复现效率和质量。

Comments Accepted to CVPR 2026. Project page: https://seemandhar.github.io/NERFIFY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00682 2026-03-03 cs.CV

CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion

CoLC: 通信高效协同感知与激光雷达补全

Yushan Han, Hui Zhang, Qiming Xia, Yi Jin, Yidong Li

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, Ministry of Education(交通运输大数据与人工智能重点实验室,教育部) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Xiamen University(厦门大学)

AI总结 CoLC通过激光雷达补全和早期融合技术,在稀疏传输下实现高效协同感知,提升感知与通信的平衡性能。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00611 2026-03-03 cs.CV

Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmark

探索时空特征传播用于视频级压缩光谱重建:数据集、模型和基准

Lijing Cai, Zhan Shi, Chenglong Huang, Jinyao Wu, Qiping Li, Zikang Huo, Linsen Chen, Chongde Zi, Xun Cao

AI总结 本文提出PG-SVRT模型,通过时空特征传播提升视频级压缩光谱重建性能,构建DynaSpec数据集并验证其有效性

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00609 2026-03-03 cs.CV

Linking Modality Isolation in Heterogeneous Collaborative Perception

异构协作感知中的模态隔离问题

Changxing Liu, Zichen Chao, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 CodeAlign通过跨模态特征-代码-特征翻译有效解决异构协作感知中的模态隔离问题,显著降低训练参数和通信负载,提升感知性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00595 2026-03-03 cs.CV

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00550 2026-03-03 cs.CV

Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning

弱监督视频异常检测与异常连接组件及意图推理

Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)

AI总结 本文提出LAS-VAD框架,通过异常连接组件和意图推理机制,提升弱监督视频异常检测的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00483 2026-03-03 cs.CV cs.AI

RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

RAISE:基于需求的进化精炼用于无训练文本到图像对齐

Liyao Jiang, Ruichen Chen, Chao Gao, Di Niu

机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) Huawei Technologies, Canada(华为技术有限公司)

AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00412 2026-03-03 cs.CV

PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models

PointAlign:用于3D视觉-语言模型的特征级对齐正则化

Yuanhao Su, Shaofeng Zhang, Xiaosong Jia, Qi Fan

机构 * University of Science and Technology of China(中国科学技术大学) Fuzhou University(福州大学) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 PointAlign通过特征级对齐正则化提升3D视觉-语言模型的几何信息保留与任务性能

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00324 2026-03-03 cs.CV

Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guarantees

证明-感知:具有组合性符合保证的认证工具使用多模态推理

Arya Fayyazi, Haleh Akrami

机构 * University of Southern California(南加州大学) Nuro

AI总结 Proof-of-Perception通过组合性符合保证实现多模态推理的可信工具使用,提升性能和可靠性,同时更高效地利用计算资源。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏