arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-06 至 2026-03-06 共收录 22
2603.05506 2026-03-06 cs.CV

FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

FaceCam: 通过尺度感知条件化实现人像视频相机控制

Weijie Lyu, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔塞德斯分校) Adobe Research(Adobe研究)

AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。

Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05446 2026-03-06 cs.CV

NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries

NaiLIA:基于密集意图描述和调色板查询的多模态美甲设计检索

Kanon Amemiya, Daichi Yashima, Kei Katsumata, Takumi Komatsu, Ryosuke Korekata, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

AI总结 NaiLIA通过密集意图描述和调色板查询实现美甲设计图像的多模态检索,提升检索精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05438 2026-03-06 cs.CV cs.AI cs.RO

Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model

8个标记的规划:一种用于潜在世界模型的紧凑离散标记器

Dongwon Kim, Gawon Seo, Jinsung Lee, Minsu Cho, Suha Kwak

机构 * KAIST(韩国科学技术院) POSTECH(POSTECH大学) RLWRLD

AI总结 本文提出CompACT,一种将观测压缩为8个标记的离散标记器,显著降低计算成本并提升规划效率,为潜在世界模型的实际应用提供可行方案。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14266 2026-03-06 cs.CV

DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance

DriverGaze360: 全向驾驶员注意力与物体级引导

Shreedhar Govil, Didier Stricker, Jason Rambach

AI总结 DriverGaze360通过全向视野和物体级引导方法,实现对驾驶员注意力的高精度预测,提升自动驾驶系统中的空间感知与交互能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05235 2026-03-06 cs.AI

Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learning

恢复丢失的文本层以实现无源跨域少样本学习

Zhenyu Zhang, Guangyao Chen, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 本文提出了一种方法,通过重新利用文本编码器中被忽视的层信息,提升源无关跨域少样本学习的性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05095 2026-03-06 cs.CV cs.AI

GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinement

GEM-TFL:通过EM引导分解和时间细化弥合弱监督与全监督之间的差距以实现伪造定位

Xiaodong Zhu, Yuanming Zheng, Suting Wang, Junqi Yang, Yuhong Yang, Weiping Tu, Zhongyuan Wang

机构 * NERCMS, School of Computer Science, Wuhan University(NERCMS,计算机学院,武汉大学)

AI总结 GEM-TFL通过EM引导分解和时间细化,有效弥合弱监督与全监督之间的差距,提升时间伪造定位的准确性和鲁棒性。

Comments 10 pages, 4 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05012 2026-03-06 cs.CV

Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model

Tell2Adapt:通过视觉基础模型实现源无关无监督领域自适应的统一框架

Yulong Shi, Shijie Li, Ziyi Li, Lin Qi

AI总结 Tell2Adapt通过视觉基础模型实现源无关无监督领域自适应,利用上下文感知提示正则化和视觉合理性细化提升医学图像分割性能。

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04977 2026-03-06 cs.CV

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04890 2026-03-06 cs.LG cs.AI cs.CV

FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation

FedAFD: 通过对抗融合与蒸馏实现多模态联邦学习

Min Tan, Junchao Ma, Yinfu Feng, Jiajun Ding, Wenwen Pan, Tingting Han, Qian Zheng, Zhenzhong Kuang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江空间信息感知与传输重点实验室,杭州电子大学) Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(复杂系统建模与仿真实验室,计算机科学与技术学院,杭州电子大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 FedAFD通过对抗融合与蒸馏方法,解决多模态联邦学习中的模态差异、任务差异和模型异质性问题,提升客户端与服务器的学习性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04800 2026-03-06 cs.CV

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

MASQuant: 多模态大语言模型的模态感知平滑量化

Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao

机构 * Alibaba Cloud Computing, Alibaba Group(阿里巴巴云 computing,阿里巴巴集团)

AI总结 MASQuant通过模态感知平滑和跨模态补偿技术,解决多模态大语言模型的量化问题,实现稳定且高效的量化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04745 2026-03-06 cs.CV

Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset

迈向真实世界红外图像超分辨率:一个统一的自回归框架和基准数据集

Yang Zou, Jun Ma, Zhidong Jiao, Xingyuan Li, Zhiying Jiang, Jinyuan Liu

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Software Technology & DUT-RU International School of ISE, Dalian University of Technology(大连理工大学软件学院及DUT-RU国际信息工程学院) School of Computer Science, Zhejiang University(浙江大学计算机学院) College of Information Science and Technology, Dalian Maritime University(大连海事大学信息科学与技术学院)

AI总结 本文提出Real-IISR框架和FLIR-IISR数据集,通过热-结构引导的自回归方法提升真实世界红外图像超分辨率性能。

Comments This paper was accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04598 2026-03-06 cs.CV

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。

Comments Accepted for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01007 2026-03-06 cs.CV

Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround-View Cameras for Autonomous Driving

Dr.Occ: 从环绕视图摄像头获取3D占用的深度和区域引导方法用于自动驾驶

Xubo Zhu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Wen Yang, Huai Yu

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) Horizon Robotics Wuhan University Shenzhen Research Institute(武汉大学深圳研究院)

AI总结 Dr.Occ通过深度和区域引导方法提升自动驾驶中3D占用预测的几何对齐和语义学习效果。

Comments 10 pages, 6 figures. Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00589 2026-03-06 cs.CV cs.AI

AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution

AlignVAR: 向图像超分辨率的全局一致视觉自回归模型

Cencen Liu, Dongyang Zhang, Wen Yin, Jielei Wang, Tianyu Li, Ji Guo, Wenbo Jiang, Guoqing Wang, Guoming Lu

机构 * University of Electronic Science and Technology of China(电子科技大学) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous intelligence and trusted services 重点实验室)

AI总结 AlignVAR 通过空间一致性自回归和层次一致性约束提升图像超分辨率的全局一致性与效率。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22091 2026-03-06 cs.CV

Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

学习驾驶是免费礼物:从未经处理的现实视频中进行大规模无标签自主性预训练

Matthew Strong, Wei-Jer Chang, Quentin Herau, Jiezhi Yang, Yihan Hu, Chensheng Peng, Wei Zhan

机构 * Applied Intuition Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种无标签、教师引导的框架,通过未经处理的现实视频学习自动驾驶表示,无需姿态、标签或LiDAR,实现高效的自动驾驶感知和规划。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00204 2026-03-06 cs.CV

MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing

MorphAny3D: 解锁结构潜在力量在3D变形中的应用

Xiaokun Sun, Zeyu Cai, Hao Tang, Ying Tai, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) Peking University(北京大学)

AI总结 MorphAny3D通过结构潜在表示实现高质量3D变形,利用注意力机制生成合理变形序列,并支持解耦变形和3D风格迁移。

Comments Accepted by CVPR 2026; Project page: https://xiaokunsun.github.io/MorphAny3D.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14654 2026-03-06 cs.CV

ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking

ViRC: 通过推理分块增强视觉交错数学思维链

Lihong Wang, Liangqi Li, Weiwei Feng, Jiamin Wu, Changtao Miao, Tieru Wu, Rui Ma, Bo Zhang, Zhe Li

AI总结 ViRC通过引入推理分块机制,提升多模态数学任务中的推理能力,实现18.8%的性能提升。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19854 2026-03-06 cs.CV

STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction

STAvatar: 基于软绑定与时间密度控制的单目3D头部人偶重建

Jiankuo Zhao, Xiangyu Zhu, Zidu Wang, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算技术研究所) SCSE, FIE, M.U.S.T(M.U.S.T)

AI总结 STAvatar通过软绑定与时间密度控制方法,实现了单目视频中高保真3D头部人偶的重建,尤其在细粒度细节和遮挡区域的重建上表现优异。

Comments Accepted to CVPR 2026. Project page: https://jiankuozhao.github.io/STAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00507 2026-03-06 cs.CL cs.AI

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

Graph2Eval: 通过知识图谱实现自动多模态任务生成

Yurun Chen, Xavier Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiameng University(Xmeng大学) The Ohio State University(俄亥俄州立大学) Ant Group(蚂蚁集团)

AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18534 2026-03-06 cs.CV cs.LG

Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models

阐明基于任意噪声的扩散模型的设计空间

Xingyu Qiu, Mengying Yang, Xinghua Ma, Dong Liang, Fanding Li, Gongning Luo, Wei Wang, Kuanquan Wang, Shuo Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Case Western Reserve University(凯斯西储大学)

AI总结 EDA通过扩展噪声模式灵活性并保持模块化,提升图像恢复任务的泛化能力。

Comments 16 pages, 4 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04764 2026-03-06 cs.CV

HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognition

HypeVPR: 在超球面空间中探索视角到等距投影的视觉位置识别

Suhan Woo, Seongwon Lee, Jinwoo Jang, Euntai Kim

机构 * Yonsei University(延世大学) Kookmin University(韩国庆熙大学) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

AI总结 HypeVPR通过在超球面空间中利用分层嵌入框架,提升视角到等距投影的视觉位置识别的精度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏