arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11868
2605.29539 2026-06-02 cs.CV cs.AI

GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Detection

GiPL: 用于跨域小样本目标检测的生成增强迭代伪标签方法

Jiacong Liu, Shu Luo, Yikai Qin, Yaze Zhao, Yongwei Jiang, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 提出GiPL双分支训练框架,通过迭代伪标签自训练和生成数据增强,解决跨域小样本目标检测中支持集利用不足和过拟合问题。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19065 2026-06-02 cs.NI

A Geometric Algebra-Informed 3DGS Framework for Wireless Channel Prediction

一种几何代数驱动的3DGS框架用于无线信道预测

Jingzhou Shen, Tianya Zhao, Xuyu Wang

AI总结 提出几何代数驱动的3D高斯泼溅框架(GAI-GS),通过结合3D高斯泼溅与几何代数注意力机制显式建模复杂传播环境中的射线-物体交互,实现无线信道预测。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17007 2026-06-02 cs.CV cs.AI

MobileAgeNet: Lightweight Facial Age Estimation for Mobile Deployment

MobileAgeNet:面向移动部署的轻量级面部年龄估计

Arun Kumar, Aswathy Baiju, Radu Timofte, Dmitry Ignatov

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学、德国)

AI总结 提出基于MobileNetV3-Large的轻量级年龄回归框架MobileAgeNet,通过两阶段微调和边界回归策略,在UTKFace测试集上达到4.65年MAE,移动端延迟14.4ms,参数量3.23M。

Comments 9 Pages including references, 3 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3810-3818, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02997 2026-06-02 cs.LG cs.CV

From Memorization to Creativity: LLM as a Designer of Novel Neural Architectures

从记忆到创造:LLM作为新型神经架构的设计者

Waleed Khalid, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

AI总结 本文提出NNGPT框架,通过闭环架构合成流水线,利用代码型LLM的监督微调循环,结合MinHash-Jaccard新颖性过滤和低保真性能信号,迭代提升生成架构的有效性、性能和多样性,实现从记忆到创造的转变。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3252-3261, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24120 2026-06-02 cs.CV cs.AI

Enhancing LLM-Based Neural Network Generation: Few-Shot Prompting and Efficient Validation for Automated Architecture Design

增强基于LLM的神经网络生成:面向自动化架构设计的少样本提示与高效验证

Raghuvir Duvvuri, Chandini Vysyaraju, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

AI总结 本文提出少样本架构提示(FSAP)和空白归一化哈希验证方法,以提升基于LLM的计算机视觉架构自动生成效率,并通过大规模实验验证其有效性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3242-3251, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27645 2026-06-02 cs.CV

OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

OpenDPR:面向遥感影像的基于视觉中心扩散引导原型检索的开放词汇变化检测

Qi Guo, Jue Wang, Yinhe Liu, Yanfei Zhong

机构 * Wuhan University(武汉大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出OpenDPR框架,通过扩散模型构建原型并检索视觉相似性,解决开放词汇变化检测中类别识别瓶颈,并设计S2C模块增强变化定位能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20176 2026-06-02 cs.CV

LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis

LagerNVS:用于全神经实时新视角合成的潜在几何

Stanislaw Szymanowicz, Minghao Chen, Jianyuan Wang, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Meta AI

AI总结 提出LagerNVS,一种基于3D感知潜在特征的编码器-解码器神经网络,通过显式3D监督预训练初始化编码器,结合轻量解码器和光度损失端到端训练,实现实时、泛化的新视角合成,在Re10k上达到31.4 PSNR。

Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: szymanowiczs.github.io/lagernvs

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09292 2026-06-02 cs.RO cs.CV

See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation

看、规划、回退:面向鲁棒机器人操作的进度感知视觉-语言-动作模型

Tingjun Dai, Mingfei Han, Tingwen Du, Zhiheng Liu, Zihao Zhang, Zhihui Li, Salman Khan, Jun Yu, Xiaojun Chang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) University of Technology Sydney(新南威尔士大学) Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(人工智能与计算机视觉系,Mohamed Bin Zayed人工智能大学) The University of Hong Kong(香港大学) Institute of AI for Industry, Chinese Academy of Sciences(产业人工智能研究所,中国科学院) School of Intelligent Science and Engineering, Harbin Institute of Technology (Shenzhen)(智能科学与工程学院,哈尔滨工业大学(深圳))

AI总结 提出进度感知的视觉-语言-动作框架SPR,通过动态将语言指令映射为空间子目标序列,并利用闭环进度监控实现错误恢复,在LIBERO基准上提升5%性能,在LIBERO-Plus上展现最先进的鲁棒性。

Comments Suggested to CVPR Findings. https://tingjundai.github.io/SPRVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05217 2026-06-02 cs.CV

Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation

跨域小样本分割:多视角渐进适应

Jiahao Nie, Guanqiao Fu, Wenbin An, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学交叉学科研究生项目) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学) VinUniversity(文大学) SMBU

AI总结 提出多视角渐进适应方法,通过混合渐进增强和双链多视角预测,从数据和策略两方面逐步将小样本能力适应到目标域,显著提升跨域小样本分割性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00664 2026-06-02 cs.LG cs.AI cs.CV cs.HC cs.MM

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

Avatar Forcing:用于自然对话的实时交互式头部化身生成

Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡国立大学) DeepAuto.ai

AI总结 提出Avatar Forcing框架,通过扩散强制实现实时交互式头部化身生成,利用直接偏好优化进行无标签学习,在低延迟(约500ms)下生成富有表现力的反应动作。

Comments CVPR 2026. Project page: https://taekyungki.github.io/AvatarForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23351 2026-06-02 cs.CV

CountGD++: Generalized Prompting for Open-World Counting

CountGD++: 面向开放世界计数的通用提示

Niki Amini-Naieni, Andrew Zisserman

机构 * Visual Geometry Group (VGG)(视觉几何组(VGG)) University of Oxford, UK(牛津大学,英国)

AI总结 提出CountGD++模型,通过扩展提示方式(包括负样本描述、伪示例自动标注和外部图像示例)提升开放世界计数的灵活性、准确性和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10958 2026-06-02 cs.CV

WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World

WorldLens:真实世界中驾驶世界模型的全光谱评估

Ao Liang, Lingdong Kong, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队) Equal Contributions Project Lead(同等贡献项目负责人) Project Lead(项目负责人) Corresponding Author(通讯作者)

AI总结 提出WorldLens基准,从生成、重建、动作跟随、下游任务和人类偏好五个方面评估生成世界模型在视觉真实性、几何一致性、物理合理性和功能可靠性上的表现,并构建WorldLens-26K数据集和WorldLens-Agent评估模型以实现可扩展的可解释评分。

Comments CVPR 2026 Oral Presentation; 80 pages, 37 figures, 29 tables; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04069 2026-06-02 cs.CV cs.RO

SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL

SpaceTools: 通过双交互强化学习实现工具增强的空间推理

Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA University of Michigan(密歇根大学)

AI总结 提出双交互强化学习(DIRL)框架,通过两阶段训练让视觉语言模型学会协调多种工具(如深度估计、分割、姿态估计)进行精确空间推理,在多个基准上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22881 2026-06-02 cs.CV

CLIP-like Model as a Foundational Density Ratio Estimator

CLIP-like模型作为基础密度比估计器

Fumiya Uchiyama, Rintaro Yanagi, Shohei Taniguchi, Shota Takashiro, Masahiro Suzuki, Hirokatsu Kataoka, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) AIST(日本产业技术综合研究所)

AI总结 本文重新解释CLIP类模型为预训练的通用密度比估计器,提出重要性权重学习和KL散度估计两种应用,通过单一提示提升F1分数达7点,并利用KL散度实现数据筛选。

Comments Accepted to CVPR 2026. Code: https://github.com/fumiyauchiyama/CLIP_Density_Ratio

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20333 2026-06-02 cs.AI cs.LG cs.NE

NNGPT: Rethinking AutoML with Large Language Models

NNGPT: 用大型语言模型重新思考AutoML

Roman Kochnev, Waleed Khalid, Tolgay Atinc Uzun, Xi Zhang, Yashkumar Sanjaybhai Dhameliya, Furui Qin, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

AI总结 提出NNGPT开源框架,利用大型语言模型实现自我改进的AutoML引擎,通过生成-评估-自我改进闭环自动设计神经网络架构和超参数。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 5664-5674, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24078 2026-06-02 cs.CV

Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification

超越对象:面向细粒度分类的上下文合成数据生成

William Yang, Xindi Wu, Zhiwei Deng, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

AI总结 提出BOB微调策略,通过提取并条件化类不可知属性(如场景背景和物体姿态)来缓解过拟合,提升细粒度分类中合成训练数据的质量,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17045 2026-06-02 cs.CV cs.AI cs.LG

Video Reasoning without Training

无需训练的视频推理

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague

机构 * Qualcomm AI Research(高通AI研究) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。

Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01653 2026-06-02 cs.CV

MCPDepth: Omnidirectional Depth Estimation via Stereo Matching from Multi-Cylindrical Panoramas

MCPDepth:基于多圆柱全景图的立体匹配全方位深度估计

Feng Qiao, Zhexiao Xiong, Xinge Zhu, Yuexin Ma, Qiumeng He, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) The Chinese University of Hong Kong(香港中文大学) ShanghaiTech University(上海科技大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出MCPDepth两阶段框架,通过圆柱全景图的立体匹配和融合,利用循环注意力模块处理垂直畸变,在标准网络组件上实现高效的全方位深度估计,在Deep360和3D60数据集上MAE分别降低18.8%和19.9%。

Comments Accepted at the OmniCV Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10552 2026-06-02 cs.LG cs.AI cs.CV cs.DL

LEMUR Neural Network Dataset: Towards Seamless AutoML

LEMUR 神经网络数据集:迈向无缝 AutoML

Arash Torabi Goodarzi, Roman Kochnev, Waleed Khalid, Hojjat Torabi Goudarzi, Furui Qin, Tolgay Atinc Uzun, Yashkumar Sanjaybhai Dhameliya, Yash Kanubhai Kathiriya, Zofia Antonina Bentyn, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

AI总结 提出 LEMUR 开源数据集与框架,通过统一模板、结构化存储和自动化超参数优化,标准化神经网络实现与评估,以加速 AutoML 研究并促进公平基准测试。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3291-3300, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07617 2026-06-02 cs.CV

Scaling Pre-training to One Hundred Billion Data for Vision Language Models

将视觉语言模型的预训练扩展到一千亿数据

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

AI总结 本文通过实验探究将视觉语言模型预训练数据扩展到一千亿规模的效果,发现传统基准性能饱和,但文化多样性任务和低资源语言受益显著,并指出质量过滤可能减少文化多样性。

Comments v2: CVPR Findings'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31596 2026-06-01 cs.CV cs.LG

KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems

KLIP:通过逆问题中扩散先验的KL散度进行局部分布偏移检测

Alireza Kheirandish, Jihoon Hong, Sara Fridovich-Keil

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出基于KL散度的OOD检测指标,无需校准数据或偏移分布知识,可检测并定位图像中的局部分布偏移。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31576 2026-06-01 cs.CV

Joint Multi-Camera LiDAR Extrinsic Calibration via Learned Pairwise Initialization and Geometric Refinement

联合多相机激光雷达外参标定:基于学习的成对初始化与几何优化

Aziz Al-Najjar, Marzieh Amini, James R. Green, Felix Kwamena

机构 * Department of System and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学)

AI总结 提出两阶段框架,先通过CMRNext独立估计每个相机的外参和2D-3D对应,再通过联合光束法平差优化实现全局一致的多相机标定,显著提升精度和一致性。

Comments Paper is accepted in CVPR 2026 Workshop URVI: Unified Robotic Vision with Cross-Modal Sensing and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31551 2026-06-01 cs.CV

SMART: SMPLest-X Mesh Adaptation and RAFT Tracking for Soccer Pose Estimation

SMART: SMPLest-X 网格自适应与 RAFT 跟踪用于足球姿态估计

Parthsarthi Rawat

机构 * GameChanger by Dick’s Sporting Goods(Dick’s Sporting Goods 游戏革新部)

AI总结 提出 SMART 方法,通过微调 SMPLest-X 模型、结合 RAFT 光流相机跟踪和足部平面锚定等策略,在 FIFA 骨骼跟踪挑战中显著降低 3D 姿态估计误差。

Comments CVPR 2026 SoccerNet FIFA Skeleton Tracking Light Challenge, Rank 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31400 2026-06-01 cs.CV

FSM-Net: An Efficient Frequency-Spatial Network for Real-World Deblurring

FSM-Net:一种用于真实世界去模糊的高效频率-空间网络

Vinh-Thuan Ly

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University, Ho Chi Minh City(越南国家大学)

AI总结 提出FSM-Net,通过频率注意力模块和交叉门控视觉E-Branchformer实现高效双域去模糊,在NTIRE 2026挑战赛中获得第二名。

Comments Accepted to NTIRE Workshop at CVPR 2026. Project page: https://efficient-deblurring-fsmnet.vercel.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31284 2026-06-01 cs.CV cs.AI

SAM for Robust Mitochondria Instance Segmentation in Fluorescence Microscopy

SAM 用于荧光显微镜中鲁棒的线粒体实例分割

Suyog Jadhav, Dilip K. Prasad, Krishna Agarwal

机构 * UiT The Arctic University of Norway(UiT北极大学)

AI总结 通过仅在合成荧光显微镜数据上微调 SAM,解决了真实数据稀缺问题,提高了线粒体实例分割的精度和平均 Dice 分数。

Comments Accepted at PHAROS-AIF-MIH workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31227 2026-06-01 cs.CV

HiERO-StepG @ Ego4D Step Grounding Challenge: hierarchical activity understanding enables zero-shot step grounding

HiERO-StepG @ Ego4D Step Grounding Challenge: 层次化活动理解实现零样本步骤定位

Andrea Zenotto, Simone Alberto Peirone, Francesca Pistilli, Giuseppe Averta

机构 * Politecnico di Torino(托里诺理工大学)

AI总结 提出HiERO-StepG方法,利用弱监督层次化表示学习和聚类,无需任务特定微调即可实现零样本步骤定位,在Ego4D挑战中达到56.27% R@1 (IoU=0.3)。

Comments Technical report for the Ego4D Goal Step - Step Grounding challenge at CVPR 2026, derived from arXiv:2505.12911

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31204 2026-06-01 cs.CV

Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

基于整流流变压器的概率降水临近预报

Johannes Schusterbauer, Jannik Wiese, Nick Stracke, Timy Phan, Björn Ommer

机构 * CompVis LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

AI总结 提出FREUD模型,通过帧级编码器和统一解码器结合整流流变压器,在保持不确定性的同时实现高效时空压缩,在SEVIR基准上达到降水临近预报最优性能。

Comments CVPR 2026, Project Page: https://compvis.github.io/weather-rf/

详情

展开后加载摘要…

URL PDF HTML 收藏