arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2359 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2359 篇

2608.19965 2026-08-21 cs.CV cs.LG q-bio.QM 新提交 57%

Flow Matching Meets 3D Curvilinear Structure Segmentation in Medical Imaging

流匹配在医学影像三维曲线结构分割中的应用

Sidi Mohamed Sid'El Moctar, Nicolas Vitry, Hélène Bouvrais

机构 * CNRS(法国国家科学研究中心) Univ. Rennes(雷恩大学) Institute of Genetics and Development of Rennes (IGDR)(雷恩遗传与发育研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于流匹配的3D-CurvSegFlow模型,用于三维医学图像的曲线结构分割,在三个不同公开数据集上的表现优于通用及血管专用方法,为医学图像分析提供高效泛化的新方向。

Comments International Workshop on Machine Learning in Medical Imaging (MLMI 2026) @ MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19900 2026-08-21 cs.CV 新提交 57%

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

AvatarDynamizer:通过生成式动态纹理从静态化身到动态人类化身

Guoxing Sun, Heming Zhu, Linjie Lyu, Pascal Fua, Christian Theobalt, Marc Habermann

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) EPFL(洛桑联邦理工学院) VIA Research Center(VIA研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AvatarDynamizer是一种生成式方法,可将现成静态3D化身转为可控多视角一致4D化身,通过纹理空间动态嵌入实现真实表面动态,在视觉保真度上优于通用方法。

Comments Project page: https://vcai.mpi-inf.mpg.de/projects/AvatarDynamizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-21 cs.LG cs.CV 新提交 57%

Continuous Adversarial MeanFlow Transfer

连续对抗平均流迁移

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出MeanFlow-Transfer与Continuous Adversarial MeanFlow,解决有限数据下新域生成器训练的适配与加速问题,在四个源模型适配五个目标域时,FID等指标相当或更优且NFEs最多减125倍,少步FID平均提29%。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20112 2026-08-21 eess.IV cs.CV physics.med-ph 新提交 57%

Flow Matching-Based PET Image Reconstruction

基于流匹配的正电子发射断层扫描(PET)图像重建

Fumio Hashimoto, Ziqian Huang, Tatsuya Yokota, Kuang Gong

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出两种基于流匹配的PET图像重建方法,经[$^{\text{18}}\text{F}$]FDG脑部PET数据集实验,其在不同剂量水平下的偏差-方差权衡优于其他参考方法,展现出流匹配作为定量PET重建生成先验的潜力。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18907 2026-08-20 cs.CV cs.AI 新提交 57%

Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets

面向小规模数据集的学习状态感知动态生成式数据增强

Ting Xiang, Chenxi Deng, Jinhui Zhao, Bingting Jiang, Ke Zhang, Changjian Chen, Zhuo Tang

机构 * Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对小规模图像分类数据稀缺问题,提出LSADA方法,通过构建样本学习状态映射增强强度,采用解耦增强与扩散融合策略,在9个数据集上较SOTA动态GDA方法取得平均2.5%-4.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18523 2026-08-20 cs.CV cs.AI 新提交 57%

Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection

用于通用AI生成图像检测的先验条件高斯判别模型

Shashank Kotyan, Makoto Shing, Yuki Imajuku, Rujikorn Charakorn, Tarin Clanuwat

机构 * Sakana AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测在多因素变化下失效的问题,提出先验条件高斯判别梯方法,在Percept-Lens数据集上验证其性能,推动相关报告与基线的优化。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18516 2026-08-20 cs.CV cs.AI 新提交 57%

OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation

OptiModNet:用于视盘和视杯分割的结合分组查询与通道注意力的UNet-Transformer混合模型

Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra

机构 * IEM Saltlake(IEM盐湖校区) Techno Main Salt Lake(Techno主盐湖校区) VIT Bhopal University(博帕尔维洛尔理工大学) IIT Jodhpur(焦特布尔印度理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出OptiModNet,一款用于视盘和视杯分割的轻量混合架构,结合分组查询与通道注意力及聚合金字塔损失,在REFUGE2数据集上实现超现有方法2.5%的最优性能,且仅需3.73 GFLOPs和1.93M参数,兼顾高性能与低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 57%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交 57%

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: https://li00147.github.io/SPVC-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17095 2026-08-19 cs.CV 新提交 57%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

Journal ref European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 57%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14758 2026-08-18 eess.IV cs.AI cs.CV 新提交 57%

Synthesizing Post-Acetazolamide Cerebral Blood Flow Maps from Baseline MRI in Moyamoya Using 3D Generative AI

利用3D生成AI从烟雾病患者的基线MRI合成乙酰唑胺给药后脑血流量图

Julia Huang, Camila Gonzalez, Rydham Goyal, Aja Zou, Sasha Alexander, Michael Moseley, Moss Y. Zhao, Gary K. Steinberg

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CAE3D模型,可从烟雾病患者基线MRI合成乙酰唑胺后脑血流量图,在多指标上优于对比方法,为ACZ禁忌患者的血流动力学评估提供可行方案。

Comments 25 pages. Accepted at Machine Learning for Healthcare (MLHC 2026). To appear in Proceedings of Machine Learning Research (PMLR), volume 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16457 2026-08-18 cs.CV cs.AI 新提交 57%

Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos

用于教学视频中推理时流程规划的对比能量场(CEFITO)

Mohamed Afham, Christoph Reich, Oliver Hahn, Daniel Cremers, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。

Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16380 2026-08-18 cs.CV cs.AI 新提交 57%

Synthetic Data Augmentation for Satellite-Based Analysis of Battle-Damaged Agricultural Fields in Ukraine

用于乌克兰战区受损农田卫星分析的合成数据增强方法

Marta Sumyk, Oleksandr Kosovan, Iryna Voitsitska

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对乌克兰受损农田卫星分析的标注数据稀缺问题,采用类别条件GAN与DDPM生成合成农田样本,结合真实数据训练视觉Transformer,使分类性能显著提升,验证了合成卫星图像在数据稀缺地理空间应用的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15555 2026-08-18 cs.CV cs.LG 新提交 57%

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

RigidBench:评估视频生成模型中的刚体物理效果

Swarnim Jain, Shangzhe Wu

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。

Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15298 2026-08-18 cs.CV 新提交 57%

Image Denoising via the Adaptive Rank-Cluster Filter

基于自适应秩聚类滤波器的图像去噪方法

Dmitry Pozdnyakov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应秩聚类滤波器,经Otsu聚类、模糊融合处理像素强度,在混合噪声场景下对图像去噪的鲁棒性优于多种基线滤波算法。

Comments 18 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15296 2026-08-18 cs.CV 新提交 57%

FMReward: Aligning and Evaluating Audio-Driven 3D Facial Animation with Human Preferences

FMReward:基于人类偏好的音频驱动三维面部动画对齐与评估框架

Sijing Wu, Yunhao Li, Zhilin Gao, Huiyu Duan, Yucheng Zhu, Guangtao Zhai, Patrick Le Callet

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学 USC-文化创意产业学院) Institut Universitaire de France (IUF)(法国大学研究院) University of Nantes(南特大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文构建首个音频驱动三维面部动画人类偏好数据集FMPair,提出FMReward奖励模型与FMFL微调算法,可更好对齐人类偏好,提升该类动画的感知质量。

Comments Accepted for publication in IEEE TVCG, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15141 2026-08-18 cs.CV 新提交 57%

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

HOIMask:面向用于人机交互生成的生成式掩码建模

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Fuzhou University(福州大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-18 cs.CV 新提交 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14706 2026-08-18 cs.CV cs.AI cs.LG 新提交 57%

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

均衡强迫:无需噪声条件的自适应视频生成

Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校) MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。

Comments Project page: https://equilibriumforcing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 57%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14046 2026-08-17 cs.CV 新提交 57%

Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking

基于潜在感知自适应掩码的源无关图像翻译

Tomislav Dobrički, Byung-Woo Hong

机构 * Chung-Ang University(中央大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出一种源无关图像翻译框架,通过潜在感知自适应掩码方案,在AFHQ、Celeba-HQ数据集上优于现有无监督图像到图像方法,无需专门训练即可实现跨源分布的无缝翻译。

Comments This paper has been accepted for publication at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交 57%

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-08-14 cs.CV cs.RO 新提交 57%

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12997 2026-08-14 cs.CV 新提交 57%

PixSDS: Why Latent SDS Makes Noisy Pixels

PixSDS:潜在SDS为何会产生带噪像素

Vsevolod Skorokhodov

机构 * EPFL(洛桑联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对潜在SDS生成3D时的像素漂移问题,提出轻量级VAE一致性梯度修复方法PixSDS,减少结构化伪影并保留语义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12780 2026-08-14 cs.CV 新提交 57%

SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention

SCOPE:用于稀疏视频注意力的在线分头Top-K估计的子空间聚类

Qi Zhao, Qirui Li, Hanlin Tang, Yiduo Li, Zhen Guo, Cuifeng Shen, Chao Xu, Zhaosheng Chi, Xiaojin Lu, Kan Liu, Tao Lan, Lin Qu, Xi Li

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SCOPE是一种无训练稀疏注意力框架,通过子空间聚类与在线分头Top-k估计解决视频DiTs的高成本问题,在6种配置中优于基线,实现1.99倍加速且保持28.46 dB PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 57%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏