arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2551 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2551 篇

2310.19415 2023-11-01 cs.CV cs.AI cs.GR 62%

Text-to-3D with Classifier Score Distillation

Xin Yu, Yuan-Chen Guo, Yangguang Li, Ding Liang, Song-Hai Zhang, Xiaojuan Qi

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Our project page is https://xinyu-andy.github.io/Classifier-Score-Distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12152 2023-10-16 cs.CV cs.GR 62%

Efficient Halftoning via Deep Reinforcement Learning

Haitian Jiang, Dongliang Xiong, Xiaowen Jiang, Li Ding, Liang Chen, Kai Huang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Journal ref IEEE Transactions on Image Processing (TIP), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14244 2023-08-29 cs.CV cs.GR 62%

HoloFusion: Towards Photo-realistic 3D Generative Modeling

Animesh Karnewar, Niloy J. Mitra, Andrea Vedaldi, David Novotny

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments ICCV 2023 conference; project page at: https://holodiffusion.github.io/holofusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12865 2023-07-25 cs.CV cs.GR cs.LG 62%

NeRF-GAN Distillation for Efficient 3D-Aware Generation with Convolutions

Mohamad Shahbazi, Evangelos Ntavelis, Alessio Tonioni, Edo Collins, Danda Pani Paudel, Martin Danelljan, Luc Van Gool

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09582 2023-07-20 cs.CV cs.GR 62%

Guided Linear Upsampling

Shuangbing Song, Fan Zhong, Tianju Wang, Xueying Qin, Changhe Tu

专题命中 效率与蒸馏 :image editing(abstract);分类 cs.CV、cs.GR

Comments ACM SIGGRAPH

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18193 2023-04-03 cs.CV cs.GR cs.LG 62%

GVP: Generative Volumetric Primitives

Mallikarjun B R, Xingang Pan, Mohamed Elgharib, Christian Theobalt

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR

Comments https://vcai.mpi-inf.mpg.de/projects/GVP/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12480 2021-11-25 cs.CV cs.GR cs.LG 62%

Octree Transformer: Autoregressive 3D Shape Generation on Hierarchically Structured Sequences

Moritz Ibing, Gregor Kobsik, Leif Kobbelt

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0511032 2009-12-01 cs.GR cs.CV 62%

Spatiotemporal sensistivity and visual attention for efficient rendering of dynamic environments

Yang Li Hector Yee

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR

Journal ref ACM Transactions on Graphics, 20(1), January 2001

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12232 2024-12-18 cs.CV cs.AI cs.LG 61%

You Only Submit One Image to Find the Most Suitable Generative Model

Zhi Zhou, Lan-Zhe Guo, Peng-Xiao Song, Yu-Feng Li

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV;diffusion(comments)

Comments Accepted by NeurIPS 2023 Workshop on Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09958 2017-08-04 cs.CV 61%

(k,q)-Compressed Sensing for dMRI with Joint Spatial-Angular Sparsity Prior

Evan Schwab, René Vidal, Nicolas Charon

专题命中 效率与蒸馏 :diffusion(abstract,comments);分类 cs.CV

Comments To be published in the 2017 Computational Diffusion MRI Workshop of MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17730 2026-08-25 cs.CV 版本更新 57%

AdaptPrompt: Parameter-Efficient Adaptation of VLMs for Generalizable Deepfake Detection

AdaptPrompt: 为通用深度伪造检测高效调整视觉语言模型参数

Yichen Jiang, Mohammed Talha Alam, Sohail Ahmed Khan, Duc-Tien Dang-Nguyen, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) University of Bergen(卑尔根大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 AdaptPrompt通过参数高效迁移学习框架,利用CLIP模型提升深度伪造检测的泛化能力,实现跨领域和少量样本下的高准确率识别。

Comments Accepted at DFF ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22281 2026-08-25 cs.CV 版本更新 57%

Collapse of Patches: Ranking Image Patches for Efficient Visual Modeling

补丁的崩溃

Wei Guo, Shunqi Mao, Zhuonan Liang, Xuanhua Yin, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 通过补丁崩溃视角提升图像建模效率,利用补丁依赖关系优化图像生成与分类

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20208 2026-08-21 cs.CV 新提交 57%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18832 2026-08-20 cs.CV 新提交 57%

EfficientSync: Real-Time Lip Synchronization via Deformation-Based Reference Texture Mixing

EfficientSync:基于变形参考纹理混合的实时唇形同步

Fa-Ting Hong, Runzhen Liu, Luchuan Song, Hongmin Cai, Chuhua Xian

机构 * The Hong Kong University of Science and Technology(香港科技大学) South China University of Technology(华南理工大学) University of Rochester(罗切斯特大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EfficientSync是一种基于变形的实时唇形同步框架,通过动态纹理混合器等技术保留参考纹理,在HDTF和VFHQ数据集上以166 FPS实现领先的视觉质量与身份保留效果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17995 2026-08-19 cs.CV 新提交 57%

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: https://github.com/QHR69/AViTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 57%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交 57%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新 57%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09831 2026-08-18 eess.IV cs.CV 版本更新 57%

IMPLICITSTAINER: Resolution Agnostic Data-Efficient Virtual Staining Using Neural Implicit Functions

IMPLICITSTAINER:基于神经隐式函数的无分辨率依赖数据高效虚拟染色

Tushar Kataria, Beatrice Knudsen, Shireen Y. Elhabian

机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) Department of Pathology, University of Utah(犹他大学病理学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出IMPLICITSTAINER,通过神经隐式深度学习模型将H&E图像转化为IHC图像,实现无分辨率依赖的高效虚拟染色,提升低数据场景下的鲁棒性与输出确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09233 2026-08-14 cs.LG cs.CV 版本更新 57%

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。

Comments project page: https://sleepy1231.github.io/DreOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12203 2026-08-13 cs.CV 新提交 57%

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09637 2026-08-11 cs.CV cs.AI 新提交 57%

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07136 2026-08-10 cs.CV 版本更新 57%

MotionStrata: Hierarchical Motion Latents for Compact Video Autoencoding

MotionStrata:用于紧凑视频自编码的分层运动隐变量

Wenzhang Sun, Huaize Liu, Chunfeng Wang, Biao Gong, Hao Li, Changqing Zou

机构 * University of Chinese Academy of Sciences(中国科学院大学) Li Auto Zhejiang Lab(浙江实验室) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19161 2026-08-06 cs.CV 版本更新 57%

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03218 2026-08-05 cs.CV cs.AI 新提交 57%

Self-Supervised Representation-Guided Generative Dataset Distillation

自监督表示引导的生成式数据集蒸馏

Mingzhuo Li, Guang Li, Linfeng Ye, Jiafeng Mao, Takahiro Ogawa, Konstantinos N. Plataniotis, Miki Haseyama

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 57%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01288 2026-08-04 cs.CV 新提交 57%

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion

TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法

Jiawei Guo, Junxian Li, Yixin Tang, Bingya Zhang, Jiaxin Lu, Yulun Zhang, Shangchen Zhou

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。

Comments Code: https://github.com/GuoCalix/TurboClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00769 2026-08-04 cs.CV 新提交 57%

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑

Zhiqiang Lao

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交 57%

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14749 2026-08-04 eess.AS cs.CV 版本更新 57%

WanSong v1.0 Technical Report

万松v1.0技术报告

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。

Comments Wan Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏