Text-to-3D with Classifier Score Distillation
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
Comments Our project page is https://xinyu-andy.github.io/Classifier-Score-Distillation
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
Comments Our project page is https://xinyu-andy.github.io/Classifier-Score-Distillation
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
Journal ref IEEE Transactions on Image Processing (TIP), 2023
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
Comments ICCV 2023 conference; project page at: https://holodiffusion.github.io/holofusion
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR
专题命中 效率与蒸馏 :image editing(abstract);分类 cs.CV、cs.GR
Comments ACM SIGGRAPH
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments https://vcai.mpi-inf.mpg.de/projects/GVP/index.html
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR
Journal ref ACM Transactions on Graphics, 20(1), January 2001
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV;diffusion(comments)
Comments Accepted by NeurIPS 2023 Workshop on Diffusion Models
专题命中 效率与蒸馏 :diffusion(abstract,comments);分类 cs.CV
Comments To be published in the 2017 Computational Diffusion MRI Workshop of MICCAI
AdaptPrompt: 为通用深度伪造检测高效调整视觉语言模型参数
机构 * University of Waterloo(滑铁卢大学) ; University of Bergen(卑尔根大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 AdaptPrompt通过参数高效迁移学习框架,利用CLIP模型提升深度伪造检测的泛化能力,实现跨领域和少量样本下的高准确率识别。
Comments Accepted at DFF ACM Multimedia 2026
补丁的崩溃
机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 通过补丁崩溃视角提升图像建模效率,利用补丁依赖关系优化图像生成与分类
Comments 12 pages, 9 figures
RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。
EfficientSync:基于变形参考纹理混合的实时唇形同步
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; South China University of Technology(华南理工大学) ; University of Rochester(罗切斯特大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 EfficientSync是一种基于变形的实时唇形同步框架,通过动态纹理混合器等技术保留参考纹理,在HDTF和VFHQ数据集上以166 FPS实现领先的视觉质量与身份保留效果。
Comments Under review
AViTS:用于高效动态分辨率生成的自适应时空令牌选择
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) ; Jilin University(吉林大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容
Comments Accepted to ECCV 2026. 20 pages including appendix. Code: https://github.com/QHR69/AViTS
SQuad:用于高效视频生成的次二次注意力蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。
基于同步感知跨模态稀疏注意力的高效视听生成
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba Cloud Computing(阿里巴巴云计算) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
IMPLICITSTAINER:基于神经隐式函数的无分辨率依赖数据高效虚拟染色
机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) ; Department of Pathology, University of Utah(犹他大学病理学系)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出IMPLICITSTAINER,通过神经隐式深度学习模型将H&E图像转化为IHC图像,实现无分辨率依赖的高效虚拟染色,提升低数据场景下的鲁棒性与输出确定性。
DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。
Comments project page: https://sleepy1231.github.io/DreOPD/
GeoFlow:基于几何对齐先验的高效驾驶视频生成
机构 * Beihang University(北京航空航天大学) ; Macquarie University(麦考瑞大学) ; Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) ; Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。
Comments Accepted at ECCV 2026
DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。
MotionStrata:用于紧凑视频自编码的分层运动隐变量
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Li Auto ; Zhejiang Lab(浙江实验室) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。
Flash-VAED: 用于高效视频生成的即插即用VAE解码器
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。
Comments Accepted by ICML 2026
自监督表示引导的生成式数据集蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。
用于高效视频生成的 Token 半径注意力机制
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。
Comments Code: https://github.com/GuoCalix/TurboClear
ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑
专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV
AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器
基于潜在流匹配的混合域后验采样用于逆问题
机构 * College of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV
AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。
Comments Accepted to ACM Multimedia 2026
万松v1.0技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。
Comments Wan Team, Alibaba Group