arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-09 至 2025-12-09 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 4 篇

2512.07503 2025-12-09 cs.CV 88%

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

SJD++: 改进的推测雅可比解码用于无训练加速离散自回归文本到图像生成

Yao Teng, Zhihuan Jiang, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) xAI Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 SJD++通过概率并行解码算法提升自回归文本到图像生成的效率,实现2-3倍的推理延迟降低和2-7倍的步骤压缩,同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09261 2025-12-09 cs.CV 57%

Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling

面向头部的KV缓存压缩以实现高效的视觉自回归建模

Ziran Qin, Youru Lv, Mingbao Lin, Hang Guo, Zeren Zhang, Danping Zou, Weiyao Lin

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 HACK通过面向头部的KV缓存压缩技术,有效降低VAR模型的注意力复杂度和内存开销,实现70%的缓存压缩率和1.57倍的推理加速。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02216 2025-12-09 cs.LG stat.ML 50%

Flatten Graphs as Sequences: Transformers are Scalable Graph Generators

将图扁平化为序列:Transformer是可扩展的图生成器

Dexiong Chen, Markus Krimmel, Karsten Borgwardt

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 AutoGraph利用Transformer模型将图扁平化为序列,实现高效可扩展的图生成,生成速度比扩散模型快100倍,并展示出良好的迁移能力。

Comments Camera-ready version published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏