arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-09 至 2025-12-09 共收录 95 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1 篇

2512.06020 2025-12-09 cs.CV cs.AI 85%

PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation

PrefGen: 多模态偏好学习用于偏好条件下的图像生成

Wenyi Mo, Tianyu Zhang, Yalong Bai, Ligong Han, Ying Ba, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) iN2X MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract);personalized generation(abstract);分类 cs.CV

AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。

Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与蒸馏 4 篇

2512.07503 2025-12-09 cs.CV 88%

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

SJD++: 改进的推测雅可比解码用于无训练加速离散自回归文本到图像生成

Yao Teng, Zhihuan Jiang, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) xAI Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 SJD++通过概率并行解码算法提升自回归文本到图像生成的效率,实现2-3倍的推理延迟降低和2-7倍的步骤压缩,同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09261 2025-12-09 cs.CV 57%

Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling

面向头部的KV缓存压缩以实现高效的视觉自回归建模

Ziran Qin, Youru Lv, Mingbao Lin, Hang Guo, Zeren Zhang, Danping Zou, Weiyao Lin

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 HACK通过面向头部的KV缓存压缩技术,有效降低VAR模型的注意力复杂度和内存开销,实现70%的缓存压缩率和1.57倍的推理加速。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02216 2025-12-09 cs.LG stat.ML 50%

Flatten Graphs as Sequences: Transformers are Scalable Graph Generators

将图扁平化为序列:Transformer是可扩展的图生成器

Dexiong Chen, Markus Krimmel, Karsten Borgwardt

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 AutoGraph利用Transformer模型将图扁平化为序列,实现高效可扩展的图生成,生成速度比扩散模型快100倍,并展示出良好的迁移能力。

Comments Camera-ready version published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏