arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-07 至 2026-01-07 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 3 篇

2601.02594 2026-01-07 eess.IV cs.AI cs.CV 70%

Annealed Langevin Posterior Sampling (ALPS): A Rapid Algorithm for Image Restoration with Multiscale Energy Models

退火拉格朗日后验采样(ALPS):一种用于图像修复的多尺度能量模型快速算法

Jyothi Rikhab Chand, Mathews Jacob

机构 * University of Virginia(弗吉尼亚大学)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 ALPS通过多尺度能量模型和退火拉格朗日后验采样,提升图像修复和MRI重建的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 57%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23379 2026-01-07 cs.CV cs.AI 57%

SoulX-FlashTalk: Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation

SoulX-FlashTalk: 通过自校正双向蒸馏实现音频驱动的实时无限流式生成

Le Shen, Qian Qiao, Tan Yu, Ke Zhou, Tianhang Yu, Yu Zhan, Zhenjie Wang, Ming Tao, Shunshun Yin, Siyuan Liu

机构 * AIGC Team, Soul AI Lab, China(AIGC团队,Soul AI实验室,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SoulX-FlashTalk通过自校正双向蒸馏实现音频驱动的实时无限流式生成,首次达到亚秒启动延迟和32 FPS的高保真交互数字人合成标准。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏