arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-30 至 2025-12-30 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2512.22374 2025-12-30 cs.CV cs.AI cs.LG 89%

Self-Evaluation Unlocks Any-Step Text-to-Image Generation

自我评估解锁任意步文本到图像生成

Xin Yu, Xiaojuan Qi, Zhengqi Li, Kai Zhang, Richard Zhang, Zhe Lin, Eli Shechtman, Tianyu Wang, Yotam Nitzan

机构 * The University of Hong Kong(香港大学) Adobe Research(Adobe研究)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Self-E 是一种新颖的从头开始训练方法,通过自我评估机制实现任意步文本到图像生成,兼具高效与高质量生成能力。

Comments Project page: https://xinyu-andy.github.io/SelfE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23576 2025-12-30 cs.CV 79%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22802 2025-12-30 cs.LG cs.CV 79%

ReDiF: Reinforced Distillation for Few Step Diffusion

ReDiF: 基于强化学习的少步扩散模型知识蒸馏

Amirhossein Tighkhorshid, Zahra Dehghanian, Gholamali Aminian, Chengchun Shi, Hamid R. Rabiee

机构 * London School of Economics(伦敦经济学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 ReDiF通过强化学习方法实现少步扩散模型的知识蒸馏,以更高效的方式生成高质量样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21710 2025-12-30 cs.CV 57%

RAPTOR: Real-Time High-Resolution UAV Video Prediction with Efficient Video Attention

RAPTOR: 用于高效视频注意的实时高分辨率无人机视频预测

Zhan Chen, Zile Guo, Enze Zhu, Peirong Zhang, Xiaoxuan Liu, Lei Wang, Yidan Zhang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 RAPTOR通过高效视频注意机制实现了实时高分辨率视频预测,首次在Jetson AGX Orin上达到30 FPS以上,提升了无人机任务成功率18%。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04678 2025-12-30 cs.CV 57%

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

奖励强制:基于奖励分布匹配蒸馏的高效流式视频生成

Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) SIAS-ZJU SJTU(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 奖励强制通过EMA-Sink和Re-DMD提升流式视频生成效率与质量,实现23.1 FPS的高性能视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22166 2025-12-30 cs.SD eess.AS 50%

AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation

AudioGAN: 一种用于实时高保真文本到音频生成的紧凑高效框架

HaeChun Chung

机构 * KT Corporation(KT公司)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 AudioGAN通过单次通过生成音频,以更少的参数和更快的速度实现高保真文本到音频生成。

Comments 10 pages, 6 figures, Accepted to AES AIMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏