arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-29 至 2025-12-29 共收录 35 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2512.22096 2025-12-29 cs.CV 57%

Yume-1.5: A Text-Controlled Interactive World Generation Model

Yume-1.5:一种文本控制的交互式世界生成模型

Xiaofeng Mao, Zhen Li, Chuanhao Li, Xiaojie Xu, Kaining Ying, Tong He, Jiangmiao Pang, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21867 2025-12-29 cs.CV 57%

DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation

DPAR:动态分块化用于高效的自回归视觉生成

Divyansh Srivastava, Akshay Mehra, Pranav Maneriker, Debopam Sanyal, Vishnu Raj, Vijay Kamarshi, Fan Du, Joshua Kimball

机构 * University of California, San Diego(加州大学圣地亚哥分校) Dolby Laboratories(杜比实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 DPAR通过动态分块化技术提升自回归视觉生成效率,减少计算资源消耗并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21857 2025-12-29 cs.CV 57%

Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees

视觉自回归模型快速推断的邻接自适应动态草案树

Haodong Lei, Hongsong Wang, Xin Geng, Liang Wang, Pan Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(东南大学新一代人工智能技术及交叉应用重点实验室(教育部)) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),多模态人工智能系统国家重点实验室(MAIS),中国科学院自动化研究所(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ADT-Tree通过邻接自适应动态草案树提升视觉自回归模型的推断速度,实现3.13倍和3.05倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21338 2025-12-29 cs.CV 57%

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成

Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua

机构 * Meta AI Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。

Comments Project Page: http://haonanqiu.com/projects/HiStream.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21829 2025-12-29 stat.ML cs.LG 50%

Tilt Matching for Scalable Sampling and Fine-Tuning

倾斜匹配用于可扩展的采样与微调

Peter Potaptchik, Cheuk-Kit Lee, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) Kempner Institute(凯普纳研究所) IAIFI

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于倾斜匹配的算法,用于高效且可扩展地进行生成模型采样与微调,无需奖励梯度或轨迹反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏