arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-29 至 2026-01-29 共收录 67 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 9 篇

2512.05150 2026-01-29 cs.CV 70%

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: 在大模型上实现一步生成的自对抗流

Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin

机构 * Inclusion AI Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。

Comments arxiv v1, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20168 2026-01-29 cs.CV 57%

Efficient Token Pruning for LLaDA-V

LLaDA-V的高效令牌修剪

Zhewen Wan, Tianchen Song, Chen Lin, Zhiyong Zhao, Xianpeng Lang

机构 * Li Auto Inc.(利自动公司) SJTU(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种针对LLaDA-V的结构化令牌修剪方法,通过在中层到后期层移除部分视觉令牌,减少计算开销并保持95%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11497 2026-01-29 cs.CV 57%

QVGen: Pushing the Limit of Quantized Video Generative Models

QVGen:推动量化视频生成模型的极限

Yushi Huang, Ruihao Gong, Jing Liu, Yifu Ding, Chengtao Lv, Haotong Qin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港理工大学) Beihang University(北京航空航天大学) SenseTime Research(商汤科技研究院) Monash University(墨尔本大学) Nanyang Technological University(南洋理工大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 QVGen通过量化感知训练框架在极低比特下实现高性能视频生成模型,首次达到全精度质量并优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20701 2026-01-29 cs.RO 50%

One Step Is Enough: Dispersive MeanFlow Policy Optimization

一步即可:分散均流策略优化

Guowei Zou, Haitao Wang, Hejun Wu, Yukun Qian, Yuhang Wang, Weibing Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(大数据分析与处理广东省重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 DMPO通过单步生成、分散正则化和强化学习微调,在实时机器人控制中实现高效动作生成,性能超越多步基线。

Comments Code and project page: https://guowei-zou.github.io/dmpo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20227 2026-01-29 cs.LG cs.AI cs.NA math.NA 50%

ProFlow: Zero-Shot Physics-Consistent Sampling via Proximal Flow Guidance

ProFlow:通过近端流引导实现零样本物理一致采样

Zichao Yu, Ming Li, Wenyi Zhang, Difan Zou, Weiguo Gao

机构 * University of Science School of Mathematical Sciences, Fudan University, Shanghai 200433, China Department of Electronic Engineering Information Science, University of Science School of Computing Data Science, The University of Hong Kong School of Mathematical Sciences, Fudan University, Shanghai 200433, China \& Shanghai Key Laboratory of Contemporary Applied Mathematics, Shanghai 200433, China

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 ProFlow通过近端引导框架实现零样本物理一致采样,有效平衡物理约束与生成先验的统计结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17517 2026-01-29 cs.SD cs.LG eess.AS 50%

EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding

EuleroDec:一种用于高效且鲁棒音频编码的复值RVQ-VAE

Luca Cerovaz, Michele Mancusi, Emanuele Rodolà

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) Moises Systems Inc.(莫伊塞斯系统公司) Paradigma(帕拉迪玛)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种复值RVQ-VAE音频编解码器,通过保持幅度-相位耦合,无需对抗判别器和扩散模型,实现了高效且高质量的音频编码。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他图像生成 1 篇

2601.20462 2026-01-29 cs.CE physics.comp-ph 50%

CM-GAI: Continuum Mechanistic Generative Artificial Intelligence Theory for Data Dynamics

CM-GAI:持续力学生成人工智能理论用于数据动态

Shan Tang, Ziwei Cao, Zhenling Yang, Jiachen Guo, Yicheng Lu, Wing Kam Liu, Xu Guo

专题命中 其他图像生成 :image generation(abstract)

AI总结 CM-GAI通过连续力学理论框架,利用少量数据生成材料、结构和系统层面的动态响应,为工程应用提供新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏