arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2551 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2551 篇

2511.20565 2026-03-25 cs.CV 57%

DINO-Tok: Adapting DINO for Visual Tokenizers

DINO-Tok:为视觉分词器适应DINO

Mingkai Jia, Mingxiao Li, Zhijian Shu, Anlin Zheng, Liaoyuan Fan, Jiaxin Guo, Tianxing Shi, Dongyue Lu, Zeming Li, Xiaoyang Guo, Xiaojuan Qi, Xiao-Xiao Long, Qian Zhang, Ping Tan, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Horizon Robotics(Horizon机器人) Nanjing University(南京大学) Hong Kong University(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22375 2026-03-25 cs.LG cs.AI cs.CV 57%

Three Creates All: You Only Sample 3 Steps

三步创造一切:你只需采样三步

Yuren Cai, Guangyi Wang, Zongqing Li, Li Li, Zhihui Liu, Songzhi Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Artificial Intelligence, Shenzhen Polytechnic University(深圳职业技术学院人工智能学院) Algorithm Research Department, Truesight(Truesight算法研究部)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MTEO方法,通过冻结预训练扩散模型并蒸馏分层时间嵌入,提升少步采样效率,实验证明在多样本集上达到最优性能,显著缩小蒸馏与轻量方法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22271 2026-03-24 cs.CV 57%

DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

DUO-VSR:双流蒸馏用于一步视频超分辨率

Zhengyao Lv, Menghan Xia, Xintao Wang, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 DUO-VSR提出双流蒸馏策略,通过轨迹保留蒸馏、双流优化和偏好引导细化,解决视频超分辨率中训练不稳定和监督不足的问题,提升视觉质量和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21864 2026-03-24 cs.CV cs.AI 57%

Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

自适应视频蒸馏:缓解少步生成中的过饱和与时间崩溃

Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出针对视频扩散模型的自适应蒸馏框架,通过动态回归损失、时间正则化损失和推理时帧插值策略,提升少步视频生成的稳定性和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21619 2026-03-24 cs.CV cs.AI 57%

Efficient Zero-Shot AI-Generated Image Detection

高效的人工智能生成图像检测

Ryosuke Sonoda, Ramya Srinivasan

机构 * Fujitsu Ltd., Japan(日本富士通株式会社) Fujitsu Research of America, Inc., USA(美国富士通研究公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的图像检测方法,通过测量表示对结构化频率扰动的敏感性,实现对细微篡改的检测,方法计算效率高,检测速度比现有方法快一个到两个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20690 2026-03-24 cs.CV 57%

MFSR: MeanFlow Distillation for One Step Real-World Image Super Resolution

MFSR:用于一步真实世界图像超分辨率的MeanFlow蒸馏

Ruiqing Wang, Kai Zhang, Yuanzhi Zhu, Hanshu Yan, Shilin Lu, Jian Yang

机构 * Nanjing University(南京大学) LIX, École Polytechnique, CNRS, IPP(巴黎高等学院LIX研究所、法国国家科学研究中心、ipp) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MFSR提出一种单步蒸馏框架,通过MeanFlow作为学习目标,实现高效高质量的图像超分辨率,同时保留少量步骤的可选路径以进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12060 2026-03-24 cs.LG cs.AI cs.CV 57%

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

你的VAR模型实际上是一个高效且可解释的生成分类器

Yi-Chung Chen, David I. Inouye, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃洛姆家族电气与计算机工程学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视觉自回归模型的新型生成分类器,引入A-VARC+提升准确率与推理速度,展示VAR方法在可解释性和灾难性遗忘抵抗方面的独特优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV 57%

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18572 2026-03-20 eess.IV cs.CV 57%

UEPS: Robust and Efficient MRI Reconstruction

UEPS:鲁棒且高效的MRI重建

Xiang Zhou, Hong Shang, Zijian Zhan, Tianyu He, Jintao Meng, Dong Liang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University, China(生物医学工程学院,深圳大学医学院,深圳大学,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology, China(计算机科学与人工智能学院,深圳先进技术大学,中国) State Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统国家重点实验室,中国科学院,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UEPS框架,通过消除CSM依赖、渐进分辨率和稀疏注意力机制,提升MRI重建的鲁棒性和效率,在多种临床转移测试中表现优异。

Comments The document contains the main paper and additional experimental details in the supplementary material. Open-source code can be found at: https://github.com/HongShangGroup/UEPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14331 2026-03-19 cs.CV 57%

AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising

AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars

Liyuan Cui, Wentao Hu, Wenyuan Zhang, Zesong Yang, Fan Shi, Xiaoqiang Liu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV 57%

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15279 2026-03-17 cs.LG cs.CV 57%

Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling

通过改进的数据-噪声耦合实现流基生成模型的更快推理

Aram Davtyan, Leello Tadesse Dadi, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LOOM-CFM方法,通过优化 minibatch OT 跨 minibatch 的 assignments,提升流基生成模型在样本速度与质量间的平衡,支持高分辨率潜在空间合成和蒸馏初始化。

Comments Patched from ICLR2025. Code: https://github.com/araachie/loom-cfm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13438 2026-03-17 cs.CV cs.AI 57%

Draft-and-Target Sampling for Video Generation Policy

视频生成策略的草稿与目标采样

Qikang Zhang, Yingjie Lei, Wei Liu, Daochang Liu

机构 * South China Normal University(华南师范大学) University of Western Australia(西澳大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08629 2026-03-17 cs.CV 57%

Dynamic Mixture-of-Experts for Visual Autoregressive Model

动态专家混合模型用于视觉自回归模型

Jort Vincenti, Metod Jazbec, Guoxuan Xia

机构 * University of Amsterdam(阿姆斯特丹大学) UvA-Bosch Delta Lab(UvA-博斯奇Delta实验室) Imperial College London(伦敦帝国学院)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种动态专家混合路由机制,用于改进视觉自回归模型,通过规模感知阈值策略在不额外训练的情况下提升效率和质量,实现20%的FLOPs减少和11%的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12036 2026-03-13 cs.CV physics.optics 57%

Single Pixel Image Classification using an Ultrafast Digital Light Projector

单像素图像分类使用超快数字光投影仪

Aisha Kanwal, Graeme E. Johnstone, Fahimeh Dehkhoda, Johannes H. Herrnsdorf, Robert K. Henderson, Martin D. Dawson, Xavier Porte, Michael J. Strain

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本研究利用单像素成像技术与低复杂度机器学习模型,实现超快图像分类,通过空间时间变换避免图像重建,展示其在超快成像中的异常检测潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10893 2026-03-12 cs.CV 57%

S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

S2D:基于稀疏到密集的3D重建方法,使用最少输入

Yuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang, Guangzhi Cao, Lizhuang Ma, Yuan Xie, Xin Tan

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chery Automobile(奇瑞汽车)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 S2D通过稀疏到密集的提升方法,在最少输入下实现高质量的3DGS重建,提升稀疏点云和3DGS的一致性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10583 2026-03-12 cs.CV 57%

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

属性作为检索:模型无关的AI生成图像属性

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。

Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10340 2026-03-12 cs.CV cs.AI cs.RO cs.SY eess.SY 57%

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

通过概念门控视觉蒸馏克服视觉杂乱

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

机构 * University of Technology Sydney(技术大学悉尼大学) Western Sydney University(西悉尼大学)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。

Comments 7 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12229 2026-03-12 cs.CV 57%

Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder

超低比特率感知图像压缩与浅层编码

Tianyu Zhang, Dong Liu, Chang Wen Chen

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种非对称极值图像压缩框架,利用浅层编码器和单步扩散解码器实现超低比特率下的高保真度重建,同时提升编码效率和解码速度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 57%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07476 2026-03-10 cs.CV 57%

EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

EVLF: 早期视觉-语言融合用于生成数据集蒸馏

Wenqi Cai, Yawen Zou, Guang Li, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(东福冈大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EVLF通过早期视觉-语言融合提升生成数据集蒸馏的语义准确性和视觉一致性。

Comments CVPR2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV 57%

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10466 2026-03-10 cs.LG cs.AI cs.CR cs.CV 57%

Efficient Semi-Supervised Adversarial Training via Latent Clustering-Based Data Reduction

通过基于潜在聚类的数据减少实现高效的半监督对抗训练

Somrita Ghosh, Yuelin Xu, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全赫尔姆霍兹中心)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于潜在聚类的数据减少方法,有效降低半监督对抗训练的数据和计算需求,同时保持鲁棒性优势。

Comments Shorter version of this work accepted by NextGenAISafety Workshop at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06449 2026-03-09 cs.CV 57%

CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization

CaTok:通过Mean流平滑均值流以实现一维因果图像标记化

Yitong Chen, Zuxuan Wu, Xipeng Qiu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究所,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CaTok 通过 MeanFlow 解码器实现一维因果图像标记化,提升图像生成与重建性能。

Comments Project website is available in https://sharelab-sii.github.io/catok-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13669 2026-03-09 cs.CV cs.AI cs.LG 57%

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

CanvasMAR: 通过Canvas提升遮蔽自回归视频预测

Zian Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05503 2026-03-06 cs.CV 57%

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

通过校准稀疏注意力加速文本到视频生成

Shai Yehezkel, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar

机构 * Apple Tel Aviv University(苹果以色列大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CalibAtt通过校准稀疏注意力提升文本到视频生成的效率,实现1.58倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01776 2026-03-06 cs.CL cs.AI cs.CV 57%

FreeAct: Freeing Activations for LLM Quantization

FreeAct: 为LLM量化释放激活

Xiaohao Liu, Xiaobo Xia, Manyi Zhang, Ji-Fu Li, Xianzhi Yu, Fei Shen, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Huawei Technology(华为技术有限公司) Central South University(中央南大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FreeAct通过放松静态转换约束,为LLM量化提供动态适应的激活转换方法,实现性能提升5.3%。

Comments 26 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05589 2026-03-06 cs.CV cs.AI cs.LG 57%

ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation

ReactDance: 基于分层表示的高保真且一致的长形式反应舞蹈生成

Jingzhong Lin, Xinru Li, Yuanyuan Qi, Bohao Zhang, Wenxiang Liu, Kecheng Tang, Wenxuan Huang, Xiangfeng Xu, Bangyan Li, Changbo Wang, Gaoqi He

机构 * East China Normal University(东华师范大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReactDance通过分层潜在空间和非自回归采样策略,提升长形式反应舞蹈生成的高保真度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04379 2026-03-05 cs.CV 57%

Helios: Real Real-Time Long Video Generation Model

Helios:实时长视频生成模型

Shenghai Yuan, Yuanyang Yin, Zongjian Li, Xinwei Huang, Xiao Yang, Li Yuan

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Helios是首个无需并行框架、能实时生成长视频且质量媲美基线模型的14B视频生成模型。

Comments Page: pku-yuangroup.github.io/Helios-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01515 2026-03-04 cs.CV 57%

FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

FACE:一种基于面部的自回归表示,用于高保真和高效的网格生成

Hanxiao Wang, Yuan-Chen Guo, Ying-Tian Liu, Zi-Xin Zou, Biao Zhang, Weize Quan, Ding Liang, Yan-Pei Cao, Dong-Ming Yan

机构 * CASIA UCAS VAST KAUST

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FACE提出了一种基于面的自回归表示方法,通过在面级别生成网格,显著提高3D网格生成的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏