arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2551 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2551 篇

2605.30239 2026-08-04 cs.CV 版本更新 57%

CA-World: Multi-Object Counterfactual Alignment for Efficient Interactive-Ready Reconstruction

SAM3D-Phys:迈向真实世界中的多物体交互仿真

Xin Dong, Weijian Deng, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05372 2026-08-04 cs.CV cs.AI 57%

Two Steps Are All You Need: Efficient 3D Point Cloud Anomaly Detection with Consistency Models

两步即可:基于一致性模型的高效3D点云异常检测

Pranav A, Shashank B, Pranav Siddappa, Dominik Seuss, Minal Moharir, Subramanya KN

机构 * R.V. College of Engineering(R.V. 工程学院) Technical University of Applied Sciences Würzburg-Schweinfurt(Würzburg-Schweinfurt 应用科学大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于一致性学习的重建异常检测方法,通过简化推理过程提升效率,实现低延迟的3D点云异常检测,适用于资源受限设备。

Comments Accepted to CVPR 2026, at the 9th Workshop on Efficient Deep Learning for Computer Vision (ECV). To be published in the IEEE/CVF CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 3479-3487

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25318 2026-08-03 cs.CV 版本更新 57%

Dataset Distillation Based on Saliency-Driven Prototype Alignment

超越背景偏差:用于数据集蒸馏的显著性驱动原型对齐

Yawen Zou, Wenqi Cai, Guang Li, Ling Xiao, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(富山大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对数据集蒸馏中基于扩散方法的局限性,提出显著性驱动蒸馏框架,通过两步构建类判别潜在原型,增强代表性与泛化能力,实验证明其性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28144 2026-07-31 eess.IV cs.CV 新提交 57%

ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate

ReGenVC:超低位率下的端到端实时生成式视频编码

Zheyuan Zhang, Johnson Wu

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27755 2026-07-31 cs.CV 新提交 57%

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

EgoGVAE:基于引导变分自编码器的自我身体网格重建

Jaehun Jung, Wonjun Kim

机构 * Konkuk University(建国大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。

Comments 18 pages, 6 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 57%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11654 2026-07-30 cs.CV 版本更新 57%

Kinetic Mining in Context: Few-Shot Action Synthesis via Text-to-Motion Distillation

上下文中的动作合成:通过文本到运动蒸馏实现少样本动作合成

Luca Cazzola, Ahed Alboody

机构 * University of Trento(特伦托大学) CESI LINEACT

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 KineMIC通过文本到运动蒸馏实现少样本动作合成,提升HAR识别准确率23.1%

Comments To appear in the proceedings of 28th International Conference on Pattern Recognition (ICPR 2026). For references, please cite the official proceedings version. Paper website: https://lucazzola.github.io/kinemic-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02294 2026-07-30 cs.CV 版本更新 57%

Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation

通过置信度引导的数据增强改进未知协变量偏移下的知识蒸馏

Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) University of Tübingen(图宾根大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对未知协变量偏移下知识蒸馏效果受限的问题,提出置信度引导的扩散数据增强策略,经实验验证可提升多数据集上的相关准确率与虚假特征得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24377 2026-07-28 cs.LG cs.AI cs.CV 新提交 57%

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21553 2026-07-24 cs.CV 新提交 57%

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20940 2026-07-24 cs.CV 新提交 57%

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00543 2026-07-24 cs.CV 版本更新 57%

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩

Yiling Gao, Hongchen Wei, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18230 2026-07-21 cs.CV cs.AI 新提交 57%

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。

Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16361 2026-07-21 cs.CV 新提交 57%

Spatial Transport of Integration Error in Generative ODEs

生成常微分方程中积分误差的空间传输

Songheng Yin

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究生成常微分方程中积分误差的空间传输问题,通过带符号的源和传输计算,利用单步截断残差和结构破坏零值等方法分析误差,还发现训练惩罚注入变化可降误差,模型可据此训练改变。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交 57%

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新 57%

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09881 2026-07-13 cs.CV cs.AI cs.LG 版本更新 57%

Transition Matching Distillation for Fast Video Generation

用于快速视频生成的过渡匹配蒸馏

Weili Nie, Julius Berner, Nanye Ma, Chao Liu, Saining Xie, Arash Vahdat

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对大型视频模型多步采样低效问题,提出过渡匹配蒸馏框架TMD,将扩散模型多步去噪轨迹与少步概率过渡过程匹配,分解扩散主干为组件,经实验验证TMD在速度和质量权衡上表现出色,优于现有蒸馏模型。

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4645-4655

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 57%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08766 2026-07-10 cs.CV 新提交 57%

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏

Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen

机构 * Meituan(美团) HKUST(香港科技大学) City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。

Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08020 2026-07-10 cs.CV 新提交 57%

SAGA: Stable Acceleration Guidance for Autoregressive Video Generation

SAGA:自回归视频生成的稳定加速引导

Thanh-Nhan Vo, Trong-Thuan Nguyen, Trung-Hoang Le, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学) University of Dayton(Dayton 大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究自回归视频生成中因重复使用潜在变量致时间误差问题,提出SAGA方法,它整合加速域频谱引导目标与初始化策略,无需训练可直接用于现有模型,能提升时间质量、减少时间不稳定性并保持视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交 57%

Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成

Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) BlueImage, vivo(蓝城图像,维沃) Xian Jiaotong-Liverpool University(西交利物浦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19238 2026-07-09 cs.CV 版本更新 57%

Allo{SR}$^2$: Rectifying One-Step Super-Resolution to Stay Real via Allomorphic Generative Flows

Allo{SR}$^2$: 通过全形生成流纠正一步超分辨率以保持真实

Zihan Wang, Xudong Huang, Junbo Qiao, Wei Li, Jie Hu, Xinghao Chen, Shaohui Lin

机构 * East China Normal University Huawei Noah's Ark Lab(华东师范大学华为诺亚实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Allo{SR}$^2$,通过全形生成流纠正一步超分辨率轨迹,以维持高保真生成现实。方法利用SNR引导轨迹初始化和FATC确保稳定路径,同时通过ATM策略减少分布差异,实验证明其在真实世界超分辨率中表现优异。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19348 2026-07-09 cs.CV 版本更新 57%

When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators

当蒸馏破坏运动控制时:恢复快速视频生成器的生成轨迹

Jintao Rong, Xin Xie, Xinyi Yu, Linlin Ou, Xinyu Zhang, Chunhua Shen, Dong Gong

机构 * Zhejiang University of Technology(浙江工业大学) University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼)) University of Auckland(奥克兰大学) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究免训练运动定制应用于蒸馏视频生成器的问题,提出MotionEcho框架,通过推理时用高质量扩散教师模型校正学生模型采样轨迹,实现准确运动控制,提升运动保真度和视觉质量,且保留蒸馏生成效率优势。

Comments Project page: https://euminds.github.io/motionecho/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06481 2026-07-08 cs.CV cs.AI 新提交 57%

Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation

用于参数高效多镜头长视频外推的提示适配器上下文路由

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究多镜头长视频外推问题,提出PACR-Video框架,通过冻结文本到视频扩散变换器,用低秩时间适配器及递归提示库增强,结合特定调优目标和调度,在多基准测试中优于多种基线,证明其能为长视频外推提供可控能力。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05605 2026-07-08 cs.CV 新提交 57%

Patch Knowledge Transfer for Efficient AI-Generated Image Quality Assessment

用于高效人工智能生成图像质量评估的补丁知识转移

Jiquan Yuan

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对人工智能生成图像质量评估任务,主流方法存在计算成本高或评估准确性差的问题,提出基于知识蒸馏的补丁知识转移(PKT)框架,设计双模型架构,实验表明该框架能降低计算成本并平衡模型效率与评估准确性。

Comments 13 pages. ICME26 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09513 2026-07-08 physics.med-ph cs.AI cs.CV cs.LG eess.IV 版本更新 57%

Reduced NEXI protocol for the quantification of human gray matter microstructure on the Connectome 2.0 scanner

用于Connectome 2.0扫描仪中人类灰质微结构量化的一种简化NEXI协议

Quentin Uhl, Tommaso Pavan, Julianna Gerold, Kwok-Shing Chan, Yohan Jun, Shohei Fujita, Aneri Bhatt, Yixin Ma, Qiaochu Wang, Hong-Hsi Lee, Susie Y. Huang, Berkin Bilgic, Ileana Jelescu

机构 * Lausanne University Hospital (CHUV) and University of Lausanne(拉沃斯大学医院(CHUV)和拉沃斯大学) Massachusetts General Hospital(麻省总医院) Athinoula A. Martinos Center for Biomedical Imaging(阿提诺拉A.马丁诺斯生物医学成像中心)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种简化NEXI协议,利用可解释AI框架减少扫描时间,验证了其在体内的有效性,并展示了其在微结构映射中的优势。

Comments Submitted to Imaging Neuroscience. This all-in-one version includes supplementary materials. 34 pages, 145 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01725 2026-07-08 cs.LG cs.CV 版本更新 57%

Imbalance-Robust and Sampling-Efficient Continuous Conditional GANs via Adaptive Vicinal Learning and Auxiliary Regularization

通过自适应邻域学习和辅助正则化实现不平衡鲁棒且采样高效的连续条件生成对抗网络

Xin Ding, Yun Chen, Yongwei Wang, Kao Zhang, Sen Zhang, Peibei Cao, Xiangxue Wang

机构 * School of Artificial Intelligence/School of Future Technology, Nanjing University of Information Science & Technology, Nanjing, China(人工智能学院/未来技术学院,南京信息科学技术大学) Perceptual and Generative AI Lab, Nanjing University of Information Science & Technology, Nanjing, China(感知与生成人工智能实验室,南京信息科学技术大学) College of Media, Zhejiang University, Hangzhou, China(传媒学院,浙江大学) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对CcGAN固定大小邻域训练对标签密度敏感及CCDM计算昂贵问题,提出结合软/混合自适应邻域与辅助判别器引导正则化的CcGAN-AVAR,实验表明其能保持GAN采样效率,提升生成质量和标签一致性,推理速度远超CCDM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03960 2026-07-07 cs.CV 新提交 57%

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13649 2026-07-07 cs.CV 版本更新 57%

Distribution Matching Distillation Meets Reinforcement Learning

分布匹配蒸馏与强化学习的结合

Dengyang Jiang, Dongyang Liu, Zanyi Wang, Qilong Wu, Liuzhuozheng Li, Hengzhuang Li, Xin Jin, David Liu, Changsheng Lu, Zhen Li, Bo Zhang, Mengmeng Wang, Steven Hoi, Peng Gao, Harry Yang

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) SIAT, CAS(中国科学院深圳先进技术研究院) Shanghai AI Lab(上海人工智能实验室) ZJUT(浙江工业大学) CUHK(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DMDR框架,结合奖励倾斜分布匹配与动态蒸馏策略,通过联合优化提升生成质量与可控性,优于多步生成模型。

Comments [ECCV 26] The synergy of reinforcement learning and distribution matching distillation. See more: https://github.com/vvvvvjdy/dmdr

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 57%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏