arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 127 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 127 篇

2607.00535 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition

Flow-Map GRPO:基于锚定随机组合的少步流映射生成器的强化学习

Zhiqi Li, Wen Zhang, Bo Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出Flow-Map GRPO框架,通过锚定随机流映射组合(ASFMC)对确定性少步流映射生成器进行随机化,使其适用于强化学习后训练,并在FLUX文本到图像生成器上提升奖励和感知指标。

Comments 31 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25040 2026-06-25 cs.CV 新提交 57%

Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

Chorus II: 跨请求稀疏性重用用于高效图像到视频生成

Hao Liu, Chenghuan Huang, Hao Liu, Xing Cai, Chen Li, Ziyang Ma, Jing Lyu, Nong Xiao, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) WeChat HPC, Tencent Inc.(腾讯微信高性能计算) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频生成中计算昂贵的问题,提出跨请求稀疏性重用框架,通过共享稀疏掩码重用避免在线预测,实现2.16倍加速且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23743 2026-06-25 cs.CV cs.AI cs.LG 新提交 57%

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

Sol视频推理引擎:面向高效视频生成的智能原生全栈加速框架

Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA Research, Efficient AI Team & Singapore Lab(英伟达研究院高效AI团队及新加坡实验室) NVIDIA SANA Team(英伟达SANA团队) Codex GPT-Image2

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Sol视频推理引擎,通过智能体驱动的缓存、稀疏注意力、令牌剪枝、量化和内核融合五种技术组合,针对具体模型、硬件和配置自动优化,实现视频扩散模型2倍以上加速且保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18478 2026-06-24 cs.CV 新提交 57%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22089 2026-06-23 cs.CV 新提交 57%

BAC-JEPA: Label-Efficient Breast Arterial Calcification Segmentation via Synthetic Mammography-Guided Supervision

BAC-JEPA: 通过合成乳腺X线摄影引导的标签高效乳腺动脉钙化分割

Scott Chase Waggener, Lakshman Tamil

机构 * Department of Computer Engineering University of Texas at Dallas Richardson, TX(计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出BAC-JEPA框架,利用合成动脉钙化图像和自监督视觉Transformer,实现无需像素级人工标注的乳腺动脉钙化分割,在BacSeg数据集上达到AUROC 0.8719。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21982 2026-06-23 cs.CV 新提交 57%

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

CoDMD: 基于Copula感知的分布匹配蒸馏用于快速视频生成

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

机构 * HKUST(香港科技大学) Wan Team, Alibaba Group(阿里巴巴集团万团队) THU(清华大学) CUHK(香港中文大学) XDU(西安电子科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型少步蒸馏中分布匹配蒸馏(DMD)的结构缺陷,提出Copula感知的DMD(CoDMD),通过轻量关系正则化器利用分数估计构建样本间和帧间关系矩阵,实现4步生成,速度提升约25倍,VBench得分达84.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21705 2026-06-23 cs.CV 新提交 57%

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

结构评估用于理解和指导离散令牌空间中的数据集蒸馏

Yue Cao, Jianyang Gu, Vyacheslav Kungurtsev, Yu Hu, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia(不列颠哥伦比亚大学) The Ohio State University(俄亥俄州立大学) Czech Technical University in Prague(布拉格捷克理工大学) TerraSense Analytics(TerraSense Analytics公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文通过离散视觉分词器分析令牌组成结构,提出结构评分衡量令牌组合充分性,发现平衡的令牌组成提升蒸馏数据集性能,并指导扩散模型的数据集蒸馏。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19970 2026-06-19 cs.CV 新提交 57%

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow: 跨潜在空间与像素空间的单步生成

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Tencent(腾讯) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出CrossFlow,一种跨空间流模型,将噪声潜在输入直接映射到像素图像,通过无速度单步目标实现潜在到像素的生成,并替代潜在扩散中的解码器,在ImageNet-1k上达到1.62 FID。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18702 2026-06-18 cs.CV 新提交 57%

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe 研究院) University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of California Davis(加利福尼亚大学戴维斯分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11363 2026-06-11 cs.CV 新提交 57%

NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization

NSVQ: 通过稳定向量量化中的编码器漂移缓解码本崩溃

Hao Lu, Yongxin Guo, Onur Koyun, Zhengjie Zhu, Abbas Alili, Metin N. Gurcan

机构 * Wake Forest University School of Medicine(维克森林大学医学院) Advocate Health(倡导健康)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出NSVQ训练策略,通过非平稳嵌入损失、码本替换和分阶段编码器冻结,缓解大码本VQ中的码本崩溃,在ImageNet-1k上提升重建质量并保持100%码本利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08302 2026-06-09 cs.CV 新提交 57%

HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

HACK++:面向高效视觉自回归建模的更有效的头部感知键值压缩

Ziran Qin, Yuchen Jiang, Mingbao Lin, Youru Lv, Hang Guo, Wen Fei, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten(乐天) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 针对VAR模型跨尺度KV缓存导致的高计算和内存开销,提出无训练头部感知压缩框架HACK++,通过离线分类头部类型和自适应预算分配,在极低缓存预算下保持近无损生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19906 2026-08-21 cs.LG 新提交 50%

PETA:Parameter-Efficient Test-Time Adaptation for Virtual Screening

PETA:用于虚拟筛选的参数高效测试时自适应方法

Jia-Qi Lin, Yinghua Yao, Chang-Dong Wang, Yew-Soon Ong, Yuangang Pan

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出参数高效测试时自适应框架PETA,仅更新预训练虚拟筛选模型约0.03%的LayerNorm参数,在测试时通过构建特定负样本等方式自适应,性能优于预训练及全重训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19209 2026-08-21 physics.comp-ph physics.chem-ph 新提交 50%

Physics-Informed Neural Networks as Fast Surrogate Models for Electrochemical Flow Reactors

用于电化学流动反应器快速替代模型的物理信息神经网络

Eric Fernández-García, Miguel Modestino, Sergio Maldonado

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出物理信息神经网络(PINN),将其作为电化学流动反应器的快速替代模型,经验证精度高、速度快,为低计算成本的数字孪生建模提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 50%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18954 2026-08-20 astro-ph.HE 新提交 50%

Constraining Cosmic-Ray Acceleration and Escape in Middle-Aged Supernova Remnants with GeV-TeV Gamma-Ray Observations

利用GeV-TeV伽马射线观测约束中年超新星遗迹中的宇宙射线加速与逃逸

Siyu Chen, Bing Theodore Zhang, Yi Xing, Siming Liu

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究通过对四个中年超新星遗迹的伽马射线辐射开展时变研究,结合多望远镜观测,约束了宇宙射线加速与逃逸参数,揭示逃逸宇宙射线对其甚高能辐射及中微子通量的重要影响。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17022 2026-08-19 math.PR math.AP 新提交 50%

Sharp hypocoercive convergence estimates for underdamped Langevin dynamics with specular reflection

Hengrong Du, Qi Feng, Lingjiong Zhu

专题命中 效率与蒸馏 :diffusion(abstract)

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13932 2026-08-17 cs.LG 新提交 50%

Post-training Quantization for Hybrid Iterative Generative Models

混合迭代生成模型的训练后量化

Jing Gao, Junyi Wu, Wei Wang, Yan Yan, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对混合迭代生成模型训练后量化易引发模型崩溃的问题,提出HyGenQ框架,通过分层聚类解耦与缩放重校准,成功将其量化至8位精度且性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11019 2026-08-12 cs.LG 新提交 50%

DEFT: Data-Efficient Frequency-domain Top-k Sampling via Inverse Discrete Fourier Transform for Spatiotemporal Dynamical Systems Modeling

DEFT:用于时空动力系统建模的、基于逆离散傅里叶变换的数据高效频域Top-k采样方法

Hengbo Xiao, Jiale Liu, Jiahao Song, Guannan He

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 DEFT是一种频域数据采样方法,通过逆离散傅里叶变换生成物理一致的训练数据,可减少数据需求且提升泛化能力,在多个PDE及电池退化系统建模任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10384 2026-08-12 cs.LG 新提交 50%

Generator-Guided Inverse Sampling for Lévy-Driven Generative Models

用于Lévy驱动生成模型的生成器引导逆采样

Tianfu Qi, Jun Wang, Jun Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文针对Lévy驱动生成模型的非局域反向过程挑战,提出生成器引导的结构化逆采样器,将动力学分解为三类分量,结合神经网络与解析分布实现高效采样,在OFDM-SISO信道估计中表现出稳健性能与良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08638 2026-08-11 cs.SD cs.AI cs.CL 新提交 50%

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

CuteTTS:基于连续隐变量自回归建模的高效高保真语音合成

Yuqian Zhang, Yao Shi, Kexin Huang, Botian Jiang, Zhe Xu, Yiwei Zhao, Min Liang, Shuang Chen, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) OPPO AI Center(OPPO人工智能中心) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 CuteTTS是结合语义对齐因果VAE隐变量等的连续自回归TTS系统,经引导步蒸馏后,在保持相当质量的同时降低了延迟,实现了高保真与低延迟的平衡。

Comments 20 pages, 6 figures, 10 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08129 2026-08-11 cs.HC 新提交 50%

Understanding Security and Privacy Perceptions of Content Creators Regarding AI Labels of AI-Generated Content

理解内容创作者对AI生成内容的AI标签的安全与隐私认知

Shuning Zhang, Hui Wang, Rongjun Ma, Xin Yi, Kanye Ye Wang, Robert Xiao, Hewu Li

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文通过对21位AIGC创作者访谈及多平台图像测试,揭示创作者对AI标签的认知偏差与规避行为,提出应开发适配创作者动机的隐式AI标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07648 2026-08-11 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.comp-ph 新提交 50%

Leveraging generative models to assist Monte Carlo sampling

利用生成模型辅助蒙特卡洛采样

Marylou Gabrié

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本教程综述介绍了机器学习与计算统计物理交叉领域的新范式——用生成模型辅助蒙特卡洛采样,探讨相关方法方向及优劣势,为相关领域研究者提供入门基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07329 2026-08-10 math.OC math.AP 新提交 50%

Sampling and Optimization meet Enhanced Flows

采样与优化方法结合增强流

Yuan Gao, Siming He, Eitan Tadmor

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文针对采样与优化中核心的Gibbs概率测度计算问题,引入带增强耗散的输运-扩散动力学,设计了对应的采样数值算法与粒子系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06107 2026-08-07 cs.LG cs.NA math.NA 新提交 50%

Kastor: An efficient fine-tuning strategy for generative emulation of PDE simulations

Kastor:一种用于生成式模拟偏微分方程(PDE)仿真的高效微调策略

Guillaume Couairon, Alexis Jacq, Yu-Han Wu, Renu Singh, Yana Hasson, Quentin Berthet, Romuald Elie

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出Kastor微调策略,通过两阶段推理、均值预测正则化等方法改进物理基础模型,在The Well数据集上实现比Walrus更优的PDE仿真性能,降低预测误差并提升效率。

Comments 34 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05022 2026-08-06 cs.DS cs.NA math.NA math.PR math.ST stat.TH 新提交 50%

Exact simulation of diffusions and improved algorithms for log-concave sampling

扩散过程的精确模拟及对数凹采样的改进算法

Fan Chen, Sinho Chewi, Alexander Rakhlin, Matthew S. Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 该研究基于Girsanov定理的密度比无偏估计量,提出改进的扩散精确模拟及对数凹采样算法,优化了采样复杂度与维度依赖关系,还给出相关应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03878 2026-08-05 cs.LG cs.SY eess.SY 新提交 50%

Operationally Feasible Synthetic Power-Grid Scenarios via Learning the AC-Operable Joint Distribution

通过学习交流(AC)可运行联合分布实现可操作的合成电网场景

Chenhan Xiao, Xinyu He, Haoran Li, Hanghang Tong, Yang Weng

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出感知可行性的分层扩散分布学习框架,学习电网拓扑、参数与负荷的交流可操作联合分布,生成的合成电网场景可行性与鲁棒性显著提升,且消除了优化后处理。

Comments 10 pages, 10 figures, journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29470 2026-08-03 math.NA cs.NA 新提交 50%

iSMART: An Iterative Sampling-and-Regression Technique for Solving Martingale-Based PDEs

iSMART:一种求解基于鞅的偏微分方程的迭代采样-回归技术

Tiejun Li, Xiaoguang Li, Fugui Ma

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对高维基于鞅的PDE,提出iSMART迭代采样-回归技术,通过停止梯度等方法规避对抗优化,引入冻结-补偿技术优化HJB方程收敛性,经多类高维数值实验验证其准确性、效率与鲁棒性。

Comments 32 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27784 2026-07-31 cs.RO 新提交 50%

DexDirect: Direct Kinesthetic Arm Guidance for Efficient Dexterous Demonstration Collection

DexDirect:用于高效灵巧演示采集的直接运动学手臂引导

Beom Jun Kim, Shiu-Jen Wang, Jonathan Liu, Alvin Zhu, Quanyou Wang, Hanzhang Fang, Feng Xu, Mingzhang Zhu, Yuchen Cui, Dennis W. Hong

机构 * UCLA(加利福尼亚大学洛杉矶分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 该研究提出DexDirect方法,结合直接运动学手臂引导与视觉手部重定向,采集灵巧操作演示的效率更高、认知负荷更低,训练的扩散策略在立方体抓取任务上达到90%成功率。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏