arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2551 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2551 篇

2605.30991 2026-06-01 cs.LG cs.CV 57%

Parallel Tempering Initial Sampling in Inference-Time Reward Alignment

推理时奖励对齐中的并行回火初始采样

Myeongjun Oh, Gwangho Kim, Sungyoon Lee

机构 * Department of Artificial Intelligence(人工智能系) Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对推理时奖励对齐中标准SMC方法因初始采样陷入局部模式的问题,提出基于并行回火的PATHS方法,通过耦合多条回火链实现高效探索,提升对齐质量。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28691 2026-05-28 cs.CV 57%

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

OSP-Next: 结合稀疏序列并行、HiF8量化和强化学习的高效高质量视频生成

Yunyang Ge, Xianyi He, Zezhong Zhang, Bin Lin, Bin Zhu, Xinhua Cheng, Li Yuan

机构 * Peking University(北京大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出OSP-Next文本到视频生成模型,通过混合全稀疏注意力架构、稀疏序列并行(SSP)、HiF8量化和混合GRPO后训练,在保持高质量的同时显著提升效率,在NVIDIA H200和Ascend 950PR上实现1.5倍以上加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11755 2026-05-28 cs.LG cs.CV stat.ML 57%

One-Step Generative Modeling via Wasserstein Gradient Flows

通过Wasserstein梯度流的一步生成建模

Jiaqi Han, Puheng Li, Qiushan Guo, Renyuan Xu, Stefano Ermon, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出W-Flow框架,通过Wasserstein梯度流将参考分布到目标分布的演化压缩为一步生成,结合Sinkhorn散度实现高效最优传输,在ImageNet 256×256上达到1.29 FID且采样速度提升约100倍。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16483 2026-05-28 cs.CV 57%

FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models

FasterVAR:视觉自回归模型的即插即用加速

Senmao Li, Kai Wang, Salman Khan, Fahad Shahbaz Khan, Jian Yang, Yaxing Wang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院、VCIP、PCA实验室) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机系,中国) City University of Hong Kong, HK SAR, China(香港城市大学,香港特别行政区,中国) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) Linkoping University, Sweden(林地平大学,瑞典) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院、PCA实验室) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对VAR模型在大尺度步骤计算复杂度高的问题,提出一种基于阶段感知的即插即用加速框架FasterVAR,通过保留早期关键步骤并剪枝或近似后期细节步骤,实现最高3.4倍加速且几乎无性能损失。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27336 2026-05-27 cs.CV 57%

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26744 2026-05-27 cs.CV 57%

Self-Intersection-Aware 3D Human Motion Generation Using an Efficient Human Sphere Proxy

基于高效人体球代理的自交感知3D人体运动生成

Pascal Herrmann, Maarten Bieshaar, Dennis Mack, Robert Herzog, Juergen Gall

机构 * Bosch Research(博世研究院) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于人体球代理的自交损失函数,用于训练人体运动生成模型,可减少高达49%的自交现象并改善评估指标。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19741 2026-05-27 cs.CV 57%

Efficient Transferable Optimal Transport via Min-Sliced Transport Plans

通过最小切片传输计划的高效可迁移最优传输

Xinran Liu, Elaheh Akbari, Rocio Diaz Martin, Navid NaderiAlizadeh, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比大学计算机科学系) Department of Mathematics, Florida State University(佛罗里达州立大学数学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Electrical & Computer Engineering, Vanderbilt University(范德比大学电气与计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出最小切片传输计划(min-STP)框架,研究优化切片器在不同分布对间的可迁移性,并引入小批量公式以提高可扩展性,在点云对齐和流生成建模中实现一次性匹配和摊销训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25547 2026-05-26 cs.RO cs.CV 57%

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TapSampling:基于任务进度理解验证器的推理时采样方法用于机器人操作

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Harbin Institute of Technology (Weihai) Qingdao Research Institute, China(哈尔滨工业大学(威海)青岛研究院,中国) Iray Technology co., Ltd., Shandong, China(Iray科技有限公司,山东,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出TapSampling框架,通过Action-VAE在低维潜空间采样候选动作,并利用任务进度预测验证器选择最优动作,无需微调即可提升多种通用策略的性能。

Comments ICML 2026. Project Page: https://aipixel.github.io/TapSampling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24843 2026-05-26 cs.CV cs.AI 57%

Adversarial Error Correction for Visual Autoregressive Generation

视觉自回归生成的对抗性纠错

Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 提出AID-VAR框架,通过对抗性注入诊断机制纠正视觉自回归模型中的级联误差,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23522 2026-05-25 cs.LG cs.AI cs.CV 57%

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23445 2026-05-25 cs.CV 57%

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

DFSAttn:面向高效视频生成的动态细粒度稀疏注意力

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散变换器中注意力二次复杂度导致计算成本高的问题,提出一种无需训练的稀疏注意力框架DFSAttn,通过希尔伯特曲线重排序、分层块评分和稀疏掩码缓存实现动态细粒度稀疏化,在保持生成质量的同时实现高达2.1倍端到端加速。

Comments ICML 2026; 17 pages, 8 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22718 2026-05-22 cs.CV 57%

WorldKV: Efficient World Memory with World Retrieval and Compression

WorldKV: 通过世界检索和压缩实现高效的world内存

Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Naver AI Lab(Naver人工智能实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldKV,一种无需训练的框架,通过世界检索和压缩技术,在保持一致性的同时提高效率,实现在Matrix-Game-2.0和LingBot-World-Fast数据集上达到或超越全KV内存保真的性能。

Comments Project Page: https://cvlab-kaist.github.io/WorldKV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21042 2026-05-21 cs.CV 57%

Dynamic Video Generation: Shaping Video Generation Across Time and Space

动态视频生成:跨时间和空间的视频生成塑造

Shikang Zheng, Jingkai Huang, Jiacheng Liu, Guantao Chen, Lixuan, Yuqi Lin, Peiliang Cai, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DVG框架,通过在时间和空间上联合分配计算,自动选择内容感知的加速策略,实现近无损加速,展示了在视频生成中的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20476 2026-05-21 cs.CV 57%

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

告别漂移:用于长时视频到视频生成的锚定树采样

Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

机构 * Descript, Inc.(Descript公司)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种名为锚定树采样的方法,通过减少关键路径步骤来解决长时视频生成中的漂移问题,并在静态相机模式下实现了稳定且高质量的视频生成。

Comments 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03139 2026-05-20 cs.CV 57%

Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis

保留多样性的分布匹配蒸馏用于快速视觉合成

Tianhe Wu, Ruibin Li, Lei Zhang, Kede Ma

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种保留多样性的分布匹配蒸馏(DP-DMD)方法,通过分离角色的蒸馏策略,在少量步骤中保持样本多样性并维持竞争性的视觉质量,为其他DMD变体提供了一种简单且稳定的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17726 2026-05-20 cs.CV cs.AI 57%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18052 2026-05-19 cs.CV 57%

Efficient 3D Content Reconstruction and Generation

高效3D内容重建与生成

Jiahao Li

机构 * TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO(丰田技术研究所芝加哥分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种高效的3D内容生成和重建方法,通过结合多视图扩散和稀疏视图3D重建,实现了高质量的3D资产生成,并开发了FastMap算法以提高3D重建的速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17365 2026-05-19 cs.CV 57%

Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval

基于记忆的查询意图理解用于高效的基于聊天的图像检索

Xianke Chen, Daizong Liu, Yushuo Lou, Xin Tan, Xun Yang, Shuhui Wang, Xun Wang, Jianfeng Dong

机构 * School of Computer Science and Technology, and the School of Statistics and Mathematics, Zhejiang Gongshang University(计算机科学与技术学院,和统计与数学学院,浙江工商大学) School of Computer Science and Technology, Zhejiang Gongshang University, and the Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(计算机科学与技术学院,浙江工商大学,和大数据与未来电子商务技术浙江省重点实验室) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) School of Information and Electronic Engineering, Zhejiang Gongshang University(信息与电子工程学院,浙江工商大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences , Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所,中国科学院) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种高效的基于聊天的图像检索任务中的记忆增强查询意图理解框架MAQIU,通过动态聚合和演化查询意图的语义表示,防止意图遗忘并增强长期语义完整性,从而在保持高计算效率的同时实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16649 2026-05-19 cs.CV 57%

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

AtlasVid: 通过解耦的全局-局部建模实现高效超高清长视频生成

Ziyang Mai, Yuyao Zhang, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AtlasVid框架,通过解耦建模提升超高清长视频生成效率,实现60.9倍加速和更低训练成本,优于原生4K生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13108 2026-05-18 cs.CV 57%

DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection

DGS-Net:基于知识蒸馏的梯度手术用于AI生成图像检测中的CLIP微调

Jiazhen Yan, Ziqiang Li, Fan Wang, Boyu Wang, Ziwen He, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science(南京信息工程大学计算机学院) University of Macau(澳门大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DGS-Net,通过梯度空间分解分离有害和有益的下降方向,提升CLIP在AI生成图像检测中的微调效果,实验表明其在检测性能和泛化能力上优于现有方法。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23352 2026-05-18 cs.CV cs.AI 57%

Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling

动态树RPO:通过结构化采样打破独立轨迹瓶颈

Xiaolong Fu, Lichen Ma, Zipeng Guo, ShiPing Dong, Lan Yang, Tan Lit Sin, Gaojing Zhou, Yu He, Jingling Fu, Shizhe Zhou, Junshi Huang, Jason Li

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出动态树RPO,通过树状结构采样策略和动态噪声强度,提升文本到图像生成的质量与效率,同时结合层调优强化学习方法,在多个基准测试中表现出色。

Comments Fig.3 updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15492 2026-05-18 cs.RO cs.CV 57%

FLASH: Efficient Visuomotor Policy via Sparse Sampling

FLASH:通过稀疏采样实现高效的视觉-运动策略

Jiaqi Bai, Jindou Jia, Yuxuan Hu, Gen Li, Xiangyu Chen, Tuo An, Kuangji Zuo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(马尔萨实验室,南洋理工大学,新加坡)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FLASH通过稀疏采样和Legendre多项式轨迹表示,提升视觉-运动策略学习效率,实现更长的动作时间跨度和更快的推理速度,实验表明其在多个任务中达到最先进的性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17588 2026-05-15 cs.CV 57%

HERO: Hierarchical Extrapolation and Refresh for Efficient World Models

HERO:高效世界模型的分层外推与刷新

Quanjian Song, Xinyu Wang, Donghao Zhou, Jingyu Lin, Cunjian Chen, Yue Ma

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 HERO通过分层策略提升世界模型推理效率,采用补丁刷新和线性外推技术,在保持质量的同时实现1.73倍加速。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22394 2026-05-15 cs.CV 57%

PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models

PacTure:基于打包视角的高效PBR纹理生成方法

Fan Fei, Jiajun Tang, Fei-Peng Tian, Boxin Shi, Ping Tan

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,计算机学院,北京大学) The Hong Kong University of Science and Technology(香港科技大学) Light Illusions PKU-AI 2 Robotics Joint Lab of Embodied AI(北京大学人工智能2机器人联合实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 PacTure通过引入视角打包技术,提升多视角生成的效率与一致性,结合自回归模型实现高效PBR纹理生成。

Comments Accepted by Computational Visual Media Journal (CVMJ) in Feb. 2026. 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13457 2026-05-14 cs.CV 57%

OP4KSR: One-Step Patch-Free 4K Super-Resolution with Periodic Artifact Suppression

OP4KSR:一种一步式无补丁4K超分辨率方法,具有周期性伪影抑制

Chengyan Deng, Pengbin Yu, Zhentao Chen, Wei Shen, Kai Zhang, Meng Li, Lunxi Yuan, Xue Zhou, Li Yu

机构 * School of Automation Engineering, University of Electronic Science and Technology of China(电子科技大学自动化工程学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 OP4KSR提出一种基于Flux架构的一步式4K超分辨率方法,利用F16 VAE压缩降低内存消耗,同时通过RoPE基频重缩放和周期性损失抑制伪影,实现高效且高质量的4K超分辨率生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13858 2026-05-14 cs.CV 57%

EDITS: Enhancing Dataset Distillation with Implicit Textual Semantics

EDITS: 通过隐式文本语义增强数据集蒸馏

Qianxin Xia, Jiawei Du, Guoming Lu, Zhiyong Shu, Jielei Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(前沿人工智能研究中心,科技研究局)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出EDITS框架,利用图像数据中的隐式文本语义提升数据集蒸馏效果,通过全局语义查询模块融合外部文本与图像特征,结合局部语义意识选择代表性样本构建图像和文本原型,最终通过双原型引导策略生成合成数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09003 2026-05-13 cs.CV 57%

FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching

FlashClear: 通过高效的步骤蒸馏和特征缓存实现超快图像内容移除

Yixin Tang, Jiawei Guo, Junxian Li, Zhiteng Li, Jixin Zhao, Bingya Zhang, Chenbo Wang, Yulun Zhang, Shangchen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Honor Device Co., Ltd(荣耀设备有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashClear,通过区域感知对抗蒸馏和前景优先的注意力与缓存策略,实现高效内容移除,实验表明其在保持性能的同时显著提升速度,达到8.26倍和122倍的加速。

Comments Code: https://github.com/GuoCalix/FlashClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI 57%

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09302 2026-05-12 cs.LG cs.CV 57%

Discrete Langevin-Inspired Posterior Sampling

离散 Langevin 激发后验采样

Chaitanya Amballa, Sattwik Basu, Jorge Vančo Sampedro, Romit Roy Choudhury

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出离散 Langevin 激发后验采样方法,用于在离散状态空间中解决逆问题,通过梯度信息指导离散移动,实现高效的并行更新,适用于多种逆问题场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09071 2026-05-12 cs.CV 57%

Probability-Flow Distillation: Exact Wasserstein Gradient Flow for High-Fidelity 3D Generation

概率流蒸馏:用于高保真3D生成的精确Wasserstein梯度流

Rohith Ramanan, A. N. Rajagopalan

机构 * Department of Physics(物理系) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Department of Electrical Engineering(电气工程系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出概率流蒸馏,通过精确Wasserstein梯度流解决SDI的模式崩溃问题,实现高保真3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏