LTX-2: Efficient Joint Audio-Visual Foundation Model
LTX-2:高效的音频-视觉联合基础模型
机构 * Lightricks(利光科技)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
LTX-2:高效的音频-视觉联合基础模型
机构 * Lightricks(利光科技)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。
SoulX-FlashTalk: 通过自校正双向蒸馏实现音频驱动的实时无限流式生成
机构 * AIGC Team, Soul AI Lab, China(AIGC团队,Soul AI实验室,中国)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 SoulX-FlashTalk通过自校正双向蒸馏实现音频驱动的实时无限流式生成,首次达到亚秒启动延迟和32 FPS的高保真交互数字人合成标准。
Comments 12 pages, 6 figures
RS-vHeat:基于热传导的高效远程传感基础模型
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 RS-vHeat通过热传导运算符和自监督策略,实现高效多模态遥感基础模型,提升效率和性能。
Comments 19 pages, 8 figures and 10 tables
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025
TeleWorld:面向动态多模态合成的4D世界模型
机构 * TeleWorld Team(TeleWorld团队)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 TeleWorld提出了一种实时多模态4D世界建模框架,通过生成-重建-引导范式实现动态场景重建与长期记忆,提升世界模型的交互性和计算效率。
RAPTOR: 用于高效视频注意的实时高分辨率无人机视频预测
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 RAPTOR通过高效视频注意机制实现了实时高分辨率视频预测,首次在Jetson AGX Orin上达到30 FPS以上,提升了无人机任务成功率18%。
Comments Accepted by AAAI2026
奖励强制:基于奖励分布匹配蒸馏的高效流式视频生成
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; SIAS-ZJU ; SJTU(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 奖励强制通过EMA-Sink和Re-DMD提升流式视频生成效率与质量,实现23.1 FPS的高性能视频生成。
Yume-1.5:一种文本控制的交互式世界生成模型
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。
DPAR:动态分块化用于高效的自回归视觉生成
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Dolby Laboratories(杜比实验室)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 DPAR通过动态分块化技术提升自回归视觉生成效率,减少计算资源消耗并提高生成质量。
视觉自回归模型快速推断的邻接自适应动态草案树
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(东南大学新一代人工智能技术及交叉应用重点实验室(教育部)) ; New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),多模态人工智能系统国家重点实验室(MAIS),中国科学院自动化研究所(CASIA)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息学院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 ADT-Tree通过邻接自适应动态草案树提升视觉自回归模型的推断速度,实现3.13倍和3.05倍的加速。
HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成
机构 * Meta AI ; Nanyang Technological University(南洋理工大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。
Comments Project Page: http://haonanqiu.com/projects/HiStream.html
StereoPilot: 通过生成先验学习统一且高效的立体转换
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; CUHK(香港中文大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 StereoPilot通过生成先验学习实现高效立体转换,提升视觉保真度和计算效率。
球面Leech量化用于视觉标记化与生成
机构 * UT Austin(得克萨斯大学奥斯汀分校) ; Stanford University(斯坦福大学) ; Adobe Research(Adobe研究院) ; Mistral AI
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 本文提出了一种基于Leech格的球面量化方法,通过提高对称性和均匀分布,实现了更高效的图像标记化与生成。
Comments Tech report; project page: https://zhaoyue-zephyrus.github.io/npq/
具有亮度意识的统计量化:无监督分层学习用于照明增强
机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学与技术学院,国防科技大学) ; College of Electronic and Information Engineering, Beihang University(电子与信息工程学院,北航)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出LASQ框架,通过无监督分层学习实现照明增强,改进亮度转换建模,提升低光照图像恢复的适应性和泛化能力。
Comments Accepted at NeurIPS 2025
AnchorHOI: 通过基于锚点的先验蒸馏实现零样本4D人-物交互生成
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 AnchorHOI通过基于锚点的先验蒸馏策略,结合视频扩散模型提升4D人-物交互生成的多样性和泛化能力。
Comments AAAI 2026
一种高效且协调的平衡跨域特征整合框架
机构 * Shaoxu Li, Ye Pan Corresponding author(Shaoxu Li, Ye Pan 通讯作者)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 本文提出了一种高效协调的跨域特征整合框架,通过定制模型和多模型组合提升内容与风格的平衡能力。
Comments https://github.com/lishaoxu1994/DiffStyler, AAAI2026
Fast-ARDiff: 一种基于熵信息的连续空间自回归生成加速框架
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 Fast-ARDiff通过联合优化AR和扩散组件,结合熵信息引导策略和动态调度器,实现高效连续空间自回归生成加速。
DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型
机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) ; Zhejiang University(浙江大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.MM
AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。
Comments 10 pages; Bytedance
面向头部的KV缓存压缩以实现高效的视觉自回归建模
专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV
AI总结 HACK通过面向头部的KV缓存压缩技术,有效降低VAR模型的注意力复杂度和内存开销,实现70%的缓存压缩率和1.57倍的推理加速。
Comments Accepted by AAAI 2026
通过调和分解保持形态的颗粒微结构重新网格化方法
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.GR
AI总结 本文提出了一种基于分层扩散的重新采样方法,用于生成高质量的颗粒微结构网格,保持表面形态及面积体积信息,提升数值模拟效率。
RELIC:具有长时间记忆的交互式视频世界模型
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 RELIC通过统一框架实现长时记忆与实时交互,提升视频世界建模的准确性与稳定性。
Comments 22 pages
LSRS: 隐式尺度拒绝采样用于视觉自回归建模
机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, China(南京航空航天大学人工智能学院) ; MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, Nanjing, China(信息产业部模式分析与机器智能重点实验室) ; The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, Nanjing, China(教育部脑机智能技术重点实验室)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 LSRS通过隐式尺度拒绝采样方法,在保持计算效率的同时提升视觉自回归模型的生成质量。
FantasyStyle: 用于3D高斯点云的可控风格化蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 FantasyStyle通过可控风格化蒸馏和多视图频率一致性,解决3DGS风格迁移中的多视图不一致和内容泄漏问题,提升风格化质量与视觉真实感。
Comments Accepted by AAAI 2026
基于最优传输的分布几何对齐优化用于生成数据集蒸馏
机构 * University of Science and Technology of China(中国科学技术大学) ; CUHK MMLab(香港中文大学多媒体实验室) ; Independent Researcher(独立研究者)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于最优传输的分布几何对齐方法,通过优化传输距离提升数据集蒸馏效果,实验表明在ImageNet-1K上准确率提升至少4%。
Comments NeurIPS 2025
无鞍点指导:无需标签或额外训练的改进在流形上的采样
机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 无鞍点指导通过利用对数密度估计的正曲率,无需标签或额外训练,提升基于分数模型在流形上的采样效果。
MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。
Comments Our Demo and code:https://github.com/hustvl/MobileI2V
高效训练人类视频生成的熵引导优先级渐进学习
机构 * Stanford University(斯坦福大学) ; North China Electric Power University(华北电力大学) ; University of Adelaide(阿德莱德大学) ; University of Technology Sydney(悉尼技术大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出熵引导优先级渐进学习方法,通过条件熵膨胀和自适应渐进计划,高效训练扩散模型生成人类视频,实现训练速度提升和内存消耗降低。
Comments Project page: https://github.com/changlin31/Ent-Prog
无图像时间步蒸馏:通过连续时间一致性与轨迹采样对偶
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 TBCM通过直接提取教师模型生成轨迹的潜在表示,实现无训练数据依赖的时间步蒸馏,提升效率和简洁性,同时在生成质量与资源消耗上表现优异。
校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。
Comments Code at https://github.com/BienLuky/Rectified-SpaAttn
面向慢性低背痛(cLBP)评估的3D超声图像组织层分割的分割感知生成强化网络(GRN)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 GRN通过整合分割损失反馈,实现图像生成与分割的联合训练,显著减少标注数据需求,提升3D超声图像中组织层分割的性能。
QuantFace: 面部修复的高效量化方法
机构 * Shanghai Jiao Tong University(上海交通大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 QuantFace通过低比特量化和自适应策略提升面部修复效率,优于现有方法。