SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
SALSA-V:基于视频的捷径增强式长同步音频生成模型
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
SALSA-V:基于视频的捷径增强式长同步音频生成模型
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。
完全非线性退化扩散的数值方法
专题命中 扩散模型 :diffusion(abstract)
AI总结 针对退化完全非线性椭圆型方程及相关传输型自由边界问题,提出有限差分方法,通过正则化程序克服困难并证明收敛性,经数值实验支撑,方法可扩展至更广泛非变分问题。
专题命中 扩散模型 :diffusion(abstract)
Comments 18 pages, 4 figurea
Kuramoto-Vicsek模型的渐近精确散射理论
专题命中 扩散模型 :diffusion(abstract)
AI总结 该研究针对Kuramoto-Vicsek模型,突破平均场假设,采用单侧分子混沌假设解析计算低密度下粒子散射,其理论结果与模拟吻合,还推导了高密区噪声关联及正对齐强度下的Boltzmann碰撞算子。
Marionette:预测世界状态、渲染几何、绘制外观
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。
Comments Project page: https://alayalab.github.io/Marionette/
马尔可夫跳跃过程的过渡路径问题的最优控制公式
专题命中 可控生成 :diffusion(abstract)
AI总结 该研究将马尔可夫跳跃过程的过渡路径问题转化为路径空间随机最优控制问题,通过committor函数、Γ-收敛等方法得到最优路径测度与受控过程,为过渡路径问题提供了严格的最优控制框架。
Comments 30 pages
物理修复:用于上下文驱动流体模拟的自监督学习
机构 * AI for Image-Guided Diagnosis and Therapy, Technical University of Munich(图像引导诊断与治疗人工智能,慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; AI in Healthcare and Medicine, Technical University of Munich(医疗人工智能,慕尼黑技术大学) ; Imperial College London(伦敦帝国学院)
专题命中 图像修复 :inpainting(title,abstract)
AI总结 提出将稳态CFD推理重构为修复问题,通过自监督学习速度场先验并在推理时施加边界约束,利用局部邻域分词器处理大规模3D网格,在颅内动脉瘤血流动力学中优于监督代理模型。
MagnifiQ:面向高分辨率图像修复的感知补丁文本引导渐进式上采样方法
机构 * Qualcomm AI Research(高通人工智能研究中心)
专题命中 图像修复 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 MagnifiQ是一种跨分辨率渐进式上采样的图像修复框架,替换扩散模型自注意力层为线性计算卷积,采用补丁文本提示,在4K图像修复中性能优于现有方法,实现速度与质量的实用权衡。
Comments Camera-ready version (ECCV workshop - LoViF'26)
RefGC-SR$^2$: 参考引导的生成内容超分辨率与精炼
机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) ; Adobe Research(Adobe 研究院)
专题命中 图像修复 :diffusion(abstract);分类 cs.CV
AI总结 针对生成管道中参考图像下采样导致细节丢失和伪影问题,提出RefGC-SR$^2$任务,利用原始高分辨率参考图像同时恢复细节、精炼伪影并提升分辨率,构建首个真实三元组数据生成管道并设计频率感知扩散Transformer模型。
Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/RefGC-SR2/
Edit2Restore:通过参数高效适应预训练编辑模型实现少样本图像修复
机构 * Codeway AI ; Koc University(科克大学)
专题命中 图像修复 :image editing(abstract);分类 cs.CV
AI总结 Edit2Restore通过参数高效微调预训练编辑模型,在少样本条件下实现多种图像修复任务,提升感知质量并减少数据需求。
Comments Accepted to the LoViF Workshop at ECCV 2026
基于视觉语言模型的图像传输个性化数字语义通信
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM
AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。
Comments Accepted by IEEE GLOBECOM 2026
CRAFT:无需组合目标的主题个性化的注意力微调约束奖励
机构 * DGIST(大邱科技研究院) ; Baidu, Inc.(百度公司) ; KAIST(韩国科学技术院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。
Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026
CForce:通过一致性强制提升扩散大语言模型(dLLMs)的并行解码性能
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 本文提出CForce方法,通过一致性强制提升dLLMs的并行解码性能,在LLaDA模型上实验证实其在高并行解码预算下可优化速度-质量权衡。
HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。
Comments 18 pages, 8 figures
混合迭代生成模型的训练后量化
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 针对混合迭代生成模型训练后量化易引发模型崩溃的问题,提出HyGenQ框架,通过分层聚类解耦与缩放重校准,成功将其量化至8位精度且性能优于现有方法。
Hi-Token:用于生成式视觉定位的分层坐标分词
专题命中 其他图像生成 :generative vision(abstract);分类 cs.CV
AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。
Comments 15 pages, 7 figures, 15 tables