MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
MeSS: 基于城市网格的户外场景生成与跨视角一致扩散
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MeSS: 基于城市网格的户外场景生成与跨视角一致扩散
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。
ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。
TRACE:通过可触觉重建和几何对齐的上下文视频遮罩实现高保真的3D场景编辑
机构 * ReLER Lab, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学全国重点实验室(CCAI)ReLER实验室) ; DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系(DBMI))
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 TRACE通过可触觉重建和几何对齐的上下文视频遮罩,实现高保真的3D场景编辑,解决了现有方法在局部姿态调整和组件替换时结构完整性不足的问题。
Comments 9 pages, 9 figures
I2VShield:一种针对基于DiT的图像到视频模型的高效主动防御框架
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 针对I2V模型被滥用问题,提出I2VShield主动防御框架。其包含文本自适应扰动生成框架和非目标多模态注意力干扰攻击两部分。该方法在多数据集和模型上保护性能优,能破坏时空连贯性且降低计算成本。
BiWM:利用双向自回归推进开源交互式视频世界模型
机构 * LynnReal AI ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。
PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理
机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。
Comments This work is accepted by ECCV 2026
VIGOR: 面向视频几何的时序生成对齐奖励
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。
Comments Project Page: https://vigor-geometry-reward.com/
跨分辨率分布匹配的扩散蒸馏
机构 * Huawei(华为) ; Nanjing University of Science and Technology(南京理工大学) ; HiThink Research(海康研究院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。
VS3R:基于深度三维重建的鲁棒全帧视频稳定
机构 * Hunan University(湖南大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出VS3R框架,结合前馈三维重建与生成式视频扩散,通过联合估计相机参数、深度和掩码,并引入混合稳定渲染模块和稳定驱动扩散模型,实现高保真全帧视频稳定,在鲁棒性和视觉质量上显著优于现有方法。
PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新
机构 * KDDI Research, Inc.(KDDI研究所)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。
Comments Accepted to ECCV 2026
相位对齐的混合分辨率扩散Transformer旋转位置编码
机构 * Stony Brook University(石溪大学) ; UNC-Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。
Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/
绝对尺度下的场景生成:利用文本的语义和几何引导实现精确且可解释的3D室内场景生成
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出GuidedSceneGen框架,通过文本预测全局3D布局并利用全景扩散模型和视频扩散模型生成绝对尺度的室内场景,实现高一致性、可导航的3D重建。
即时表达性高斯头部虚拟化身,帧率超过100 FPS
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; NVIDIA(英伟达)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出一种前馈编码器流水线,将单张野外图像转换为3D一致、快速且富有表现力的可动画化表示,通过轻量级局部融合策略实现高动画表现力,运行速度达107.31 FPS。
Comments Project website is https://research.nvidia.com/labs/amri/projects/instant4d
两步物理:在视觉细化之前锁定运动先验会擦除它们
机构 * National Institute of Standards and Technology(国家标准与技术研究院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文发现图像到视频扩散模型在两步生成中比多步生成具有更好的物理一致性,通过频谱分析将原因归结为去噪过程中的相位侵蚀,并提出无需训练的PhaseLock框架,通过从两步推理中提取运动先验并利用潜在增量引导强制到高保真生成中,有效缓解相位退化,提升物理一致性平均6.2点,同时保持视觉保真度且开销极小。
Comments ICML 2026
iTryOn: 通过空间-语义引导掌握交互式视频虚拟试穿
机构 * Shenzhen Campus of Sun Yat-sen University ; Taobao \& Tmall Group of Alibaba
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出iTryOn框架,通过空间-语义引导解决交互式视频虚拟试穿中的语义模糊和复杂服装变形问题,实现了更动态可控的虚拟试穿体验。
Comments Project Page: https://zhengjun-ai.github.io/itryon-page. Accepted by ICML 2026
MPMWorlds: 用于推断和外推物理动力学的物质点法模拟
机构 * Cornell University(康奈尔大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。
Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/
Pixel Cube: 基于扩散的肖像视频重光照通过真实感光照再现
机构 * George Mason University(乔治·马歇尔大学) ; LightThought LLC ; Columbia University(哥伦比亚大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出一种基于扩散的方法,利用混合训练数据集和HDR环境图控制,实现动态肖像视频的真实感重光照,保持时间一致性和身份特征。
Comments ACM SIGGRAPH 2026 Journal Track / ACM Transactions on Graphics, 17 pages. Project page: https://yufanzhang82.github.io/PixelCube/
Journal ref ACM Trans. Graph. 45, 4, Article 119 (July 2026), 17 pages
高维流形假设下扩散模型的收敛性
专题命中 视频扩散模型 :video generation(abstract)
AI总结 该研究在流形假设下证明 DDPM 的分数学习和采样复杂度均实现与高维 ambient 空间维度无关的速率,通过建立扩散模型与高斯过程极值理论的新框架完成,解释了其经验成功。
预训练视频模型作为可微物理模拟器用于城市风流
机构 * ETH Zurich(苏黎世联邦理工学院) ; Tel Aviv University(特拉维夫大学) ; TU Darmstadt(达姆施塔特工业大学)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。
ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航
机构 * Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) ; Guangzhou University(广州大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。
Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0