arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3080 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2359 篇

2606.14721 2026-07-07 cs.GR cs.CV cs.RO 新提交 62%

DC-Motion: Decoupling Structure and Details via Discrete-Continuous Tokens for Human Motion Generation

DC-Motion: 通过离散-连续令牌解耦语义与细节以生成人体运动

Hequan Wang, Xuean Chen, Jiaxu Zhang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出DC-Motion框架,通过离散-连续VAE将运动分解为语义离散令牌和细节连续残差,结合掩码自回归模型和残差扩散模型,实现复杂文本指令下的高质量运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30673 2026-07-01 cs.GR cs.CV 新提交 62%

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

机构 * ZJU(浙江大学) Tencent(腾讯) THU(清华大学) CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交 62%

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22481 2026-06-23 cs.GR cs.CV 新提交 62%

Lighting-Consistent Object Transfer Across Radiance Fields

跨辐射场的一致光照物体迁移

Nicolás Violante, George Kopanas, Linus Franke, Julien Philip, George Drettakis

机构 * Inria Université Côte d’Azur(大学皮埃尔-皮埃尔·德·科蒂尔) Google DeepMind(谷歌DeepMind) Eyeline Labs(Eyeline实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对3D高斯泼溅中物体迁移时光照不一致的问题,提出一种扩散模型调和合成图像,结合合成、生成和真实数据训练,并通过后优化整合为3DGS表示,实现高质量物体迁移。

Comments Project page: https://repo-sam.inria.fr/nerphys/dot3d

Journal ref Computer Graphics Forum (EGSR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18243 2026-06-17 cs.CV cs.GR cs.RO 新提交 62%

MOCHI: Motion Enhancement of Collaborative Human-object Interactions

MOCHI: 协作人-物交互的运动增强

Jiye Lee, Yonghun Choi, Jungdam Won

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对多人-物交互数据中手物接触错位、运动抖动和手指细节缺失等问题,提出两阶段框架MOCHI,先通过优化生成物理合理的手部抓取,再基于扩散模型优化全身运动,有效增强噪声数据。

Comments SIGGRAPH 2026 Journal (ACM TOG); Project page: https://jiyewise.github.io/projects/MOCHI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13652 2026-06-12 cs.CV cs.GR 新提交 62%

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

世界追踪:超越可见表面的生成式像素对齐几何

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

机构 * World Labs University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。

Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交 61%

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract,comments);分类 cs.CV

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20621 2026-08-24 cs.CV 新提交 57%

RECOUNT: Reference-guided Counting with Synthetic Visual Exemplars

RECOUNT:基于合成视觉示例的参考引导计数

Adriano D'Alessandro, Ali Mahdavi-Amiri, Ghassan Hamarneh

机构 * Simon Fraser University(西蒙菲莎大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RECOUNT是基于合成视觉示例的图像引导零样本计数即插即用框架,通过扩散模型扩展参考图像生成示例库,在两个基准上实现最优零样本计数准确率,大幅降低计数误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 57%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20561 2026-08-24 eess.IV cs.AI cs.CV cs.LG physics.med-ph 新提交 57%

Consistency Models for Fast MRI Reconstruction Using Regularization by Denoising

基于去噪正则化的快速MRI重建一致性模型

Merve Gülle, Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CM-RED方法,将一致性模型整合到去噪正则化框架中,仅用4次网络函数评估,在fastMRI数据集上实现优于现有方法的快速高质量MRI重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20335 2026-08-21 cs.CV 新提交 57%

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

4DAnyone:从随意的单目视频中创建4D虚拟人物

Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Robbyant Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 4DAnyone是一种从单目视频重建4D人体的框架,通过RCP和TCR解决多视图一致性问题,在相关数据集上优于现有方法且泛化性好。

Comments Project page: https://4danyone.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19965 2026-08-21 cs.CV cs.LG q-bio.QM 新提交 57%

Flow Matching Meets 3D Curvilinear Structure Segmentation in Medical Imaging

流匹配在医学影像三维曲线结构分割中的应用

Sidi Mohamed Sid'El Moctar, Nicolas Vitry, Hélène Bouvrais

机构 * CNRS(法国国家科学研究中心) Univ. Rennes(雷恩大学) Institute of Genetics and Development of Rennes (IGDR)(雷恩遗传与发育研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于流匹配的3D-CurvSegFlow模型,用于三维医学图像的曲线结构分割,在三个不同公开数据集上的表现优于通用及血管专用方法,为医学图像分析提供高效泛化的新方向。

Comments International Workshop on Machine Learning in Medical Imaging (MLMI 2026) @ MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19900 2026-08-21 cs.CV 新提交 57%

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

AvatarDynamizer:通过生成式动态纹理从静态化身到动态人类化身

Guoxing Sun, Heming Zhu, Linjie Lyu, Pascal Fua, Christian Theobalt, Marc Habermann

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) EPFL(洛桑联邦理工学院) VIA Research Center(VIA研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AvatarDynamizer是一种生成式方法,可将现成静态3D化身转为可控多视角一致4D化身,通过纹理空间动态嵌入实现真实表面动态,在视觉保真度上优于通用方法。

Comments Project page: https://vcai.mpi-inf.mpg.de/projects/AvatarDynamizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-21 cs.LG cs.CV 新提交 57%

Continuous Adversarial MeanFlow Transfer

连续对抗平均流迁移

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出MeanFlow-Transfer与Continuous Adversarial MeanFlow,解决有限数据下新域生成器训练的适配与加速问题,在四个源模型适配五个目标域时,FID等指标相当或更优且NFEs最多减125倍,少步FID平均提29%。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20112 2026-08-21 eess.IV cs.CV physics.med-ph 新提交 57%

Flow Matching-Based PET Image Reconstruction

基于流匹配的正电子发射断层扫描(PET)图像重建

Fumio Hashimoto, Ziqian Huang, Tatsuya Yokota, Kuang Gong

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出两种基于流匹配的PET图像重建方法,经[$^{\text{18}}\text{F}$]FDG脑部PET数据集实验,其在不同剂量水平下的偏差-方差权衡优于其他参考方法,展现出流匹配作为定量PET重建生成先验的潜力。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18907 2026-08-20 cs.CV cs.AI 新提交 57%

Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets

面向小规模数据集的学习状态感知动态生成式数据增强

Ting Xiang, Chenxi Deng, Jinhui Zhao, Bingting Jiang, Ke Zhang, Changjian Chen, Zhuo Tang

机构 * Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对小规模图像分类数据稀缺问题,提出LSADA方法,通过构建样本学习状态映射增强强度,采用解耦增强与扩散融合策略,在9个数据集上较SOTA动态GDA方法取得平均2.5%-4.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18523 2026-08-20 cs.CV cs.AI 新提交 57%

Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection

用于通用AI生成图像检测的先验条件高斯判别模型

Shashank Kotyan, Makoto Shing, Yuki Imajuku, Rujikorn Charakorn, Tarin Clanuwat

机构 * Sakana AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测在多因素变化下失效的问题,提出先验条件高斯判别梯方法,在Percept-Lens数据集上验证其性能,推动相关报告与基线的优化。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18516 2026-08-20 cs.CV cs.AI 新提交 57%

OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation

OptiModNet:用于视盘和视杯分割的结合分组查询与通道注意力的UNet-Transformer混合模型

Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra

机构 * IEM Saltlake(IEM盐湖校区) Techno Main Salt Lake(Techno主盐湖校区) VIT Bhopal University(博帕尔维洛尔理工大学) IIT Jodhpur(焦特布尔印度理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出OptiModNet,一款用于视盘和视杯分割的轻量混合架构,结合分组查询与通道注意力及聚合金字塔损失,在REFUGE2数据集上实现超现有方法2.5%的最优性能,且仅需3.73 GFLOPs和1.93M参数,兼顾高性能与低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 57%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交 57%

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: https://li00147.github.io/SPVC-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17095 2026-08-19 cs.CV 新提交 57%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

Journal ref European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 57%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14758 2026-08-18 eess.IV cs.AI cs.CV 新提交 57%

Synthesizing Post-Acetazolamide Cerebral Blood Flow Maps from Baseline MRI in Moyamoya Using 3D Generative AI

利用3D生成AI从烟雾病患者的基线MRI合成乙酰唑胺给药后脑血流量图

Julia Huang, Camila Gonzalez, Rydham Goyal, Aja Zou, Sasha Alexander, Michael Moseley, Moss Y. Zhao, Gary K. Steinberg

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CAE3D模型,可从烟雾病患者基线MRI合成乙酰唑胺后脑血流量图,在多指标上优于对比方法,为ACZ禁忌患者的血流动力学评估提供可行方案。

Comments 25 pages. Accepted at Machine Learning for Healthcare (MLHC 2026). To appear in Proceedings of Machine Learning Research (PMLR), volume 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16457 2026-08-18 cs.CV cs.AI 新提交 57%

Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos

用于教学视频中推理时流程规划的对比能量场(CEFITO)

Mohamed Afham, Christoph Reich, Oliver Hahn, Daniel Cremers, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。

Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16380 2026-08-18 cs.CV cs.AI 新提交 57%

Synthetic Data Augmentation for Satellite-Based Analysis of Battle-Damaged Agricultural Fields in Ukraine

用于乌克兰战区受损农田卫星分析的合成数据增强方法

Marta Sumyk, Oleksandr Kosovan, Iryna Voitsitska

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对乌克兰受损农田卫星分析的标注数据稀缺问题,采用类别条件GAN与DDPM生成合成农田样本,结合真实数据训练视觉Transformer,使分类性能显著提升,验证了合成卫星图像在数据稀缺地理空间应用的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15555 2026-08-18 cs.CV cs.LG 新提交 57%

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

RigidBench:评估视频生成模型中的刚体物理效果

Swarnim Jain, Shangzhe Wu

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。

Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15298 2026-08-18 cs.CV 新提交 57%

Image Denoising via the Adaptive Rank-Cluster Filter

基于自适应秩聚类滤波器的图像去噪方法

Dmitry Pozdnyakov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应秩聚类滤波器,经Otsu聚类、模糊融合处理像素强度,在混合噪声场景下对图像去噪的鲁棒性优于多种基线滤波算法。

Comments 18 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏