arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2512.04926 2025-12-08 cs.CV 79%

Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

语义优先:通过异步潜在扩散和谐统一语义与纹理建模

Yueming Pan, Ruoyu Feng, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng

机构 * IAIR, Xi’an Jiaotong University(西安交通大学IAIR) Microsoft Research Asia(微软亚洲研究院) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SFD通过异步方式优先生成语义,提升潜在扩散模型在图像生成中的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01826 2025-12-08 cs.CV 79%

GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer

GLDiTalker: 基于图潜在扩散变换器的语音驱动3D面部动画

Yihong Lin, Zhaoxin Fan, Xianjia Wu, Lingyu Xiong, Liang Peng, Xiandong Li, Wenxiong Kang, Songju Lei, Huang Xu

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Huawei Cloud(华为云) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GLDiTalker通过图潜在扩散变换器解决语音驱动3D面部动画中的模态不一致问题,提升唇形同步精度和运动多样性。

Comments 9 pages, 5 figures

Journal ref the 34th International Joint Conference on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05000 2025-12-05 cs.CV cs.AI 79%

Reflection Removal through Efficient Adaptation of Diffusion Transformers

通过高效适应扩散变换器实现反射去除

Daniyar Zakarin, Thiemo Wandel, Anton Obukhov, Dengxin Dai

机构 * ETH Zürich(苏黎世联邦理工学院) HUAWEI Bayer Lab(华为拜耳实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散变换器的高效反射去除方法,通过物理驱动的数据合成和LoRA适应,实现了高保真的反射去除性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04699 2025-12-05 cs.CV 79%

OmniScaleSR: Unleashing Scale-Controlled Diffusion Prior for Faithful and Realistic Arbitrary-Scale Image Super-Resolution

OmniScaleSR: 解锁受控扩散先验以实现高保真和逼真任意尺度图像超分辨率

Xinning Chai, Zhengxue Cheng, Yuhong Zhang, Hengsheng Zhang, Yingsheng Qin, Yucai Yang, Rong Xie, Li Song

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) College of Information, Mechanical and Electrical Engineering, Shanghai Normal University(上海师范大学信息、机械与电气工程学院) Transsion in China(中国Transsion) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniScaleSR通过显式扩散控制机制和多领域保真度增强,实现高保真和逼真任意尺度图像超分辨率。

Comments Accepted as TCSVT, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04504 2025-12-05 cs.CV 79%

UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers

UltraImage: 重新思考图像扩散变换器中的分辨率外推

Min Zhao, Bokai Yan, Xue Yang, Hongzhou Zhu, Jintao Zhang, Shilong Liu, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, Tsinghua University(计算机科学与技术系,北京理工大学中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(光明人工智能学院,中国人民大学) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UltraImage通过修正主导频率和自适应注意力集中,解决了图像扩散变换器在高分辨率外推中的内容重复和质量下降问题,实现了高达6K*6K的生成能力。

Comments Project page: https://thu-ml.github.io/ultraimage.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04459 2025-12-05 cs.CV 79%

dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

dVLM-AD:通过可控推理增强扩散视觉语言模型以实现驾驶

Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 dVLM-AD通过可控推理提升扩散视觉语言模型,实现更一致的驾驶推理与规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04385 2025-12-05 cs.LG cs.AI cs.CV 79%

STeP-Diff: Spatio-Temporal Physics-Informed Diffusion Models for Mobile Fine-Grained Pollution Forecasting

STeP-Diff:用于移动细粒污染预报的时空物理指导扩散模型

Nan Zhou, Weijie Hong, Huandong Wang, Jianfeng Zheng, Qiuhua Wang, Yali Song, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Tech- nology (BNRist), Tsinghua University, China(电子工程系,北京信息科学与技术国家研究中心(BNRist),清华大学) Shenzhen Smartcity Communication, Shenzhen, China(深圳智慧城市通信) College of Soil and Water Conservation, Southwest Forestry University, China(水土保持学院,西南林业大学) College of Civil Engineering, Southwest Forestry University, China(土木工程学院,西南林业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STeP-Diff通过结合DeepONet和PDE指导的扩散模型,有效提升移动细粒污染预报的精度与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22622 2025-12-05 cs.CV 79%

Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion

Zero4D: 无需训练的单视频生成4D视频

Jangho Park, Taesung Kwon, Jong Chul Ye

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Zero4D通过无需训练的视频扩散模型,将单视频扩展为多视角4D视频,保持空间时间一致性。

Comments project page: https://zero4dvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03673 2025-12-04 cs.CV 79%

ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers

ConvRot:基于旋转的插拔式4位量化用于扩散变换器

Feice Huang, Zuliang Han, Xing Zhou, Yihuang Chen, Lifei Zhu, Haoqian Wang

机构 * SIGS, Tsinghua University(清华大学信号与信息系) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ConvRot提出基于旋转的4位量化方法,通过正则Hadamard变换抑制异常值,实现扩散变换器的插拔式W4A4推理,提升速度和内存效率同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19499 2025-12-04 cs.CV cs.AI 79%

Sat2Flow: A Structure-Aware Diffusion Framework for Human Flow Generation from Satellite Imagery

Sat2Flow: 一种结构感知的扩散框架,用于从卫星图像生成人类流量

Xiangxu Wang, Tianhong Zhao, Wei Tu, Bowen Zhang, Guanzhou Chen, Jinzhou Cao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Sat2Flow通过结构感知的扩散框架,利用卫星图像生成结构一致的OD流量,解决了现有方法对辅助数据依赖和空间拓扑变化敏感的问题。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14430 2025-12-04 cs.CV cs.AI cs.PF 79%

PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference

PipeFusion: 基于扩散变换器推理的片级流水线并行

Jiarui Fang, Jinzhe Pan, Aoyu Li, Xibo Sun, Jiannan Wang

机构 * ByteDance(字节跳动) HUST(华中科技大学) Tencent(腾讯) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PipeFusion通过片级流水线并行方法,提高扩散变换器推理的效率和性能,适用于大模型如Flux.1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03451 2025-12-04 cs.CV cs.AI cs.LG 79%

GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers

GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成

Zhiye Song, Steve Dai, Ben Keller, Brucek Khailany

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03450 2025-12-04 cs.CV cs.LG 79%

KeyPointDiffuser: Unsupervised 3D Keypoint Learning via Latent Diffusion Models

KeyPointDiffuser: 通过潜在扩散模型实现无监督的3D关键点学习

Rhys Newbury, Juyan Zhang, Tin Tran, Hanna Kurniawati, Dana Kulić

机构 * Monash University(蒙纳士大学) Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 KeyPointDiffuser通过潜在扩散模型实现无监督3D关键点学习,提升关键点一致性6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03430 2025-12-04 cs.CV 79%

Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features

通过低级预训练扩散特征的光谱FiLM调制实现标签高效的超光谱图像分类

Yuzhen Hu, Biplab Banerjee, Saurabh Prasad

机构 * University of Houston, Texas, USA(德克萨斯大学) Indian Institute of Technology Bombay, Mumbai, India(印度班加罗尔理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于预训练扩散模型的标签高效超光谱图像分类方法,通过光谱FiLM调制融合空间和光谱信息,提升分类性能。

Comments Accepted to the ICML 2025 TerraBytes Workshop (June 9, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03317 2025-12-04 cs.CV cs.AI cs.LG cs.RO 79%

NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction

NavMapFusion: 基于扩散的导航地图融合用于在线向量化的高精度地图构建

Thomas Monninger, Zihan Zhang, Steffen Staab, Sihao Ding

机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研究与开发) University of Stuttgart, Germany(斯图加特大学) University of California, San Diego, USA(加州大学圣地亚哥分校) University of Southampton, United Kingdom(南安普顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 NavMapFusion通过结合低保真先验与高保真传感器数据,利用扩散模型实现在线高精度地图构建,提升环境表示的准确性和实时性。

Comments Accepted to 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03045 2025-12-03 cs.CV 79%

CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models

CAMEO:多视图扩散模型中的对应-注意力对齐

Minkyung Kwon, Jinhyeok Choi, Jiho Park, Seonghu Jeon, Jinhyuk Jang, Junyoung Seo, Minseop Kwak, Jin-Hwa Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(延世大学人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CAMEO通过几何对应监督注意力图,提升多视图扩散模型的训练效率和生成质量。

Comments Project page: https://cvlab-kaist.github.io/CAMEO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02681 2025-12-03 cs.CV 79%

PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution

PGP-DiffSR: 基于相位引导的渐进剪枝用于高效的扩散式图像超分辨率

Zhongbao Yang, Jiangxin Dong, Yazhou Yao, Jinhui Tang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PGP-DiffSR通过基于相位信息的渐进剪枝和相位交换适配器模块,实现高效的扩散式图像超分辨率,减少计算和内存消耗同时保持高质量恢复。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV 79%

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI 79%

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02088 2025-12-03 eess.IV cs.AI cs.CV cs.LG 79%

Comparing Baseline and Day-1 Diffusion MRI Using Multimodal Deep Embeddings for Stroke Outcome Prediction

比较基线和第1天扩散磁共振成像用于中风预后预测的多模态深度嵌入

Sina Raeisadigh, Myles Joshua Toledo Tan, Henning Müller, Abderrahmane Hedjoudje

机构 * 1 Department of Computer Science, University of Geneva, Switzerland 2 Department of Electrical \& Computer Engineering, University of Florida, FL, USA 3 Service of Medical Informatics, University Hospital of Geneva, Switzerland 4 Department of Imaging Medical Informatics, University of Geneva, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过多模态深度嵌入方法,利用基线和治疗后1天的扩散MRI数据,结合临床特征和病变体积,预测急性缺血性中风患者3个月的功能预后。

Comments 5 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04979 2025-12-03 cs.CV 79%

Steering One-Step Diffusion Model with Fidelity-Rich Decoder for Fast Image Compression

通过高保真解码器引导单步扩散模型实现快速图像压缩

Zheng Chen, Mingde Zhou, Jinpei Guo, Jiale Yuan, Yifei Ji, Yulun Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SODEC通过单步扩散模型和高保真解码器实现快速图像压缩,显著提升压缩效率和保真度

Comments Accepted to AAAI 2026. Code is available at: https://github.com/zhengchen1999/SODEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01975 2025-12-02 cs.CV 79%

SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning

SGDiff: 基于场景图引导的扩散模型用于图像协作分割与描述

Xu Zhang, Jin Yuan, Hanwang Zhang, Guojin Zhong, Yongsheng Zang, Jiacheng Lin, Zhiyong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SGDiff通过基于场景图引导的扩散模型,实现从简单提示到多样化描述与掩码对的图像协作分割与描述任务,提升语义对齐与灵活结果选择能力。

Comments Accept by AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01533 2025-12-02 cs.CV cs.AI 79%

Diffusion Fuzzy System: Fuzzy Rule Guided Latent Multi-Path Diffusion Modeling

扩散模糊系统:基于模糊规则的潜在多路径扩散建模

Hailong Yang, Te Zhang, Kup-sze Choi, Zhaohong Deng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散模糊系统,通过模糊规则引导的多路径扩散建模,提升图像生成的稳定性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23127 2025-12-02 cs.CV 79%

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08711 2025-12-02 cs.CV 79%

Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification

利用扩散生成的合成图像实现公平的图像分类

Abhipsa Basu, Aviral Gupta, Abhijnya Bhat, R. Venkatesh Babu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用扩散模型微调技术生成组平衡数据,以提升图像分类的公平性,实验表明其在去偏效果上优于现有方法。

Comments Accepted to AAAI AISI Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00412 2025-12-02 cs.CV cs.LG 79%

CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion

CraftSVG: 通过布局引导扩散实现多对象文本到SVG合成

Ayan Banerjee, Nityanand Mathur, Josep Llados, Umapada Pal, Anjan Dutta

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Smallest AI Indian Statistical Institute, Kolkata(印度统计研究所) Institute for People Centred Artificial Intelligence, University of Surrey(以人为中心的人工智能研究所,萨里大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SVGCraft通过布局引导扩散模型实现多对象文本到SVG合成,提升场景生成的抽象性、可识别性和细节表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01481 2025-12-02 cs.CV 79%

ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling

ChronosObserver: 用超空间扩散采样驯服4D世界

Qisen Wang, Yifan Zhao, Peisen Shen, Jialu Li, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01422 2025-12-02 cs.CV 79%

MDiff4STR: Mask Diffusion Model for Scene Text Recognition

MDiff4STR:用于场景文本识别的掩码扩散模型

Yongkun Du, Miaomiao Zhao, Songlin Fan, Zhineng Chen, Caiyan Jia, Yu-Gang Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MDiff4STR通过改进的掩码扩散模型在场景文本识别中实现更高的准确性和快速推断。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01252 2025-12-02 cs.LG cs.CV 79%

Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe

扩散混合专家模型的高效训练:一种实用配方

Yahui Liu, Yang Yue, Jingyuan Zhang, Chenxi Sun, Yang Zhou, Wencong Zeng, Ruiming Tang, Guorui Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种高效训练扩散混合专家模型的方法,通过优化架构配置提升模型性能,提供实用且高效的训练方案。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00909 2025-12-02 cs.CV 79%

TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model

TalkingPose: 基于反馈引导扩散模型的高效人脸与手势动画

Alireza Javanmardi, Pragati Jaiswal, Tewodros Amberbir Habtegebrial, Christen Millerdurai, Shaoxiang Wang, Alain Pagani, Didier Stricker

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU(鲁尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TalkingPose通过反馈引导扩散模型实现高效的人体上半身动画生成,支持无限持续时间的连贯动画创作。

Comments WACV 2026, Project page available at https://dfki-av.github.io/TalkingPose

详情

展开后加载摘要…

URL PDF HTML 收藏