arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2502.05130 2025-07-30 cs.SD cs.AI cs.CV cs.MM eess.AS 81%

Latent Swap Joint Diffusion for 2D Long-Form Latent Generation

Yusheng Dai, Chenxi Wang, Chang Li, Chen Wang, Jun Du, Kewei Li, Ruoyu Wang, Jiefeng Ma, Lei Sun, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) iFlytek Research(iFlytek研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03897 2025-07-08 cs.MM cs.AI cs.CV cs.SD eess.AS 81%

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Lei Zhao, Linfeng Feng, Dongxu Ge, Rujin Chen, Fangqiu Yi, Chi Zhang, Xiao-Lei Zhang, Xuelong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Our demos are available at https://uniform-t2av.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14453 2025-07-08 cs.CV cs.GR cs.LG 81%

Multimodal Latent Diffusion Model for Complex Sewing Pattern Generation

Shengqi Liu, Yuhao Cheng, Zhuo Chen, Xingyu Ren, Wenhan Zhu, Lincheng Li, Mengxiao Bi, Xiaokang Yang, Yichao Yan

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, China(人工智能领域关键实验室、人工智能研究院、上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Our project page: https://shengqiliu1.github.io/SewingLDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16579 2025-07-02 cs.CV cs.MM cs.SD eess.AS 81%

Contrastive Conditional Latent Diffusion for Audio-visual Segmentation

Yuxin Mao, Jing Zhang, Mochu Xiang, Yunqiu Lv, Dong Li, Yiran Zhong, Yuchao Dai

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) Shaanxi Key Laboratory of Information Acquisition and Processing(信息获取与处理陕西省重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Journal ref IEEE Transactions on Image Processing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20946 2025-06-27 cs.GR cs.AI cs.CV 81%

Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models

Donggoo Kang, Jangyeong Kim, Dasol Jeong, Junyoung Choi, Jeonga Wi, Hyunmin Lee, Joonho Gwon, Joonki Paik

机构 * Department of Image, Chung-Ang University(Chung-Ang大学图像系) Graphics AI Lab, NCSOFT(NCSOFT图形AI实验室) Department of Computer Science, University of Seoul(首尔大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16767 2025-06-26 cs.CV cs.AI cs.GR 81%

ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model

Fangfu Liu, Wenqiang Sun, Hanyang Wang, Yikai Wang, Haowen Sun, Junliang Ye, Jun Zhang, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Department of Computer Science, Tsinghua University(计算机科学系,清华大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://liuff19.github.io/ReconX

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15684 2025-06-19 cs.GR cs.CV cs.LG 81%

Nabla-R2D3: Effective and Efficient 3D Diffusion Alignment with 2D Rewards

Qingming Liu, Zhen Liu, Dinghuai Zhang, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Technical Report (21 pages, 21 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09665 2025-06-17 cs.GR cs.CV 81%

VideoMat: Extracting PBR Materials from Video Diffusion Models

Jacob Munkberg, Zian Wang, Ruofan Liang, Tianchang Shen, Jon Hasselgren

机构 * NVIDIA Sweden(NVIDIA瑞典分公司) NVIDIA , University of Toronto , Vector Institute Canada(NVIDIA、多伦多大学、向量研究所加拿大) NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project website: https://nvlabs.github.io/videomat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10002 2025-06-13 cs.MM cs.AI cs.CV cs.RO 81%

EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis

Jianwu Fang, Lei-Lei Li, Zhedong Zheng, Hongkai Yu, Jianru Xue, Zhengguo Li, Tat-Seng Chua

机构 * Xi’an Jiaotong University(西安交通大学) University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Department of Electrical Engineering and Computer Science, Cleveland State University(克莱姆森大学电气工程与计算机科学系) Institute for Infocomm Research, Agency for Science, Technology and Research (A ∗ STAR)(信息与通信研究机构,科技研究局)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE-TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10007 2025-06-13 cs.MM cs.AI cs.CV 81%

Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space

Kangwei Liu, Junwu Liu, Xiaowei Yi, Jinlin Guo, Yun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Laboratory for Big Data and Decision, School of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院大数据与决策实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14732 2025-06-10 cs.CV cs.GR 81%

OctFusion: Octree-based Diffusion Models for 3D Shape Generation

Bojun Xiong, Si-Tong Wei, Xin-Yang Zheng, Yan-Pei Cao, Zhouhui Lian, Peng-Shuai Wang

机构 * Peking University(北京大学) Tsinghua University(清华大学) VAST(中国科学院软件研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to Computer Graphics Forum (SGP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13762 2025-06-10 cs.CV cs.LG cs.MM cs.SD eess.AS 81%

A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation

Gwanghyun Kim, Alonso Martinez, Yu-Chuan Su, Brendan Jou, José Lezama, Agrim Gupta, Lijun Yu, Lu Jiang, Aren Jansen, Jacob Walker, Krishna Somandepalli

机构 * Seoul National University(首尔国立大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Journal ref In Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17327 2025-06-06 cs.GR cs.AI cs.CV 81%

AnyTop: Character Animation Diffusion with Any Topology

Inbar Gat, Sigal Raab, Guy Tevet, Yuval Reshef, Amit H. Bermano, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH 2025. Video: https://www.youtube.com/watch?v=NWOdkM5hAbE, Project page: https://anytop2025.github.io/Anytop-page, Code: https://github.com/Anytop2025/Anytop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04283 2025-06-06 cs.GR cs.AI cs.CV 81%

SSIMBaD: Sigma Scaling with SSIM-Guided Balanced Diffusion for AnimeFace Colorization

Junpyo Seo, Hanbin Koo, Jieun Yook, Byung-Ro Moon

机构 * Department of Computer Science(计算机科学系) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 10 pages, rest of the pages are appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14151 2025-06-05 cs.CV cs.MM 81%

ReactDiff: Latent Diffusion for Facial Reaction Generation

Jiaming Li, Sheng Wang, Xin Wang, Yitao Zhu, Honglin Xiong, Zixu Zhuang, Qian Wang

机构 * School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(生物医学工程学院及先进医学材料与器件国家重点实验室,上海科技大学) School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02661 2025-06-04 cs.SD cs.CV cs.GR eess.AS 81%

MotionRAG-Diff: A Retrieval-Augmented Diffusion Framework for Long-Term Music-to-Dance Generation

Mingyang Huang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21555 2025-06-04 cs.LG cs.CV cs.GR stat.ML 81%

SyncSDE: A Probabilistic Framework for Diffusion Synchronization

Hyunjun Lee, Hyunsoo Lee, Sookwan Han

机构 * ECE, Seoul National University(电子工程系,首尔国立大学) Republic of Korea Air Force(韩国空军)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Accepted to CVPR2025. Project Page: https://hjl1013.github.io/SyncSDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00562 2025-06-03 cs.CV cs.MM 81%

SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models

Yule Zhu, Ping Liu, Zhedong Zheng, Wei Liu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Nevada Reno(内华达大学拉森分校) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22489 2025-05-29 eess.IV cs.CV cs.GR 81%

Cascaded 3D Diffusion Models for Whole-body 3D 18-F FDG PET/CT synthesis from Demographics

Siyeop Yoon, Sifan Song, Pengfei Jin, Matthew Tivnan, Yujin Oh, Sekeun Kim, Dufan Wu, Xiang Li, Quanzheng Li

机构 * Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments MICCAI2025 Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21437 2025-05-28 cs.GR cs.CV cs.RO 81%

CoDA: Coordinated Diffusion Noise Optimization for Whole-Body Manipulation of Articulated Objects

Huaijin Pi, Zhi Cen, Zhiyang Dou, Taku Komura

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://phj128.github.io/page/CoDA/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19151 2025-05-27 cs.GR cs.AI cs.CV 81%

SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation

Shenggan Cheng, Yuanxin Wei, Lansong Diao, Yong Liu, Bujiao Chen, Lianghua Huang, Yu Liu, Wenyuan Yu, Jiangsu Du, Wei Lin, Yang You

机构 * National University of Singapore(国立新加坡大学) Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08353 2025-05-16 cs.GR cs.CV cs.LG 81%

Single View Garment Reconstruction Using Diffusion Mapping Via Pattern Coordinates

Ren Li, Cong Cao, Corentin Dumery, Yingxuan You, Hao Li, Pascal Fua

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09608 2025-05-15 cs.CV cs.GR 81%

LightLab: Controlling Light Sources in Images with Diffusion Models

Nadav Magar, Amir Hertz, Eric Tabellion, Yael Pritch, Alex Rav-Acha, Ariel Shamir, Yedid Hoshen

机构 * Tel Aviv University and Google Israel(特拉维夫大学和谷歌以色列) Google United States of America(谷歌美国) Google Israel(谷歌以色列) Reichman University and Google Israel(Reichman大学和谷歌以色列) Hebrew University of Jerusalem and Google Israel(耶路撒冷希伯来大学和谷歌以色列)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project Page: https://nadmag.github.io/LightLab/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04996 2025-05-09 cs.GR cs.CV cs.SD eess.AS 81%

Inter-Diffusion Generation Model of Speakers and Listeners for Effective Communication

Jinhe Huang, Yongkang Cheng, Yuming Hang, Gaoge Han, Jinewei Li, Jing Zhang, Xingjian Gu

机构 * Nanjing Agriculture University(南京农业大学) Northwest A&F University(西北农林科技大学) City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学) Northwestern Polytechnical University(西北工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments accepted by ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04276 2025-05-08 cs.CV cs.MM 81%

HDiffTG: A Lightweight Hybrid Diffusion-Transformer-GCN Architecture for 3D Human Pose Estimation

Yajie Fu, Chaorui Huang, Junwei Li, Hui Kong, Yibin Tian, Huakang Li, Zhiyuan Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机电与控制工程学院) School of AI and Advanced Computing, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学人工智能与高级计算学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息系统学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments 8 pages, 4 figures, International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17253 2025-04-25 cs.CV cs.MM 81%

DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks

Yinqi Li, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, 100190, China, and University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院信息处理重点实验室,计算技术研究所,北京,100190,中国,以及中国科学院大学,北京100049,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11389 2025-04-21 cs.GR cs.AI cs.CV 81%

VideoPanda: Video Panoramic Diffusion with Multi-view Attention

Kevin Xie, Amirmojtaba Sabour, Jiahui Huang, Despoina Paschalidou, Greg Klar, Umar Iqbal, Sanja Fidler, Xiaohui Zeng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project website at https://research.nvidia.com/labs/toronto-ai/VideoPanda/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12809 2025-04-18 cs.CV cs.MM 81%

Saliency-Aware Diffusion Reconstruction for Effective Invisible Watermark Removal

Inzamamul Alam, Md Tanvir Islam, Simon S. Woo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at The Web Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12788 2025-04-18 cs.GR cs.CV 81%

ARAP-GS: Drag-driven As-Rigid-As-Possible 3D Gaussian Splatting Editing with Diffusion Prior

Xiao Han, Runze Tian, Yifei Tong, Fenggen Yu, Dingyao Liu, Yan Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12540 2025-04-18 cs.GR cs.CV cs.RO 81%

UniPhys: Unified Planner and Controller with Diffusion for Flexible Physics-Based Character Control

Yan Wu, Korrawe Karunratanakul, Zhengyi Luo, Siyu Tang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://wuyan01.github.io/uniphys-project/

详情

展开后加载摘要…

URL PDF HTML 收藏