arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2602.23165 2026-03-31 cs.CV 79%

DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

DyaDiT:一种多模态扩散变换器,用于生成社会有利的双人手势

Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani

机构 * Institute of Science Tokyo(东京科学大学) UNIST(蔚山科学技术院) Shanda AI Research Tokyo(盛大人工智能研究院东京) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DyaDiT通过多模态扩散变换器生成适合社会互动的双人手势,利用双人音频信号和社交上下文令牌,融合双方信息并编码运动先验,实现更自然的交互。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14959 2026-03-31 cs.CV 79%

Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

迈向视频帧插值的整体建模:具有自回归扩散变换器的局部扩散强制

Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LDF-VFI方法,通过自回归扩散变换器建模整个视频序列,结合跳连采样策略和稀疏注意力机制,提升视频帧插值的时序一致性和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12554 2026-03-31 cs.CV 79%

Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion

基于PDE图扩散的多模态图网络建模用于人-物交互检测

Wenxuan Ji, Haichao Shi, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 79%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27371 2026-03-31 cs.CV 79%

HMPDM: A Diffusion Model for Driving Video Prediction with Historical Motion Priors

HMPDM:一种利用历史运动先验的扩散模型用于驾驶视频预测

Ke Li, Tianjia Yang, Kaidi Liang, Xianbiao Hu, Ruwen Qin

机构 * Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HMPDM模型,通过引入历史运动先验提升驾驶视频预测的时序一致性与视觉质量,实验表明其在Cityscapes和KITTI基准上优于现有方法,FVD指标提升28.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17388 2026-03-31 cs.CV 79%

Toward Phonology-Guided Sign Language Motion Generation: A Diffusion Baseline and Conditioning Analysis

迈向语音引导的手语动作生成:一种扩散基线与条件分析

Rui Hong, Jana Kosecka

机构 * George Mason University(乔治梅森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的基线方法,研究文本条件对手语动作生成的影响,发现将符号化标注转为自然语言是CLIP有效条件,T5不受影响,最佳变体在所有指标上优于现有方法。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV 79%

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-03-31 cs.CV 79%

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments v5: Fix some typos. Figures were compressed to 150 dpi to comply with arXiv's submission size limit. Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC 79%

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG 79%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26827 2026-03-31 cs.LG cs.AI cs.CV 79%

Central-to-Local Adaptive Generative Diffusion Framework for Improving Gene Expression Prediction in Data-Limited Spatial Transcriptomics

面向数据有限空间转录组学的中心到局部自适应生成扩散框架:提升基因表达预测

Yaoyu Fang, Jiahe Qian, Xinkun Wang, Lee A. Cooper, Bo Zhou

机构 * Northwestern University(西北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出C2L-ST框架,通过结合大规模形态学先验与有限分子指导,解决空间转录组学数据稀缺问题,提升基因表达预测准确性与空间一致性。

Comments 31 pages, 12 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26767 2026-03-31 cs.CV 79%

A training-free framework for high-fidelity appearance transfer via diffusion transformers

无需训练的高保真外观迁移框架:通过扩散变换器

Shengrong Gu, Ye Wang, Song Wu, Rui Ma, Qian Wang, Lanjun Wang, Zili Yi

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of New Media and Communication, Tianjin University(天津大学新媒体与传播学院) JIUTIAN Research(九天研究院) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的扩散变换器框架,通过解耦结构与外观,利用高保真倒置建立内容先验,结合几何先验实现参考图像的动态融合,从而在结构保持和外观保真度上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26759 2026-03-31 cs.CV 79%

Physics-Aware Diffusion for LiDAR Point Cloud Densification

面向激光雷达点云密集化的物理感知扩散模型

Zeping Zhang, Robert Laganière

机构 * University of Ottawa(渥太华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Scanline-Consistent Range-Aware Diffusion模型,通过概率细化提升激光雷达点云密集度,以156ms实现高保真结果,采用Ray-Consistency损失和Negative Ray增强技术抑制物理幻觉,提升3D检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26509 2026-03-30 cs.CV 79%

Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays

基于条件扩散的3DCT体积重建从2DX光

Martin Rath, Morteza Ghahremani, Yitong Li, Ashkan Taghipour, Marcus Makowski, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Western Australia (UWA)(西澳大利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AXON框架,通过多阶段扩散模型直接从真实X光重建高保真3DCT体积,采用粗到细策略和ControlNet优化,支持双平面X光输入并提升诊断分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26263 2026-03-30 cs.CV cs.RO 79%

DRUM: Diffusion-based Raydrop-aware Unpaired Mapping for Sim2Real LiDAR Segmentation

DRUM:基于扩散的反射率感知无配对映射用于Sim2Real激光雷达分割

Tomoya Miyawaki, Kazuto Nakashima, Yumi Iwashita, Ryo Kurazume

机构 * Kyushu University(九州大学) Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DRUM通过利用未标记真实数据预训练的扩散模型,结合反射强度和射线丢失噪声特性,提升Sim2Real激光雷达分割性能。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 79%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26117 2026-03-30 eess.IV cs.CV 79%

FINDER: Zero-Shot Field-Integrated Network for Distortion-free EPI Reconstruction in Diffusion MRI

FINDER:用于扩散磁共振成像中无失真EPI重建的零样本场积分网络

Namgyu Han, Seong Dae Yun, Chaeeun Lim, Sunghyun Seok, Sunju Kim, Yoonhwan Kim, Yohan Jun, Tae Hyung Kim, Berkin Bilgic, Jaejin Cho

机构 * Sejong University(世宗大学) Forschungszentrum Jülich(于利希研究中心) Athinoula A. Martinos Center for Biomedical Imaging(Athinoula A. Martinos生物医学成像中心) Harvard Medical School(哈佛医学院) Hongik University(弘益大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FINDER网络,通过联合优化图像和B0场图,解决EPI重建中的几何失真问题,提升扩散成像质量。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26071 2026-03-30 cs.CV cs.LG 79%

MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

MUST:一种模态特定表示感知的Transformer,用于具有缺失模态的扩散增强生存预测

Kyungwon Kim, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MUST通过分解模态特定和跨模态上下文化组件,提高生存预测的准确性,在缺失模态情况下仍能保持稳健预测。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19692 2026-03-30 cs.CV 79%

Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models

Interact2Ar:通过自回归扩散模型生成全身体态的人与人交互

Pablo Ruiz-Ponce, Sergio Escalera, José García-Rodríguez, Jiankang Deng, Rolandos Alexandros Potamias

机构 * Universidad de Alicante(阿利坎特大学) Universitat de Barcelona and Computer Vision Center(巴塞罗那大学与计算机视觉中心) Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Interact2Ar,首个基于文本条件的自回归扩散模型,用于生成全身体态的人与人交互,通过专用并行分支实现详细手部运动,结合新颖的记忆技术提升适应性,支持多场景应用。

Comments Project Page: https://pabloruizponce.com/papers/Interact2Ar

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16928 2026-03-30 cs.CV 79%

Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

重新思考基于扩散模型的视频超分辨率:利用对齐特征的密集引导

Jingyi Xu, Meisong Zheng, Ying Chen, Minglang Qiao, Xin Deng, Mai Xu

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DGAF-VSR方法,通过优化对齐和补偿机制提升视频超分辨率的感知质量、保真度和时间一致性。

Comments Accepted by CVPR 2026,20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26014 2026-03-30 eess.IV cs.CV 79%

Cone-Beam CT Image Quality Enhancement Using A Latent Diffusion Model Trained with Simulated CBCT Artifacts

使用基于伪CBCT伪影训练的条件潜变量扩散模型进行锥束CT图像质量增强

Naruki Murahashi, Mitsuhiro Nakamura, Megumi Nakao

机构 * Graduate School of Medicine, Kyoto University(京都大学医学研究科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于条件潜变量扩散模型的锥束CT图像质量增强方法,利用伪CBCT图像进行自监督学习,有效提升图像质量并保持解剖结构,实验表明其在处理速度和图像改善性能上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25977 2026-03-30 cs.CV 79%

Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)

具有扩散空间旋转位置嵌入的扩散磁共振成像变换器(D-RoPE)

Gustavo Chau Loo Kung, Mohammad Abbasi, Camila Blank, Juze Zhang, Alan Q. Wang, Sophie Ostmeier, Akshay Chaudhari, Kilian Pohl, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D-RoPE以解决扩散磁共振成像中空间、扩散加权和方向依赖性的建模问题,通过自监督预训练提升模型在多种任务中的表现,实现更稳健的跨设置表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25758 2026-03-30 cs.CV cs.AI cs.LG eess.IV 79%

A-SelecT: Automatic Timestep Selection for Diffusion Transformer Representation Learning

A-SelecT:扩散变换器表示学习中的自动时间步选择

Changyu Liu, James Chenhao Liang, Wenhao Yang, Yiming Cui, Jinghao Yang, Tianyang Wang, Qifan Wang, Dongfang Liu, Cheng Han

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) U. S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) University of Florida(佛罗里达大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Meta AI Rochester Institute of Technology(罗切斯特理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出A-SelecT方法,通过动态选择扩散变换器中最信息丰富的时间步,提升训练效率和表示能力,在分类和分割任务中优于现有扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15132 2026-03-27 cs.CV 79%

WiT: Waypoint Diffusion Transformers via Trajectory Conflict Navigation

WiT:通过轨迹冲突导航实现方式点扩散变换

Hainuo Wang, Mingjia Li, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WiT,通过分解连续向量场中的语义方式点,解决像素空间中的轨迹冲突问题,提升扩散生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02193 2026-03-27 cs.CV 79%

SSI-DM: Singularity Skipping Inversion of Diffusion Models

SSI-DM:扩散模型的奇点跳过反演

Chen Min, Enze Jiang, Jishen Peng, Zheng Ma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SSI-DM方法,通过在标准反演前添加小噪声跳过奇点,实现具有自然高斯性质的噪声反演,提升扩散模型的重建和插值性能。

Comments A complete revision is needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18822 2026-03-27 cs.CV 79%

DiP: Taming Diffusion Models in Pixel Space

DiP:在像素空间中驯服扩散模型

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiP提出一种高效的像素空间扩散框架,通过解耦生成过程为全局和局部阶段,结合Diffusion Transformer和轻量级Patch Detailer Head,在不依赖VAE的情况下实现高效生成,推理速度提升10倍,FID分数达1.79。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24938 2026-03-27 cs.CV 79%

Infinite Gaze Generation for Videos with Autoregressive Diffusion

视频无限 gaze 生成的自回归扩散模型

Jenna Kang, Colin Groth, Tong Wu, Finley Torrens, Patsorn Sangkloy, Gordon Wetzstein, Qi Sun

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种自回归扩散模型,用于生成任意长度视频的无限 horizon 原始 gaze,通过在 saliency-aware 视觉潜在空间中条件化,提升长程时空准确性和轨迹真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24764 2026-03-27 cs.CV cs.LG 79%

Synthetic Cardiac MRI Image Generation using Deep Generative Models

利用深度生成模型合成心脏MRI图像

Ishan Kumarasinghe, Dasuni Kawya, Madhura Edirisooriya, Isuri Devindi, Isuru Nawinne, Vajira Thambawita

机构 * Department of Computer Engineering(计算机工程系) University of Peradeniya(珀德尼亚大学) University of Maryland(马里兰大学) Department of Holistic Systems(整体系统系) SimulaMet Oslo, Norway(挪威奥斯陆)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文综述了通过深度生成模型生成合成心脏MRI图像的方法,探讨了在保真度、实用性和隐私方面现有技术的局限性,并强调了需要集成评估驱动框架以确保临床工作流程的可靠性。

Comments 12 pages, 2 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20951 2026-03-27 cs.CV cs.AI 79%

See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

查看并修复缺陷:通过代理数据合成使VLMs和扩散模型能够理解视觉缺陷

Jaehyun Park, Minyoung Ahn, Minkyu Kim, Jonghyun Lee, Jae-Gil Lee, Dongmin Park

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学) KRAFTON

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ArtiAgent,通过代理数据合成生成真实与带缺陷图像对,有效减少视觉缺陷,提升模型对视觉缺陷的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24407 2026-03-26 cs.CV 79%

Teacher-Student Diffusion Model for Text-Driven 3D Hand Motion Generation

基于文本驱动的3D手部运动生成的教师-学生扩散模型

Ching-Lam Cheng, Bin Zhu, Shengfeng He

机构 * Singapore Management University(新加坡管理大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TSHaMo模型,通过文本生成逼真3D手部运动,利用教师-学生扩散框架提升运动质量和多样性,支持多种辅助输入。

Comments 5 pages, accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏