arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2607.09753 2026-07-14 cs.CV cs.AI cs.LG 新提交 79%

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

通过内部潜变量分析对扩散模型进行统一骨干细化

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) INEEJI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型骨干细化问题,提出DUNE框架,通过分析内部潜变量检测突变偏差,对选定条目进行骨干特定抑制,可自然扩展到基于Transformer的模型,经实验验证该方法能提高保真度并减少幻觉。

Comments 45 pages, 23 figures. Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08808 2026-07-13 cs.CV 新提交 79%

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

StereoSplat+:具有扩散辅助渐进推理的前馈立体高斯点云渲染

Zihua Liu, Masatoshi Okutomi

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单目立体观察恢复高质量3DGS场景的问题,提出StereoSplat+框架,包含StereoSplat估计器及扩散增强单步渐进推理方案,实验表明该方法提升了新视图渲染质量和几何精度,优于现有前馈3DGS基线。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08241 2026-07-10 cs.CV cs.LG 新提交 79%

Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

消除零空间:用于无分类器扩散的引导感知量化

Abdullah Al Shafi, Sumaiya Rahim Suma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在实际计算预算下部署CFG扩散模型的量化问题,针对现有方法忽略其结构导致的问题,提出引导感知混合精度方法,通过直接校准引导预测等操作防止无条件分支漂移,实现更好量化效果。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08086 2026-07-10 cs.CV 新提交 79%

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion

GRE-Diff:用于结构化布局扩散的高斯房间嵌入

Jing Wang, Haoran Xiong, Zihao Yan, Minglun Gong, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省视觉媒体与多维智能重点实验室,计算机科学与软件学院,深圳大学) School of Computer Science, University of Guelph(圭尔夫大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GRE-Diff框架,结合AI建议与人工编辑,通过大语言模型或图形用户界面让用户指定房间相关约束和操作,利用高斯房间嵌入生成多样合理设计,实验表明其能产生高质量布局,助力空间设计中AI与人类创造力结合。

Comments 37 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 79%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 扩散模型 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交 79%

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 79%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07195 2026-07-09 cs.CV 新提交 79%

DiffCVE: Diffusion-based Compressed Video Enhancement

DiffCVE:基于扩散的压缩视频增强

Wenqiang Xiao, Wenzhuo Ma, Junxi Zhang, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对严重压缩视频感知质量增强难题,提出DiffCVE方法。设计CPDC分支联合建模,引入CDSP机制与CPWF模块,利用编码先验及条件提示等,经实验验证该方法能有效提升感知质量,尤其在严重压缩时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06856 2026-07-09 cs.CV cs.LG 新提交 79%

Gen4U: Unifying Video Generation and Understanding via Diffusion

Gen4U:通过扩散统一视频生成与理解

Michael King, Aravindh Mahendran, Matthew Koichi Grimes, Fedor Kitashov, Adham Elarabawy, Pedro Velez, Maks Ovsjanikov, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究通过互 kNN 对齐指标揭示视频扩散模型潜在空间特性,引入 Gen4U 框架,该框架能单次前向传递重新利用生成表示,实验表明冻结的大规模视频扩散模型可作视频编码器,Gen4U 统一视频生成与理解范式且保留生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06843 2026-07-09 cs.CV 新提交 79%

Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation

检索和优化用于基于扩散的运动生成的获胜噪声票证

Sakuya Ota, Qing Yu, Kent Fujiwara, Satoshi Ikehata, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学研究所) LY Corporation(LY公司) National Institute of Informatics (NII)(国立情报学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散的文本到运动模型语义漂移问题,提出WINRO框架,通过在扩散采样前选择和优化获胜噪声票证改善文本与运动对齐,无需重新训练,提升了不同模型的文本与运动保真度、时间鲁棒性,并推广到多种应用。

Comments Accepted to ECCV 2026, Project page: https://sinc865.github.io/winro/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16673 2026-07-09 cs.CV 新提交 79%

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

MMDiff: 扩展扩散变换器用于多模态生成

Yagmur Akarken, Orest Kupyn, Christian Rupprecht

机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06335 2026-07-08 cs.CV 新提交 79%

Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair

通过教师对齐修复弥合扩散剪枝与步长蒸馏

Jincheng Ying, Li Wenlin, Minghui Xu, Yinhao Xiao

机构 * School of Big Data and Artificial Intelligence(大数据与人工智能学院) Guangdong University of Finance and Economics(广东财经大学) School of Computer Science(计算机科学学院) Shandong University(山东大学) GDUFE-UCM Joint Institute(广东财经大学-UCM联合学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型推理成本高的问题,提出用教师对齐修复阶段连接剪枝与步长蒸馏,解决剪枝后重新训练难题,在ImageNet-512上实验,不同剪枝比例下模型参数减少、评估次数降低,FID有相应变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05711 2026-07-08 cs.LG cs.CV 新提交 79%

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models

FourTune:迈向扩散模型的全4位高效训练后优化

Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li

机构 * Nunchux AI MIT(麻省理工学院) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对大型扩散模型训练后优化的挑战,提出FourTune框架,基于端到端W4A4G4范式,引入三分支混合管道、硬件高效量化等,在多任务中质量与全精度微调相当,在特定数据集上降低内存开销、提高训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05702 2026-07-08 cs.CV 新提交 79%

Robust Face Super-Resolution and Recognition Through Multi-Feature Aggregation in Diffusion Models

基于扩散模型中的多特征聚合实现鲁棒的面部超分辨率和识别

Marcelo dos Santos, Rayson Laroca, João Carlos Raposo Neves, David Menotti

机构 * Federal University of Paraná(巴拉那联邦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对监控图像质量低影响人脸识别的问题,提出基于扩散模型的FASR++算法,通过整合多图像特征生成超分辨率输出,减少身份失真,经实验验证,该算法在多指标上取得最优结果,提升了人脸识别性能。

Journal ref Journal of the Brazilian Computer Society, vol. 32, no. 1, pp. 1457-1470, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05637 2026-07-08 cs.CV 新提交 79%

Recovering Cloud Microstructures with Cascaded Diffusion Inversion

通过级联扩散反演恢复云微观结构

Hanan Gani, Guy Pulik, Daniel Rosenfeld, Duncan Watson-Parris, Salman Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对卫星云图像分辨率不足及现有方法不适用于此类图像的问题,提出基于扩散的两阶段超分辨率框架,能将云微观结构分辨率提高4倍,在精度和视觉质量上优于现有方法,为云微物理分析及利用AI促进气候和可持续性提供路径。

Comments Published at ML4RS Workshop ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02998 2026-07-08 cs.CV cs.AI cs.LG 新提交 79%

CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

CONFLUX:一种用于3D胸部CT合成的潜在扩散模型及强化学习后训练

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CONFLUX潜在扩散模型用于胸部CT合成,由3D变分自编码器和整流流变压器构成,基于放射学元数据生成,通过强化学习后训练增强对临床属性控制,在三平面弗雷歇距离上领先并发布模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03299 2026-07-07 eess.IV cs.CV cs.LG 新提交 79%

Piecewise Dynamic Diffusion Regularization for Reconstruction of Cardiac Cine MRI

用于心脏电影MRI重建的分段动态扩散正则化方法

Florian Fürnrohr, Reinhard Heckel

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对实时心脏电影MRI严重欠采样与运动导致的重建难题,提出PDDR方法,分段融合时空扩散先验,实现高效高质量重建,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05319 2026-07-07 cs.CV cs.AI 新提交 79%

Steering Optimisation Trajectories in Diffusion Representation Learning

引导扩散表示学习中的优化轨迹

Rajat Rasal, Avinash Kori, Tian Xia, Ben Glocker

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究探究扩散自编码器图像质量相近但潜在结构差异大的成因,提出SteeringDRL方法,通过门控残差U-Net和噪声水平课程引导优化,提升表示质量并降低种子敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 79%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04276 2026-07-07 cs.CV 新提交 79%

EMPURPLE: A Free Lunch for Diffusion Distillation based on the Information Bottleneck

EMPURPLE:基于信息瓶颈的扩散蒸馏免费午餐

Zilai Li, Lujia Bai

机构 * University of Nottingham(诺丁汉大学) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型推理成本高问题。通过PAC-style泛化界分析原因,提出无需训练的EMPURPLE减少中间潜在分布不匹配,提升FID,该方法与模型无关,在多个模型上效果显著。

Comments 20 pages,2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03803 2026-07-07 cs.CV cs.AI 新提交 79%

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile:用于电影级相机运动生成的设备端图像到视频扩散

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Transsion(传音)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对移动设备图像到视频创作需求,提出CineMobile。采用蒸馏引导剪枝、扩散蒸馏与强化学习优化及混合后训练量化策略,在保持视觉质量的同时大幅加速生成,证明其在移动图像到视频创作中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03770 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

Self-Improving Diffusion Classifiers with Minority Preference Optimization

通过少数偏好优化实现自我改进的扩散分类器

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

机构 * Korea University(韩国大学) Kook Min University(国民大学) Kyung Hee University(庆熙大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现扩散分类器感知偏向多数区域,提出MiPO方法,利用少数偏好奖励微调预训练扩散模型,无需额外图像数据等,经实验验证可缓解偏差并提升零样本扩散分类性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03696 2026-07-07 cs.CV 新提交 79%

IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance

IPDiff:基于信息重构和多先验引导的扩散驱动光学遥感图像显著目标检测

Gongyang Li, Zhen Bai, Runmin Cong, Dan Zeng, Weisi Lin, Xiao-Ping Zhang

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Department of Medical Equipment, the First Affiliated Hospital of Zhengzhou University(郑州大学第一附属医院医学装备部) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院深圳泛在数据赋能重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出IPDiff,一种基于独特动态优化策略的扩散驱动光学遥感图像显著目标检测方法,通过提取多先验信息,在去噪网络中迭代去噪生成显著图,并经混合损失函数监督训练,性能优于46种先进方法。

Comments 22 pages, 8 figures, accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03568 2026-07-07 cs.CV cs.AI 新提交 79%

EPRA U-Net: An Efficient Pyramid Residual Attention Framework for Accurate Infarct Segmentation in Diffusion-Weighted MRI

EPRA U-Net:一种用于扩散加权磁共振成像中准确梗死分割的高效金字塔残差注意力框架

Hasan Ulutas, Muhammet Emin Sahin, Mustafa Fatih Erkoc, Esra Yuce, Turker Tuncer, Sengul Dogan, Serkan Kiranyaz

机构 * Yozgat Bozok University(亚兹加特博兹克大学) Izmir Bakircay University(伊兹米尔巴克伊大学) Queen Mary’s Digital Environment Research Institute (DERI)(皇后玛丽数字环境研究 institute (DERI)) Firat University(费拉特大学) Qatar University(卡塔尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出EPRA U-Net用于DWI图像梗死分割,用基于EfficientNet的编码器提取特征,集成多种模块并采用双注意力机制,用Tversky损失函数,实验表明其性能优于其他模型。

Comments 25 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03509 2026-07-07 cs.CV 新提交 79%

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcing:迈向统一的自回归和双向视频扩散模型

Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有视频生成方法推理范式僵化的问题,提出Flex-Forcing框架。核心是灵活分块机制,可依设备预算灵活分块,跨块双向推理与块内自回归生成,实验表明该框架提升了视频质量、稳定性并加快推理速度。

Comments Project page: https://research.nvidia.com/labs/genair/flex-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03422 2026-07-07 cs.CV 新提交 79%

Handwriting Trajectory Recovery with Diffusion Models

使用扩散模型进行手写轨迹恢复

Hiroki Nagamatsu, Shoji Toyota, Seiichi Uchida

机构 * Kyushu University(九州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个基于扩散模型的框架用于从离线手写图像恢复在线笔轨迹,将其作为图像条件生成任务,用去噪扩散模型采样轨迹,实验验证该方法能准确恢复复杂多笔画字符,提升指标并具笔画顺序倾向及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03103 2026-07-07 cs.CV cs.AI 新提交 79%

SNR-Adaptive Unified Diffusion for Multi-Task Medical Image Segmentation

用于多任务医学图像分割的信噪比自适应统一扩散

Jiahao Liu, Hang Wei, Shuai Wu

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究解决临床心脏成像模型冗余及知识共享问题,提出统一扩散分割框架UniT-Diff,通过特定机制化解冲突,在多基准测试中超越独立训练的特定任务基线。

Comments Accepted to IEEE SMC 2026. 6 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03012 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion

HyperVAttention:用于视频扩散的具有时空聚类的高效稀疏注意力

Dongyeun Lee, Amir Zandieh, Vahab Mirrokni, Junmo Kim, Insu Han

机构 * KAIST(韩国科学技术院) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散中自注意力机制的二次复杂度问题,提出HyperVAttention框架,通过3D局部窗口聚类等方法解决聚类开销大及CTA利用率低的瓶颈,提升视频扩散中无训练稀疏注意力的质量和速度。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02968 2026-07-07 cs.CV 新提交 79%

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

唤醒扩散变换器:通过大规模激活调制激发更强的生成和理解能力

Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Monash University(莫纳什大学) The University of Hong Kong(香港大学) Zhongguancun Academy(中关村科学城创新中心) Chulalongkorn University(朱拉隆功大学) City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散变换器中大规模激活(MAs)的结构和功能,发现其空间分布及与AdaLN残差缩放因子的关系。基于此提出EMA框架,通过MA驱动的细节引导和MA调制的表征提取,提升生成和理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏