arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2607.12937 2026-07-15 eess.IV cs.CV 新提交 79%

Exact and Calibrated Diffusion Reconstruction for Digital Breast Tomosynthesis

数字乳腺断层合成的精确校准扩散重建

Imade Bouftini

机构 * Imade Bouftini

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对有限角度数字乳腺断层合成,提出用精确欧几里得投影替换近端更新来确保数据一致性,通过等渗重新校准解决不确定性问题,修复投影仪伴随不匹配,实现首个数据一致、不确定性校准的学习重建,提高了重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13031 2026-07-15 cs.LG cs.CV 新提交 79%

The Seriality Gap in Video Diffusion Models

视频扩散模型中的序列性差距

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。

Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12464 2026-07-15 cs.CV cs.LG 新提交 79%

Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification

通过类对比影响引导扩散模型进行少样本医学分类

Jeeyung Kim, Erfan Esmaeili, Qiang Qiu

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对少样本医学分类中标记数据稀缺,现有方法忽视样本对分类有用性衡量与优化的问题,提出类对比影响(C2I)准则,通过强化学习用C2I奖励微调扩散模型,引导生成类信息丰富样本,提高了下游准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11941 2026-07-15 cs.CV cs.LG 新提交 79%

GenDiff: A Dose and Anatomy Aware Diffusion Model with Structural Prior Refinement for Low-Dose CT Reconstruction and Generalization

GenDiff:一种具有结构先验细化的剂量和解剖感知扩散模型,用于低剂量CT重建和泛化

Md Imam Ahasan, Guangchao Yang, A F M Abdun Noor, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mahfuzur Rahman

机构 * Faculty of Information Science & Technology, Multimedia University, Malaysia(马来西亚多媒体大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对低剂量CT重建中现有方法局限性,提出GenDiff框架,联合建模剂量与解剖信息,集成多种模块,经多数据集实验验证,该方法在不同条件下鲁棒性强且重建质量优,是低剂量CT成像的有前途方案。

Comments 20 pages, 8 figures, 4 tables. Under review at PeerJ Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 79%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01841 2026-07-15 cs.CV 版本更新 79%

Leveraging Prior Knowledge of Diffusion Model for Person Search

利用扩散模型的先验知识进行行人搜索

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom

机构 * GSAIM, Chung-Ang University(Chung-Ang大学图像信息研究所) IPAI, Seoul National University(首尔国立大学图像感知研究所) Department of Mathematical Sciences and RIMS, Seoul National University(首尔国立大学数学科学系和RIMS)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对行人搜索中现有方法的不足,提出DiffPS框架,利用预训练扩散模型,消除子任务优化冲突,通过分析扩散先验属性设计三个专门模块,在CUHK-SYSU和PRW数据集上取得新的最优成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10094 2026-07-15 cs.CV cs.LG 版本更新 79%

Beyond Perceptual Distance: Discrepancy Assessment on Deep Representation for Out-of-Distribution Detection with Diffusion Model

超越感知距离:基于扩散模型的分布外检测深度表示差异评估

Kun Fang, Zuopeng Yang, Haibo Hu, Xiaolin Huang, Jie Yang, Qinghua Tao

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) The Intsig Information Co., Ltd., Shanghai, China(上海Intsig信息有限公司) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散模型的分布外检测差异评估,提出以分类器相关方式评估,利用其表示空间量化特征级和logit级差异,设计优化策略构成DDR框架,实验表明DDR在ImageNet-1K数据集上检测性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11578 2026-07-14 cs.LG cs.AI cs.CV eess.SP 新提交 79%

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

DiffEEG:用于学习脑电通用表示的自监督去噪扩散模型

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

机构 * Lebanese American University(黎巴嫩美国大学) Institute of Applied Artificial Intelligence, TÉLUQ University(应用人工智能研究所,泰鲁克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对基于脑电的癫痫检测面临的注释稀缺和类别不平衡问题,提出DiffEEG自监督基础模型,通过去噪扩散预训练和强化学习微调学习通用神经表示,在癫痫检测中取得较好效果,证明该方法能以最少标记数据实现临床可部署监测。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11533 2026-07-14 cs.CV cs.LG 新提交 79%

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction

基于高效扩散变压器的PNI预测的自适应路由

Youngung Han, Dohyun Kweon, Kyeonghun Kim, Hyunsu Go, Jina Jeong, Suah Park, Induk Um, Junga Kim, Anna Jung, Yului Jeong, Sungha Park, Jinyong Jun, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学) OUTTA Chung-Ang University(Chung-Ang 大学) Seoul National University School of Medicine(首尔国立大学医学院) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对胆管癌PNI术前MRI预测难题,传统方法有局限。本文将PNI预测设为扩散分类问题,用基于Transformer的表示实现去噪网络,并引入自适应路由提高效率,实验取得了0.731的AUC及257.57 GFLOPs的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交 79%

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10984 2026-07-14 cs.CV cs.AI cs.HC cs.LG 新提交 79%

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion:通过等变潜扩散实现与运动学无关的人体运动预测

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有3D人体运动预测模型受骨骼运动学硬编码限制的问题,提出EquiFusion模型,通过排列等变架构实现潜扩散,对未见运动学有跨数据集泛化能力,在基准测试中成果领先,建立了新的人体运动预测标准。

Comments Accepted to ECCV 2026. Visit our webpage at https://ceveloper.github.io/publications/equifusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10580 2026-07-14 cs.CV cs.AI 新提交 79%

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

DiffUE:通过扩散自动编码器增强不可学习示例的效用-不可学习性权衡

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Oak Ridge National University, Knoxville(橡树岭国家实验室诺克斯维尔分部) University of Georgia, Athens(佐治亚大学雅典分校) Virginia Commonwealth University, Richmond(弗吉尼亚联邦大学里士满分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对AI模型利用个人图像致隐私侵犯问题,DiffUE通过在图像语义空间注入噪声,利用扩散自动编码器框架操纵语义特征,增强图像不可学习性,显著提升了图像质量和不可学习性之间的权衡,保障个人数据安全。

Comments To appear at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09753 2026-07-14 cs.CV cs.AI cs.LG 新提交 79%

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

通过内部潜变量分析对扩散模型进行统一骨干细化

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) INEEJI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型骨干细化问题,提出DUNE框架,通过分析内部潜变量检测突变偏差,对选定条目进行骨干特定抑制,可自然扩展到基于Transformer的模型,经实验验证该方法能提高保真度并减少幻觉。

Comments 45 pages, 23 figures. Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新 79%

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00786 2026-07-14 cs.CV 版本更新 79%

Zero-Shot Paragraph-level Handwriting Imitation with Latent Diffusion Models

基于潜在扩散模型的零样本段落级手写模仿

Martin Mayr, Marcel Dreier, Florian Kordon, Mathias Seuret, Jochen Zöllner, Fei Wu, Andreas Maier, Vincent Christlein

机构 * Planet AI GmbH

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于潜在扩散模型的零样本段落级手写模仿方法,通过改进模型、增强注意力机制等,能处理未见风格,提高手写生成真实感,在综合评估中表现优异,还公开代码支持相关研究。

Journal ref Int. J. Comput. Vis. 133 (2025) 7054-7075

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08808 2026-07-13 cs.CV 新提交 79%

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

StereoSplat+:具有扩散辅助渐进推理的前馈立体高斯点云渲染

Zihua Liu, Masatoshi Okutomi

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单目立体观察恢复高质量3DGS场景的问题,提出StereoSplat+框架,包含StereoSplat估计器及扩散增强单步渐进推理方案,实验表明该方法提升了新视图渲染质量和几何精度,优于现有前馈3DGS基线。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08241 2026-07-10 cs.CV cs.LG 新提交 79%

Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

消除零空间:用于无分类器扩散的引导感知量化

Abdullah Al Shafi, Sumaiya Rahim Suma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在实际计算预算下部署CFG扩散模型的量化问题,针对现有方法忽略其结构导致的问题,提出引导感知混合精度方法,通过直接校准引导预测等操作防止无条件分支漂移,实现更好量化效果。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08086 2026-07-10 cs.CV 新提交 79%

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion

GRE-Diff:用于结构化布局扩散的高斯房间嵌入

Jing Wang, Haoran Xiong, Zihao Yan, Minglun Gong, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省视觉媒体与多维智能重点实验室,计算机科学与软件学院,深圳大学) School of Computer Science, University of Guelph(圭尔夫大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GRE-Diff框架,结合AI建议与人工编辑,通过大语言模型或图形用户界面让用户指定房间相关约束和操作,利用高斯房间嵌入生成多样合理设计,实验表明其能产生高质量布局,助力空间设计中AI与人类创造力结合。

Comments 37 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 79%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 扩散模型 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14584 2026-07-10 cs.CV 版本更新 79%

Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling

用于脑 MRI 进展建模的解剖学引导潜在扩散

Cheng Wan, Bahram Jafrasteh, Ehsan Adeli, Miaomiao Zhang, Qingyu Zhao

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Stanford University(斯坦福大学) University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确建模脑 MRI 进展,提出解剖学引导潜在扩散模型 AG-LDM,通过融合多因素简化训练流程,经实验验证其在图像质量、误差降低及特征捕捉等方面表现优异,是可靠的脑 MRI 进展建模框架。

Comments 24 pages, 7 figures, 7 tables. Code available at https://github.com/JornyWan/AG-LDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交 79%

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 79%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07195 2026-07-09 cs.CV 新提交 79%

DiffCVE: Diffusion-based Compressed Video Enhancement

DiffCVE:基于扩散的压缩视频增强

Wenqiang Xiao, Wenzhuo Ma, Junxi Zhang, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对严重压缩视频感知质量增强难题,提出DiffCVE方法。设计CPDC分支联合建模,引入CDSP机制与CPWF模块,利用编码先验及条件提示等,经实验验证该方法能有效提升感知质量,尤其在严重压缩时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06856 2026-07-09 cs.CV cs.LG 新提交 79%

Gen4U: Unifying Video Generation and Understanding via Diffusion

Gen4U:通过扩散统一视频生成与理解

Michael King, Aravindh Mahendran, Matthew Koichi Grimes, Fedor Kitashov, Adham Elarabawy, Pedro Velez, Maks Ovsjanikov, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究通过互 kNN 对齐指标揭示视频扩散模型潜在空间特性,引入 Gen4U 框架,该框架能单次前向传递重新利用生成表示,实验表明冻结的大规模视频扩散模型可作视频编码器,Gen4U 统一视频生成与理解范式且保留生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06843 2026-07-09 cs.CV 新提交 79%

Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation

检索和优化用于基于扩散的运动生成的获胜噪声票证

Sakuya Ota, Qing Yu, Kent Fujiwara, Satoshi Ikehata, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学研究所) LY Corporation(LY公司) National Institute of Informatics (NII)(国立情报学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散的文本到运动模型语义漂移问题,提出WINRO框架,通过在扩散采样前选择和优化获胜噪声票证改善文本与运动对齐,无需重新训练,提升了不同模型的文本与运动保真度、时间鲁棒性,并推广到多种应用。

Comments Accepted to ECCV 2026, Project page: https://sinc865.github.io/winro/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16673 2026-07-09 cs.CV 新提交 79%

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

MMDiff: 扩展扩散变换器用于多模态生成

Yagmur Akarken, Orest Kupyn, Christian Rupprecht

机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17077 2026-07-09 cs.LG cs.AI cs.CV 版本更新 79%

ContrastiveCFG: Guiding Diffusion Sampling by Contrasting Positive and Negative Concepts

对比CFG:通过对比正负概念引导扩散采样

Jinho Chang, Changsun Lee, Hyungjin Chung, Jong Chul Ye

机构 * EverEx

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在条件扩散模型采样中,针对简单否定CFG引导存在的问题,提出用对比损失实现对给定条件引导的新方法,能在多样场景下有效注入或去除给定概念并保持样本质量。

Comments 20 pages, 11 figures. Poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏