arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-25 至 2026-08-25 共收录 156 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2608.21748 2026-08-25 cs.CV 新提交 86%

Calibrate What You SHIP: Post-Selection Risk Control for Verifier-Guided Text-to-Image Generation

校准你所发布的内容:验证器引导的文本到图像生成的后选择风险控制

Xuanhua Yin, Shunqi Mao, Wei Guo, Chuanzhi Xu, Weidong Cai

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 该研究针对验证器引导的文本到图像生成的后选择风险控制问题,提出 SHIP 方法,通过策略级校准降低发布输出风险,在 GenEval2 数据集上使发布风险从 0.310 降至 0.162。

Comments 17 pages, 9 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21713 2026-08-25 cs.CV cs.CL cs.LG 新提交 86%

The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation

计划而非解码器:诊断与修复推理增强型文本到图像生成中的组合式失败

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 该研究针对推理增强型文本到图像生成的组合式失败,发现问题源于规划器而非解码器,通过编辑计划(如重写几何结构)可显著提升生成质量,还发布了相关评估协议及数据。

Comments 15 pages, 7 figures. Accepted at ECCV 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21784 2026-08-25 cs.CV 新提交 79%

DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models

DefaultShift:审计加速文本到图像模型中的语义默认偏移

Xuanhua Yin, Chuanzhi Xu, Shunqi Mao, Wei Guo, Weidong Cai

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本研究提出DefaultShift审计方法检测文本到图像模型加速时的语义默认偏移,还提出DefaultShift-Select校准方法降低偏移,提升模型语义保护能力。

Comments 21 pages, 12 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-08-25 cs.CR 版本更新 78%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 文生图 :text-to-image(title,abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21869 2026-08-25 cs.CV cs.AI 新提交 77%

GuardPaint:SpeculativeSafetyDecodingforText-to-ImageGeneration

GuardPaint:文本到图像生成的推测性安全解码

Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi, Aranbi Dutta, Aman Chadha, Vinija Jain, Amitava Das

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 GuardPaint是一种无需修改基础模型的文本到图像生成安全防护框架,可在扩散轨迹内干预,通过轻量级审计器定位并修复不安全区域,在多类越狱提示词和主流T2I模型上显著降低有害内容生成且对图像质量影响极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-08-25 cs.CV 版本更新 57%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2608.22780 2026-08-25 cs.CV 新提交 83%

Can We Perform Online RL for Image Editing without Editing Rewards?

我们能否在无编辑奖励的情况下进行图像编辑的在线强化学习?

Qichao Ma, Jikang Cheng, Ling Liang, Zhaofei Yu, Tiejun Huang, Renye Yan

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Lever-Edit框架,将文本到图像(T2I)奖励生态系统迁移至图像编辑,在无编辑奖励的情况下优化编辑策略,实验效果优于直观迁移基线且接近基于编辑奖励的微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24844 2026-08-25 cs.CV 版本更新 79%

Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing

弥合流形差距:黎曼残差线搜索用于一步图像编辑

Hongzhu Yi, Zhongtian Luo, Tong Li, Yiyan Fan, Jungang Xu

机构 * UCAS(中国科学院大学) WashU(华盛顿大学) SHU(上海大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 针对一步扩散编辑中固定更新强度无法兼顾目标提示和源图像保真度的问题,提出黎曼残差线搜索方法,通过局部时间曲率估计和残差路径选择,在PIE-Bench++上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23024 2026-08-25 cs.CV 新提交 70%

When the Edit Changes the Patient: Measuring Identity Preservation in Counterfactual Retinal Images

当编辑改变患者时:在反事实视网膜图像中测量身份保留情况

Andrea Posada, Wenke Karbole, Bach Ngoc Doan, Alexander Weers, Solmaz Abdolrahimzadeh, Maria Patsiamanidi, Kahkashan Haider, Vaishali Khare, Daniel Rueckert, Andrew Lotery, Sobha Sivaprasad, Martin J. Menten

机构 * Technical University of Munich(慕尼黑工业大学) TUM University Hospital(慕尼黑工业大学医院) Munich Center of Machine Learning (MCML)(慕尼黑机器学习中心) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所) Sapienza University of Rome(罗马第一大学) Faculty of Medicine, University of Southampton(南安普顿大学医学院) Moorfields Eye Hospital NHS Foundation Trust(摩尔菲尔兹眼科医院NHS信托基金) Imperial College London(伦敦帝国学院)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 本研究针对视网膜OCT图像,用裁判分类器等方法对比三类文本条件编辑方法的身份保留效果,发现配对训练法身份保留最佳,建议未来医学反事实生成需明确报告身份保留情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09130 2026-08-25 cs.GR cs.CV cs.MM 版本更新 67%

Reference-free Human-Object Interaction Editing

无参考的人机交互编辑

Jiun Tian Hoe, Weipeng Hu, Wei Zhou, Chao Xie, Ziwei Wang, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文提出InteractEdit框架,通过分解场景组件、结合选择性反转与SeRA策略实现无参考HOI编辑,引入IEBench基准及对应指标,实验显示其优于23种现有方法,为HOI编辑研究提供强基线。

Comments Website: this https URL (https://jiuntian.github.io/interactedit), Paper: this https URL (https://www.sciencedirect.com/science/article/abs/pii/S0925231226022678)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21776 2026-08-25 cs.CV 新提交 57%

SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling

SpatialDiff:基于隐式空间建模的三维感知物体运动

Zheng Liu, Zijian He, Huiguo He, Weizhi Zhong, Yejun Tang, Huan Yang, Kun Gai, Guanbin Li

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Kuaishou Technology(快手科技) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 SpatialDiff通过隐式三维空间建模和全局空间监督,解决了现有图像编辑方法难以处理复杂场景中物体空间运动的问题,提升了空间运动的准确性与保真度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 124 篇

2608.23102 2026-08-25 cs.CV cs.IR 新提交 85%

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22272 2026-08-25 cs.CV cs.AI cs.LG 新提交 83%

GAN-Diff: Coupling Pretrained WGAN-GP Features with Conditional Diffusion U-Nets

GAN-Diff:耦合预训练WGAN-GP特征与条件扩散U-Net

Saif Ahmed, Ashadulla Hil Galib, S.M. Riaz Rahman Antu, Ahmed Faizul Haque Dhrubo, Souvik Pramanik, Mohammad Abdul Qayum, Mohsin Sajjad, Mohammad Ashrafuzzaman Khan

机构 * North South University(北南大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出GAN-Diff框架,将预训练WGAN-GP特征作为先验耦合到条件扩散U-Net,在CelebA数据集的高斯去噪和2倍超分辨率任务上,分别提升PSNR达4.40 dB和3.70 dB,实现稳定高效的图像复原。

Comments 7 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21885 2026-08-25 cs.CV 新提交 83%

Pixel-Space Diffusion via Observation Operators

基于观测算子的像素空间扩散模型

Shaojie Guo, Lichen Ma, Haoyang Tong, Yu He, Zipeng Guo, Xiaoan Liu, Feng Yan, Yu Guo, Fei Wang, Junshi Huang, Yan Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对像素空间扩散模型的尺度-时间不匹配问题,提出观测算子扩散框架,采用时变观测轨迹与GL-CoDA解码器,在ImageNet-256上FID达1.52,收敛更快且生成质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04719 2026-08-25 cs.DC cs.CV 版本更新 83%

Spatio-Temporal Parallelism for Diffusion Model Inference on Heterogeneous Multi-GPU Systems

面向异构多GPU系统的扩散模型推理时空并行技术

Han Liang, Jiahui Zhou, Zicheng Zhou, Xiaoxi Zhang, Xu Chen

机构 * Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对异构多GPU环境下扩散模型并行推理的掉队者效应,提出Orchestra框架,通过时空细粒度并行平衡负载,使端到端延迟降低最多45%,提升资源利用率。

Comments 11 pages, 12 figures,accecpted by 2026 IEEE 46th International Conference on Distributed Computing Systems (ICDCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23429 2026-08-25 cs.LG cs.AI 新提交 82%

ChebBooster: A Training-Free Approach for Efficient Diffusion Transformer Inference via Chebyshev-Inspired Extrapolation

ChebBooster:一种基于切比雪夫启发式外推的无训练高效扩散Transformer推理方法

Chengjie Lu, Tianchi Deng, Zhengqi He, Chengwen Luo, Xueliang Li

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出无训练外推框架ChebBooster,基于切比雪夫多项式理论解耦为离线预计算与轻量在线阶段,在三种DiT模型上实现最高3.68倍延迟加速,优于现有无训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23167 2026-08-25 cs.CL 新提交 82%

Accelerating Diffusion Language Models via Structured Suffix Modeling

通过结构化后缀建模加速扩散语言模型

Zifeng Cheng, Keda Li, Zhiwei Jiang, Cong Wang, Fei Shen, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散语言模型(DLM)并行解码的高计算开销问题,提出结构化后缀建模方法,将后缀分区域处理并融入前一步解码信息,无需训练且可与其他加速技术结合,能进一步加速DLM推理并提升性能,长序列场景下最高可实现72.81倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22619 2026-08-25 eess.IV cs.CV cs.LG 新提交 81%

GET: Generative Embedding Translation for Medical Image Segmentation

GET:用于医学图像分割的生成式嵌入翻译

Md Maklachur Rahman, Md Hasan Al Banna, Saraf Anjum, Mahmudul Hasan, Tracy Hammond

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出GET框架,基于Stable Diffusion VAE的冻结潜在空间实现医学图像分割,在多数据集上优于各类基线,参数更少且域偏移下性能提升显著。

Comments Accepted at ECCV 2026 - BioImage Computing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22111 2026-08-25 cs.SD 新提交 80%

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

FlowSep 2:用于语言查询音频源分离的自监督流匹配方法

Yi Yuan, Xubo Liu, Haohe Liu, Xiyuan Kang, Mark D. Plumbley, Wenwu Wang

机构 * School of Computer Science and Electronic Engineering, University of Surrey(萨里大学计算机科学与电子工程学院) Meta Superintelligence Labs(元宇宙超级智能实验室) Department of Informatics, King’s College London(伦敦国王学院信息学系)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 本研究提出FlowSep2,一种结合Self-Flow与Diffusion Transformer的文本条件流匹配生成模型,用于语言查询音频源分离,在多个基准上达到SOTA性能,可有效分离重叠声源。

Comments Submission to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23432 2026-08-25 cs.CV 新提交 79%

Image-Conditioned Diffusion Models for Quality Assurance of Organ-at-Risk Segmentations in Radiotherapy

用于放疗中危及器官分割质量保证的图像条件扩散模型

Clea Dronne, Catharine H Clark, Xavier Loizeau, Elizabeth Miles, Peter Hoskin, Jamie R McClelland

机构 * UCL Hawkes Institute(UCL霍克斯研究所) University College London(伦敦大学学院) National Physical Laboratory(英国国家物理实验室) University College London Hospital(伦敦大学学院医院) National Radiotherapy Trials Quality Assurance Group(国家放射治疗试验质量保证组) Mount Vernon Hospital(芒特弗农医院) University of Manchester(曼彻斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对放疗中危及器官分割审阅耗时主观的问题,对比VAE框架与图像条件分割扩散模型,发现后者能更一致地定位细微边界错误,为分割质量保证提供了有前景的框架。

Comments Submitted to the MICCAI 2026 UNSURE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23343 2026-08-25 cs.CV 新提交 79%

Controllable blind deblurring with diffusion models

基于扩散模型的可控盲去模糊

Imane Si Salah, Emile Cribelier, Thomas Veit, Wolf Hauser, Arthur Leclaire

机构 * DxO Labs LTCI, Télécom Paris, IP Paris(LTCI,巴黎电信学院,巴黎理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散模型的SuperSharpen盲去模糊方法,通过模糊度量可控调整复原强度,经实验验证其在合成与真实模糊上的感知质量及可控性优于对比策略

Comments 6 pages, 5 figures, 1 table. Accepted to IEEE ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23302 2026-08-25 cs.CV 新提交 79%

Grounding Free-Form Instructions for Fashion Complementary Image Generation

基于自由形式指令的时尚互补图像生成的接地

Matteo Attimonelli, Claudio Pomo, Alessandro De Bellis, Danilo Danese, Dietmar Jannach, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马大学) University of Klagenfurt(克拉根福大学)

专题命中 扩散模型 :image generation(title,abstract);分类 cs.CV

AI总结 针对现有时尚互补图像生成基准的缺陷,该研究提出基于自由形式指令的新设置,用StyleFlow模型实现该任务,其生成的服装符合指令且风格连贯,同时降低了架构复杂度和推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23279 2026-08-25 cs.CV 新提交 79%

Spatiotemporally Decoupled Autoregressive Diffusion Model for Human Motion Generation

用于人体动作生成的时空解耦自回归扩散模型

Chengqun Yang, Liang Xu, Yanping Li, Fulong Liu, Jingnan Gao, Weili Zeng, Yichao Yan

机构 * AI Institute, Shanghai Jiao Tong University(上海交通大学AI学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出名为DeMoDiff的时空解耦框架,通过针对每个身体关节编码的时空VAE与融入时空掩码和注意力的自回归扩散生成器,在HumanML3D和KIT-ML数据集上取得最优重构性能与动作生成效果,且具备强时空编辑能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23190 2026-08-25 cs.CV 新提交 79%

Toward a Foundation Plug-and-Play Prior for Computed Tomography Reconstruction via a Multimodal Diffusion Model

面向计算机断层扫描重建的即插即用基础先验:基于多模态扩散模型

Haley Duba-Sullivan, Patxi Fernandez-Zelaia, Obaidullah Rahman, Amirkoushyar Ziabari

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究探究用跨多成像域训练的单一多模态扩散模型作为CT重建的通用先验,在三类不同CT数据集上验证其性能优于解析重建,为异构CT重建提供可复用基础先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23014 2026-08-25 cs.CV 新提交 79%

AnaDiffusion: Anatomically CompositionalLatent Diffusion for Controllable 3D Brain MRI Generation

AnaDiffusion:用于可控3D脑部MRI生成的解剖学组成式潜在扩散模型

Huiwen Han, Lulin Liu, Bangya Liu, Yuanhao Cai, Nuo Chen, Xiaoqing Wang, Ziqian Xie, Chenyu You, Shuiwang Ji, Degui Zhi, Zhiwen Fan

机构 * Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) University of Minnesota(明尼苏达大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) UTHealth Houston(休斯顿健康科学中心) Stony Brook University(纽约州立大学石溪分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AnaDiffusion是一种解剖学组成式潜在扩散框架,通过分解3D脑部MRI生成为解剖区域并组装细化,在ADNI测试集上实现低FID与高Cohen's d值,支持无需密集分割图的可控部分编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21972 2026-08-25 cs.CV stat.ML 新提交 79%

Improved denoising diffusion probabilistic models with efficient non-diagonal covariance modeling

结合高效非对角协方差建模的改进去噪扩散概率模型

Rui Xia, Ayan Das, Artem Artemev, Andi Zhang, Guillaume Hennequin, Alberto Bernacchia

机构 * University of Cambridge(剑桥大学) MediaTek Research(联发科研究院) University of Warwick(华威大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出K-DCT协方差模型改进DDPM,降低计算复杂度,在少采样步数下于多数据集上实现优于现有SOTA的采样性能。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21849 2026-08-25 cs.CV 新提交 79%

GaussVid: Sparse-View Gaussian Splatting with 3D-Aware Video Diffusion Priors

GaussVid:结合3D感知视频扩散先验的稀疏视图高斯溅射

Xinhui Liu, Can Wang, Wei Jiang, Wei Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Futurewei Technologies Inc(华为主流技术公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出结合3D感知视频扩散先验的GaussVid框架,构建3DGS视频数据集并引入相机条件几何先验,提升稀疏视图3DGS重建的像素、结构保真度与多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21710 2026-08-25 cs.CV 新提交 79%

StereoDiffuer: Diffusion-based Progressive Geometry Modeling with Saliency Attention Perception for Stereo Matching

StereoDiffuer:基于扩散的显著性注意力感知渐进几何建模的立体匹配方法

Bohan Li

机构 * Shanghai Jiaotong University(上海交通大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波东方理工大学数字孪生研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有立体匹配方法难以保留细粒度几何细节的问题,提出基于扩散的StereoDiffuer框架,通过显著性注意力感知模块提取几何线索,结合迭代去噪扩散过程优化视差,在Scene Flow与KITTI基准上表现具竞争力。

Comments 17 pages, 9 figures, and 11 tables. Accepted by Signal Processing: Image Communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19567 2026-08-25 cs.CV 版本更新 79%

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Project page: this https URL (https://alexandertsui.github.io/block3d/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26203 2026-08-25 cs.CV 版本更新 79%

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏