arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2406.14429 2026-08-05 cs.LG cs.AI cs.CV 版本更新 83%

CollaFuse: Collaborative Diffusion Models

CollaFuse:协同扩散模型

Simeon Allmendinger, Domenique Zipperling, Lukas Struppek, Niklas Kühl

机构 * University of Bayreuth(巴耶鲁斯大学) Fraunhofer FIT(弗劳恩霍夫 FIT) FIM Research Center for Information Management(信息管理研究所以) Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CollaFuse协同扩散模型,通过本地保留数据和轻量计算,将高计算任务转移至服务器,降低客户端负担,提升性能并减少数据泄露风险。

Comments Accepted at the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01298 2026-08-04 cs.CV cs.AI cs.LG 新提交 83%

UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction

UDT:通过数据自适应令牌缩减协调U-Net与扩散Transformer

Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * University of Minnesota(明尼苏达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出UDT架构,通过数据自适应令牌合并协调U-Net与DiTs,在ImageNet图像生成任务中收敛速度更快、FID指标更优,为DiTs提供了新的高效骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00444 2026-08-04 cs.CV 新提交 83%

Reconstruction-Shift Discrimination via Mask-Guided Latent Diffusion for Medical Anomaly Detection

基于掩码引导的潜在扩散的重构-偏移判别用于医学异常检测

Yibo Wan, Jinyu Cai, Yunhe Zhang, Yi Bin, See-kiong Ng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出判别式掩码引导扩散(DMD)框架,结合自监督分类的重构-偏移判别与残差定位,在五种医学影像数据集上实现了最优的无监督医学异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29471 2026-08-04 cs.CV 版本更新 83%

V2VCrafter: Consistent Street-View Image Generation Across Vehicles

V2XCrafter:学习生成跨智能体的驾驶场景

Yihang Tao, Yu Guo, Senkang Hu, Yanan Ma, Zihan Fang, Sam Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) Lingnan University(岭南大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出V2XCrafter框架,通过渐进式多智能体扩散模型和跨智能体注意力模块,生成跨智能体相机视角的一致可控协作驾驶场景,以增强数据并提升下游协作3D目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29337 2026-08-03 cs.CV cs.AI 新提交 83%

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

DualDiT:用于联合生成OCT图像与分割掩码的条件双输出扩散Transformer

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-tech), Universitat Politècnica de València(瓦伦西亚理工大学以人类为中心技术大学研究所) Artikode Intelligence S.L(Artikode智能公司) Biomedical Technology Center of the Medical Faculty, University of Muenster(明斯特大学医学院生物医学技术中心) Department of Ophthalmology, University of Muenster Medical Centre(明斯特大学医学中心眼科)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究提出DualDiT模型,联合生成小鼠OCT图像与分割掩码,在生成质量、下游分割性能上优于DDPM、LDM,可用于医学图像数据增强

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19139 2026-07-31 cs.CV 版本更新 83%

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

文本模板令牌是扩散Transformer中的隐式语义寄存器

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13868 2026-07-30 cs.CV 版本更新 83%

Particle-Filtering-based Latent Diffusion for Inverse Problems

基于粒子滤波的隐式扩散模型在逆问题中的应用

Amir Nazemi, Mohammad Hadi Sepanj, Nicholas Pellegrino, Chris Czarnecki, Paul Fieguth

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于粒子滤波的隐式扩散(PFLD)框架,用于逆问题求解时探索解空间,实验显示其在FFHQ-1K和ImageNet-1K数据集的三类逆问题任务中优于SoTA求解器PSLD。

Comments Mohammad Hadi Sepanj, Nicholas Pellegrino, and Chris Czarnecki contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30147 2026-07-29 cs.CV 版本更新 83%

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

T2LDM++:一种用于真实文本到激光雷达场景生成的自条件表示引导扩散模型

Wentao Qu, Qi Zhang, Chenxu Wang, Guofeng Mei, Yongfei Liu, Xiaoshui Huang, Gim Hee Lee, Liang Xiao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanjing University of Science and Technology(南京理工大学) Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Beijing Institute of Technology(北京理工大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) School of Public Health(公共卫生学院) Shanghai Jiao Tong University(上海交通大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对文本-激光雷达数据稀缺导致场景过平滑和可控性不足的问题,提出T2LDM++模型,通过自条件表示引导(SCRG)提供重建监督,并构建高质量基准数据集,实现几何细节丰富的激光雷达场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06421 2026-07-29 cs.CV cs.LG 版本更新 83%

FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation

FREPix:频率异质流匹配用于像素空间图像生成

Mingfeng Lin, Jiakun Chen, Liang Han, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 FREPix通过分解低频和高频组件,设计显式生成流程,提升像素空间图像生成效果,实现1.91 FID在256×256和2.38 FID在512×512的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24249 2026-07-28 cs.CV cs.RO 新提交 83%

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

SILICA:将扩散先验用于联合玻璃分割和深度估计

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

机构 * Robotics Research Center (RRC), IIIT Hyderabad(海得拉巴国际信息技术研究所机器人研究中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究透明表面深度估计难题,提出SILICA统一管道,利用文本到图像扩散模型先验联合预测玻璃分割和深度,无需真实世界玻璃深度注释,经实验验证其在不同环境中零样本转移性能出色,优于现有模型。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23937 2026-07-28 cs.CV 新提交 83%

Manifold-Constrained Noise Optimization for Diverse Diffusion Sampling

用于多样化扩散采样的流形约束噪声优化

Qitan Shi, Cheng Jin, Ziyuan Liu, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何在推理时优化初始噪声以恢复几步蒸馏扩散模型的提示多样性。提出MoNO方法,在低维噪声流形上进行流形约束噪声优化,能大步长更新且无需辅助目标,实验表明该方法可保持图像质量并提升提示多样性。

Comments 19 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 83%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17572 2026-07-28 cs.LG cs.CV cs.SY eess.SY 版本更新 83%

JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

AGG:用于扩散模型高效GRPO训练的雅可比聚合组梯度

Ruiyi Ding, Jie Li, He Kang, Ziyan Liu, Chengru Song, Yuan cheng

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究GRPO扩展到扩散模型的计算瓶颈问题,提出JAGG方法,通过特定插值和聚合梯度,减少反向传播次数,实验表明该方法能在质量损失小的情况下显著加速T2I训练中的DiT RL训练。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 83%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21591 2026-07-24 cs.CV 新提交 83%

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

通过渐进式种子剪枝实现扩散模型的推理时间缩放

Rogerio Guimaraes, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究扩散模型推理时间缩放问题,提出渐进式种子剪枝方法,通过早期评估多种子并剪枝,有效利用固定计算预算,在扩散和流匹配主干上比其他基线方法在奖励引导选择及提示对齐评估上表现更优。

Comments Project page: https://www.vision.caltech.edu/psp. Code: https://github.com/rogerioagjr/psp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04731 2026-07-24 cs.CV 版本更新 83%

When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions

高CFG扩散反演何时失败?对提示-潜在交互的对照研究

Yan Zeng, Yusuke Hosoya, Huyen T. T. Tran, Takayuki Okatani

机构 * GSIS Tohoku University(东北大学全球信息社会研究院) RIKEN AIP JAPAN(日本理化学研究所先进智能项目中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究在图像编辑中,高CFG轨迹生成的目标图像何时能被反演。通过对照实验,用现有基准的提示生成图像并反演,揭示提示重建行为类型,定义提示压力分析生成,文本分析表明主体和措辞影响反演,评估干预措施支持局部轨迹感知分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16615 2026-07-24 cs.CV 版本更新 83%

Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

用于高效扩散变压器的可训练对数线性稀疏注意力

Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究针对扩散变压器二次自注意力成本限制长序列扩展问题,提出可训练的对数线性稀疏注意力机制LLSA,通过分层结构降低成本,经实验验证其能加速注意力推理和DiT训练,为高效训练长序列DiTs提供方向。

Comments Code is available at: https://github.com/SingleZombie/LLSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19895 2026-07-23 cs.CV cs.AI 新提交 83%

OSVE: One Step Video Editing with One Step Diffusion Models

OSVE:使用单步扩散模型进行单步视频编辑

Habin Lim, Gyeong-Moon Park

机构 * Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型文本引导视频编辑慢的问题,提出OSVE框架。通过训练可学习编码器预测初始噪声,引入UFE技术及滑动窗口策略保持一致性,实现高质量视频编辑,速度比现有方法快约155 - 171倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18882 2026-07-22 cs.CV cs.LG 新提交 83%

Local Label-Informed Feature Transfer for Generating Ground-Truth Medical Images: A Comparison of GAN- and Diffusion-Based Approaches

用于生成真实医学图像的局部标签信息特征转移:基于GAN和扩散方法的比较

Rick Wilming, Irem Ozseker, Luca Matteo Cornils, Ahcène Boubekki, Benedict Clark, Danny Panknin, Stefan Haufe

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 研究针对医学成像中验证XAI方法缺少真实数据的问题,提出LLIFT框架,用GAN和扩散两种范式实现,能生成含真实病变的半合成脑磁共振图像,为评估XAI方法提供了可控真实数据,且评估效果良好。

Comments 6 pages, submitted to IEEE MetroXRAINE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18510 2026-07-22 cs.CV 新提交 83%

DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer

DuSPiT:双分支子补丁像素扩散变换器

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Reve(瑞夫)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究针对像素空间扩散中单一表示兼顾全局与细节的问题,提出双分支子补丁像素扩散变换器DuSPiT。通过分离全局与局部处理,利用两分支交互,实现更丰富细节和更好质量效率权衡,优于此前的像素空间扩散变换器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16636 2026-07-21 cs.CV 版本更新 83%

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

利用全局和局部语义重新绑定潜在信息以进行纠缠扩散

Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgiou

机构 * University of West Attica(西阿提卡大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 研究针对潜在扩散模型语义监督不足问题,提出REGLUE框架,联合建模VAE图像潜在信息、局部VFM语义和全局[CLS]令牌,用轻量级卷积语义压缩器聚合特征,经实验验证该框架能提升FID并加速收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17657 2026-07-21 cs.CV 版本更新 83%

Improving Diffusion Generative Models via Truncated Karhunen--Loève Expansion

通过截断卡尔胡宁-勒夫展开改进扩散生成模型

Yumeng Ren, Yaofang Liu, Aitor Artola, Laurent Mertz, Raymond H. Chan, Jean-michel Morel

机构 * City University of Hong Kong(香港城市大学) Lingnan University of Hong Kong(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究预训练扩散模型训练-采样不匹配问题,提出基于截断卡尔胡宁-勒夫展开的无训练采样策略,通过相应方程实现,无需修改网络架构,在多数据集上改进预训练模型,加快收敛并降低生成误差。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14765 2026-07-17 cs.CV 新提交 83%

Rare Concept Generation via Counterfactual Inference in Diffusion Models

通过扩散模型中的反事实推理生成罕见概念

Zhengyuan Jiang, Haipeng Liu, Meng Wang, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型训练的常识偏差致罕见概念图像生成不佳的问题,提出基于反事实推理的CI-Diff方法,阻断干扰,利用自然直接效应解耦属性,重新设计引导机制,经实验验证该方法优于现有模型。

Comments Comments: 17 pages, 15 figures, to appear at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13812 2026-07-16 eess.IV cs.CV 新提交 83%

TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model

TCAM-Diff:三平面感知交叉注意力医学扩散模型

Zhenkai Zhang, Krista A. Ehinger, Tom Drummond

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究提出TCAM-Diff这一3D医学图像生成模型,采用仅解码器自动编码器方法学习三平面表示,利用三平面感知交叉注意力扩散模型整合特征,经预训练解码器模块转换为3D体素,在多规模医学数据集实验中结果出色,优于其他类似方法。

Comments Accepted at AAAI 2025. Code is available at https://github.com/Fredy-Zhang/TCAM-Diff

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(21): 22732-22740, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00927 2026-07-16 cs.CV cs.AI 版本更新 83%

Post-Training Pruning for Diffusion Transformers

扩散变换器的训练后剪枝

Chengzhi Hu, Xuewen Liu, Jing Zhang, Mengjuan Chen, Zhikai Li, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiTs)计算开销大的问题,提出DiT-Pruning方法,通过能量感知的显著性度量与聚类感知的剪枝粒度,在50%稀疏度下仅损失0.001 CLIP分数。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05981 2026-07-16 cs.CV cs.LG 版本更新 83%

Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU

基于视觉感知的多模态大语言模型条件编辑扩散的视频率流式风格化:蒸馏UNet + MLLM文本编码器上的非对称批处理推理

Yoshiyuki Ootani

机构 * Independent researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对蒸馏扩散模型中文本编码器成为瓶颈的问题,提出一种结合非对称CUDA流水线、编译友好的ControlNet-LLLite重构和周期性条件刷新调度的流式管线,在消费级GPU上实现视频率实时风格化编辑。

Comments 14 pages, 4 figures, 13 tables. Code, evaluation harness, and the released Temporal LLLite adapter weights are at https://github.com/otanl/dreamlite-stream (also mirrored to Hugging Face and Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16241 2026-07-15 cs.CV 版本更新 83%

Structure-Semantic Co-optimized Latent Diffusion Model for Fast Visual Anagram Synthesis

结构-语义协同优化的潜扩散模型用于快速视觉字谜合成

Xiang Gao, Yunpeng Jia

机构 * School of Digital Media and Design Arts, Beijing University of Posts and Telecommunications(北京邮电大学数字媒体与设计艺术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出结构-语义协同优化框架S2CO-Anagram,通过空文本结构对齐、语义增强和注意力引导噪声融合,在极低计算成本下生成高分辨率、高视觉和谐度与语义保真度的视觉字谜图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09784 2026-07-14 cs.CV cs.IT math.IT 新提交 83%

Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion

噪声锚定扩散反演中的压缩不对称性与轨迹绑定

Yongseong Park, Joeun Kim, HoEun Kim, Young-Sik Kim

机构 * DGIST(大邱庆北科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究真实图像扩散反演的质量-成本权衡,通过高斯噪声锚分离出压缩不对称与轨迹绑定机制,据此提出NARC方法,该方法无需训练,存储少且效果好,在实验中表现出色并可应用于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15779 2026-07-09 cs.CV 83%

Diffusion Model-Based Data Augmentation for Enhanced Neuron Segmentation

基于扩散模型的数据增强用于增强神经元分割

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Yizhuo Lu, Ruining Zhou, Hua Han

机构 * State Key Laboratory of Brain Cognition(脑认知国家重点实验室) Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(脑启发智能技术,自动化研究所,中国科学院) School of Future Technology, University of Chinese Academy of Sciences(未来技术学院,中国科学院大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的数据增强方法,用于提升神经元分割的性能,通过生成结构合理的图像-标签对,提高分割准确率。

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 01-05, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 83%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏