arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2606.27935 2026-07-01 cs.CV 新提交 79%

Controllable Histopathology Image Synthesis with Training-free Structural Initialization and Textural Modulation

可控的组织病理学图像合成:无需训练的结构初始化和纹理调制

Yuheng Qiu, Jingyi Luo, Chenfei Ye, Ting Ma, Jianfeng Cao

机构 * School of Biomedical Engineering, Harbin Institute of Technology (Shenzhen), Shenzhen, China(哈尔滨工业大学(深圳)生物医学工程学院,深圳,中国)

专题命中 扩散模型 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 提出CHIS框架,通过频率域结构初始化和小波域纹理调制,使无标签预训练扩散模型生成与先验结构掩码对齐且保持参考组织风格的图像,提升下游分割任务性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06136 2026-07-01 cs.CV 版本更新 79%

Cross-Resolution Distribution Matching for Diffusion Distillation

跨分辨率分布匹配的扩散蒸馏

Feiyang Chen, Hongpeng Pan, Haonan Xu, Xinyu Duan, Zhefeng Wang, Yang Yang

机构 * Huawei(华为) Nanjing University of Science and Technology(南京理工大学) HiThink Research(海康研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17330 2026-07-01 cs.CV cs.AI 版本更新 79%

CharDiff-LP: A Diffusion Model with Character-Level Guidance for License Plate Image Restoration

CharDiff-LP: 一种具有字符级引导的车牌图像恢复扩散模型

Kihyun Na, Gyuhwan Park, Injung Kim

机构 * Handong Global University(韩东国际大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CharDiff-LP扩散框架,通过字符级引导(CHARM模块)恢复严重退化车牌图像,在Roboflow-LP数据集上字符错误率相对降低28.3%。

Comments Accepted at ICPR 2026. 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 79%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新 79%

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新 79%

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17979 2026-07-01 cs.CV 版本更新 79%

FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning

FeRA: 面向高效扩散自适应微调的频率能量约束路由

Bo Yin, Xiaobin Hu, Xingyu Zhou, Yu He, Peng-Tao Jiang, Yue Liao, Junwei Zhu, Jiangning Zhang, Ying Tai, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) vivo Tencent(腾讯) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FeRA框架,通过揭示扩散模型去噪过程中的频率能量机制,利用频率能量指示器、软频率路由和频率能量一致性正则化,实现参数更新与内在频率能量进程对齐,从而高效稳定地微调扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22476 2026-07-01 cs.CV 版本更新 79%

Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA

多通道不确定性加权分数匹配用于医学UDA中的条件扩散

Chen Li, Meilong Xu, Xiaoling Hu, Weimin Lyu, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院与哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出UPDiff-UDA框架,通过不确定性加权的分数匹配聚合多通道伪标签,结合贝塞尔曲线适应,提升跨模态医学图像分割性能。

Comments 28 pages, 7 figures. Accepted by ECCV'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12878 2026-07-01 cs.CV 版本更新 79%

Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation

从少到多:基于扩散学习器的原型扩展网络用于点云小样本语义分割

Qianguang Zhao, Dongli Wang, Yan Zhou, Jianxun Li, Richard Irampa

机构 * School of Mathematics and Computational Science, Xiangtan University(湘潭大学数学与计算科学学院) School of Automation and Electronics Information, Xiangtan University(湘潭大学自动化与电子信息学院) School of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对小样本点云语义分割中原型容量小且与查询空间不对齐的问题,提出原型扩展网络(PENet),利用扩散模型的预训练条件编码器扩展原型,并通过推-拉机制对齐,在S3DIS和ScanNet数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02798 2026-07-01 cs.CV eess.IV physics.optics 版本更新 79%

Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion

无滤波器快照高光谱成像引导补丁扩散

Dean Hazineh, Luca Sacchi, Davide Cassara, Federico Capasso, Todd Zickler

机构 * Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出使用条件去噪扩散模型,通过小补丁移位不变操作和光学点扩散函数物理一致性引导,从单衍射透镜和滤光片全色传感器捕获的灰度快照中重建高光谱图像。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10141 2026-07-01 cs.CV 版本更新 79%

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Southeast University(东南大学) Tsinghua University(清华大学) VAST

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。

Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30417 2026-06-30 cs.CV cs.AI 79%

Beyond Point Estimates for Glaucoma Visual Field Forecasting with Diffusion Models

超越点估计:基于扩散模型的青光眼视野预测

Marta Colmenar Herrera, Pablo Márquez Neila, Şerife Seda Kucur Ergünay, Martin S. Zinkernagel, Raphael Sznitman

机构 * ARTORG Center for Biomedical Engineering Research, UniBe, Switzerland(瑞士UniBe生物医学工程研究中心ARTORG) PeriVision SA, Epalinges, Switzerland(瑞士Epalinges市PeriVision公司) Department of Ophthalmology, Inselspital, Bern, Switzerland(瑞士伯恩Inselspital眼科部门)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出使用条件去噪扩散模型进行概率性视野预测,生成未来视野的分布,实现校准良好的预测,并在点估计上达到最先进精度,支持从点估计向不确定性感知的临床风险评估转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30012 2026-06-30 cs.CV 79%

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

SkelEM:用于体积显微镜中自监督轴向超分辨率的骨架与扩散训练信号解耦

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室) School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SkelEM框架,通过解耦低频拓扑与高频细节的训练信号,结合确定性骨架与扩散精炼器,实现体积显微镜自监督轴向超分辨率,仅需≤5步即可恢复高保真细节,并在新基准BRAVE-ASR上取得最优平衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29387 2026-06-30 cs.GR cs.NA math.NA 79%

Dipole Diffusion Error in Thin Geometry: Optical Thickness Laws for Grid-Free Subsurface Scattering

薄几何中的偶极子扩散误差:无网格次表面散射的光学厚度定律

Faruk Alpay, Baris Basaran

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 针对偶极子模型在薄和弯曲物体上的几何误差,通过有限板多极子对比发现漫反射率误差具有材料无关的主导率$C e^{-2τ}$,透射率主导衰减为$e^{-τ}$,并利用Walk on Spheres方法直接求解扩散方程,无需网格或半空间近似。

Comments 22 pages, 13 figures, 1 table. Ancillary files include the full reproduction code (Python/NumPy CPU reference and Apple Metal GPU kernels) and all result data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29360 2026-06-30 cs.CV 79%

SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers

SAFE-DiT:面向高分辨率扩散Transformer的语义感知快速路径执行

Xuanhua Yin, Yuxuan Jia, Chuanzhi Xu, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高分辨率扩散Transformer推理中的空间冗余导致注意力掩码引发性能瓶颈(MIDT),提出无训练框架SAFE-DiT,通过分离精确掩码消除与近似空间调度,实现2.69-5.09倍加速并降低内存占用,同时保持视觉质量。

Comments 20 pages, 12 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29319 2026-06-30 cs.CV 79%

FDM-MFVT: Few-step Sampling Diffusion Model for Mask-Free Virtual Try-On

FDM-MFVT: 用于无掩模虚拟试穿的少步采样扩散模型

Jiaxin Liu, Xiaoye Liang, Lai Jiang, Mai Xu, Jun Liu

机构 * School of Electronic Information Engineering, Beihang University, Beijing, China(北京航空航天大学电子信息工程学院) Zhongguancun Academy, Beijing, China(中关村学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FDM-MFVT,一种少步扩散模型,通过噪声优化模块和指令驱动模块实现高效无掩模虚拟试穿,并构建了3万对的无掩模数据集MFVT。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28785 2026-06-30 cs.CV 79%

Stochastic Optimal Control Sampling for Diffusion Inverse Problems

扩散逆问题的随机最优控制采样

Jie Zhang, Youmei Qiu, Hanling Tian, Jingyuan Zhang, Xiang Yin, Xiaolin Huang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院,上海,中国) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室,同仁医院,医学机器人研究所,上海交通大学,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出随机最优控制采样(SOCS),通过闭式控制更新在每一步将测量一致的干净预测拉回去噪流,以高效解决扩散逆问题,提升视觉保真度和定量性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28677 2026-06-30 cs.CV 79%

SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending

SATB-VR:使用信噪比感知轨迹混合训练少步视频恢复扩散模型

Haoran Bai, Xiaoxu Chen, Xiaoyu Liu, Zongsheng Yue, Sibin Deng, Wangmeng Zuo, Ying Chen

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SATB-VR少步视频恢复框架,通过辅助预测器跳过低信噪比步骤,并利用SNR感知轨迹混合策略解决训练-推理不一致,实现高效高质量恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17980 2026-06-30 cs.CV 79%

Learning to Balance: Decoupled Siamese Diffusion Transformer for Reference-Based Remote Sensing Image Super-Resolution

学习平衡:用于基于参考的遥感图像超分辨率的解耦孪生扩散变换器

Bin Luo, Runmin Dong, Zhaoyang Luo, Jinxiao Zhang, Jiyao Zhao, Fan Wei, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School, Shenzhen, China(清华大学深圳国际研究生院) Sun Yat-sen University, Zhuhai, China(中山大学) National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) Tsinghua University, Beijing, China(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DS-DiT解耦孪生扩散变换器,通过在注意力层面解耦低分辨率和参考信息交互,解决参考基于超分辨率中参考信息依赖过重和利用不足的问题,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10629 2026-06-30 cs.CV 79%

Product-of-Gaussian-Mixture Diffusion Models for Joint Nonlinear MRI Reconstruction

基于高斯混合积的扩散模型用于联合非线性MRI重建

Laurenz Nagler, Martin Zach, Thomas Pock

机构 * Graz University of Technology(格拉茨技术大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Biomedical Imaging Group and Center for Biomedical Imaging(生物医学成像组和生物医学成像中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合参数高效高斯混合积扩散模型与经典平滑先验的联合重建方法,提升MRI重建的效率和鲁棒性,同时改善去噪和图像重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17975 2026-06-30 cs.CV 79%

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Imperial College London(帝国理工学院) KAUST(阿卜杜拉国王科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。

Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14526 2026-06-30 cs.CV 79%

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Zhensong Zhang, Jifei Song, Jiankang Deng, Ioannis Patras

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。

Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20606 2026-06-30 cs.CV 79%

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

探查并利用视频扩散变换器特征以实现稳健的点跟踪

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。

Comments Project Page: https://cvlab-kaist.github.io/DiTracker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08505 2026-06-30 cs.CV 79%

Early Estimation of Language to Latent Alignment in Diffusion Models

扩散模型中语言到潜在对齐的早期估计

Vasco Ramos, Regev Cohen, Idan Szpektor, Joao Magalhaes

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NoisyCLIP模型,通过噪声感知双塔结构实现扩散模型中语言与潜在对齐的早期评估,降低计算成本并提升语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28092 2026-06-29 cs.CV 新提交 79%

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

通过去噪器响应的谱耦合进行扩散模型归因

Pragati Shuddhodhan Meshram, Varun Chandrasekaran

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出谱去噪签名(SDS)方法,通过分析去噪过程中的谱几何特性,实现高精度非侵入式扩散模型归因,准确率达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28039 2026-06-29 cs.CV cs.AI 新提交 79%

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

注意差距:量化跨传感器扩散超分辨率中的域差距

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba

机构 * WUST(弗罗茨瓦夫科技大学) Tooploox

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对跨传感器超分辨率中合成数据与真实数据之间的域差距,首次系统研究其对扩散模型的影响,提出域自适应感知指标LPIPS-Sat,并揭示合成训练与真实训练的双重挑战。

Comments 26th International Conference on Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27988 2026-06-29 cs.CV 新提交 79%

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

潜在视觉扩散推理与蒙特卡洛树搜索

Xirui Teng, Nan Xi, Junsong Yuan

机构 * Beijing Jiaotong University(北京交通大学) Virginia Commonwealth University(弗吉尼亚联邦大学) University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LVDR框架,结合关键点引导的蒙特卡洛树搜索,实现细粒度技能活动的可解释视觉推理,在多个体育和手术数据集上取得竞争性表现。

Comments Accepted to ECCV 2026. Project page: https://github.com/XiruiTeng/LVDR_Official.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27760 2026-06-29 cs.CV 新提交 79%

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

PixelU: 一种用于高效端到端像素扩散的U形Transformer

Zipeng Guo, Lichen Ma, Yu He, Xiaolong Fu, Jingling Fu, Junshi Huang, Yan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PixelU,一种极简单阶段U形扩散Transformer,通过零成本跳跃连接和恒通道空间下采样解耦高低频建模,在ImageNet上以约1/3计算成本超越强基线JiT-G。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交 79%

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏