arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1802 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1384 篇

2506.20294 2026-07-07 cs.CV 版本更新 79%

Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations

Ctrl-Z Sampling:通过受控随机zigzag探索扩展扩散采样

Shunqi Mao, Wei Guo, Chaoyi Zhang, Jieting Long, Ke Xie, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Ctrl-Z采样方法,通过检测质量景观中的高原并进行受控探索,提升扩散模型生成质量,在不同NFE预算下均表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16357 2026-07-07 cs.CV 版本更新 79%

GMODiff: One-Step Gain Map Refinement with Diffusion Priors for HDR Reconstruction

GMODiff:基于扩散先验的单步增益图优化用于高动态范围重建

Tao Hu, Weiyu Zhou, Yanjie Tu, Peng Wu, Wei Dong, Qingsen Yan, Yanning Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GMODiff,通过单步扩散框架优化增益图,提升多曝光HDR重建的动态范围和效率,实验表明其性能优于现有方法且速度提升100倍。

Comments This paper is accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04795 2026-07-07 cs.CV cs.AI 版本更新 79%

LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation

法律与秩序:医学扩散与分割的自适应空间加权

Anugunj Naman, Ayushman Singh, Gaibo Zhang, Yaguang Zhang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫尔电气与计算机工程学院) Purdue University(普渡大学) Sesame AI Department of Computer Science(计算机科学系) Department of Agricultural and Biological Engineering (ABE)(农业与生物工程系) Department of Agricultural Sciences Education and Communication (ASEC)(农业科学教育与交流系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究医学图像分析中自适应空间加权,通过两个适配器实现。LAW为掩码条件扩散学习像素损失权重,ORDER通过选择性双向跳跃注意力改进分割,在多个数据集上取得良好效果,证明该方法对医学扩散和分割的有效性。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10099 2026-07-07 cs.LG cs.CV 版本更新 79%

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

流形上的学习:通过表示编码器解锁标准扩散变压器

Amandeep Kumar, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用表示编码器进行生成建模时标准扩散变压器收敛失败的问题,指出根本原因是几何干扰,提出黎曼流匹配与雅可比正则化方法,使标准扩散变压器无需宽度缩放就能收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新 79%

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02908 2026-07-07 cs.LG cs.AI cs.CV stat.ML 版本更新 79%

A Random Matrix Theory Perspective on the Consistency of Diffusion Models

扩散模型一致性的随机矩阵理论视角

Binxu Wang, Jacob Zavatone-Veth, Cengiz Pehlevan

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型在不同数据集子集训练时输出相似的原因,用随机矩阵理论框架量化有限数据集对去噪器和采样映射期望及方差的影响,揭示交叉分割不一致的因素并验证对模型行为的预测。

Comments 58 pages, 45 figures. Accepted as an Oral Presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15829 2026-07-07 cs.CV 版本更新 79%

Towards Realistic Remote Sensing Dataset Distillation with Discriminative Prototype-guided Diffusion

基于判别原型引导扩散的逼真遥感数据集蒸馏研究

Yonghao Xu, Pedram Ghamisi, Qihao Weng

机构 * Computer Vision and Learning Systems, Department of Electrical Engineering, Linköping University(计算机视觉与学习系统,电气工程系,利厄普大学) Helmholtz-Zentrum Dresden-Rossendorf, Responsible AI Group(海姆霍尔茨·德累斯顿-罗斯托克研究中心,负责任人工智能小组) University of Iceland, Faculty of Electrical and Computer Engineering(冰岛大学,电气与计算机工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对遥感图像解释依赖大量训练数据带来的高成本问题,提出判别原型引导扩散框架,通过提取原型、构建语义锚及筛选候选样本,将大规模数据集浓缩成有代表性的蒸馏数据集用于下游模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14788 2026-07-07 cs.CV 版本更新 79%

Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation

用于文本到运动生成的重建锚定扩散模型

Yifei Liu, Changxing Ding, Ling Guo, Huaiguang Jiang, Qiong Cao

机构 * South China University of Technology(华南理工大学) Joy Future Academy(京东探索研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本驱动人体运动生成中预训练文本编码器存在表征差距及迭代去噪过程中误差传播问题,提出重建锚定扩散模型,利用运动潜在空间监督,采用自正则化等目标函数训练,还提出重建误差引导机制,实验表明性能显著提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 79%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11437 2026-07-03 cs.CV cs.HC 版本更新 79%

Hi-DREAM: Brain-Inspired Hierarchical Diffusion for fMRI-to-Image Reconstruction via ROI Encoder and VisuAl Mapping

Hi-DREAM: 基于脑启发的层次化扩散用于fMRI到图像重建,通过ROI编码器和视觉映射

Guowei Zhang, Yun Zhao, Kai Sun, Moein Khajehnejad, Adeel Razi, Dinh Phung, Levin Kuhlmann

机构 * Dept of Data Science and AI, Monash University, Melbourne, Australia(数据科学与人工智能系,墨尔本大学,澳大利亚) School of Psychological Sciences, Monash University, Melbourne, Australia(心理学科学学院,墨尔本大学,澳大利亚) Brain and Mind Centre, University of Sydney, Sydney, Australia(脑与心智中心,悉尼大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Hi-DREAM框架,利用层次化扩散模型,通过ROI适配器将早期、中期和晚期视觉ROI流转换为多尺度皮层金字塔,并用轻量级ROI条件ControlNet注入解剖先验,在NSD数据集上实现最先进的高层语义重建和强低层结构。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13581 2026-07-02 cs.CV 版本更新 79%

HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation

HIR-ALIGN:通过基于扩散的数据生成增强超光谱图像恢复

Li Pang, Heng Zhao, Yijia Zhang, Deyu Meng, Xiangyong Cao

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Mathematics and Statistics and the Ministry of Education Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou(广州黄埔 Pazhou 实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HIR-ALIGN框架,通过生成与目标分布匹配的合成数据提升超光谱图像恢复性能,包含代理生成、分布自适应合成和对齐监督微调三个阶段,理论分析表明增强细调可降低目标域恢复风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19036 2026-07-02 cs.CV 版本更新 79%

FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal

FUMO:先验调制扩散模型用于单图像反射去除

Telang Xu, Chaoyang Zhang, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FUMO扩散模型,通过从混合图像提取强度和高频先验,结合粗到细训练范式,实现空间自适应和结构保真的单图像反射去除。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15129 2026-07-02 cs.CV 版本更新 79%

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06275 2026-07-02 cs.CV 版本更新 79%

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

扩散变换器超分辨率的频谱与轨迹正则化

Jingkai Wang, Yixin Tang, Jue Gong, Jiatong Li, Shu Li, Libo Liu, Jianliang Lan, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shenzhen Transsion Holdings Co., Ltd.(深圳传音控股股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出StrSR框架,通过非对称判别蒸馏和频率分布匹配策略,解决扩散变换器在真实图像超分辨率中的轨迹失配和周期性伪影问题,实现最先进性能。

Comments 15 pages, appears at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03370 2026-07-02 cs.CV cs.LG 版本更新 79%

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散

Takaya Kawakatsu, Ryo Ishiyama

机构 * Preferred Networks, Inc.(Preferred Networks公司) Kyushu University(九州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11641 2026-07-02 cs.CV cs.LG 版本更新 79%

Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

Yuxi Liu, Yipeng Hu, Zekun Zhang, Kunze Jiang, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 79%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06136 2026-07-01 cs.CV 版本更新 79%

Cross-Resolution Distribution Matching for Diffusion Distillation

跨分辨率分布匹配的扩散蒸馏

Feiyang Chen, Hongpeng Pan, Haonan Xu, Xinyu Duan, Zhefeng Wang, Yang Yang

机构 * Huawei(华为) Nanjing University of Science and Technology(南京理工大学) HiThink Research(海康研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17330 2026-07-01 cs.CV cs.AI 版本更新 79%

CharDiff-LP: A Diffusion Model with Character-Level Guidance for License Plate Image Restoration

CharDiff-LP: 一种具有字符级引导的车牌图像恢复扩散模型

Kihyun Na, Gyuhwan Park, Injung Kim

机构 * Handong Global University(韩东国际大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CharDiff-LP扩散框架,通过字符级引导(CHARM模块)恢复严重退化车牌图像,在Roboflow-LP数据集上字符错误率相对降低28.3%。

Comments Accepted at ICPR 2026. 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 79%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新 79%

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新 79%

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17979 2026-07-01 cs.CV 版本更新 79%

FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning

FeRA: 面向高效扩散自适应微调的频率能量约束路由

Bo Yin, Xiaobin Hu, Xingyu Zhou, Yu He, Peng-Tao Jiang, Yue Liao, Junwei Zhu, Jiangning Zhang, Ying Tai, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) vivo Tencent(腾讯) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FeRA框架,通过揭示扩散模型去噪过程中的频率能量机制,利用频率能量指示器、软频率路由和频率能量一致性正则化,实现参数更新与内在频率能量进程对齐,从而高效稳定地微调扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22476 2026-07-01 cs.CV 版本更新 79%

Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA

多通道不确定性加权分数匹配用于医学UDA中的条件扩散

Chen Li, Meilong Xu, Xiaoling Hu, Weimin Lyu, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院与哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出UPDiff-UDA框架,通过不确定性加权的分数匹配聚合多通道伪标签,结合贝塞尔曲线适应,提升跨模态医学图像分割性能。

Comments 28 pages, 7 figures. Accepted by ECCV'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12878 2026-07-01 cs.CV 版本更新 79%

Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation

从少到多:基于扩散学习器的原型扩展网络用于点云小样本语义分割

Qianguang Zhao, Dongli Wang, Yan Zhou, Jianxun Li, Richard Irampa

机构 * School of Mathematics and Computational Science, Xiangtan University(湘潭大学数学与计算科学学院) School of Automation and Electronics Information, Xiangtan University(湘潭大学自动化与电子信息学院) School of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对小样本点云语义分割中原型容量小且与查询空间不对齐的问题,提出原型扩展网络(PENet),利用扩散模型的预训练条件编码器扩展原型,并通过推-拉机制对齐,在S3DIS和ScanNet数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02798 2026-07-01 cs.CV eess.IV physics.optics 版本更新 79%

Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion

无滤波器快照高光谱成像引导补丁扩散

Dean Hazineh, Luca Sacchi, Davide Cassara, Federico Capasso, Todd Zickler

机构 * Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出使用条件去噪扩散模型,通过小补丁移位不变操作和光学点扩散函数物理一致性引导,从单衍射透镜和滤光片全色传感器捕获的灰度快照中重建高光谱图像。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10141 2026-07-01 cs.CV 版本更新 79%

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Southeast University(东南大学) Tsinghua University(清华大学) VAST

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。

Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04049 2026-06-29 cs.CV cs.RO 版本更新 79%

DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving

DIVER:强化扩散突破端到端自动驾驶的模仿瓶颈

Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, Mingzhe Guo, Lei Yang, Yongchang Zhang, Shaoqing Xu, Caiyan Jia, Yadan Luo

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大数据挖掘与具身智能关键实验室,北京交通大学计算机科学与技术学院) Horizon Robotics(地平线机器人) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) University of Macau(澳门大学) School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电子工程与计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DIVER通过融合强化学习与扩散生成,生成多样化可行轨迹,提升自动驾驶的泛化能力,解决模仿学习中的模式崩溃问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17426 2026-06-29 cs.CV 版本更新 79%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏