arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1384 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1384 篇

2511.11437 2026-07-03 cs.CV cs.HC 版本更新 79%

Hi-DREAM: Brain-Inspired Hierarchical Diffusion for fMRI-to-Image Reconstruction via ROI Encoder and VisuAl Mapping

Hi-DREAM: 基于脑启发的层次化扩散用于fMRI到图像重建,通过ROI编码器和视觉映射

Guowei Zhang, Yun Zhao, Kai Sun, Moein Khajehnejad, Adeel Razi, Dinh Phung, Levin Kuhlmann

机构 * Dept of Data Science and AI, Monash University, Melbourne, Australia(数据科学与人工智能系,墨尔本大学,澳大利亚) School of Psychological Sciences, Monash University, Melbourne, Australia(心理学科学学院,墨尔本大学,澳大利亚) Brain and Mind Centre, University of Sydney, Sydney, Australia(脑与心智中心,悉尼大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Hi-DREAM框架,利用层次化扩散模型,通过ROI适配器将早期、中期和晚期视觉ROI流转换为多尺度皮层金字塔,并用轻量级ROI条件ControlNet注入解剖先验,在NSD数据集上实现最先进的高层语义重建和强低层结构。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13581 2026-07-02 cs.CV 版本更新 79%

HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation

HIR-ALIGN:通过基于扩散的数据生成增强超光谱图像恢复

Li Pang, Heng Zhao, Yijia Zhang, Deyu Meng, Xiangyong Cao

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Mathematics and Statistics and the Ministry of Education Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou(广州黄埔 Pazhou 实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HIR-ALIGN框架,通过生成与目标分布匹配的合成数据提升超光谱图像恢复性能,包含代理生成、分布自适应合成和对齐监督微调三个阶段,理论分析表明增强细调可降低目标域恢复风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19036 2026-07-02 cs.CV 版本更新 79%

FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal

FUMO:先验调制扩散模型用于单图像反射去除

Telang Xu, Chaoyang Zhang, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FUMO扩散模型,通过从混合图像提取强度和高频先验,结合粗到细训练范式,实现空间自适应和结构保真的单图像反射去除。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15129 2026-07-02 cs.CV 版本更新 79%

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06275 2026-07-02 cs.CV 版本更新 79%

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

扩散变换器超分辨率的频谱与轨迹正则化

Jingkai Wang, Yixin Tang, Jue Gong, Jiatong Li, Shu Li, Libo Liu, Jianliang Lan, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shenzhen Transsion Holdings Co., Ltd.(深圳传音控股股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出StrSR框架,通过非对称判别蒸馏和频率分布匹配策略,解决扩散变换器在真实图像超分辨率中的轨迹失配和周期性伪影问题,实现最先进性能。

Comments 15 pages, appears at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03370 2026-07-02 cs.CV cs.LG 版本更新 79%

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散

Takaya Kawakatsu, Ryo Ishiyama

机构 * Preferred Networks, Inc.(Preferred Networks公司) Kyushu University(九州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11641 2026-07-02 cs.CV cs.LG 版本更新 79%

Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

Yuxi Liu, Yipeng Hu, Zekun Zhang, Kunze Jiang, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 79%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06136 2026-07-01 cs.CV 版本更新 79%

Cross-Resolution Distribution Matching for Diffusion Distillation

跨分辨率分布匹配的扩散蒸馏

Feiyang Chen, Hongpeng Pan, Haonan Xu, Xinyu Duan, Zhefeng Wang, Yang Yang

机构 * Huawei(华为) Nanjing University of Science and Technology(南京理工大学) HiThink Research(海康研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出跨分辨率分布匹配蒸馏(RMD)框架,通过logSNR映射和分布匹配弥合分辨率间隙,实现高保真、少步数多分辨率级联推理,在SDXL和Wan2.1-14B上分别加速33.4倍和25.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17330 2026-07-01 cs.CV cs.AI 版本更新 79%

CharDiff-LP: A Diffusion Model with Character-Level Guidance for License Plate Image Restoration

CharDiff-LP: 一种具有字符级引导的车牌图像恢复扩散模型

Kihyun Na, Gyuhwan Park, Injung Kim

机构 * Handong Global University(韩东国际大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CharDiff-LP扩散框架,通过字符级引导(CHARM模块)恢复严重退化车牌图像,在Roboflow-LP数据集上字符错误率相对降低28.3%。

Comments Accepted at ICPR 2026. 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 79%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19778 2026-07-01 cs.CV 版本更新 79%

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer

相位对齐的混合分辨率扩散Transformer旋转位置编码

Haoyu Wu, Jingyi Xu, Qiaomu Miao, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对混合分辨率token在RoPE中注意力分数异常的问题,提出无训练机制PMA,通过统一位置尺度稳定注意力,并引入边界细化模块提升局部连贯性,在图像和视频扩散模型中提升视觉质量与计算效率。

Comments Accepted to ECCV 2026. Project page: https://hao-yu-wu.github.io/mixed_res/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18775 2026-07-01 cs.CV cs.AI 版本更新 79%

Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise

重新思考基于扩散的虚拟试穿中的服装条件:解耦,而非去噪

Kihyun Na, Jinyoung Choi, Injung Kim

机构 * Handong Global University(韩东国际大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散虚拟试穿中双UNet结构参数多、空间拼接全微调失效的问题,通过可视化研究揭示服装条件必须与去噪过程解耦,提出DeCo-VTON模型,以单网络架构达到双UNet水平且成本减半。

Comments Accepted at ECCV 2026. 28 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17979 2026-07-01 cs.CV 版本更新 79%

FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning

FeRA: 面向高效扩散自适应微调的频率能量约束路由

Bo Yin, Xiaobin Hu, Xingyu Zhou, Yu He, Peng-Tao Jiang, Yue Liao, Junwei Zhu, Jiangning Zhang, Ying Tai, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) vivo Tencent(腾讯) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FeRA框架,通过揭示扩散模型去噪过程中的频率能量机制,利用频率能量指示器、软频率路由和频率能量一致性正则化,实现参数更新与内在频率能量进程对齐,从而高效稳定地微调扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22476 2026-07-01 cs.CV 版本更新 79%

Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA

多通道不确定性加权分数匹配用于医学UDA中的条件扩散

Chen Li, Meilong Xu, Xiaoling Hu, Weimin Lyu, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院与哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出UPDiff-UDA框架,通过不确定性加权的分数匹配聚合多通道伪标签,结合贝塞尔曲线适应,提升跨模态医学图像分割性能。

Comments 28 pages, 7 figures. Accepted by ECCV'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12878 2026-07-01 cs.CV 版本更新 79%

Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation

从少到多:基于扩散学习器的原型扩展网络用于点云小样本语义分割

Qianguang Zhao, Dongli Wang, Yan Zhou, Jianxun Li, Richard Irampa

机构 * School of Mathematics and Computational Science, Xiangtan University(湘潭大学数学与计算科学学院) School of Automation and Electronics Information, Xiangtan University(湘潭大学自动化与电子信息学院) School of Automation, Shanghai Jiao Tong University(上海交通大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对小样本点云语义分割中原型容量小且与查询空间不对齐的问题,提出原型扩展网络(PENet),利用扩散模型的预训练条件编码器扩展原型,并通过推-拉机制对齐,在S3DIS和ScanNet数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02798 2026-07-01 cs.CV eess.IV physics.optics 版本更新 79%

Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion

无滤波器快照高光谱成像引导补丁扩散

Dean Hazineh, Luca Sacchi, Davide Cassara, Federico Capasso, Todd Zickler

机构 * Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出使用条件去噪扩散模型,通过小补丁移位不变操作和光学点扩散函数物理一致性引导,从单衍射透镜和滤光片全色传感器捕获的灰度快照中重建高光谱图像。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10141 2026-07-01 cs.CV 版本更新 79%

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Southeast University(东南大学) Tsinghua University(清华大学) VAST

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。

Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04049 2026-06-29 cs.CV cs.RO 版本更新 79%

DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving

DIVER:强化扩散突破端到端自动驾驶的模仿瓶颈

Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, Mingzhe Guo, Lei Yang, Yongchang Zhang, Shaoqing Xu, Caiyan Jia, Yadan Luo

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大数据挖掘与具身智能关键实验室,北京交通大学计算机科学与技术学院) Horizon Robotics(地平线机器人) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) University of Macau(澳门大学) School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电子工程与计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DIVER通过融合强化学习与扩散生成,生成多样化可行轨迹,提升自动驾驶的泛化能力,解决模仿学习中的模式崩溃问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17426 2026-06-29 cs.CV 版本更新 79%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17434 2026-06-26 cs.CV 版本更新 79%

TinySR: Pruning Diffusion for Real-World Image Super-Resolution

TinySR:剪枝扩散模型用于现实世界图像超分辨率

Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co. Ltd(沃伊通信有限公司) Zhejiang Lab(浙江实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TinySR,一种针对现实世界图像超分辨率的紧凑高效扩散模型,通过动态块激活和扩展-腐蚀策略实现实时性能与高质量输出,相比教师模型TSD-SR在计算成本和参数量上分别减少5.68倍和83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 79%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新 79%

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22249 2026-06-24 cs.CV 版本更新 79%

D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities

D3Seg: 依赖感知的扩散模型用于缺失模态的脑肿瘤分割

Danish Ali, Ajmal Mian, Naveed Akhtar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D3Seg模型,通过多跳模态图融合、轻量扩散插补机制和概率空间决策细化,解决缺失MRI模态下的脑肿瘤分割问题,提升分割性能并保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29578 2026-06-24 cs.CV 版本更新 79%

Emotion Diffusion Classifier with Adaptive Margin Discrepancy Training for Facial Expression Recognition

具有自适应间隔差异训练的情感扩散分类器用于面部表情识别

Rongkang Dong, Cuixin Yang, Cong Zhang, Yushen Zuo, Kin-Man Lam

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于条件生成扩散模型的情感扩散分类器(EmoDC),通过自适应间隔差异训练(AMDiT)动态调整间隔,提升噪声预测判别能力,在面部表情识别中优于现有判别模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10983 2026-06-23 cs.LG cs.AI cs.CV 版本更新 79%

TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

TMPO:用于多样化和高效扩散对齐的轨迹匹配策略优化

Jiaming Li, Chenyu Zhu, Nanxi Yi, Youjun Bao, Li Sun, Quanying Lv, Xiang Fang, Daizong Liu, Jianjun Li, Kun He, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TMPO,通过轨迹级奖励分布匹配提升扩散模型生成多样性,采用Softmax-TB目标和动态随机树采样,有效减少训练时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新 79%

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14310 2026-06-23 cs.CV 版本更新 79%

Iterative Diffusion-Refined Neural Attenuation Fields for Multi-Source Stationary CT Reconstruction: NAF Meets Diffusion Model

迭代扩散精化神经衰减场用于多源静态CT重建:NAF遇见扩散模型

Jiancheng Fang, Shaoyu Wang, Junlin Wang, Weiwen Wu, Yikun Zhang, Qiegen Liu

机构 * School of Information Engineering, Nanchang University(南昌大学信息工程学院) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Laboratory of Image Science and Technology, School of Computer Science and Engineering, and the Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院图像科学与技术实验室,以及教育部新一代人工智能技术及其交叉应用重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对超稀疏视角下多源静态CT重建质量差的问题,提出Diff-NAF框架,结合神经衰减场与双分支条件扩散模型,通过迭代投影合成与精化,显著提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04495 2026-06-23 cs.CV 版本更新 79%

MoFusion: A Framework for Denoising-Diffusion-based Motion Synthesis

MoFusion: 一种基于去噪扩散的运动合成框架

Rishabh Dabral, Muhammad Hamza Mughal, Vladislav Golyanik, Christian Theobalt

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Saarland University(萨尔兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MoFusion框架,利用去噪扩散模型实现高质量、多样化的条件人体运动合成,支持音乐和文本等多种条件,并通过调度加权策略引入运动学损失,适用于运动编辑应用。

Comments CVPR23, 11 pages, 6 figures, 2 tables; project page: https://vcai.mpi-inf.mpg.de/projects/MoFusion

详情

展开后加载摘要…

URL PDF HTML 收藏