arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2337 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2607.02137 2026-07-07 cs.LG cs.AI cs.SY eess.SY math.OC 新提交 82%

ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning

ART 用于扩散采样:连续时间控制与 Actor-Critic 学习

Yilie Huang, Wenpin Tang, Xun Yu Zhou

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系) Data Science Institute, Columbia University(哥伦比亚大学数据科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出自适应重参数化时间 (ART) 方法,将扩散采样的时间步分配建模为连续时间控制问题,并通过强化学习求解,以自适应学习采样时间表,提升样本质量。

Comments 36 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30934 2026-07-01 cs.LG 新提交 82%

Quality-Aware Modulation for Diffusion Transformers

扩散变压器的质量感知调制

Luke Budny, Yuhong Guo, Kevin Cheung

机构 * Carleton University(卡尔顿大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 提出质量表示模块(QRM),通过轻量级变压器学习质量感知向量,调整DiT中的自适应层归一化调制,提升生成图像质量,无需改变采样流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24313 2026-06-24 cs.AI 新提交 82%

Prob-BBDM: a Probabilistic Brownian Bridge Diffusion Model for MRI sequence image-to-image translation

Prob-BBDM:用于MRI序列图像到图像翻译的概率布朗桥扩散模型

Martin Valls, Pascal Bourdon, Christine Fernandez-Maloigne, Guillaume Herpe, David Helbert

机构 * University of Poitiers, CNRS, XLIM, France(波尔多大学,法国国家科学研究中心,XLIM,法国) University of Poitiers, CNRS, Laboratory of Applied Mathematics, France(波尔多大学,法国国家科学研究中心,应用数学实验室,法国) Poitiers University Hospital(波尔多大学医院) I3M common laboratory CNRS-Siemens Healthinners, Poitiers University Hospital and University of Poitiers, France(I3M共同实验室,法国国家科学研究中心-西门子医疗,波尔多大学医院和波尔多大学,法国)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 提出基于概率布朗桥扩散模型(Prob-BBDM)的MRI序列图像翻译方法,通过变分编码器引导扩散机制,在BraTS 2021数据集上实现高效高质量合成,仅需4步扩散,SSIM达88.46%,PSNR达26.09 dB。

Journal ref Computerized Medical Imaging and Graphics, 2026, 130, pp.102745

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22717 2026-06-23 cs.CR cs.NI 新提交 82%

One-Prompt Censorship Evasion via Generative Diffusion Models

通过生成扩散模型实现单提示审查规避

Shiyi Ling, Yuhang Gan, Chen Qian

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)

AI总结 提出FlowPaint框架,利用扩散模型的语义编辑能力,将审查流量重塑为良性模式,用户仅需自然语言指令即可对抗多种审查范式。

Comments 20 pages, 4 figures, 7 tables. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20094 2026-06-19 cs.CV cs.AI cs.GR cs.LG cs.MM 新提交 82%

MakeupMirror: Improving Facial Attribute Preservation in Diffusion Models for Makeup Transfer

MakeupMirror:在用于化妆迁移的扩散模型中改进面部属性保持

Nefeli Andreou, Angel Martínez-González, Sabine Sternig, Matthieu Guillaumin, Epameinondas Antonakos, Michael Opitz

机构 * Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 提出MakeupMirror扩散模型,通过ControlNet几何条件、区域特定迁移控制、肤色调制和Langevin采样器,在保持面部特征和肤色的同时实现高质量化妆迁移,相比Stable-Makeup提升面部识别相似度60%、降低肤色差异50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17378 2026-06-17 cs.DC 新提交 82%

RISE: Relay Inference and Online Scheduling for Efficient Edge-Device Collaborative Diffusion Model Services

RISE: 面向高效边缘-设备协同扩散模型服务的接力推理与在线调度

Zilan Huang, Zhiqing Tang, Hanshuai Cui, Tian Wang, Yuan Wu, Weijia Jia, Wei Zhao

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 提出RISE方法,通过训练无关的接力机制利用模型家族共享潜空间,将边缘大模型与设备小模型结合,并采用上下文感知调度器优化质量与延迟权衡。

Comments to be published in IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16700 2026-06-16 cs.CL 新提交 82%

Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

多轮反射掩码激发掩码扩散模型中的推理能力

Yanming Zhang, Yihan Bian, Jingyuan Qi, Yuguang Yao, Lifu Huang, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Virginia Tech(弗吉尼亚理工大学) Intuit UC Davis(加州大学戴维斯分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)

AI总结 提出反射掩码(RM)方法,通过轻量级后训练使掩码扩散模型具备多轮掩码与去噪能力,实现迭代局部修正,无需架构改变,在文本生成、数独和图像编辑等任务中优于基线。

Comments 22 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15154 2026-06-16 cs.RO 新提交 82%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15023 2026-06-16 physics.flu-dyn cs.LG 新提交 82%

Multiscale Hypersonic Boundary Layer Reconstruction via Spectral Binning and Subdomain-wise Conditional Diffusion

基于频谱分箱和子域条件扩散的高超声速边界层多尺度重构

Hojin Kim, Dibyajyoti Chakraborty, Takahiko Toki, Carlo Scalo, Romit Maulik

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Mathematics and Computer Science Division, Argonne National Laboratory(阿贡国家实验室数学与计算机科学部)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出多尺度概率重构框架,通过条件扩散模型从顶部壁面有限观测推断近壁状态,采用软重叠修复策略和边界频谱损失实现高超声速库埃特流全场重构。

Comments 33 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13347 2026-06-12 cs.LG 新提交 82%

Enhanced Low-Density Region Exploration in Classifier-Guided Diffusion Models Through Modified Reverse Diffusion Sampling

改进反向扩散采样在分类器引导扩散模型中的低密度区域探索

Jagriti Singh, Shekhar Verma, Muneendra Ojha

机构 * University of Allahabad(阿拔斯大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 提出一种无需额外训练的采样时间密度感知方法,通过修改分类器梯度引导轨迹朝向低置信区域并引导采样朝向预测真实图像,以增强扩散模型对低密度区域的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10390 2026-06-10 physics.med-ph 新提交 82%

Foveated-Imaging Geometry CT Architecture and Seeded Diffusion Model Enabling Global Super-Resolution Reconstruction

中心凹成像几何CT架构与种子扩散模型实现全局超分辨率重建

Wenxin Mo, Yingxian Xia, Yongle Yan, Hao Zhou, Li Zhang, Hewei Gao

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出中心凹成像几何CT架构,集成局部高分辨率数据到低分辨率主导的采集方案,并开发扩散概率超分辨率重建框架,实现全场高分辨率CT图像重建。

Comments 24pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14729 2026-08-18 cs.CV 新提交 81%

Do CNNs Internally Represent Real and Fake Images Differently? A Hidden-Layer Analysis

卷积神经网络(CNNs)是否在内部对真实图像与虚假图像的表示存在差异?隐藏层分析

Moumita Sen Sarma, Pascal Hitzler, Eugene Y. Vasserman

机构 * Kansas State University(堪萨斯州立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究通过场景识别实验证实,CNNs对真实与虚假图像的隐藏层激活存在可统计的差异,该差异无法仅用图像退化解释,为改进虚假图像检测提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27036 2026-07-30 cs.CV cs.LG 新提交 81%

Mitigating Compounding Error via Video Representation Regularization

通过视频表示正则化缓解复合误差

Taiye Chen, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 81%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27234 2026-06-26 cs.CY cs.AI cs.CV cs.HC 新提交 81%

From Celebrities to Anyone: Characterizing AI Nudification Content, Technology, and Community Dynamics on 4chan

从名人到普通人:4chan上AI裸化内容、技术与社区动态的特征分析

Chi Cui, Yixin Wu, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 本研究通过分析4chan上的24,105个AI裸化内容,发现目标从名人转向普通人(占55.8%),开源模型(如Stable Diffusion)主导生成,少数活跃生产者驱动社区生态。

Comments 22 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13597 2026-08-17 eess.IV cs.AI cs.CR cs.CV cs.MM 新提交 81%

Secret-Stego Dissimilarity as a Design Axis: Invertible Coverless Image Steganography with Diffusion Models

以秘密-隐写图像的差异性为设计轴:基于扩散模型的可逆无载体图像隐写术

Hongxin Xu, Jianping Mei, Can Wang, Defang Chen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究提出InvCISD可逆扩散框架,耦合秘密与参考图像潜在表示,降低秘密-隐写图像视觉相似性,提升隐写质量,为CIS抗隐写分析研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28164 2026-07-31 cs.CV cs.GR 新提交 81%

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image

S-Avatar:基于单张图像的扩散引导高斯头部化身

Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo

机构 * KAIST(韩国科学技术院) KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24665 2026-07-28 cs.CV cs.GR cs.LG 新提交 81%

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

MMOE:通过高效专家设计使扩散变压器现代化

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 81%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14732 2026-06-16 cs.CV cs.AI cs.LG cs.MM 新提交 81%

Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion

Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡

Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong, Unsang Park

机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) Department of Artificial Intelligence, Sogang University(西江大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。

Comments Project page: https://minar09.github.io/steadyforcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13655 2026-06-16 cs.CV cs.GR 新提交 81%

Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction

Flex4DHuman:面向4D人体重建的灵活多视角视频扩散模型

Jen-Hao Cheng, Yipeng Wang, Hao Zhang, Gengshan Yang, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学) World Labs

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 提出Flex4DHuman,一种基于相对相机位姿条件化的多视角视频扩散模型,无需显式几何先验即可将单目或稀疏多视角视频转换为密集多视角视频,并用于4D高斯溅射重建。

Comments Project Page: https://andy-cheng.github.io/Flex4DHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13366 2026-06-12 cs.CV cs.MM 新提交 81%

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

双约束扩散图像压缩用于操作率失真感知优化

Sanxin Jiang, Jiro Katto, Heming Sun

机构 * Shanghai University of Electric Power(上海电力大学) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出DCIC框架,结合学习编解码器和基于扩散的解码器,通过联合失真和等幂约束实现率失真感知帕累托前沿的连续导航,无需额外码率开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10183 2026-06-10 cs.CV cs.AI cs.MM 新提交 81%

Making Time Editable in Video Diffusion Transformers

在视频扩散Transformer中实现时间可编辑性

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

机构 * Kandinsky Lab(坎迪斯基实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08734 2026-08-11 cs.CV 新提交 80%

IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack

IDATA:用于无限制对抗迁移攻击的可扩展可逆扩散模型

Yi Pan, Jun-Jie Huang, Tianrui Liu, Zihan Chen, Lin Liu, Zhao Wentao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IDATA是一种用于无限制对抗迁移攻击的内存高效扩散框架,通过可逆扩散模块与低频约束模块提升攻击性能,在多基准测试中优于现有方法,可用于评估深度视觉模型黑盒鲁棒性。

Comments Adversarial attack,Invertible diffusion model,Memory-efficient,Low-frequency

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06717 2026-08-10 cs.CV 新提交 80%

WaveFreqAnchor: Wave-Structural Anchoring and Frequency Correction Diffusion for Training-Free Face Restoration

WaveFreqAnchor:用于无训练人脸修复的波结构锚定与频率校正扩散

Zelin Du, Wenjie Li, Zhengxue Wang, Juncheng Li, Cailing Wang, Guangwei Gao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对现有扩散模型人脸修复的结构漂移与保真度问题,提出无训练框架WaveFreqAnchor,通过ASWG、MWFI、SHE设计实现高质量人脸修复,性能优于现有方法。

Comments training-free wavelet-structural diffusion sampling framework for face restoration that improves structural stability, identity consistency, and real-world perceptual quality without task-specific fine-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11385 2026-07-14 eess.IV cs.CV 新提交 80%

Diffusion MRI preprocessing affects ADC estimation and automatic PI-RADS v2.1 classification in bi-parametric prostate MRI

扩散加权磁共振成像预处理影响双参数前列腺磁共振成像中表观扩散系数估计和自动PI-RADS v2.1分类

Christos Kanakis, Mathias Perslev, Tim Schakel, Silvia Ingala, Akshay Pai, Dennis Klomp, Chantal M. W. Tax

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究不同DWI预处理策略对前列腺MRI中ADC估计及PI-RADS分类的影响,通过对268个病例应用多种处理方法,比较不同算法下的ADC图,训练分类器预测PI-RADS分数,发现预处理可提升ADC图质量及分类预测能力。

Comments 19 pages, 10 figures, ISMRM Diffusion workshop 2025, ESMRMB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31065 2026-07-01 cs.CV 新提交 80%

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

基于扩散的材料正则化用于物理逆渲染

Jingwang Ling, Lifan Wu, Feng Xu, Shuang Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) BNRist and School of Software, Tsinghua University(清华大学软件学院及北京国家信息科学与技术研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出将扩散模型预测作为相似性核,通过正则化损失约束材料优化,联合重建几何、材质和光照,在多个数据集上显著优于现有方法。

Comments Accepted to ECCV 2026. Includes supplementary material. Project page: https://gerwang.github.io/diffusion-regularized-inverse-rendering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23610 2026-06-23 cs.CV 新提交 80%

Vera: A Layered Diffusion Model for Content-Preserving Video Editing

Vera: 一种用于内容保持视频编辑的分层扩散模型

Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein, Yisong Yue, Zhuoning Yuan

机构 * California Institute of Technology(加州理工学院) Netflix, Inc(Netflix公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Vera分层扩散框架,通过生成编辑层和alpha遮罩与源视频合成,利用混合Transformer架构和高质量分层数据集,在保持内容的同时实现高质量编辑。

Comments https://vera-layered-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10280 2026-06-10 eess.IV cs.CV 新提交 80%

Overlapped Wavelet Diffusion for Low-Light Image Enhancement

重叠小波扩散用于低光照图像增强

Fen Peng, Taizo Suzuki, Seisuke Kyochi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出重叠小波扩散框架OWDiff,通过重叠小波变换消除块伪影,并引入低频引导的高频增强模块恢复细节,在LOLv1和LOLv2-real数据集上优于现有方法。

Comments Advance published in IEICE Transactions on Information and Systems. DOI: 10.1587/transinf.2026PCP0006. Code: https://github.com/FinnPeg/Overlapped-Wavelet-Diffusion

Journal ref IEICE Transactions on Information and Systems, Advance online publication, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03938 2026-08-05 cs.RO cs.SY eess.SY 新提交 80%

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

8 GB预算内的双臂操作:入门级Jetson上的零拷贝感知与量化ACT

Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 该研究在8 GB入门级Jetson上实现了双臂操作,采用零拷贝感知、量化ACT,发现ACT在相同演示下优于Diffusion Policy,INT8量化可大幅降低延迟且保留任务成功率。

Comments 9 pages, 8 tables. Work conducted at the Georgia Tech Research Institute (GTRI), Aerospace, Transportation and Advanced Systems Laboratory (ATAS)

详情

展开后加载摘要…

URL PDF HTML 收藏