arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2420 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2420 篇

2608.05471 2026-08-07 eess.IV cs.CV cs.LG physics.med-ph 新提交 57%

A Foundational EDM2-Based Generative Model for High-Resolution Synthetic Fetal Ultrasound Imaging from Open Datasets

基于EDM2的高分辨率合成胎儿超声成像基础生成模型,源自开放数据集

Harvey Mannering, Yilin Zhang, Ziao Liu, Zhiwu Huang, Jacqueline Matthew, Miguel Xochicale

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对胎儿超声AI数据稀缺问题,提出基于EDM2的合成框架,生成512×512图像,在分类任务中准确率达93.36%,优于真实数据训练结果,为胎儿超声AI提供开放资源。

Comments Short paper for the 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 57%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04818 2026-08-06 cs.CV 新提交 57%

Rethinking Pixel Mean Flows via Interval Denoiser

通过区间去噪器重新思考像素均值流

Alexander Zaytsev, Dmitry Baranchuk, Alexander Korotin, Aibek Alanov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散与流模型的计算及重建瓶颈,提出Interval Denoiser框架,经训练在ImageNet 256x256上实现少步生成的低FID值,提升了少步生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04557 2026-08-06 cs.CV 新提交 57%

VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis

VoxStruct3D:用于体素空间3D MRI合成的结构引导流匹配方法

Fang Li, Yang Gao, Shihao Zou, Weixin Si, Hongyu Wu, Qing Xia, Shuai Li, Aimin Hao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VoxStruct3D,一种体素空间流匹配框架,通过结构优先策略引导,在T1加权脑MRI合成任务上实现了特征分布对齐、样本多样性等指标的最优性能,生成的体积解剖连贯且视觉真实。

Comments Project page: https://neesky.github.io/VoxStruct3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03517 2026-08-05 cs.CV 新提交 57%

GVCCTurbo: Rate-Compute Quality Scheduling for Codebook Driven Generative Compression

GVCCTurbo:基于码本驱动生成压缩的码率-计算量质量调度

Ziyue Zeng, Dingjie Peng, Xun Su, Hiroshi Watanabe

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GVCCTurbo是一种BPP驱动的调度器,分离生成压缩的先验刷新与码本校正,降低解码时间,在低码率下提升压缩性能且兼容多种生成压缩模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03422 2026-08-05 cs.CV 新提交 57%

HyperbolicDiffusion: Sharp & Scalable Tiled Generation on the Hyperbolic Plane

HyperbolicDiffusion:双曲平面上的清晰且可扩展的平铺生成

Hugo Caselles-Dupré

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出无需训练的HyperbolicDiffusion方法,通过Hyperbolic Blooming Cover与几何修复阶段,在双曲平面H²上生成清晰、可重投影且跨视点一致的视觉场,为埃舍尔《圆极限》系列提供生成对应物。

Comments Work in progress. Updated version incoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03198 2026-08-05 cs.CV cs.RO 新提交 57%

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03046 2026-08-05 cs.CV 新提交 57%

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法

Yizhuo Jia, Jingyun Hua, Yuanxing Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。

Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02053 2026-08-04 eess.IV cs.CV 新提交 57%

Protocol generalisation for brain tissue microstructure estimation via hypernetwork-controlled geometric deep learning

基于超网络控制的几何深度学习的脑组织微结构估计的协议泛化

Andrea Brigliadori, Leevi Kerkela, Hui Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种融入b-值依赖的超网络控制SCNN架构,实现b-值与b-向量泛化及旋转等变性,提升了脑组织微结构估计的鲁棒性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02177 2026-08-04 cs.CV 新提交 57%

GSRAIN: Physically Calibrated High-/Low-Frequency Rainfall Synthesis for 3D Gaussian Driving Scenes

GSRAIN:面向3D高斯溅射(3DGS)驾驶场景的物理校准高低频降雨合成方法

Fanyu Wang, Longgao Zhang, Junyi Chen

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GSRAIN针对自动驾驶降雨模拟的物理可控性与多视图一致性局限,结合实测数据与几何感知扩散模型生成可控降雨场景,在FID指标上优于现有方法,可用于自动驾驶算法的雨天测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01990 2026-08-04 cs.CV cs.AI 新提交 57%

SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching

SPARE:用于流匹配的无结构参数亲和力正则化

Zong-Wei Hong, Jinglun Li, Shen Zhang, Yuhan Liu, Linze Li, Yao Tang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对去噪扩散Transformer训练收敛慢的问题,提出无结构参数亲和力正则化SPARE,利用跨图像标记对的结构实现正则化,在ImageNet数据集上取得优异生成性能,内存开销极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01896 2026-08-04 cs.CV 新提交 57%

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

GeoCore-9B:面向地球观测的地理感知生成基础模型

Jeonghyeok Do, Munchurl Kim

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。

Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01771 2026-08-04 cs.CV 新提交 57%

LiveLight: Real-time Streaming Video Relighting with Interactive Control

LiveLight:具备交互式控制的实时流视频重光照

Yue Ma, Jiangming Wang, Yucheng Wang, Xilai Wang, Zhiyuan Li, Xinyu Wang, Hongyu Liu, Ruofan Liang, Songchun Zhang, Yuxuan Xue, Qifeng Chen

机构 * HKUST(香港科技大学) University of Macau(澳门大学) THU(清华大学) UoT(多伦多大学) University of Tuebingen(蒂宾根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。

Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01306 2026-08-04 cs.CV 新提交 57%

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents

SPAE:用于预训练视觉隐层的频谱引导自编码器

Yibin Huang, Jixiang Hong, Zongzhao Li, Yuhan Dai, Zhibin Wang, Chunwei Wang, Jun Song, Chen Wang, Xiaofei Sun, Xiaoxiao Xu, Conghui Zhu

机构 * Alibaba Group(阿里巴巴集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 针对DiT生成隐层与编码器隐层的频谱不匹配问题,提出SPAE框架,通过紧凑瓶颈结构与通道级掩码策略实现隐层适配,在视觉理解、生成质量与重建保真度间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00079 2026-08-04 cs.CV cs.SD 新提交 57%

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

LeapTalk:打破说话头生成中的延迟-质量权衡

Rongxiang Zhang, Songhua Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 57%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28760 2026-08-03 cs.CV cs.AI cs.LG stat.ML 新提交 57%

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

面向信号的WaiT:简单的频率感知流匹配

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

机构 * FAIR, Meta(FAIR(Meta旗下研究机构)) École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 该研究提出频率感知流匹配模型WaiT,通过无损小波分解生成过程,引入三轴评估协议,在ImageNet等数据集上实现SOTA生成性能,采样计算量降低50%,还可无缝扩展至视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 57%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 57%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28470 2026-07-31 cs.AI cs.CV 新提交 57%

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

基于星上推理与生成式数据增强的纳卫星自主飞机监视技术研究

Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin, Juan Moreno-Garcia

机构 * Universidad de Castilla–La Mancha(卡斯蒂利亚-拉曼恰大学) Universidad de Castilla-La Mancha(卡斯蒂利亚-拉曼恰大学) Escuela de Ingeniería Industrial y Aeroespacial de Toledo(托莱多工业与航空航天工程学院) Escuela Superior de Informática(高等信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对纳卫星机载监视的下行链路瓶颈与数据集类别不平衡问题,提出结合星上推理与生成式数据增强的工作流,提升了检测精度与帧率,可作为实时自主监视的决策支持工具。

Comments 43 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 57%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27749 2026-07-31 cs.CV cs.RO 新提交 57%

Articulated Object Reconstruction from Rest-State Observation

从静止状态观测的关节对象重建

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27634 2026-07-31 cs.CV 新提交 57%

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans

4DHumanDiff:直接基于文本生成4DGS以实现一致的360度动态人类

Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本生成360度动态人类的现有方法存在成本高、一致性差的问题,本文提出4DHumanDiff扩散框架,直接基于文本生成4DGS表示的动态人类,结合新数据集与技术,实现高效且一致性更好的生成。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 57%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26646 2026-07-30 cs.CV 新提交 57%

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线

Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25948 2026-07-29 cs.CV cs.AI cs.LG 新提交 57%

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

MODUS:仅解码器的多模态任意到任意建模

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。

Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22772 2026-07-28 eess.IV cs.CV 新提交 57%

Generative Video Compression with Adaptive Score Distillation

基于自适应分数蒸馏的生成式视频压缩

Naifu Xue, Zhaoyang Jia, Haosen Li, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Qi Meng, Yuan Zhang, Yan Lu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视频压缩探索专门设计的扩散模型,提出GenVC,通过全局到局部层次结构恢复时空细节,用自适应分数蒸馏加速推理,在超低比特率下实现高质量重建,参数少且解码速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22765 2026-07-28 eess.IV cs.CV 新提交 57%

Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging

电子显微镜成像中用于平衡真实感和保真度的频率感知双流学习

Longmi Gao, Zhengkai Zhao, Pan Gao, Manoranjan Paul

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对电子显微镜成像分辨率与采集速度权衡问题,提出频率自适应双流架构,利用离散小波变换分解图像,通过条件扩散模型和变压器网络分别进行全局合成与细节恢复,实验表明该方法性能优越且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24436 2026-07-28 cs.CV 新提交 57%

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

MSVS-VAE:用于高保真3D重建的多尺度锚定向量集

Dehao Hao, Kaiyi Zhang, Tanghui Jia, Xiangjun Gao, Dongyu Yan, Weikai Chen, Zeyu Hu, Lingting Zhu, Yingda Yin, Runze Zhang, Li Yuan, Xin Wang, Long Quan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lightspeed Studios(光速工作室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对高保真3D重建中VAE的瓶颈问题,提出MSVS-VAE。通过分层点洗牌上采样 densify 锚定向量集潜在特征,用AVS-Conv取代全局交叉注意力,引入多尺度查询解码融合特征,实验表明其性能优于现有方法,解码速度和紧凑性有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24027 2026-07-28 cs.CV 新提交 57%

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Sol-Attn:通过即时注意力稀疏化加速视频生成推理

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散变压器视频生成中注意力推理瓶颈,提出无训练的Sol-Attn方法,通过即时块阈值处理和代理分数重用统一动态路由等,在图像和视频生成任务实验中实现质量-效率提升,加速视频生成和编辑。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏