arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 215 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 158 篇

2606.24232 2026-09-01 cs.CV cs.GR 版本更新 62%

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28872 2026-09-01 eess.IV cs.CV cs.LG 新提交 57%

Generative Translation Priors: Bayesian Imaging with Cross-Modality Image Translation

生成式翻译先验:基于跨模态图像翻译的贝叶斯成像

Evan Bell, Jiaming Liu, Yifan Chen, Yu Sun

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出生成式翻译先验(GTP)贝叶斯框架,将扩散式图像翻译模型转化为跨模态先验,推导两种离散化算法,在CT、PET重建任务中验证其可有效融入跨模态信息,欠采样下仍实现高保真重建。

Comments 51 pages, 12 figures. Code is available at https://github.com/Hopkins-CIG/GTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30913 2026-09-01 cs.SD cs.MM 新提交 57%

Decoupled Latent Flow Matching for Few-Step Joint Vocal-Accompaniment Separation

用于少步联合人声-伴奏分离的解耦潜在流匹配

Lishi Zuo, Youzhi Tu, Lu Yi, Zezhong Jin, Chongxin Gan, Man-Wai Mak, KongAik Lee

机构 * Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文提出解耦潜在流匹配框架,通过VAE与Flow2GAN相关技术实现少步联合人声-伴奏分离,在减少采样预算时可提升分离性能与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30835 2026-09-01 cs.CV cs.AI 新提交 57%

Reliable Benchmarking of Artifact Detection in Computational Pathology: A Reproducibility and Uncertainty Analysis

计算病理学中伪影检测的可靠基准:可复现性与不确定性分析

Konstantinos Moutselos, Ilias Maglogiannis

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对计算病理学伪影检测基准的缺陷,提出含四类变异检验的可靠性协议,经评估发现原基准的核心机制可复现但对比声明不可靠,小队列基准结论可信度低。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30692 2026-09-01 cs.CV 新提交 57%

Can Video World Models Track Unobserved World States?

视频世界模型能否追踪未被观测的世界状态?

Joonghyuk Shin, Yicong Hong, Jaesik Park, Xun Huang

机构 * Seoul National University(首尔大学) Roblox(罗布乐思公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究通过动作条件视频“贝壳游戏”实验,发现多数视频世界模型无法追踪未观测的世界状态,仅线性注意力(转移特征值为负)和TTT(带非线性快速权重)可实现外推,为构建有状态视频世界模型提供了方向。

Comments Project webpage:https://joonghyuk.com/stateful-vwm-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30194 2026-09-01 cs.CV 新提交 57%

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

NoisEasier:用于文本到视频生成的测试时噪声优化

Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出NoisEasier框架,通过测试时噪声优化提升文本到视频生成的组合对齐效果,在多数据集实验中取得超10%平均增益,为可控文本到视频生成提供有效新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29927 2026-09-01 cs.CV 新提交 57%

Everybody Tracking Every Body

所有人的全身姿态跟踪

Daeyun Shin, Yunhan Zhao, Shu Kong, Alexander C. Berg, Charless Fowlkes

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对多互动个体的第一人称视角3D人体姿态估计问题,提出基于扩散的融合方法,结合第一人称头部运动与外参观测,在多人数据集上提升了姿态精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29910 2026-09-01 cs.CV 新提交 57%

Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory

Matrix-Game 3.5:利用补丁内存增强实时流式交互式世界模型

Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang Liu, Yaokun Li, Fei Kang, Kaichen Huang, Mengyin An, Haobo Zhang, Biao Jiang, Jiahua Wang, Haofeng Sun, Yang Liu, Yangguang Li

机构 * Riemann Dynamics(黎曼动力学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Matrix-Game 3.5通过三项关键改进优化交互式世界模型,实现稳定长时序实时交互式生成,在多类任务上表现出色。

Comments https://matrix-game-v3-5.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29793 2026-09-01 cs.CV 新提交 57%

GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation

GridFlow:用于无缝城市级三维点云生成的结构化潜在流

Xinyu Wang, Muhammad Ibrahim, Atif Mansoor, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出GridFlow框架,结合多模态条件生成城市级无缝三维点云,并构建City3D-MultiGen基准,实验显示其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29346 2026-09-01 cs.CV 新提交 57%

GSPotential: Camera Potential Field for Sparse-View 3D Gaussian Splatting

GSPotential:面向稀疏视图三维高斯溅射的相机势场

Zeyuan An, Yanghang Xiao, Zhiying Leng, Yijun Feng, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Zhongguancun Laboratory(中关村实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GSPotential是面向稀疏视图3D Gaussian Splatting的框架,通过相机势场解决稀疏视图下的过拟合与几何伪影,采用虚拟相机采样与高斯更新策略提升重建保真度且训练效率具竞争力。

Comments 10 pages, 8 figures, 5 tables. Accepted to Pacific Graphics 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29172 2026-09-01 cs.CV 新提交 57%

A Tensor Variational Formulation of Gradient Energy Total Variation

梯度能量全变分的张量变分形式

Freddie Åström, George Baravdish, Michael Felsberg

机构 * Linköping University(林雪平大学) Center for Medical Image Science and Visualization (CMIV)(医学图像科学与可视化中心(CMIV)) Department of Science and Technology, Linköping University(林雪平大学科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出了梯度能量全变分(GETV)的张量变分形式,证明其为凸泛函,可形式推导欧拉-拉格朗日方程,实验显示其在图像去噪上优于EAD、TV等方法。

Journal ref Energy Minimization Methods in Computer Vision and Pattern Recognition. EMMCVPR 2015. Lecture Notes in Computer Science, vol 8932, pp. 307-320, Springer, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29001 2026-09-01 cs.LG cs.CV cs.IR 新提交 57%

Effective Graph and Rank-based Contextual Embeddings for Textual and Multimedia Data

面向文本与多媒体数据的高效图及基于秩的上下文嵌入

Thiago César Castilho Almeida, Gustavo Rosseto Letício, Lucas Pascotti Valem, André Freitas, Daniel Carlos Guimarães Pedronette

机构 * State University of São Paulo (UNESP)(圣保罗州立大学(UNESP)) University of São Paulo (USP)(圣保罗大学(USP)) University of Manchester(曼彻斯特大学) Idiap Research Institute(Idiap研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出无监督框架GRaCE,通过基于秩的度量生成可解释嵌入,在文本、图像等多数据集的检索、分类、聚类任务中优于RaDE及原始特征。

Comments Published in International Joint Conference on Neural Networks, 2025 (IJCNN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28895 2026-09-01 cs.CV 新提交 57%

ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views

ReconSplat:超越观测视图的通用3D场景重建

Giuseppe Stracquadanio, Kevin Raj, Julia Grabinski, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) Zuse School ELIZA(楚斯学校ELIZA)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ReconSplat是基于3DGS与MV-LDM的前馈3D场景重建模型,解决未观测区域视图生成与几何一致性的权衡问题,在RealEstate10K、DL3DV-10K基准上优于现有方法,可外推未观测视点并保持精确几何。

Comments ECCV 2026. Code and additional visual results are available on our project page: https://visinf.github.io/reconsplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26363 2026-09-01 cs.CV 版本更新 57%

A Unified Framework for the Mechanics of Information in Convolutional Neural Network Image Space

卷积神经网络图像空间中信息力学的统一框架

Aryan Shukla, Matthew Toews

机构 * École de technologie supérieure(蒙特魁北克大学工程学院(École de technologie supérieure))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CNN图像空间信息力学的统一数学框架,建立离散滤波器对称性与相对论能量-动量关系的对应,经3D图像验证可在多尺度图像中生成尺度不变莫尔斯临界点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新 57%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22394 2026-09-01 cs.CV 版本更新 57%

Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

曲率自适应一致性流匹配:基于强化学习的自主轨迹优化

Songtao Tian, Guhan Chen, Bohan Li, Jingyi Ma, Zixiong Yu

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出曲率自适应一致性流匹配(CACFM),利用强化学习代理动态构建效率导向课程,优先处理关键区域,在FLUX和SDXL等大规模模型上实现最先进结果,极少数步下保持高视觉保真度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13421 2026-09-01 cs.LG cs.CV 版本更新 57%

Generalization and Memorization in Rectified Flow

修正流中的泛化与记忆化

Mingxing Rao, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究修正流模型的记忆行为,通过成员推断攻击测试统计量揭示其记忆机制,并提出复杂度校准指标,提升攻击性能并抑制记忆化以保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23667 2026-09-01 cs.CV 版本更新 57%

MVID: Feed-Forward Multi-View Intrinsic Image Decomposition

IDT: 一种物理基础的Transformer用于前馈多视角内在分解

Kang Du, Duotun Wang, Wanling Li, Yirui Guan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 IDT通过基于Transformer的注意力机制实现多视角内在图像分解,采用物理基础模型分离材料和照明效应,提升多视角一致性。

Comments 12 pages 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29838 2026-09-01 eess.SP 新提交 50%

KDGen-BF: A Generative Site-Specific Multi-User Beamforming Approach

KDGen-BF:一种针对特定站点的多用户波束成形生成方法

Ruihang Jiang, Zhaolin Wang, Yuanwei Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出KDGen-BF框架,将多用户波束成形建模为条件生成问题,训练扩散变换器并采用多候选策略,在DeepMIMO场景下,该方法在有限探测预算、大探测预算及含噪RSRP观测时均优于多数基线方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28937 2026-09-01 eess.IV 新提交 50%

Multimodal Deep Learning for Uncertainty-Aware Radiation Pneumonitis Risk Prediction

用于不确定性感知放射性肺炎风险预测的多模态深度学习

Jin Yang, Tian Liu, Jing Wang, Robert Samstein, Kenneth Rosenzweig, Julie Bloom, Ming Chao

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出MM-DiT框架,通过多模态预训练整合CT图像与放射剂量分布,可联合估计RP风险并量化三类不确定性,在独立队列中验证了其预测准确性与不确定性量化能力。

Comments 30 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28892 2026-09-01 q-bio.NC eess.SP 新提交 50%

Structurally Informed Connectivity Disruptions in Cocaine Use Disorder

可卡因使用障碍中基于结构的连接性破坏

Seyed Majid Razavi, Saeed Tajik Hesarkuchak, Triet M. Tran, Mehdi Zaeifi, Amirhossein Arezoumand, Farnaz Zamani Esfahlani, Jason A. Oliver, Sina Khanmohammadi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究引入基于结构的动态功能连接框架,发现可卡因使用障碍患者脑网络整合增强、灵活性降低,且该特征可预测每周可卡因使用量,为可卡因成瘾的网络改变研究提供了有价值的测量方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30957 2026-09-01 cs.CE 新提交 50%

Viable Pool Sizing for On-Chain FX Liquidity: Amplification, Capital, and Resilience

链上外汇流动性的可行资金池规模:放大系数、资本与韧性

Ryan Fang, Ivan Bardziyan, Jessica Wang, Mayank Anand

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对链上外汇流动性的资金池设计问题,结合StableSwap机制、Merton跳扩散模型与LVR框架,确定了满足竞争力、盈利性与韧性的资金池规模配置,明确了资本下限与放大系数上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29748 2026-09-01 cs.CL 新提交 50%

ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding

ReTrace:用于投机解码的拒绝轨迹条件方法

Luxi Lin, Zhanpeng Zeng, Shuang Peng, Songwei Liu, Rongrong Ji

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出ReTrace方法,针对投机解码中被拒绝后缀的有效信息,通过跨轮条件保留优化拒绝后缀,无需额外计算即可提升Qwen3模型在多任务上的解码效率,且可与现有方法结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29291 2026-09-01 cs.AI 新提交 50%

Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling

通过核心扩展路由与统一计算调度加速统一多模态模型

Wengyi Zhan, Chenqian Yan, Songwei Liu, Mingbao Lin, Rongrong Ji

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出CE-Router方法,通过核心扩展路由与统一计算调度减少统一多模态模型的冗余计算,在保留98.03%密集理解性能的同时实现1.93倍端到端推理加速,提升了质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28827 2026-09-01 stat.ML cs.LG math.PR 新提交 50%

Quantitative Target Convergence and Uniform-in-Time Propagation of Chaos for Langevin-Regularized SVGD

朗之万正则化SVGD的定量目标收敛性与时不变混沌传播

Sayan Banerjee, Dohyeon Kim

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对朗之万正则化SVGD,建立了其定量目标收敛性与时不变混沌传播的理论结果,推导了相关界并对比了两种有限时间机制的性能。

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31158 2026-09-01 math.AP 新提交 50%

Stationary kinetic Krylov-Safonov estimates in space dimension one

一维空间中的定常动力学Krylov-Safonov估计

Yuzhe Zhu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对一维空间非散度形式定常动力学Fokker-Planck方程,证明了解的内部Hölder正则性,且该估计不依赖于扩散系数的小振荡条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31099 2026-09-01 math.PR math.DS math.FA 新提交 50%

On (fake) Stationarity in Stochastic Volterra Equations with Affine Drift and Regular Kernels

带仿射漂移与正则核的随机沃尔泰拉方程的(伪)平稳性研究

Emmanuel Gnabeyeu, Gilles Pagès

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究带仿射漂移与正则核的随机沃尔泰拉方程的伪平稳性,通过两种方法诱导伪平稳 regime,证明时移解弱收敛至L²平稳过程,并将结果应用于α≥1的指数-分数SVIE。

Comments 46 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30715 2026-09-01 math.AP 新提交 50%

Endpoint Energy Atoms Force Local Pressure Concentration in Three-Dimensional Navier-Stokes Flow

端点能量原子在三维纳维-斯托克斯流中迫使局部压力集中

Hao Huang

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究证明三维不可压缩纳维-斯托克斯流的端点动能测度中的点原子会迫使局部压力集中,通过建立相对压力功恒等式等揭示了相关压力功机制。

Comments 17 pages. Submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29984 2026-09-01 math.AP 新提交 50%

On Cauchy Problems for Parabolic Equations with Rough Coefficients

具粗糙系数的抛物型方程的柯西问题

Cheng Yuan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究扩散系数粗糙的两类抛物型方程柯西问题,在最优分数阶Sobolev空间中建立其唯一可解性,构造近似格式并结合多种分析工具完成估计,证明阈值$s < 1/2$的尖锐性,提供相关数学框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29877 2026-09-01 math.NA cs.NA 新提交 50%

High-order energy-stable BGN parametric finite element methods for geometric flows

Shu Ma, Qiqi Rao

专题命中 扩散模型 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏