arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-17 至 2026-08-17 共收录 76 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 60 篇

2510.02916 2026-08-17 cs.SD cs.LG 版本更新 50%

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

SALSA-V:基于视频的捷径增强式长同步音频生成模型

Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02595 2026-08-17 math.NA cs.NA math.AP 版本更新 50%

Numerical methods for fully nonlinear degenerate diffusions

完全非线性退化扩散的数值方法

Edgard A. Pimentel, Ercília Sousa

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对退化完全非线性椭圆型方程及相关传输型自由边界问题,提出有限差分方法,通过正则化程序克服困难并证明收敛性,经数值实验支撑,方法可扩展至更广泛非变分问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06429 2026-08-17 cond-mat.stat-mech 版本更新 50%

Mean-squared displacement and variance for confined Brownian motion

Yi Liao, Xiao-Bo Gong

专题命中 扩散模型 :diffusion(abstract)

Comments 18 pages, 4 figurea

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03357 2026-08-17 cond-mat.stat-mech cond-mat.soft physics.bio-ph 版本更新 50%

Asymptotically exact scattering theory of the Kuramoto-Vicsek model

Kuramoto-Vicsek模型的渐近精确散射理论

Thomas Ihle, Horst-Holger Boltz, Rüdiger Kürsten, Benjamin Lindner

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对Kuramoto-Vicsek模型,突破平均场假设,采用单侧分子混沌假设解析计算低密度下粒子散射,其理论结果与模拟吻合,还推导了高密区噪声关联及正对齐强度下的Boltzmann碰撞算子。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2608.14530 2026-08-17 cs.CV cs.AI 新提交 57%

Marionette: Predicting World States, Rendering Geometry, Painting Appearance

Marionette:预测世界状态、渲染几何、绘制外观

Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。

Comments Project page: https://alayalab.github.io/Marionette/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07795 2026-08-17 math.OC math.AP math.PR 版本更新 50%

Optimal control formulation of transition path problems for Markov Jump Processes

马尔可夫跳跃过程的过渡路径问题的最优控制公式

Yuan Gao, Jian-Guo Liu, Oliver Tse

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究将马尔可夫跳跃过程的过渡路径问题转化为路径空间随机最优控制问题,通过committor函数、Γ-收敛等方法得到最优路径测度与受控过程,为过渡路径问题提供了严格的最优控制框架。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 4 篇

2605.08832 2026-08-17 cs.LG physics.flu-dyn 版本更新 78%

Inpainting physics: self-supervised learning for context-driven fluid simulation

物理修复:用于上下文驱动流体模拟的自监督学习

Jonas Weidner, Yeray Martin-Ruisanchez, Daniel Rueckert, Benedikt Wiestler, Julian Suk

机构 * AI for Image-Guided Diagnosis and Therapy, Technical University of Munich(图像引导诊断与治疗人工智能,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) AI in Healthcare and Medicine, Technical University of Munich(医疗人工智能,慕尼黑技术大学) Imperial College London(伦敦帝国学院)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 提出将稳态CFD推理重构为修复问题,通过自监督学习速度场先验并在推理时施加边界约束,利用局部邻域分词器处理大规模3D网格,在颅内动脉瘤血流动力学中优于监督代理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14543 2026-08-17 cs.CV 新提交 70%

MagnifiQ: Patch-aware Text Guided Progressive Upscaling for High-Resolution Image Restoration

MagnifiQ:面向高分辨率图像修复的感知补丁文本引导渐进式上采样方法

Mahesh Reddy, Yashesh Savani, Antoine Mercier, Hong Cai, Fatih Porikli, Guillaume Berger

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 图像修复 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 MagnifiQ是一种跨分辨率渐进式上采样的图像修复框架,替换扩散模型自注意力层为线性计算卷积,采用补丁文本提示,在4K图像修复中性能优于现有方法,实现速度与质量的实用权衡。

Comments Camera-ready version (ECCV workshop - LoViF'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15158 2026-08-17 cs.CV 版本更新 57%

RefGC-SR$^2$: Reference-guided Super-Resolution and Refinement of AI Generated Content

RefGC-SR$^2$: 参考引导的生成内容超分辨率与精炼

Jeahun Sung, Dahyeon Kye, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) Adobe Research(Adobe 研究院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对生成管道中参考图像下采样导致细节丢失和伪影问题,提出RefGC-SR$^2$任务,利用原始高分辨率参考图像同时恢复细节、精炼伪影并提升分辨率,构建首个真实三元组数据生成管道并设计频率感知扩散Transformer模型。

Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/RefGC-SR2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03391 2026-08-17 eess.IV cs.CV 版本更新 57%

Edit2Restore:Few-Shot Image Restoration via Parameter-Efficient Adaptation of Pre-trained Editing Models

Edit2Restore:通过参数高效适应预训练编辑模型实现少样本图像修复

Mustafa Akın Yılmaz, Ahmet Bilican, Burak Can Biner, Ahmet Murat Tekalp

机构 * Codeway AI Koc University(科克大学)

专题命中 图像修复 :image editing(abstract);分类 cs.CV

AI总结 Edit2Restore通过参数高效微调预训练编辑模型,在少样本条件下实现多种图像修复任务,提升感知质量并减少数据需求。

Comments Accepted to the LoViF Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2608.14260 2026-08-17 eess.IV cs.MM 新提交 57%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14403 2026-08-17 cs.CV 新提交 57%

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

CRAFT:无需组合目标的主题个性化的注意力微调约束奖励

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Jaeyeul Kim, Han Zou, Zhenpeng Zhan, Yan Zhang, Sunghoon Im

机构 * DGIST(大邱科技研究院) Baidu, Inc.(百度公司) KAIST(韩国科学技术院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。

Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13925 2026-08-17 cs.LG cs.AI cs.CL 新提交 50%

CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

CForce:通过一致性强制提升扩散大语言模型(dLLMs)的并行解码性能

Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出CForce方法,通过一致性强制提升dLLMs的并行解码性能,在LLaDA模型上实验证实其在高并行解码预算下可优化速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 1 篇

2608.13932 2026-08-17 cs.LG 新提交 50%

Post-training Quantization for Hybrid Iterative Generative Models

混合迭代生成模型的训练后量化

Jing Gao, Junyi Wu, Wei Wang, Yan Yan, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对混合迭代生成模型训练后量化易引发模型崩溃的问题,提出HyGenQ框架,通过分层聚类解耦与缩放重校准,成功将其量化至8位精度且性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2608.03471 2026-08-17 cs.CV 版本更新 57%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 其他图像生成 :generative vision(abstract);分类 cs.CV

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏