arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-27 至 2026-08-27 共收录 21 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1 篇

2607.18227 2026-08-27 cs.CV 版本更新 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: this https URL (https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 13 篇

2608.20818 2026-08-27 cs.LG cs.AI cs.CV 版本更新 79%

Scaling Muon for Diffusion Transformers

针对扩散Transformer的Muon优化器的缩放研究

Chenghao Li, Xiao Han, Xinxin Huang, Wei Liu, Boyang Li, Bing Xiao, Heran Zhang, Juanma Perez Rua, Ke Xu, Kangning Liu, Linjun Kuang, Na Li, Tan Wang, Tian Xie, Wei Peng, Yang Pei, Yifan Xu, Yuanhao Zhai, Yuwei Lin, Zhe Wang, Zihao He, Daniel Li, Junbiao Tang, Ziyang Jiang, Dake Chen

机构 * University of Southern California(南加州大学) Meta

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03539 2026-08-27 cs.CV 版本更新 79%

IRIS: Visual-Semantic Binding for Forgery-Resistant Watermarking of Diffusion Images

IRIS:用于扩散图像防伪造水印的视觉-语义绑定

Xiaoyan Feng, Zheng Gao, Tong Guan, Rui Bao, Bokang Zeng, Xiaoyu Li, Jiaojiao Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IRIS是一种无需训练的扩散图像防伪造水印方案,通过视觉-语义绑定抵御固定图案移植与事后再生剥离,在三个提示数据集上检测可靠且保真度优异。

Comments Substantial revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17415 2026-08-27 cs.LG cs.AI cs.CV 版本更新 79%

Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models

奖励分数匹配:统一流模型和扩散模型的基于奖励的微调

Jeongjae Lee, Jinho Chang, Jeongsol Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Korea(人工智能研究生院,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出奖励分数匹配(RSM)框架,统一了多种基于奖励的微调方法,通过分数匹配与值引导目标对齐,简化了设计空间并提高了效率。

Comments 50 pages, 15 figures. Best Paper Award at SPIGM workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-08-27 cs.CV cs.AI cs.LG 版本更新 79%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments 38 pages, 22 figures, ECCV 2026, Project page: this https URL (https://dohunlee1.github.io/MemoryV2V)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23798 2026-08-27 cs.LG 版本更新 78%

A Theory of Speciation in Generative Diffusion Models on Compact Riemannian Manifolds

紧致黎曼流形上生成式扩散模型的物种形成理论

Alessio Marta, Paola Causin

机构 * University of Milan(米兰大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究建立紧致黎曼流形上生成式扩散模型的物种形成内蕴理论,刻画其分岔机制,推导相关估计与稳定性结论,经球面实验及神经网络学习方案验证。

Comments 48 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25924 2026-08-27 eess.IV physics.optics 版本更新 78%

Improving Richardson--Lucy Deconvolution with Diffusion Priors for Fluorescence Microscopy

利用扩散先验改进荧光显微镜的Richardson-Lucy反卷积

Hao Chen, Scott S. Howard

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对荧光显微镜反卷积的ill-posed问题,提出将基于分数的扩散先验集成到Richardson-Lucy迭代框架中,在保持泊松数据一致性的同时抑制噪声放大,改善低光子计数下弱丝状和点状结构的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21450 2026-08-27 cs.CE q-bio.BM 版本更新 78%

CMADiff: Cross-Modal Aligned Diffusion for Controllable Protein Generation

CMADiff: 用于可控蛋白质生成的跨模态对齐扩散

Changjian Zhou, Yuexi Qiu, Jiafeng Li, Jia Song, Wensheng Xiang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出CMADiff框架,通过条件变分自编码器整合理化特征,并利用对比学习模块BioAligner对齐文本描述与蛋白质特征,实现基于文本驱动的可控蛋白质序列生成。

Comments Further improvement is needed in the content

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-27 cs.LG cs.RO 版本更新 67%

Temporally Centered SIGReg Improves LeWorldModel Representations for Robot Policy Learning

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Zeyu Ping, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21636 2026-08-27 cs.LG cs.AI 版本更新 50%

Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models

测量依赖差距:诊断表格生成模型中的列间保真度

Jie Zhang

机构 * Accenture Japan(埃森哲日本公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究表格生成模型列间保真度,引入依赖感知保真度诊断方法,分解XGB-C2ST测试,应用于TabbyFlow/EF-VFM发现标准指标遗漏的依赖差距,探讨差距原因,表明是缺乏直接依赖监督,非容量或结构问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31362 2026-08-27 astro-ph.CO gr-qc hep-ph hep-th 版本更新 50%

Running into tension: primordial black holes from ultra-slow-roll inflation, spectral running, and the Hubble tension

陷入紧张:来自超慢滚暴涨的原初黑洞、谱运行和哈勃紧张

Miguel A. Sabogal, Antonio J. Iovino, Sunny Vagnozzi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究超慢滚暴涨模型预测的负谱运行与ACT CMB数据中正运行提示之间的紧张关系,并分析早期暗能量等新物理对谱运行及原初黑洞模型可行性的影响。

Comments 25 pages, 9 sub-figures arranged into 5 figures. v2: additional references added, minor changes to the abstract to better clarify regime of applicability of results, minor changes in the text, added a new Fig. 1 to better clarify the relevant physics. Version accepted for publication in PRD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16382 2026-08-27 quant-ph 版本更新 50%

Temporal-order-controlled Parrondo reversal in a periodically switched quantum walk acting on NEQR image states

量子图像加密中的帕尔伦多悖论

Łukasz Pawela

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于离散时间量子行走的量子图像加密方案,利用帕尔伦多悖论提升加密性能,实现高熵和低相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10194 2026-08-27 math.PR math.AP 版本更新 50%

Kinetic Theory with Fluctuations: Well-Posedness of The Vlasov--Fokker--Planck--Dean--Kawasaki Equations

含涨落的动理学理论:Vlasov-Fokker-Planck-Dean-Kawasaki 系统的强适定性

Zimo Hao, Zhengyan Wu, Johannes Zimmer

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究含相关噪声的 Vlasov-Fokker-Planck-Dean-Kawasaki 方程的强适定性,通过动理学半群估计和重整化动理学解框架,克服了动理学算子复杂性和保守噪声带来的不规则性。

Comments The previous version contained an error in Section 6, which revealed an additional challenge in the whole-space setting. This issue has been addressed in the revised version, and the resulting conclusion differs from that of the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20412 2026-08-27 cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

Active Learning of a Neural Network Potential for Large-Scale Atomistic Simulations of Polymer Electrolyte Membranes

用于聚合物电解质膜大规模原子模拟的神经网络势的主动学习

Yuta Yoshimoto, Naoki Matsumura, Meguru Yamazaki, Yuto Iwasaki, Hiroshi Nakao, Yasufumi Sakai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究采用主动学习工作流构建深度势模型,实现了含10000-20000个原子的Nafion体系长达31 ns的稳定MD模拟,提升了输运性质预测精度,拓展了水合度适用范围,为大规模原子模拟提供了高效方法。

Comments 53 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 4 篇

2607.00609 2026-08-27 cs.CV 版本更新 79%

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication

基于扩散的多类正态性用于OOD检测:在CDP认证中的应用

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * CNRS(法国国家科学研究中心) INSA Lyon(里昂国立应用科学学院) LIRIS, UMR 5205(LIRIS实验室,UMR 5205)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散多类正态性框架,用单一条件ControlNet训练于多类真实CDP,通过重构误差检测伪造,并引入双模板掩码提升性能。

Comments IEEE International Conference on Advanced Visual And Signal-Based Systems, Aug 2026, Lecce, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20803 2026-08-27 cs.CV 版本更新 79%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-27 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: this https URL (https://github.com/boschresearch/TASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-08-27 cs.RO 版本更新 50%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Shiqin Dai, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 13 pages, 5 figures, 8 tables. Project page: this https URL (https://advanced-robotics-lab.github.io/SANTS/)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 1 篇

2604.11521 2026-08-27 cs.LG cs.CV 版本更新 70%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2608.08638 2026-08-27 cs.SD cs.AI cs.CL 版本更新 50%

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

CuteTTS:基于连续隐变量自回归建模的高效高保真语音合成

Yuqian Zhang, Yao Shi, Kexin Huang, Botian Jiang, Zhe Xu, Yiwei Zhao, Min Liang, Shuang Chen, Xipeng Qiu, Yu-Gang Jiang

机构 * Shanghai Innovation Institute(上海创新研究院) OPPO AI Center(OPPO人工智能中心) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 CuteTTS是结合语义对齐因果VAE隐变量等的连续自回归TTS系统,经引导步蒸馏后,在保持相当质量的同时降低了延迟,实现了高保真与低延迟的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19377 2026-08-27 cs.LG cs.AI 版本更新 50%

Emyx: Fast and efficient all-atom protein generation

Emyx: 快速高效的全原子蛋白质生成

Nicholas J. Williams, Ward Haddadin, Matteo P. Ferla, Constantin Schneider, Nicholas B. Woodall, Ruby Sedgwick, Christian D. Madsen, Andrew L. Hopkins, Douglas E. V. Pires, Edward O. Pyzer-Knapp

机构 * Xyme

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出Emyx,一种140M参数的流匹配模型,通过轻量条件表示和稀疏连接降低复杂度,在酶设计基准上超越现有方法,训练仅需682 GPU小时。

详情

展开后加载摘要…

URL PDF HTML 收藏