arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-21 至 2025-11-21 共收录 50 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2510.22946 2025-11-21 cs.CV 77%

LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation

LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成

Zeyu Wang, Zilong Chen, Chenhui Gou, Feng Li, Chaorui Deng, Deyao Zhu, Kunchang Li, Weihao Yu, Haoqin Tu, Haoqi Fan, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Tsinghua University(清华大学) Monash University(墨尔本大学) ByteDance Seed Project(字节跳动种子项目)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17534 2025-11-21 cs.CV cs.CL cs.MM 73%

Co-Reinforcement Learning for Unified Multimodal Understanding and Generation

协同强化学习用于统一多模态理解和生成

Jingjing Jiang, Chongjie Si, Jun Luo, Hanwang Zhang, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoRL框架,通过协同强化学习提升多模态大语言模型在生成与理解任务上的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16038 2025-11-21 cs.HC 50%

Panel-by-Panel Souls: A Performative Workflow for Expressive Faces in AI-Assisted Manga Creation

面板式灵魂:一种用于AI辅助漫画创作中表现力面部的表演性工作流程

Qing Zhang, Jing Huang, Yifei Huang, Jun Rekimoto

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出了一种交互式工作流程,用于AI辅助漫画创作中表现力面部的生成,通过双混合流程实现艺术家意图与AI执行的高效衔接。

Comments NeurIPS 2025 Creative AI Track, The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 40 篇

2507.00459 2025-11-21 cond-mat.mtrl-sci cs.AI 85%

Parameter-aware high-fidelity microstructure generation using stable diffusion

基于稳定扩散的参数感知高保真微结构生成

Hoang Cuong Phan, Minh Tien Tran, Chihun Lee, Hoheok Kim, Sehyeok Oh, Dong-Kyu Kim, Ho Won Lee

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于稳定扩散3.5大模型的参数感知微结构生成方法,通过数值感知嵌入和微调技术实现高保真微结构生成,验证了其在材料设计中的有效性。

Comments 46 pages, 27 figures, 6 tables, 3rd Word Congress on Artificial Intelligence in Materials & Manufacturing 2025

Journal ref Adv. Eng. Inform. (2025), 104080

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16317 2025-11-21 cs.CV 83%

NaTex: Seamless Texture Generation as Latent Color Diffusion

NaTex: 无缝纹理生成作为潜在颜色扩散

Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Xin Yang, Xin Huang, Jingwei Huang, Xiangyu Yue, Chunchao Guo

机构 * MMLab, CUHK(CUHK多媒体实验室) Tencent Hunyuan(腾讯文生)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 NaTex通过直接在3D空间中预测纹理颜色,提出潜在颜色扩散方法,实现高效且一致的纹理生成与重建。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17957 2025-11-21 cs.CV cs.AI cs.GR cs.LG 81%

ArchComplete: Autoregressive 3D Architectural Design Generation with Hierarchical Diffusion-Based Upsampling

ArchComplete: 基于分层扩散上采样的自回归3D建筑生成

S. Rasoulzadeh, M. Bank, I. Kovacic, K. Schinegger, S. Rutzinger, M. Wimmer

机构 * TU Wien, Center for Geometry and Computational Design(维也纳技术大学,几何与计算设计中心) University of Innsbruck, Department of Design, i.sd | Structure and Design(因斯布鲁克大学,设计系,i.sd | 结构与设计)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 ArchComplete通过自回归和分层扩散上采样生成高精度3D建筑模型,实现高质量、多样性和高效性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16662 2025-11-21 cs.CV 79%

TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing

TriDiff-4D:通过基于扩散的三平面重定位实现快速4D生成

Eddie Pokming Sheung, Qihao Liu, Wufei Ma, Prakhar Kaushik, Jianwen Xie, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Lambda Inc(Lambda公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TriDiff-4D通过基于扩散的三平面重定位技术,实现高效可控的4D虚拟人物生成,显著提升生成质量和效率。

Comments 8 pages, 10 figures, Under review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16642 2025-11-21 cs.CV 79%

TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming

TRIM:基于时间和空间剪裁的可扩展3D高斯扩散推断

Zeyuan Yin, Xiaoming Liu

机构 * Department of Computer Science and Engineering, Michigan State University(计算机科学与工程系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TRIM通过引入时间和空间剪裁策略,提升3D高斯扩散模型的推断效率与生成质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04470 2025-11-21 cs.CV cs.AI 79%

DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks

DiffuSyn Bench: 评估视觉-语言模型在现实世界复杂性中的能力,通过扩散生成的合成基准

Haokun Zhou, Yipeng Hong

机构 * Imperial College London(伦敦帝国理工学院) Shanghai University(上海大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 DiffuSyn Bench通过扩散生成的合成基准评估视觉-语言模型在现实世界复杂性中的能力,揭示其区分AI与人类图像的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16161 2025-11-21 cs.CV 79%

Simba: Towards High-Fidelity and Geometrically-Consistent Point Cloud Completion via Transformation Diffusion

Simba: 通过变换扩散实现高保真的几何一致点云补全

Lirui Zhang, Zhengkai Zhao, Zhi Zuo, Pan Gao, Jie Qin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Simba通过变换扩散方法,结合对称先验和扩散模型,实现高保真的点云补全,解决传统方法的过拟合和噪声敏感问题,取得最先进性能。

Comments Accepted for publication at the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16117 2025-11-21 cs.CV 79%

Decoupling Complexity from Scale in Latent Diffusion Model

在潜在扩散模型中解耦复杂度与尺度

Tianxiong Zhong, Xingye Tian, Xuebo Wang, Boyuan Jiang, Xin Tao, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DCS-LDM通过解耦信息复杂度与尺度,实现灵活的计算-质量权衡和多尺度视觉生成。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03329 2025-11-21 cs.CV 79%

FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing

FLUX-Text: 一种简单且先进的扩散变换器基线用于场景文本编辑

Rui Lan, Yancheng Bai, Xu Duan, Mingxing Li, Dongyang Jin, Ryan Xu, Dong Nie, Lei Sun, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FLUX-Text通过轻量级模块和两阶段训练策略,实现了高效多语言场景文本编辑,提升视觉质量和文本保真度。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01406 2025-11-21 cs.CV cs.CR cs.LG 79%

VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models

VIDSTAMP:一种时间感知的水印用于视频扩散模型中的所有权和完整性

Mohammadreza Teymoorianfard, Siddarth Sitaraman, Shiqing Ma, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Brown University(布朗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidStamp通过帧级信息嵌入和动态控制信号实现高容量、低感知影响的视频水印,提升视频扩散模型的版权和完整性保障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16599 2025-11-21 stat.ML cs.LG 78%

Time dependent loss reweighting for flow matching and diffusion models is theoretically justified

时间依赖性损失再加权用于流匹配和扩散模型的理论合理性

Lukas Billera, Hedwig Nora Nordlinder, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(微生物学、肿瘤与细胞生物学系,卡罗林斯卡研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文理论证明了时间依赖性损失加权在流匹配和扩散模型中的合理性,展示了其在稳定训练和简化模型构建中的作用。

Comments 19 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16571 2025-11-21 cs.LG 78%

Boosting Predictive Performance on Tabular Data through Data Augmentation with Latent-Space Flow-Based Diffusion

通过潜在空间流基于扩散方法的数据增强提升表格数据的预测性能

Md. Tawfique Ihsan, Md. Rakibul Hasan Rafi, Ahmed Shoyeb Raihan, Imtiaz Ahmed, Abdullahil Azeem

机构 * Md. Tawfique Ihsan(独立研究者) Md. Rakibul Hasan Rafi(独立研究者) Ahmed Shoyeb Raihan(独立研究者) Imtiaz Ahmed(独立研究者) Abdullahil Azeem(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于潜在空间和树驱动扩散的方法,通过数据增强提升表格数据预测性能,实现高召回率和隐私保护。

Comments 35 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16415 2025-11-21 astro-ph.CO 78%

Denoising weak lensing mass maps with diffusion model and generative adversarial network

利用扩散模型和生成对抗网络去噪弱引力透镜质量图

Shohei D. Aoyama, Ken Osato, Masato Shirasaki

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的WL去噪方法,证明其在信号增强、训练稳定性及统计恢复方面优于生成对抗网络。

Comments Accepted to Machine Learning and the Physical Sciences Workshop, NeurIPS 2025; short version in the NeurIPS workshop paper format, full version available at arXiv:2505.00345

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16287 2025-11-21 cs.LG 78%

Graph Diffusion Counterfactual Explanation

图扩散反事实解释

David Bechtoldt, Sidney Bender

机构 * Machine Learning Group(机器学习组) TU Berlin(柏林技术大学) BASLEARN-TU Berlin/BASF Joint Laboratory(柏林技术大学/巴斯夫联合实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出图扩散反事实解释框架,结合离散扩散模型和分类器无关引导,有效生成图数据的反事实解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19081 2025-11-21 cs.CL 78%

Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement

Arg-LLaDA:通过大语言扩散模型和充分性感知细化进行论点摘要

Hao Li, Yizheng Sun, Viktor Schlegel, Kailai Yang, Riza Batista-Navarro, Goran Nenadic

机构 * The University of Manchester, UK(曼彻斯特大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Arg-LLaDA通过大语言扩散模型和充分性感知细化方法,提升论点摘要的准确性与连贯性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00236 2025-11-21 cs.RO 78%

Sim2Real Diffusion: Leveraging Foundation Vision Language Models for Adaptive Automated Driving

Sim2Real Diffusion:利用基础视觉语言模型实现自适应自动驾驶

Chinmay Vilas Samak, Tanmay Vilas Samak, Bing Li, Venkat Krovi

机构 * Department of Automotive Engineering, Clemson University International Center for Automotive Research (CU-ICAR)(汽车工程系,克莱姆森大学国际汽车研究中心(CU-ICAR))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Sim2Real Diffusion框架,利用基础视觉语言模型实现自动驾驶的跨领域适应,通过条件潜在扩散提升sim2real转换性能。

Comments Accepted in IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 1, pp. 177-184, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16207 2025-11-21 cs.LG 78%

Towards Overcoming Data Scarcity in Nuclear Energy: A Study on Critical Heat Flux with Physics-consistent Conditional Diffusion Model

迈向核能领域克服数据稀缺:基于物理一致条件扩散模型的临界热流研究

Farah Alsafadi, Alexandra Akins, Xu Wu

机构 * Department of Nuclear Engineering, North Carolina State University Burlington Engineering Laboratories(核工程系,北卡罗来纳州立大学伯灵顿工程实验室) Laboratory for Reactor Physics(反应堆物理实验室) Thermal-Hydraulics, Center for Nuclear Engineering(热工实验室,核工程中心) Sciences, Paul Scherrer Institute(科学,保罗·施特格研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于物理一致条件扩散模型生成核能领域临界热流数据,以克服数据稀缺问题并提高预测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16157 2025-11-21 math.AP 78%

Spreading Properties of a City-Road Reaction-Diffusion Model on One-Dimensional Lattice

一维晶格上城市-道路反应-扩散模型的传播特性

Grégory Faye, Jean-Michel Roquejoffre, Min Zhao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种描述生物入侵的反应-扩散模型,研究其在一维晶格上的传播特性,并在快速扩散情况下推导出具有类似经典Fisher-KPP特性的渐近模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16059 2025-11-21 cond-mat.mtrl-sci 78%

Extending SLUSCHI for Automated Diffusion Calculations

扩展SLUSCHI用于自动化扩散计算

Qi-Jun Hong, Qing Chen, Ligen Wang, Dallin Fisher, Audrey CampBell, Si-Da Xue, Linqin Mu, Noemi Leick, Seetharaman Sridhar

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 扩展SLUSCHI用于自动化基于第一性原理分子动力学的扩散计算,通过改进的工作流和后处理工具,实现对金属和氧化物中扩散系数和粘度的高通量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15550 2025-11-21 cs.RO 78%

UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware Diffusion Policy

UltraDP: 通用的颈动脉超声扫描与力感知扩散策略

Ruoqu Chen, Xiangjie Yan, Kangchen Lv, Gao Huang, Zheng Li, Xiang Li

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Surgery, Chow Yuk Ho Technology Centre for Innovative Medicine, Li Ka Shing Institute of Health Science and Multi-scale Medical Robotics Center, The Chinese University of Hong Kong, Hong Kong(外科系,创新医学技术中心,利文斯科健康科学研究所及多尺度医学机器人中心,香港中文大学,香港)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 UltraDP通过力感知扩散策略实现通用颈动脉超声扫描,利用多感官输入和混合控制器提高扫描成功率至95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12911 2025-11-21 cs.AI cs.LG 78%

Constraint-Guided Prediction Refinement via Deterministic Diffusion Trajectories

通过确定性扩散轨迹实现约束引导的预测细化

Pantelis Dogoulis, Fabien Bernier, Félix Fourreau, Karim Tit, Maxime Cordy

机构 * University of Luxembourg(卢森堡大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种通用的约束感知预测细化框架,利用DDIMs通过确定性扩散轨迹和约束梯度校正,提升约束满足和性能,适用于非凸和非线性等式约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14934 2025-11-21 math.AP 78%

Layer dynamics for the Allen-Cahn equation with nonlinear phase-dependent diffusion

Allen-Cahn方程中非线性相依赖扩散的层动力学

José Alejandro Butanda Mejía, Daniel Castañon Quiroz, Raffaele Folino, Luis Fernando Lopez Ríos

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有非线性相依赖扩散的Allen-Cahn方程的亚稳态动力学,推导了描述其缓慢演化的常微分方程系统,并扩展了经典Allen-Cahn方程的分析方法。

Comments 30 pages, 2 figures

Journal ref Discrete Contin. Dyn. Syst., 48 (2026), 1-29

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07071 2025-11-21 q-fin.TR cs.AI cs.LG q-fin.CP 78%

TRADES: Generating Realistic Market Simulations with Diffusion Models

TRADES: 使用扩散模型生成逼真市场模拟

Leonardo Berti, Bardh Prenkaj, Paola Velardi

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TRADES通过基于变换器的扩散模型生成逼真市场模拟,提升合成数据在金融任务中的应用价值。

Comments 8 pages

Journal ref ECAI 2025. Volume 413: Pages 3703 - 3710

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08945 2025-11-21 cs.CY cs.SE physics.soc-ph 71%

Who is using AI to code? Global diffusion and impact of generative AI

谁在使用AI来编程?生成式AI的全球扩散与影响

Simone Daniotti, Johannes Wachs, Xiangnan Feng, Frank Neffke

专题命中 扩散模型 :diffusion(title)

AI总结 研究通过分析AI生成代码的全球扩散情况,发现其在提升生产率和拓展开发领域方面的作用,但经验丰富的程序员从中获益更多,加剧了技能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15428 2025-11-21 math.AP math.OC 71%

Optimizing Resource Distribution in a One-Dimensional Logistic Diffusion Model

在一维逻辑扩散模型中优化资源分布

Junyoung Heo, Yubin Lee

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出了一种块分解方法,用于在一维逻辑扩散模型中优化资源分布,通过分析优势函数的凸性来确定最优控制策略。

Comments 24 pages, 5 figures. Acknowledgments added

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08073 2025-11-21 cs.CV 57%

Seeing Beyond Haze: Generative Nighttime Image Dehazing

超越雾霾:生成式夜间图像去雾

Beibei Lin, Stephen Lin, Robby Tan

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 BeyondHaze通过生成式模型提升夜间图像去雾效果,结合强背景先验和引导训练,实现雾霾和光晕下的清晰重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07503 2025-11-21 cs.CV 57%

Event Stream Filtering via Probability Flux Estimation

基于概率流估计的事件流过滤

Jinze Chen, Wei Zhai, Yang Cao, Bin Li, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 EDFilter通过概率流估计实现事件流过滤,提升事件数据的实时处理与连续辐照度动态重建能力。

详情

展开后加载摘要…

URL PDF HTML 收藏