arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-11 至 2025-12-11 共收录 51 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2512.09814 2025-12-11 cs.CV 88%

DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation

DynaIP: 动态图像提示适配器用于可扩展的零样本个性化文本到图像生成

Zhizhong Wang, Tianyi Chu, Zeyi Huang, Nanyang Wang, Kehan Li

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 DynaIP通过动态解耦策略和层次特征融合模块,提升零样本个性化文本到图像生成的细粒度概念保真度与多主体扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 86%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09081 2025-12-11 cs.CV 83%

AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models

AgentComp: 从代理推理到文本-图像模型中的组合性 mastery

Arman Zarei, Jiacheng Pan, Matthew Gwilliam, Soheil Feizi, Zhenheng Yang

机构 * TikTok University of Maryland(马里兰大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 AgentComp通过训练模型区分组合性相似的提示和图像,提升文本-图像模型的组合性生成能力,实现更准确的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2510.03506 2025-12-11 cs.AI 75%

OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows

OneFlow:并发混合模态与交错生成的编辑流

John Nguyen, Marton Havasi, Tariq Berrada, Luke Zettlemoyer, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化技术研究所、格勒诺布尔理工大学、LJK、法国)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 OneFlow是一种非自回归多模态模型,通过编辑流和流匹配实现并发混合模态生成,优于自回归和扩散方法,提升生成效率和推理能力。

Comments https://oneflow.framer.ai

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 33 篇

2503.08250 2025-12-11 cs.CV cs.AI cs.LG 87%

Aligning Text to Image in Diffusion Models is Easier Than You Think

在扩散模型中将文本对齐到图像比你想象的更容易

Jaa-Yeon Lee, Byunghee Cha, Jeongsol Kim, Jong Chul Ye

机构 * Kim Jaechul Graduate School of AI, KAIST(金佳哲人工智能研究生院,韩国科学技术院) Department of Bio and Brain Engineering, KAIST(生物与脑工程系,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 本文提出SoftREPA方法,通过对比学习提升文本与图像表示的对齐效果,减少计算开销,增强语义一致性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09247 2025-12-11 cs.CV 83%

OmniPSD: Layered PSD Generation with Diffusion Transformer

OmniPSD:基于扩散变换器的分层PSD生成

Cheng Liu, Yiren Song, Haofan Wang, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Lovart AI

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 OmniPSD通过扩散变换器实现文本到PSD生成和图像到PSD分解,提升分层设计的生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09871 2025-12-11 cs.CV 79%

Diffusion Posterior Sampler for Hyperspectral Unmixing with Spectral Variability Modeling

具有光谱变异性建模的扩散后验采样器用于超光谱解混

Yimin Zhu, Lincoln Linlin Xu

机构 * Department of Geomatics Engineering, University of Calgary, Calgary, Canada(测绘工程系,卡尔加里大学,卡尔加里,加拿大)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPS4Un通过扩散后验采样器和超像素技术,改进超光谱解混中的光谱变异性建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09477 2025-12-11 cs.CV cs.AI 79%

Color encoding in Latent Space of Stable Diffusion Models

扩散模型潜在空间中的颜色编码

Guillem Arias, Ariadna Solà, Martí Armengod, Maria Vanrell

机构 * Computer Vision Center / Universitat Autònoma de Barcelona(计算机视觉中心 / 巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了Stable Diffusion模型中颜色在潜在空间中的编码机制,揭示了颜色、亮度和形状在不同潜在通道中的表示方式,为生成模型的理解与改进提供了新视角。

Comments 6 pages, 8 figures, Color Imaging Conference 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09418 2025-12-11 cs.CV 79%

Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis

无标签的运动条件化扩散模型用于心脏超声合成

Zhe Li, Hadrien Reynaud, Johanna P Müller, Bernhard Kainz

机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃尔朗根-纽伦堡大学) Department of Computing, Imperial College London(计算系,伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无标签的运动条件化扩散模型,通过自监督运动特征生成逼真的心脏超声视频,无需手动标注。

Comments Accepted at MICAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09660 2025-12-11 cs.LG cs.AI cs.CV 79%

Learning What Matters: Steering Diffusion via Spectrally Anisotropic Forward Noise

学习关键要素:通过频谱各向异性前向噪声引导扩散

Luca Scimeca, Thomas Jiralerspong, Berton Earnshaw, Jason Hartford, Yoshua Bengio

机构 * Mila - Quebec AI Institute and Université de Montréal(蒙特利尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出频谱各向异性高斯扩散(SAGD),通过调整前向噪声的频谱特性,提升扩散模型对目标分布的适应能力,并在多个视觉数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08999 2025-12-11 cs.CV 79%

Diffusion Model Regularized Implicit Neural Representation for CT Metal Artifact Reduction

扩散模型正则化的隐式神经表示用于CT金属伪影抑制

Jie Wen, Chenhe Du, Xiao Wang, Yuyao Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合扩散模型和隐式神经表示的框架,用于改进CT图像中金属伪影的抑制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09572 2025-12-11 physics.flu-dyn cs.AI math.DS nlin.CD physics.ao-ph 78%

Lazy Diffusion: Mitigating spectral collapse in generative diffusion-based stable autoregressive emulation of turbulent flows

懒扩散:缓解生成扩散基稳定自回归湍流模拟中的频谱崩溃

Anish Sambamurthy, Ashesh Chattopadhyay

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出懒扩散方法,通过引入幂律噪声计划和分数几何,缓解生成扩散模型在湍流模拟中的频谱崩溃问题,实现更稳定的自回归预测和物理真实的惯性范围缩放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09426 2025-12-11 math.AP math-ph math.MP 78%

Fractional calculus approach to models of adsorption: Barrier-diffusion control

分数阶方法用于吸附模型:屏障-扩散控制

Ivan Bazhlekov, Emilia Bazhlekova

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用分数阶方法分析吸附模型,通过转换方程减少参数并推导出吸附和表面张力的渐近解,展示了 Henry 模型作为通用一阶近似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09136 2025-12-11 math.PR 78%

On the Green's functions and Martin boundary structure of a planar diffusion in a discontinuous layered medium

关于平面扩散在不连续分层介质中格林函数和马丁边界结构的研究

Sandro Franceschi, Irina Kourkova, Maxence Petit

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究了平面扩散在不连续分层介质中的格林函数和马丁边界结构,推导了格林函数的拉普拉斯变换并确定了马丁边界。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15731 2025-12-11 cs.CL cs.AI 78%

Attention Sinks in Diffusion Language Models

扩散语言模型中的注意力汇

Maximo Eduardo Rulli, Simone Petruzzi, Edoardo Michielon, Fabrizio Silvestri, Simone Scardapane, Alessio Devoto

机构 * Sapienza University of Rome(罗马大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了扩散语言模型中的注意力汇现象,发现其注意力位置在生成过程中动态变化,且对掩码具有鲁棒性,揭示了与自回归模型的不同特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04852 2025-12-11 stat.ML cs.LG 78%

Diffusion Secant Alignment for Score-Based Density Ratio Estimation

基于差分分量对齐的分数密度比估计

Wei Chen, Shigui Li, Jiacheng Li, Jian Xu, Zhiqi Lin, Junmei Yang, Delu Zeng, John Paisley, Qibin Zhao

机构 * South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学) AIP, RIKEN(AIP与RIKEN)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ISA-DRE通过将切线替换为secant,提升密度比估计的稳定性与效率,有效缓解密度峡谷问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09790 2025-12-11 cs.CL cs.LG 78%

Constrained Discrete Diffusion

受约束的离散扩散

Michael Cardei, Jacob K Christopher, Thomas Hartvigsen, Bhavya Kailkhura, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 受约束的离散扩散通过在扩散过程中直接施加约束,实现无训练的可控生成,优于现有方法。

Comments Published at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00180 2025-12-11 cs.LG stat.ML 78%

Spectral Analysis of Diffusion Models with Application to Schedule Design

扩散模型的频谱分析及其在调度设计中的应用

Roi Benita, Michael Elad, Joseph Keshet

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Technion(技术学院) Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过频谱分析方法,提出了一种基于数据频谱特性的噪声调度设计方法,为扩散模型的推理过程提供了理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12079 2025-12-11 cs.SE 78%

Directional Diffusion-Style Code Editing Pre-training

方向性扩散-风格代码编辑预训练

Qingyuan Liang, Zeyu Sun, Qihao Zhu, Junhao Hu, Yifan Zhao, Yizhou Chen, Mingxuan Zhu, Guoqing Wang, Lu Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DivoT5通过方向扩散方法提升代码编辑预训练效果,实现多个任务的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09059 2025-12-11 cs.LG 78%

A Diffusion-Based Framework for High-Resolution Precipitation Forecasting over CONUS

基于扩散的高分辨率降水预报框架

Marina Vicens-Miquel, Amy McGovern, Aaron J. Hill, Efi Foufoula-Georgiou, Clement Guilloteau, Samuel S. P. Shen

机构 * University of Oklahoma, School of Meteorology, Norman, Oklahoma(俄克拉荷马大学气象学院) University of Oklahoma, School of Computer Science, Norman, Oklahoma(俄克拉荷马大学计算机科学学院) NSF AI Institute for Research on Trustworthy AI in Weather, Climate, and Coastal Oceanography, Norman, Oklahoma(国家科学基金会可信人工智能研究机构) University of California Irvine, Irvine, California(加州大学伊维德分校) San Diego State University, San Diego, California(圣地亚哥州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的深度学习框架,通过比较三种残差预测策略,提升高分辨率降水预报的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09031 2025-12-11 astro-ph.GA 78%

Core-wing transitions and the breakdown of diffusion in Lyman-$α$ radiative transfer

Lyman-α辐射传输中的核心-翼过渡与扩散破坏

Kevin Lorinc, Aaron Smith, Olof Nebrin, Joshua Kasiri

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出更符合物理的Lyman-α辐射传输核心-翼过渡定义,揭示了扩散近似在特定频率和光学深度下的失效,并通过分析展示了异常的空间扩散行为。

Comments 16 pages, 20 figures. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22563 2025-12-11 math.AP 71%

Diffusion operators on $p$-adic analytic manifolds

$p$-adic分析流形上的扩散算子

Patrick Erik Bradley

专题命中 扩散模型 :diffusion(title)

AI总结 本文在$p$-adic分析流形上构造了拉普拉斯积分算子的核函数,并通过维拉米罗夫-塔伊博松型算子研究了热方程的解及有限域上椭圆曲线点数的计算方法。

Comments 27 pages, 2 figures; v2 is a substantial revision, more general plus added application to elliptic curves with good reduction; v3 is due to an erroneous factor of 2 vs. simply citing A. Weil's book which substantially simplifies a proof, the consequent adaptation to this "missing" factor two thus became necessary; v4 now has a slight change of equalising number

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05802 2025-12-11 cs.CV 57%

Bring Your Dreams to Life: Continual Text-to-Video Customization

让梦想成真:持续文本到视频定制

Jiahua Dong, Xudong Wang, Wenqi Liang, Zongyan Han, Meng Cao, Duzhen Zhang, Hanbin Zhao, Zhi Han, Salman Khan, Fahad Shahbaz Khan

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CCVD模型,通过解决持续学习中的遗忘和概念忽视问题,实现文本到视频的持续定制生成。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22787 2025-12-11 cs.CV 57%

World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models

世界在框架中:将文化混合视为视觉语言模型的新挑战

Eunsu Kim, Junyeong Park, Na Min An, Junseong Kim, Hitesh Laxmichand Patel, Jiho Jin, Julia Kruk, Amit Agarwal, Srikant Panda, Fenal Ashokbhai Ilasariya, Hyunjung Shim, Alice Oh

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CultureMix基准,研究文化混合对视觉语言模型的影响,发现模型在混合场景中表现不佳,通过监督微调提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14006 2025-12-11 cs.GR 57%

Im2SurfTex: Surface Texture Generation via Neural Backprojection of Multi-View Images

Im2SurfTex:通过神经反投影多视角图像生成表面纹理

Yiangos Georgiou, Marios Loizou, Melinos Averkiou, Evangelos Kalogerakis

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 Im2SurfTex通过神经反投影多视角图像生成高质量3D表面纹理,提升纹理连续性和高分辨率生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09768 2025-12-11 cs.CV eess.IV 57%

Tokenizing Motion: A Generative Approach for Scene Dynamics Compression

基于运动模式的视频压缩生成方法

Shanzhi Yin, Zihan Zhang, Bolin Chen, Shiqi Wang, Yan Ye

机构 * City University of Hong Kong(香港城市大学) Alibaba DAMO Academy(阿里巴巴达摩院) Hupan Lab(华平实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于运动模式先验的生成式视频压缩方法,通过流驱动扩散模型实现高质量重建和超低比特率通信。

Comments 5page, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08987 2025-12-11 cs.CV cs.AI 57%

3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization

3DID: 基于物理感知优化的直接三维逆向设计

Yuze Hao, Linchao Zhu, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能状态关键实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 3DID提出一种基于物理感知优化的直接三维逆向设计框架,通过连续潜在表示和两阶段优化策略生成高保真的三维几何结构,提升设计质量和灵活性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09725 2025-12-11 astro-ph.EP astro-ph.GA astro-ph.SR 50%

Numerical simulations of astrophysical dynamos and applications to giant planets

恒星动力学的数值模拟及其在巨行星中的应用

Albert Elias-López

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过数值模拟探讨了自激发电机在星际介质和巨行星内部的作用,分析了磁场演化及行星磁性特征。

Comments PhD thesis manuscript, defended on 15th September 2025, 222 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09691 2025-12-11 physics.optics 50%

Self-Hybridized Exciton-Polariton Photodetectors From Layered Metal-Organic Chalcogenolates

自杂化极子光探测器:基于层状金属有机硫化物

Bongjun Choi, Adam D. Alfieri, Wangleong Chen, Deep Jariwala

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于层状金属有机硫化物开发出无需顶部镜面的自杂化极子光探测器,通过多模极子工程实现子带间隙光子检测,提升光-暗电流比2.38倍,展现极子增强光探测的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09590 2025-12-11 math.PR q-fin.MF 50%

On Inhomogeneous Affine Volterra Processes: Stationarity and Applications to the Volterra Heston Model

关于非均匀仿射Volterra过程:平稳性及在Volterra Heston模型中的应用

Emmanuel Gnabeyeu, Gilles Pagès, Mathieu Rosenbaum

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了非均匀仿射Volterra过程的有限时间平稳性,提出假平稳Volterra Heston模型并推导其特征函数,揭示长期行为中平稳分布的存在性及初始状态的影响。

Comments 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏