arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 215 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 158 篇

2608.27349 2026-09-01 cond-mat.supr-con 版本更新 50%

High-Temperature Superconductivity of the Fe-Se-H compound

Fe-Se-H化合物的高温超导性

S. I. Bondarenko, A. A. Prokhorov, N. N. Galtsov, V. P. Timofeev, V. P. Koverya, I. S. Bondarenko, A. V. Krevsun

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过EPR谱仪测量证实,经氢热扩散制备的Fe-Se-H化合物,在常压下于3.6-25 K及室温295 K均呈现超导性,拓展了铁基化合物的超导温度范围。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09904 2026-09-01 quant-ph physics.optics 版本更新 50%

Surface passivation for narrowing optical linewidth of silicon T centers in nanophotonic devices

用于缩小纳米光子器件中硅T中心光学线宽的表面钝化

Fariba Islam, Chang-Min Lee, Kyu-Young Kim, Sorah Fischer, Purbita Purkayastha, Amirehsan Alizadehherfati, Edo Waks

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究采用原子层沉积Al₂O₃钝化硅表面,最多将纳米光子器件中硅T中心的光学线宽降低57%,为产生不可区分光子提供了CMOS兼容的路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03438 2026-09-01 physics.flu-dyn 版本更新 50%

Modelisation of chaotic systems with a latent Stochastic Differential Equation

基于隐式随机微分方程的混沌系统建模

Ismaël Zighed, Nicolas Thome, Patrick Gallinari, Taraneh Sayadi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究针对混沌系统提出概率非侵入式降阶模型,用非线性自编码器结合隐空间SDE建模,生成的轨迹保留统计特性,为混沌研究提供可靠替代方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01650 2026-09-01 math.NT math-ph math.MP 版本更新 50%

Algebraic Wave Fields and Self-Regulating Field Theories: The Emergence of Spacetime from Rational Chirp Rings

从无背景流形的原始波场构建自调节场理论:坐标连续统的涌现

Terence R. Smith

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出无背景流形的数学框架,从原始波场导出时空坐标连续统与自调节场,消除点状场相互作用的数学发散,证明紫外灾难源于经典扩散方程的点状表示。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22626 2026-09-01 cond-mat.stat-mech cond-mat.dis-nn quant-ph 版本更新 50%

Continuous-Time Random Walk Description of Anomalous Spin Transport in Dilute Dipolar Networks

稀磁偶极网络中反常自旋输运的连续时间随机游走描述

Cooper M. Selco, Christian Bengs, Ashok Ajoy

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究稀磁偶极网络中反常自旋输运,用连续时间随机游走描述¹³C极化输运,构建速率矩阵并采样轨迹。发现无序平均动力学致反常输运,分析等待时间分布等特征,追溯微观起源,联系全局输运与穿越时间,表明需超越菲克扩散方程的描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01777 2026-09-01 eess.SP cs.AI 版本更新 50%

Scene-Conditioned PINN-GNN for Multipath RF Maps: Cross-Scene Generation and In-Scene Completion

场景条件PINN-GNN用于多径射频地图:跨场景生成与场景内补全

Lizhou Liu, Xiaohui Chen, Zihan Tang, Mengyao Ma, Wenyi Zhang

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Wireless Technology Lab, Huawei(华为无线技术实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出基于物理信息神经网络和图神经网络的统一射频地图构建框架,支持跨场景生成和场景内补全,采用峰值加权动态时间弯曲度量评估多径重建质量,实验表明优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16417 2026-09-01 cs.SD eess.AS 版本更新 50%

Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning

Joycent: 基于扩散的口音语音合成,无需口音音素预测

Xintong Wang, Junchuan Zhao, Ye Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出Joycent,一种基于扩散模型的口音TTS方法,直接从标准音素序列和语音参考合成口音语音,无需口音音素预测,通过条件层归一化集成口音和说话人表征,并引入WhisAID口音识别模型,在保持说话人身份的同时提升口音自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07569 2026-09-01 cs.LG 版本更新 50%

TriHead-GAN: A Generative Adversarial Network with Triple-Head Discriminator for Carbon Emission Time Series Generation

TriHead-GAN: 一种具有三头判别器的生成对抗网络用于碳排放时间序列生成

Zesen Wang, Lijuan Lan, Yonggang Li, Chunhua Yang

机构 * SanMuGuo

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对城市级高频碳排放数据稀缺问题,提出TriHead-GAN,通过三头判别器联合监督分布真实性、跨变量依赖和步态平滑性,在多个数据集上优于主流基线并提升下游预测精度。

Comments Accepted at ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11199 2026-09-01 hep-lat cs.LG 版本更新 50%

Operator-Guided Model Reduction for Generative Sampling in Lattice Field Theory

训练晶格采样器的运算谱分析

Moxian Qian

机构 * Johannes Gutenberg University Mainz(杰尼森-古腾堡大学马因茨)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究训练后的晶格采样器的运算谱特性,通过投影到固定基底来区分不同采样器类别,发现不同基底对残差的影响差异。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10594 2026-09-01 physics.flu-dyn physics.geo-ph 版本更新 50%

Magnetohydrodynamic drag on an oscillating sphere in a rotating spherical cavity

旋转腔中振荡球体的磁流体动力学阻力

David Cébron, Paolo Personnettaz

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究旋转腔中振荡球体的磁流体动力学阻力,分析磁场、旋转与粘性耦合对流体动力学的影响,提出统一的边界层框架并验证理论。

Comments 88 pages, 52 figures, Reviewed version Subm. to JFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10949 2026-09-01 math.AP 版本更新 50%

On elliptic systems with $k$-wise interactions in the strong competition regime: uniform Hölder bounds and properties of the limiting configurations

关于强竞争 regime 中具有 k- 重相互作用的椭圆系统:统一的霍尔德界及极限配置的性质

Lorenzo Giaretto

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究强竞争 regime 中具有 k- 重相互作用的椭圆系统,证明了统一的霍尔德界及极限配置的性质。

Comments 44 pages. Revised version, major modifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09528 2026-09-01 physics.comp-ph 版本更新 50%

A fast incompressible Navier-Stokes solver for non-uniform grids

基于GEMM的直接求解器用于非均匀网格中的有限差分泊松问题

Pedro Costa, Duarte Palancha, Joshua Romero, Roberto Verzicco, Massimiliano Fatica

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于GEMM的直接求解器,用于高效求解非均匀网格中的有限差分泊松问题,结合FFT与GEMM变换,提升大规模并行计算性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26364 2026-09-01 cs.LG 版本更新 50%

Data-to-Energy Stochastic Dynamics

数据到能量的随机动力学

Kirill Tamogashev, Esmeralda S. Whitammer

机构 * University of Edinburgh(爱丁堡大学) CIFAR Fellow(蒙特利尔认知研究院研究员)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种数据到能量的IPF方法,用于建模Schrödinger桥问题,无需数据样本即可学习多模态分布之间的传输,并改进了扩散系数的学习。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14520 2026-09-01 cond-mat.soft 50%

Diffusive buckling fronts in lattice-based metamaterials

基于格点的超材料中的扩散屈曲前沿

Jochem G. Meijer, Faadil H. Shaik, Victoria V. McDermott, Heinrich M. Jaeger

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过实验和理论模型,研究了高耗散三维格点超材料中由压缩触发的屈曲失稳如何以扩散前沿形式传播,并建立了基于反应-扩散方程的可预测框架。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14384 2026-09-01 cond-mat.stat-mech cond-mat.soft cond-mat.str-el 版本更新 50%

Critical scaling in one-dimensional non-reciprocal matter

一维非 reciprocal 物质中的普遍标度

Shuoguang Liu, Peter B. Littlewood, Ryo Hanai

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究一维非 reciprocal 物质中的普遍标度行为,揭示非平衡临界现象及异常粗糙指数。

Comments 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03090 2026-09-01 physics.chem-ph 50%

Digital Surfactant

数字表面活性剂

Sayeedul I. Sheikh, V. Subhasree Navya, Riya Sharma, Sudip Roy, Jayant K. Singh

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了基于图扩散和变压器的两种模型在生成非离子型表面活性剂中的性能,发现逆设计模型生成多样性更好,而变压器更擅长满足属性约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11690 2026-09-01 math-ph math.AP math.MP math.OC 版本更新 50%

Lie symmetry analysis and similarity reductions for the tempered-fractional Keller Segel system

tempered分数阶Keller-Segel系统的李对称分析与相似约化

Ghorbanali Haghighatdoost, Mustafa Bazghandi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文对含反常扩散的趋化模型tempered分数阶Keller-Segel系统开展李对称分析,用新方法处理其分数阶算子非局域性,将其PDE约化为ODE得到新精确解,所得结果为该模型行为研究提供见解并提出通用方法。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04357 2026-09-01 math.NA cs.NA 50%

Unconditionally optimal error Estimate of a linearized Second-order Fully Discrete Finite Element Method for the bioconvection flows with concentration dependent viscosity

Chenyang Li, Yuze Lu, Haibiao Zheng

专题命中 扩散模型 :diffusion(abstract)

Journal ref Journal of Computational Mathematics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03869 2026-09-01 math.PR 版本更新 50%

Particle method for the numerical simulation of the path-dependent McKean-Vlasov equation

路径依赖型McKean-Vlasov方程数值模拟的粒子方法

Armand Bernou, Yating Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出路径依赖型McKean-Vlasov方程的粒子数值模拟方法,推导了显式收敛速率,发展两种控制收敛的途径,通过数值模拟验证方法准确性并应用于神经质量模型扩展。

Comments 44 pages, 5 figures. Version submitted in january 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11098 2026-09-01 math.PR math.OC 版本更新 50%

Optimal Stopping with Randomly Arriving Stopping Opportunities

带随机到达停止机会的最优停止问题

Josha A. Dekker, Roger J. A. Laeven, John G. M. Schoenmakers, Michel H. Vellekoop

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对带随机到达停止机会的最优停止问题,本文提出基于模拟的方法,通过随机时间尺度转化问题,结合策略迭代、鞅对偶及扩展的反向动态规划,经三类示例验证了方法的性能与适用性。

Comments This version replaces the preliminary and incomplete version of 11/18/23

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 19 篇

2511.19811 2026-09-01 cs.CV cs.CL cs.LG 版本更新 83%

TPSO: Training-Free Diverse Image Generation via Semantic Prompt Embedding Optimization

无需训练生成多样化且高保真的图像 via 提示语义空间优化

Debin Meng, Chen Jin, Zheng Gao, Yanran Li, Ioannis Patras, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王学院) Centre for AI, AstraZeneca(AstraZeneca人工智能中心) University of Bedfordshire(贝德福德大学) Samsung AI Center(三星人工智能中心)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。

Comments Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026). 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14056 2026-09-01 cs.CV cs.AI 版本更新 79%

POCI-Diff: 3D-Layout Guided Diffusion for Controllable Synthetic Surveillance Data Generation

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30709 2026-09-01 cs.CV cs.AI 新提交 74%

RailSyn: Diagnosis-Guided Image Generation for Traceable Data Completion in Railway Foreign Object Detection

RailSyn:面向铁路异物检测中可追溯数据补全的诊断引导图像生成方法

Quan Hao, Chenxi Zhang, Ziyang Tao, Yuyuan Zhou, Yudong Wang, Rui Shi, Lechuan Xu, Changhao Liu, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Pratt School of Engineering, Duke University(杜克大学普拉特工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 RailSyn是诊断引导的图像生成框架,通过检查器定位补全区域并明确需求,生成器满足需求,可提升RFOD检测性能,在9种主流检测器上AP50--95最高增益4.9点,具跨架构实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29473 2026-09-01 math.OC q-fin.MF 新提交 71%

Stochastic Optimal Control of Hawkes Jump-Diffusion Systems

霍克斯跳扩散系统的随机最优控制

Daria Sakhanda, Joshué Helí Ricalde-Guerrero

专题命中 可控生成 :diffusion(title)

AI总结 本文针对含环境风险的随机增长模型,扩展泊松点过程框架至标记霍克斯过程驱动的灾害,建立受控霍克斯动力学适定性,获霍克斯激发过程定量估计,证明小激发下霍克斯价值函数收敛于泊松对应值,为随机控制问题提供泊松近似并量化自激发影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30125 2026-09-01 cs.SD cs.AI cs.CL cs.CV cs.LG 新提交 70%

VIBE: Video Instruction-aligned Background music gEneration

VIBE:视频指令对齐背景音乐生成模型

Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha

机构 * Dolby Laboratories(杜比实验室) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-09-01 cs.GR cs.AI cs.CV cs.LG cs.MM 版本更新 67%

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30727 2026-09-01 cs.CV cs.AI 新提交 57%

RailGen: Improving Railway Intrusion Detection via Agent-Guided Small-Scale Foreign Object Generation

RailGen:通过智能体引导的小规模异物生成改进铁路入侵检测

Quan Hao, Ziyang Tao, Chenxi Zhang, Yudong Wang, Rui Shi, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 该研究针对铁路异物检测的长尾小样本问题,提出RailGen智能体生成高质量小异物样本,结合FocalDEIM框架优化检测,显著提升了检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29223 2026-09-01 cs.AI cs.CV 新提交 57%

Computational Depth Measurement in Thermographic Video: Overcoming Spatial Overfitting via Spatio-Temporal Decoupling

热成像视频中的计算深度测量:通过时空解耦克服空间过拟合

Zain Ul Abidin, Habeeban Memon, Junaid Ahmed

机构 * Sukkur IBA University(苏库尔IBA大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对热成像视频深度回归的空间过拟合问题,提出时空解耦架构,采用正则化XGBoost实现0.056mm MAE的高精度测量,可快速生成三维缺陷模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29003 2026-09-01 cs.CV cs.AI 新提交 57%

RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos

RoSe-SLAM:面向动态单目视频的鲁棒语义感知高斯溅射SLAM

Wenting Wang, Jiaxin Guo, Wenzhen Dong, Yun-Hui Liu, Charlie C. L. Wang, Yeung Yam

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学) Centre for Perceptual and Interactive Intelligence (CPII) Limited(感知与互动智能中心有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本研究提出RoSe-SLAM,利用2D基础模型语义特征与时空运动掩码等模块,结合几何与语义线索,在动态单目视频中实现更优的SLAM性能,优于现有动态RGB SLAM基线。

Comments Accepted by IEEE/RSJ INTERNATIONAL CONFERENCE ON INTELLIGENT ROBOTS & SYSTEMS (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28693 2026-09-01 cs.RO cs.CV 新提交 57%

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

RoboGesture:面向人形机器人交互的实时语义对齐式伴随语音手势生成

Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Galbot Inc.(Galbot公司) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海智知研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出 RoboGesture 框架,构建专属数据集并设计相关算法,使人形机器人可实时生成语义对齐的伴随语音手势,在 Unitree G1 机器人上的实验表明其性能优于现有最优方法。

Comments Accepted at ECCV 2026. Project page: https://RoboGesture.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏