arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 175 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 129 篇

2608.14990 2026-08-18 cond-mat.mtrl-sci cond-mat.mes-hall physics.chem-ph 新提交 50%

Discovering Physically Interpretable Mathematical Expression for Predicting CO2 Adsorption in Metal-Organic Frameworks via Machine Learning-Symbolic Regression

通过机器学习-符号回归发现可物理解释的数学表达式以预测金属有机框架中的CO₂吸附

Yimin Shao, Shengluo Ma, Shenghong Ju, Yijun Shi, Wei Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过ML-SR方法,结合关键结构描述符推导得到可物理解释的CO₂吸附公式,在大规模hMOFs数据集上实现70%以上预测准确率,兼具高效性与机制可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16149 2026-08-18 astro-ph.GA astro-ph.SR 新提交 50%

Catalytic formation of H_2 on carbonaceous dust grains - implications for interstellar observations

碳质尘埃颗粒上H₂的催化形成——对星际观测的启示

Aryav Das, Julia Gao, Daniel Vrinceanu, H. R. Sadeghpour

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过动力学蒙特卡洛模拟揭示碳质尘埃颗粒表面H₂的催化形成机制,明确其效率随温度、数密度的变化规律,证实尘埃催化H₂化学可与高红移恒星形成区的引力坍缩同步。

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16078 2026-08-18 astro-ph.EP 新提交 50%

Stability Mapping of the New Uranian Moon S/2025 U1 with Updated Masses for Cordelia, Ophelia, and Cressida

新天王星卫星S/2025 U1的稳定性测绘及Cordelia、Ophelia和Cressida的更新质量研究

J. Xavier, A. Amarante, S. Giuliatti Winter, A. Ferreira

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究结合S/2025 U1的纳入、三颗卫星的修正质量及更新带谐系数,通过数值积分等方法分析天王星内卫星系统,发现S/2025 U1轨道稳定,R=7公里时可局部稳定系统,还确定了附近假设卫星的稳定范围,同时指出四颗卫星对更新参数敏感。

Comments 18 pages, 15 figures, and 6 tables. Accepted for publication in Section 10 (Planets, planetary systems, and small bodies) of Astronomy & Astrophysics (A&A)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15849 2026-08-18 astro-ph.SR astro-ph.EP 新提交 50%

Planetary systems in the light of asteroseismology: metallicity threshold for the planetary systems and age-metallicity relation

星震学视角下的行星系统:行星系统的金属丰度阈值与年龄-金属丰度关系

M. Yıldız, A. Demirkol, S. Örtel, T. Çakır Alsaç, T. Daylan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究利用MESA代码构建127颗宿主恒星的内部模型,发现行星形成的金属丰度阈值约为0.007,揭示了恒星Z₀与年龄、Zₛ的关系,以及行星半径的影响因素。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15068 2026-08-18 astro-ph.EP astro-ph.IM 新提交 50%

Scaling of microcraters with molten rims derived from laser-induced cratering experiments

激光诱导撞击实验得到的带熔融边缘的微陨石坑的标度关系

S. Sato, H. Shibayama, K. Nagai, H. Katsuragi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过激光模拟撞击实验推导标度关系,明确带熔融边缘微陨石坑形成于10²至10³ m/s撞击速度范围,为其形成机制提供实验约束,契合次级撞击起源及相关流体动力学不稳定性的结论。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08537 2026-08-18 math.AP nlin.PS 版本更新 50%

Dynamical behavior of diffusively coupled scalar differential equations as Wentzell boundary conditions

作为Wentzell边界条件的扩散耦合标量微分方程的动力学行为

Merlin Pelz

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了以Wentzell边界条件耦合的两个标量动力学系统的动力学行为,通过数值延拓分析分岔与稳定性,拓展了单系统耦合延迟的研究,为生物膜建模提供理论支撑。

Comments 38 pages, 10 figures, submitted to the European Journal of Applied Mathematics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02848 2026-08-18 quant-ph 版本更新 50%

Heisenberg scaling under collective non-parallel directional noise via geometric state design

基于几何态设计的集体非平行定向噪声下的海森堡标度

Francisco Riberi, Lorenza Viola, Milad Marvian

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对经典集体定向噪声下的参数估计,提出基于几何态设计的抗噪机制,可实现探针数依赖的海森堡标度估计精度,最优性能可通过测量单个集体自旋分量达成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21721 2026-08-18 stat.ML cs.LG 版本更新 50%

Priors learned from legacy reconstructions inherit undetectable overconfidence

先验清洗:具有继承性、不可检测的过度自信的学习先验

Ali Siahkoohi, Sina Alemohammad

机构 * Institute for Artificial Intelligence, University of Central Florida(人工智能研究所,中央佛罗里达大学) Department of CS, University of Central Florida(计算机科学系,中央佛罗里达大学) Department of ECE, The University of Texas at Austin(电子工程系,德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究在贝叶斯逆问题中使用学习生成先验时因真值稀缺采用先验清洗的情况,指出其过度自信问题,通过对旧后验求平均产生旧正则化器,单个最佳档案更糟,部署时拟合档案的先验未覆盖盲子空间,建议分开数据支持置信度与继承信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09079 2026-08-18 cond-mat.stat-mech 版本更新 50%

Predictive Renormalization-Group Theory of Universality Classes in Nonlinear Systems

非线性系统中普适类的预测重整化群理论

Ko Okumura

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对非线性系统普适性问题,开发重整化群框架,通过标度不变性和消除无关结构确定普适类,适用于多种动力学情况,能再现标度行为并预测方程族,为非线性系统普适性提供统一视角,揭示其源于与临界现象相同的基本原理。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13671 2026-08-18 math-ph cs.NA math.MP math.NA math.PR physics.flu-dyn 版本更新 50%

Stochastic modeling of Fourier modes in two-dimensional turbulence via filtered white noise

二维湍流中傅里叶模的随机建模

Paolo Cifani, Franco Flandoli, Andrea Zanoni

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过滤波白噪声建模二维湍流的傅里叶模,发现典型时间相关长度并提出随机模型,利用直接数值模拟比较被动示踪物的输运与随机模型的有效扩散。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11780 2026-08-18 cond-mat.mtrl-sci physics.app-ph 50%

Multiple spiking functionalities in annealing-optimized Ag/Hf$_{0.5}$Zr$_{0.5}$O$_2$-based memristive neurons

基于退火优化的Ag/Hf$_{0.5}$Zr$_{0.5}$O$_2$基忆阻神经元的多种脉冲功能

Nikita Zhidkov, Andrei Zenkevich, Anton Khanas

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文展示了一种基于Ag/Hf$_{0.5}$Zr$_{0.5}$O$_2$忆阻器的具有多种脉冲功能的人工神经元,通过两步退火工艺优化了忆阻器参数,并实现了LIF神经行为的多种脉冲编码方式。

Journal ref Appl. Phys. Lett. 129, 073301 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05951 2026-08-18 cond-mat.mtrl-sci 版本更新 50%

Lattice location of ion-implanted 6He in diamond

金刚石中离子植入6He的晶格位置

U. Wahl, J. G. Correia, A. Costa, B. Biesmans, G. Magchiels, S. M. Tunhuma, A. Lamelas, A. Vantomme, L. M. C. Pereira, the ISOLDE Collaboration

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过β发射通道法确定金刚石中短寿命离子植入核探针6He的晶格位置,发现其占据四面体间隙位,并探讨其迁移激活能及稳定性问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12453 2026-08-18 cs.LG 版本更新 50%

Time-Correlated Video Bridge Matching

时间相关视频桥匹配

Viacheslav Vasilev, Arseny Ivanov, Nikita Gushchin, Maria Kovaleva, Alexander Korotin

机构 * Kandinsky Lab(Kandinsky实验室) Applied AI Institute(应用人工智能研究所) HSE University(高等经济大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出时间相关视频桥匹配框架,解决视频生成中时间相关序列建模问题,通过建模序列间依赖性和时间相关性,提升视频生成质量与重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21445 2026-08-18 q-bio.NC 版本更新 50%

Self-regulated emergence of heavy-tailed weight distributions in evolving complex network architectures

自调节出现的重尾权重分布于演化的复杂网络架构中

Jia Li, Cees van Leeuwen, Roman Bauer, Ilias Rentzeperis

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出一个模型,结合突触和结构可塑性,揭示了重尾权重分布和收敛-发散电路的形成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03897 2026-08-18 cs.LG stat.ME stat.ML 版本更新 50%

Leveraging Generative Artificial Intelligence for Causal Inference with Unstructured Data

生成式人工智能驱动的推断

Kosuke Imai, Kentaro Nakamura

机构 * Harvard University(哈佛大学) John F. Kennedy School of Government(约翰·F·肯尼迪政府学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究人员提出GPI统计框架,利用开源GenAI模型提取非结构化数据的低维表示,无需微调生成模型,通过三个应用验证其可用于因果与预测推断,开源软件包可实现该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14729 2026-08-18 physics.flu-dyn 版本更新 50%

Direct numerical simulations of inhalation in a 23-generation lung model

23代肺模型中吸入过程的直接数值模拟

Marco Atzori, Emanuele Gallorini, Ciro Cottini, Andrea Benassi, Maurizio Quadrio

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过对含23次连续分叉的肺模型开展高保真直接数值模拟,揭示了肺深部气道气流波动的特征及来源,提示现有肺模型的相关假设或需修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19257 2026-08-18 cond-mat.mes-hall 50%

Few-electron spin qubits in optically active GaAs quantum dots

Peter Millington-Hotze, Petr Klenovsky, Harry E. Dyte, George Gillard, Santanu Manna, Saimon F. Covre da Silva, Armando Rastelli, Evgeny A. Chekhovich

专题命中 扩散模型 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12965 2026-08-18 cs.ET cond-mat.dis-nn cs.LG physics.app-ph physics.optics 50%

Streamlined optical training of large-scale modern deep learning architectures with direct feedback alignment

Ziao Wang, Kilian Müller, Matthew Filipovich, Julien Launay, Ruben Ohana, Gustave Pariente, Safa Mokaadi, Charles Brossollet, Fabien Moreau, Alessandro Cappelli, Iacopo Poli, Igor Carron, Laurent Daudet, Florent Krzakala, Sylvain Gigan

专题命中 扩散模型 :diffusion(abstract)

Comments 20 pages, 4 figures; Additional experiments conducted;

Journal ref PNAS 123 (20) e2532022123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12406 2026-08-18 cond-mat.mtrl-sci 50%

Spin current relaxation time in thermally evaporated naphthyl diamine derivative films

Eiji Shikoh, Yuichiro Onishi, Yoshio Teki

专题命中 扩散模型 :diffusion(abstract)

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 15 篇

2608.15705 2026-08-18 cs.CV 新提交 88%

PixelControl: Fine-Grained Condition Fidelity in Text-to-Image Diffusion

PixelControl:文本到图像扩散中的细粒度条件保真度

Xin Lin, Haodong Li, Zhifei Zhang, Yutong Yang, Haitian Zheng, Juanxi Tian, Zhe Lin, Truong Nguyen

机构 * Adobe Research(奥多比研究院) Nanyang Technological University(南洋理工大学) University of California San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对可控文本到图像扩散模型细粒度结构保真度不足的问题,提出PixelControl框架,通过结构感知控制注入与多尺度金字塔循环损失等设计,提升了边界及中/小区域的结构保真度。

Comments The project homepage can be found: https://linxin0.github.io/pixelcontrol_homepage/pixelcontrol-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15583 2026-08-18 cs.CV 新提交 85%

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

PoseAdapter:面向复杂多目标场景的双流2.5D可控图像生成

Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 PoseAdapter是一种轻量2.5D可控图像生成框架,通过双流表示解决多目标场景属性泄漏问题,构建OrientLayout数据集,在空间精度等指标上优于现有最优方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15694 2026-08-18 cs.CV cs.AI 新提交 79%

RRFC: Recursive Refinement via Feedback Conditioning for Iterative Image-to-Image Generation

RRFC:基于反馈条件的递归精修用于迭代式图像到图像生成

Kareem Hassani, Chaymaa Abbas, Hadi Al Mubasher, Mariette Awad

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 该研究提出RRFC框架,通过反馈条件实现迭代式图像到图像生成的输出精修,在多类模型和任务上评估发现其增益集中于目标属性重叠的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23924 2026-08-18 cs.CV 版本更新 79%

DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis

DepthArb: 无训练深度仲裁生成用于遮挡鲁棒图像合成

Hongjin Niu, Jiahao Wang, Xirui Hu, Weizhan Zhang, Lan Ma, Yuan Gao, Feng Lei

机构 * School of Computer Science and Technology(计算机科学与技术学院) China Telecom(中国电信)

专题命中 可控生成 :image synthesis(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DepthArb,通过仲裁交互对象的注意力竞争解决遮挡歧义,采用注意力仲裁调制和空间紧凑性控制机制,无需重新训练即可提升遮挡生成的准确性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16100 2026-08-18 cs.CV cs.NI 新提交 70%

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

TISC:用于忠实重建的文本驱动图像语义通信系统

Feifan Zhang, Yuyang Du, Xiaoyan Liu, Soung Chang Liew

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16863 2026-08-18 cs.CV 新提交 57%

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16220 2026-08-18 cs.SD cs.CV 新提交 57%

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue

机构 * Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16008 2026-08-18 cs.CV 新提交 57%

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin

机构 * East China Normal University(华东师范大学) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Statistics, East China Normal University(华东师范大学统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15749 2026-08-18 cs.CV 新提交 57%

ES3D: Embedding Semantics into 3D Space for Component-Aware Editing

ES3D:将语义嵌入3D空间以实现组件感知编辑

Xuancheng Jin, Rengan Xie, Jiayuan Lu, Wenting Zheng, Rui Wang, Yuchi Huo, Lincheng Li, Yingfeng Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 57%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏