arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-24 至 2026-02-24 共收录 129 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 93 篇

2303.09486 2026-02-24 math.AP math-ph math.MP 50%

Nontrivial absolutely continuous part of anomalous dissipation measures in time

时间中非平凡绝对连续部分的异常耗散度量

Carl Johan Peter Johansson, Massimo Sorella

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过构建新的纳维-斯托克斯方程解,揭示了时间中非平凡绝对连续部分的异常耗散度量及湍流零定律关联。

Comments Author's Accepted Manuscript

Journal ref Journal of Differential Equations, Volume 453, Part 4, February 2026, 113912

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.00753 2026-02-24 cs.SI cs.DM cs.LG 50%

Schemes of Propagation Models and Source Estimators for Rumor Source Detection in Online Social Networks: A Short Survey of a Decade of Research

在线社交网络中谣言源检测的传播模型与源估计方案:十年研究的简要综述

Rong Jin, Weili Wu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了在线社交网络中谣言源检测的三种传播模型和三种源估计方案,探讨了十年来相关研究的进展与核心方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18902 2026-02-24 math.PR 50%

Stochastic invariance in infinite dimension beyond Lipschitz coefficients

无穷维中超越利普希茨系数的随机不变性

Eduardo Abi Jaber, Stefan Tappe

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了无穷维随机微分方程中闭子集的随机不变性条件,提出基于散射算子的修正漂移和正最大原理的两种特征化方法,并通过不变流形案例进行验证。

Comments 84 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18827 2026-02-24 math.AP 50%

Steady states and dynamics of a higher dimensional thin film equation

高维薄层方程的稳态与动力学

Shen Bian

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究高维薄层方程的稳态解及其动态行为,揭示了参数分类、变分结构与动态特性之间的联系,并通过稳态解构建统一分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18794 2026-02-24 math.AP 50%

Statistical Error Bounds for Generative Solvers of Chaotic PDEs: Wasserstein Stability, Generalization, and Turbulence

混沌偏微分方程生成求解器的统计误差界:Wasserstein稳定性、泛化性与湍流

Victor Armegioiu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了混沌偏微分方程生成求解器的统计误差界,通过Wasserstein稳定性、泛化性和湍流分析,提出了一种兼容相关度量框架的分析方法,并展示了如何将常见诊断方法纳入统计解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18715 2026-02-24 q-bio.NC cs.LG 50%

A Data-Driven Method to Map the Functional Organisation of Human Brain White Matter

一种数据驱动的方法用于映射人类大脑白质的功能组织

Yifei Sun, James M. Shine, Robert D. Sanders, Robin F. H. Cash, Sharon L. Naismith, Fernando Calamante, Jinglei Lv

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种数据驱动方法,整合dMRI和fMRI,用于研究白质通路的功能组织及其在大脑衰老和认知下降中的作用。

Comments 19 pages, 4 figures, journal paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18472 2026-02-24 cs.LG cs.AI q-bio.QM 50%

Physiologically Informed Deep Learning: A Multi-Scale Framework for Next-Generation PBPK Modeling

具有生理信息的深度学习:下一代PBPK建模的多尺度框架

Shunqi Liu, Han Qiu, Tong Wang

机构 * University of Southern California(美国南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Connecticut(康涅狄格大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种多尺度的生理信息深度学习框架,结合变换器、扩散模型和神经相似性,用于提高下一代PBPK建模的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02568 2026-02-24 math.AP 50%

Travelling Waves in a Mathematical Model for Oncolytic Virotherapy

肿瘤溶瘤病毒治疗的数学模型中的行波

Negar Mohammadnejad, Thomas Hillen

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过反应扩散模型分析了溶瘤病毒治疗中行波解的存在性,确定了最小波速并探讨了肿瘤环境中的传播机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10352 2026-02-24 cond-mat.soft cond-mat.stat-mech physics.bio-ph physics.flu-dyn 50%

Osmotic forces modify lipid membrane fluctuations

渗透力改变脂质膜的波动

Amaresh Sahu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究发现渗透力影响脂质膜波动,经典松弛模式的有效性受限于波数范围,高张力下该模式消失。

Comments 9 pages, 3 figures, code repository at https://github.com/sahu-lab/osmosis-flat

Journal ref Soft Matter (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24243 2026-02-24 cs.RO cs.AI 50%

SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions

SafeFlowMatcher: 基于流匹配与控制屏障函数的安全且快速规划

Jeongyong Yang, Seunghwan Jang, SooJean Han

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 SafeFlowMatcher通过结合流匹配与控制屏障函数,实现安全且高效的路径规划,在多个机器人任务中表现出更快、更平滑和更安全的性能。

Comments ICLR 2026(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14849 2026-02-24 cond-mat.mtrl-sci 50%

Physics-Informed ML Exploration of Structure-Transport Relationships in Hard Carbon

基于物理的机器学习探索硬碳中结构-传输关系

Nikhil Rampal, Stephen E. Weitzner, Fredrick Omenya, Marissa Wood, David M. Reed, Xiaolin Li, Jonathan R. I. Lee, Liwen F. Wan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于物理的机器学习方法,通过结合原子势能和分子动力学模拟,研究硬碳中结构与离子传输的关系,揭示钠离子迁移的微观机制及设计高性能阳极的原理。

Journal ref Energy Storage Materials, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05191 2026-02-24 q-bio.CB math-ph math.MP 50%

Go-or-Grow Models in Biology: a Monster on a Leash

生物学中的Go-or-Grow模型:一条被拴住的怪兽

R. Thiessen, M. Conte, T. L. Stepien, T. Hillen

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了Go-or-Grow模型在生物学中的应用,分析了其数学性质及稳定性问题,提出了新的研究成果并强调了该模型的计算挑战。

Comments 42 pages, 7 figures

Journal ref J. Math. Biol. 91, 58 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17420 2026-02-24 q-bio.CB math.DS q-bio.TO 50%

A kinetic derivation of spatial distributed models for tumor-immune system interactions

肿瘤-免疫系统相互作用的空间分布模型的动能推导

Martina Conte, Romina Travaglini

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出动能框架推导肿瘤-免疫系统相互作用的空间分布模型,探讨肿瘤进展与免疫反应的空间动态,揭示宏观模型间的对应关系及稳定性分析。

Comments 30 pages, 9 figures

Journal ref Chaos, Solitons & Fractals, 200: 116969 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 11 篇

2602.19348 2026-02-24 cs.CV cs.AI 86%

MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose

MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态

Sirine Bhouri, Lan Wei, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18903 2026-02-24 cs.CV cs.HC 74%

SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model

Gemini 3 Pro图像的SCHEMA:为Google原生多模态模型的受控AI图像生成的结构化方法

Luca Cazzaniga

机构 * Independent Researcher(独立研究者)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 SCHEMA为Google Gemini 3 Pro图像提供结构化提示工程方法,通过三级系统提升AI图像生成的可控性,实现高合规率和跨领域应用。

Comments 24 pages, 8 tables. Based on SCHEMA Method v1.0 (deposited December 11, 2025). Previously published on Zenodo: doi:10.5281/zenodo.18721380

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-02-24 cs.GR cs.AI cs.CV cs.LG cs.MM 67%

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20079 2026-02-24 cs.CV 57%

SemanticNVS: Improving Semantic Scene Understanding in Generative Novel View Synthesis

SemanticNVS: 提高生成式新视角合成中的语义场景理解

Xinya Chen, Christopher Wewer, Jiahao Xie, Xinting Hu, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Germany(马克斯·普朗克研究所信息学院,萨尔兰州信息学院,德国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticNVS通过整合预训练语义特征提取器,提高生成式新视角合成中远距离视角下的生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19937 2026-02-24 cs.CV 57%

Learning Positive-Incentive Point Sampling in Neural Implicit Fields for Object Pose Estimation

在神经隐式场中学习正激励点采样用于物体姿态估计

Yifei Shi, Boyan Wan, Xin Xu, Kai Xu

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出结合SO(3)-等价卷积隐式网络和正激励点采样策略的方法,提升物体姿态估计的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19358 2026-02-24 cs.CV 57%

Referring Layer Decomposition

提及层分解

Fangyi Chen, Yaojie Shen, Lu Xu, Ye Yuan, Shu Zhang, Yulei Niu, Longyin Wen

机构 * Intelligent Editing Team, Intelligent Creation, ByteDance(字节跳动智能创作部)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提及层分解任务通过预测RGBA层实现精确的视觉内容控制,结合大规模数据集和评估协议,提升图像编辑和生成的可控性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14720 2026-02-24 cs.CV 57%

ShapeShift: Text-to-Mosaic Synthesis via Semantic Phase-Field Guidance

ShapeShift: 通过语义相场指导实现文本到马赛克合成

Vihaan Misra, Peter Schaldenbrand, Jean Oh

机构 * Carnegie Mellon University USA(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ShapeShift通过语义相场指导实现文本到马赛克合成,结合语义指导与可行性约束解决,提升排列的语义清晰性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18817 2026-02-24 cs.CV 57%

HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation

HeRO:用于姿态感知物体操作的分层3D语义表示

Chongyang Xu, Shen Cheng, Haipeng Li, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Dexmal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HeRO通过分层语义场结合几何与语义,提升姿态感知操作的控制策略,实现多个任务的成功率提升。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13851 2026-02-24 cs.LG stat.ML 50%

Inverting Self-Organizing Maps: A Unified Activation-Based Framework

反向自组织映射:一个基于激活的统一框架

Alessandro Londei, Matteo Benati, Denise Lanzieri, Vittorio Loreto

机构 * Sony Computer Science Laboratories - Rome Joint Initiative CREF-SONY, Centro Ricerche Enrico Fermi Via Panisperna 89/A, 00184 Rome, Italy(索尼计算机科学实验室-罗马联合计划 CREF-SONY,埃尼奇费里研究中心,帕纳尔纳街89号A,00184罗马,意大利) Department of Computer, Automatic and Management Engineering Sapienza University, Via Ariosto 25 Rome, Italy(计算机、自动与管理工程系,萨皮恩扎大学,阿里奥斯特路25号,意大利) Physics Department Sapienza University, Piazzale Aldo Moro 1 Rome, Italy(物理系,萨皮恩扎大学,阿尔多·莫罗广场1号,意大利) Complexity Science Hub Josefstädter Strasse 39, A 1080, Vienna, Austria(复杂性科学中心,约瑟夫斯塔德特街39号,奥地利1080)

专题命中 可控生成 :diffusion(abstract)

AI总结 MUSIC通过原型几何实现SOM的反向与控制,无需采样或解码器,产生语义连贯的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18739 2026-02-24 cs.LG 50%

When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models

当世界模型做梦错误:针对世界模型的物理条件对抗攻击

Zhixiang Guo, Siyuan Liang, Andras Balogh, Noah Lunberry, Rong-Cheng Tu, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出PhysCond-WMA攻击方法,通过扰动物理条件通道诱导世界模型的语义、逻辑或决策层面的扭曲,揭示生成式世界模型的安全性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18699 2026-02-24 cs.CL cs.AI 50%

Semantic Substrate Theory: An Operator-Theoretic Framework for Geometric Semantic Drift

语义基质理论:几何语义漂移的算子理论框架

Stephen Russell

机构 * Intelligent Systems and Robotics Department(智能系统与机器人系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出语义基质理论,通过算子理论框架分析几何语义漂移,引入桥质量预测未来邻居重排,并提供理论与测试合同。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 6 篇

2602.18533 2026-02-24 cs.CV 88%

Morphological Addressing of Identity Basins in Text-to-Image Diffusion Models

文本到图像扩散模型中身份盆地的形态学分析

Andrew Fraser

专题命中 个性化与一致性 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过形态学描述符和提示层面的音感结构,研究揭示了文本到图像扩散模型中身份盆地的系统性导航梯度,展示了身份稳定性和新视觉概念的生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 83%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 个性化与一致性 :image generation(title);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19254 2026-02-24 cs.CV 79%

RegionRoute: Regional Style Transfer with Diffusion Model

RegionRoute: 区域风格迁移与扩散模型

Bowen Chen, Jake Zuena, Alan C. Bovik, Divya Kothandaraman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Dolby Laboratories, Inc.(杜比实验室)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 RegionRoute提出一种注意力监督的扩散框架,通过训练对齐风格标记的注意力分数与对象掩码,实现精确的区域风格迁移,提升风格应用的局部化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06336 2026-02-24 cs.CV cs.LG eess.IV 70%

MEt3R: Measuring Multi-View Consistency in Generated Images

MEt3R:测量生成图像的多视图一致性

Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔州信息校园) ETH Zurich(苏黎世联邦理工学院)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。

Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18752 2026-02-24 cs.CV cs.GR 62%

Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement

多模态大模型中ID一致性优化:通过对齐、纠缠与解纠缠进行面部修复

Yuran Dong, Hang Dai, Mang Ye

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 EditedID通过引入对齐、解纠缠和纠缠机制,提升多模态大模型中面部身份一致性的修复能力。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20113 2026-02-24 cs.SD cs.AI 50%

StyleStream: Real-Time Zero-Shot Voice Style Conversion

StyleStream: 实时零样本语音风格转换

Yisi Liu, Nicholas Lee, Gopala Anumanchipalli

机构 * UC Berkeley(伯克利大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 StyleStream通过Destylizer和Stylizer实现实时零样本语音风格转换,采用非自回归架构,端到端延迟仅1秒。

详情

展开后加载摘要…

URL PDF HTML 收藏