arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-09 至 2026-01-09 共收录 51 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2601.04706 2026-01-09 cs.CV 79%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 文生图 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01839 2026-01-09 cs.CR cs.AI cs.CL cs.CV 79%

Jailbreaking Safeguarded Text-to-Image Models via Large Language Models

通过大型语言模型对受保护的文本到图像模型进行劫持

Zhengyuan Jiang, Yuepeng Hu, Yuchen Yang, Yinzhi Cao, Neil Zhenqiang Gong

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出了一种利用微调大型语言模型来劫持受安全防护的文本到图像模型的方法,有效绕过安全防护并优于现有攻击技术。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21015 2026-01-09 cs.CV 77%

FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing

FluencyVE:将时间感知Mamba与旁路注意力相结合用于视频编辑

Mingshu Cai, Yixuan Li, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University, Japan(早稻田大学,日本) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 FluencyVE通过结合时间感知Mamba与旁路注意力,实现高效的视频编辑,减少计算成本并提升生成能力。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03193 2026-01-09 cs.CV cs.AI 57%

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

专题命中 文生图 :image generation(abstract);分类 cs.CV

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 35 篇

2505.11013 2026-01-09 cs.CV cs.MM 81%

Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion

面向鲁棒且可控的文本到运动的掩码自回归扩散

Zongye Zhang, Bohan Kong, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute(杭州创新院) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03979 2026-01-09 cs.CV cs.AI 79%

BlurDM: A Blur Diffusion Model for Image Deblurring

BlurDM: 一种用于图像去模糊的模糊扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立成功大学) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BlurDM通过双扩散方案整合模糊形成过程,实现图像去模糊,提升去模糊效果。

Comments NeurIPS 2025. Project Page: https://jin-ting-he.github.io/BlurDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04342 2026-01-09 cs.CV 79%

ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

ReHyAt:用于视频扩散变换器的递归混合注意力

Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReHyAt通过结合softmax和线性注意力,实现高效的视频扩散模型,降低训练成本并提升长序列生成的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05042 2026-01-09 physics.flu-dyn physics.comp-ph 78%

PINN-Based Solution for a Diffusion Controlled Droplet Growth

基于PINN的扩散控制滴状生长解决方案

Pavel Gol'din, Gennady Y. Gor

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于PINN的扩散控制滴状生长解决方案,通过耦合扩散方程与界面质量平衡,实现对滴状半径的自适应训练,验证了其在广泛初始条件下的收敛性及计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04847 2026-01-09 physics.flu-dyn 78%

Turbulent Diffusion-Cascade Interaction

湍流扩散-级联相互作用

Ernesto Fuentes Noriega, John Christos Vassilicos

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究了湍流扩散与级联相互作用,发现湍流耗散率与传输率成反比,比例常数受涡和位置影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19971 2026-01-09 physics.flu-dyn cs.LG 78%

Guiding diffusion models to reconstruct flow fields from sparse data

引导扩散模型从稀疏数据重建流场

Marc Amorós-Trepat, Luis Medrano-Navarro, Qiang Liu, Luca Guastoni, Nils Thuerey

机构 * School of Computation, Information, and Technology(计算、信息与技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种引导扩散模型的方法,通过稀疏数据重建高保真流场,提升流体结构预测和像素准确性。

Comments Published on Physics of Fluids, code and data can be found at https://github.com/tum-pbs/sparse-reconstruction

Journal ref Physics of Fluids 1 January 2026; 38 (1): 015112

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15157 2026-01-09 hep-th gr-qc 78%

Diffusion method in field theories with fakeons

在场论中使用扩散方法

Gianluca Calcagni

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过扩散方法研究具有假子的场论初始条件数目,证明其为两个,并展示了线性模型的解及非局域引力的应用潜力。

Comments 15 pages, 1 figure. v2: typos corrected

Journal ref Physical Review D 113, 025006 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04572 2026-01-09 cs.LG cs.AI 78%

Spatial-Temporal Feedback Diffusion Guidance for Controlled Traffic Imputation

时空反馈扩散引导用于受控交通填补

Xiaowei Mao, Huihu Ding, Yan Lin, Tingrui Wu, Shengnan Guo, Dazhuo Qiu, Feiling Fang, Jilin Hu, Huaiyu Wan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FENCE提出了一种时空反馈扩散引导方法,通过动态调整引导尺度提升交通数据填补的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04236 2026-01-09 cs.SD cs.AI cs.RO eess.AS 78%

SmoothSync: Dual-Stream Diffusion Transformers for Jitter-Robust Beat-Synchronized Gesture Generation from Quantized Audio

SmoothSync: 双流扩散变换器用于抗抖动的语音同步手势生成

Yujiao Jiang, Qingmin Liao, Zongqing Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SmoothSync通过双流扩散变换器和抖动抑制损失,实现抗抖动的语音同步手势生成,提升同步精度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18210 2026-01-09 q-fin.PR q-fin.CP q-fin.MF 78%

American options valuation in time-dependent jump-diffusion models via integral equations and characteristic functions

通过积分方程和特征函数对时间依赖跳跃扩散模型中的美式期权估值

Andrey Itkin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过积分方程和特征函数方法,高效准确地估值时间依赖跳跃扩散模型中的美式期权,解决了传统方法的局限性。

Comments 27 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21791 2026-01-09 physics.geo-ph cs.LG 78%

SeisRDT: Latent Diffusion Model Based On Representation Learning For Seismic Data Interpolation And Reconstruction

SeisRDT:基于表征学习的潜变扩散模型用于地震数据插值与重建

Shuang Wang, Fei Deng, Peifan Jiang, Zezheng Ni, Bin Wang

机构 * Shuang Wang(双王) Fei Deng(邓飞) Peifan Jiang(江培帆) Zezheng Ni(倪泽政) Bin Wang(王彬)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SeisRDT通过基于表征学习的潜变扩散模型,有效解决地震数据中复杂缺失问题,提升重建精度与效率。

Comments Submitted to geopysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05071 2026-01-09 math-ph cs.NA math.MP math.NA 71%

A high order accurate and provably stable fully discrete continuous Galerkin framework on summation-by-parts form for advection-diffusion equations

一种高阶准确且可证明稳定的求和-按部分形式的连续伽辽金框架用于对流-扩散方程

Mrityunjoy Mandal, Jan Nordström, Arnaud G Malan

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出了一种基于求和-按部分形式的高阶准确连续伽辽金框架,用于求解对流-扩散方程,实现了空间和时间方向上的超收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12330 2026-01-09 gr-qc nucl-th 71%

Radial Oscillations of Viscous Neutron Stars: Zero Diffusion Case

黏性中子星的径向振荡:零扩散情况

Raissa F. P. Mendes, Amanda Guerrieri, João V. M. Muniz, Gabriel S. Rocha, Gabriel S. Denicol

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了粘性对中子星径向振荡的影响,揭示了粘性效应如何影响流体动力学和非流体动力学模式的稳定性。

Comments 18 pages, 7 figures

Journal ref Phys. Rev. D 113, 024010 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04488 2026-01-09 econ.EM 71%

Latent Variable Modelling by Supervised Diffusion

通过监督扩散进行潜在变量建模

Daniil Bargman

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出LARX模型,通过监督扩散方法估计包含潜在变量的推断模型,并在样本外R平方上达到79.7%,揭示了股票回报与经济增长关系的潜在驱动因素。

Comments 39 pages, 4 figures (including references and the appendix). Changes from the previous version: Stylistic revisions to the publication text, improving readability and flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10230 2026-01-09 eess.IV cs.CV 70%

Leveraging Clinical Text and Class Conditioning for 3D Prostate MRI Generation

利用临床文本和类别条件化生成3D前列腺MRI

Emerson P. Grabke, Babak Taati, Masoom A. Haider

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CCELLA方法,通过结合临床文本和类别条件化,提升3D前列腺MRI生成质量及下游分类器性能。

Comments Accepted for publication in IEEE Transactions on Biomedical Engineering, 2025. This is the accepted author version. The final published version is available at https://doi.org/10.1109/TBME.2025.3648426

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22009 2026-01-09 cs.CV 70%

StreamFlow: Theory, Algorithm, and Implementation for High-Efficiency Rectified Flow Generation

StreamFlow:高效率校正流生成的理论、算法与实现

Sen Fang, Hongbin Zhong, Yalin Feng, Yanxin Zhang, Dimitris N. Metaxas

机构 * Rutgers University, New Jersey, USA(罗杰斯大学) Georgia Institute of Technology, Atlanta, Georgia, USA(佐治亚理工学院) Nanyang Technological University, Singapore(南洋理工大学) University of Wisconsin-Madison, Wisconsin, USA(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出StreamFlow,通过理论、算法和实现的综合优化,显著提升了基于流模型的图像生成效率,达到611%的加速效果。

Comments Improved the quality. Project Page at https://world-snapshot.github.io/StreamFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-01-09 cs.CV cs.AI cs.CL cs.MM 62%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05251 2026-01-09 cs.CV 57%

Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video

Mesh4D: 从单目视频中进行4D网格重建与跟踪

Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi

机构 * VGG, University of Oxford(视觉研究院、牛津大学) Nanyang Technological University(南洋理工大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Mesh4D通过紧凑的潜在空间和潜在扩散模型,实现从单目视频中高效重建动态物体的4D网格和运动。

Comments 15 pages, 8 figures, project page: https://mesh-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV 57%

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05227 2026-01-09 stat.ML cs.LG econ.EM math.ST stat.TH 50%

Stochastic Deep Learning: A Probabilistic Framework for Modeling Uncertainty in Structured Temporal Data

随机深度学习:一种用于结构时间数据中不确定性建模的概率框架

James Rice

机构 * University of Essex(埃塞克斯大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出随机潜在微分推断框架,通过整合随机微分方程与深度生成模型,提升结构时间数据中不确定性建模的精度与稳定性。

Comments 20 pages, 6330 words

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05023 2026-01-09 math.AP 50%

Finite-time blow-up in a quasilinear two-species chemotaxis system with two chemicals

双物种趋化系统中有限时间爆破现象研究

Mingzhang Cai, Yuxiang Li, Ziyue Zeng

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了双化学物质的拟线性双物种趋化系统,证明在特定参数条件下系统存在有限时间爆破解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04915 2026-01-09 cs.HC 50%

OnomaCompass: A Texture Exploration Interface that Shuttles between Words and Images

OnomaCompass: 一种连接词语与图像的纹理探索界面

Miki Okamura, Shuhey Koyama, Li Jingjing, Yoichi Ochiai

专题命中 扩散模型 :diffusion(abstract)

AI总结 OnomaCompass通过连接拟声词与图像的潜在空间,帮助用户更高效地发现材料,减少工作量并提升用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04874 2026-01-09 q-bio.BM 50%

Structural-dynamic behavior of histamine in solution: the role of water models

组胺在溶液中的结构-动态行为:水模型的作用

Dmytro A. Gavryushenko, N. Atamas, Oleg K. Myronenko

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过分子动力学研究组胺在溶液中的动态行为,发现SPC/E水模型更适用于描述生理条件下组胺与水的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04839 2026-01-09 math.NA cs.NA 50%

A finite element method preserving the eigenvalue range of symmetric tensor fields

一种保持对称张量场特征值范围的有限元方法

Abdolreza Amiri, Gabriel R. Barrenechea, Tristan Pryer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种保持张量场特征值范围的有限元方法,通过投影和隐式欧拉方法实现稳定性与精度,验证了在对流主导情况下维持特征值约束的有效性。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06047 2026-01-09 math.PR math.DG 50%

Brownian motion and stochastic areas on complex partial flag manifolds with blocks of equal size

布朗运动与复部分旗流形上块大小相等的随机面积

Teije Kuijper

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了复部分旗流形上块大小相等的布朗运动,推导了随机面积的极限分布,并引入了新的扩散族以推广Jacobi过程。

Comments 28 pages, v2: Minor edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22094 2026-01-09 cs.RO cs.LG 50%

ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning

ReinFlow:基于在线强化学习的流匹配策略微调

Tonghe Zhang, Chao Yu, Sichang Su, Yu Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 ReinFlow通过在线强化学习微调流匹配策略,提升连续机器人控制性能,实现高效去噪与训练稳定性。

Comments 38 pages

Journal ref Published in The Thirty-Ninth Annual Conference on Neural Information Processing Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏