arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-01 至 2026-01-01 共收录 63 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 50 篇

2512.24026 2026-01-01 cs.CV cs.AI 57%

PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing

PipeFlow: 管道处理与运动感知帧选择用于长格式视频编辑

Mustafa Munir, Md Mostafijur Rahman, Kartikeya Bhardwaj, Paul Whatmough, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 PipeFlow通过运动感知帧选择和流水线任务调度,实现长格式视频编辑的高效处理,相比现有方法速度提升达9.6至31.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23667 2026-01-01 cs.CV 57%

IDT: A Physically Grounded Transformer for Feed-Forward Multi-View Intrinsic Decomposition

IDT: 一种物理基础的Transformer用于前馈多视角内在分解

Kang Du, Yirui Guan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 IDT通过基于Transformer的注意力机制实现多视角内在图像分解,采用物理基础模型分离材料和照明效应,提升多视角一致性。

Comments 10 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21776 2026-01-01 cs.CV cs.AI 57%

Inference-based GAN Video Generation

基于推断的GAN视频生成

Jingbo Yang, Adrian G. Bors

机构 * Department of Computer Science, University of York(计算机科学系,约克大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于对抗的VAE-GAN混合结构,通过马尔可夫链框架实现长视频生成,解决时序扩展难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25072 2026-01-01 cs.RO cs.AI cs.LG 50%

Coordinated Humanoid Manipulation with Choice Policies

协调的人形机器人操作与选择策略

Haozhi Qi, Yen-Jen Wang, Toru Lin, Brent Yi, Yi Ma, Koushil Sreenath, Jitendra Malik

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。

Comments Code and Website: https://choice-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24674 2026-01-01 eess.IV cs.AI 50%

An Adaptive, Disentangled Representation for Multidimensional MRI Reconstruction

一种自适应的、解耦的表示方法用于多维MRI重建

Ruiyang Zhao, Fan Lam

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种自适应解耦的多维MRI重建方法,通过学习特征表示和潜在扩散模型,实现无需任务特定训练的高效重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24456 2026-01-01 math.NA cs.NA 50%

Fast high-order spectral solvers for PDEs on triangulated surfaces with applications to deforming surfaces

快速高阶谱求解器用于三角化表面的偏微分方程及其在变形表面中的应用

Gentian Zavalani

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出快速高阶谱求解器用于三角化表面的偏微分方程,结合四边形化和基于Dubiner多项式的谱元方法,实现高精度和高效求解,应用于变形表面的数值实验。

Comments 36 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24451 2026-01-01 physics.atom-ph quant-ph 50%

Sub-Ensemble Correlations as a Covariance Geometry

子集合相关性作为协方差几何

Zuoxian Wang, Yuhao Zhang, Gaopu Hou, Zihua Liang, Gen Hu, Lu Liu, Yuan Sun, Feilong Xu, Mao Ye

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出子集合相关性由协方差算子决定,揭示了统计独立性与正交性之间的关系,并限定了自旋波动的波动模式数量。

Comments Submitted to Quantum Science and Technology. This version corresponds to the submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24428 2026-01-01 cs.RO 50%

Subsecond 3D Mesh Generation for Robot Manipulation

亚秒级机器人操作用3D网格生成

Qian Wang, Omar Abdellall, Tony Gao, Xiatao Sun, Daniel Rakita

机构 * Office of Naval Research(海军研究办公室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种亚秒级3D网格生成系统,通过集成开放词汇分割、加速扩散生成和稳健点云注册,实现高保真网格的快速生成,用于机器人感知与规划。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24397 2026-01-01 physics.med-ph cond-mat.stat-mech 50%

Analytical phase kurtosis of the constant gradient spin echo

常梯度自旋回波的解析相四次矩

Teddy X Cai, Nathan H Williamson, Peter J Basser

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文解析了常梯度自旋回波的相四次矩,发现GPA在中等实验条件下不成立。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24378 2026-01-01 math.ST cs.LG stat.ML stat.TH 50%

Implicit score matching meets denoising score matching: improved rates of convergence and log-density Hessian estimation

隐式分数匹配与去噪分数匹配:改进的收敛速率和对数密度Hessian估计

Konstantin Yakovlev, Anna Markovich, Nikita Puchkin

机构 * HSE University(俄罗斯高等经济大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过隐式和去噪分数匹配方法改进收敛速率,并利用微分估计对数密度Hessian,为生成扩散模型的采样器收敛性提供理论支持。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24180 2026-01-01 cond-mat.mtrl-sci 50%

The effect of germanium sublayer on the native corrosion of ultrathin copper films

锗亚层对超薄铜膜本征腐蚀的影响

Vladimir A. Vdovin, Ivan I. Pyataikin

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究发现,锗亚层可减缓超薄铜膜的本征腐蚀,从而提升其在电磁干扰防护中的应用价值。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24005 2026-01-01 stat.ME 50%

Least Square Estimation: SDEs Perturbed by Lévy Noise with Sparse Sample Paths

最小二乘估计:受莱维噪声扰动的随机微分方程的稀疏样本路径

Brijesh Kumar Jha, Subhra Sankar Dhar, Akash Ashirbad Panda

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种针对受莱维噪声扰动的随机微分方程中稀疏样本路径的最小二乘估计方法,并分析了其渐近收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23955 2026-01-01 cond-mat.mtrl-sci 50%

Ultrafast Exciton-Polariton Transport and Relaxation in Halide Perovskite

卤化物钙钛矿中超快激子极子输运与弛豫

Yuexing Xia, Yin Liang, Zhiyong Zhang, Tian Lan, Xiaotian Bao, Yuyang Zhang, Xin Zeng, Yiyang Gong, Shuai Yue, Wenna Du, Jianhui Fu, Rui Su, Stefan Schumacher, Xuekai Ma, Qing Zhang, Xinfeng Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过能量分辨瞬态反射显微镜揭示了卤化物钙钛矿中激子极子的超快输运与弛豫特性,展示了其高扩散速度和短弛豫时间,为极子器件设计提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23059 2026-01-01 cs.CY 50%

Artificial Intelligence and Employment Exposure: A Territorial and Gender Perspective

人工智能与就业暴露:一个地域和性别视角

Antoni Mestre, Xavier Naya, Manoli Albert, Vicente Pelechano

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过构建AI CNAE影响矩阵,分析西班牙各地区和性别层面的AI就业暴露,揭示结构性变化趋势及性别差异。

Comments in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21164 2026-01-01 math.NA cs.NA 50%

Mixed Precision General Alternating-Direction Implicit Method for Solving Large Sparse Linear Systems

混合精度通用交替方向隐式方法用于求解大规模稀疏线性系统

Jifeng Ge, Bastien Vieublé, Juan Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种混合精度GADI方法,通过低精度求解子系统和高精度计算残差,提高求解大规模稀疏线性系统效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26115 2026-01-01 cond-mat.soft cond-mat.stat-mech 50%

Nonlinear transport of tracer particles immersed in a strongly sheared dilute gas with inelastic collisions

非线性输运:浸在强剪切稀释气体中的示踪粒子

David González Méndez, Vicente Garzó

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究强剪切稀释气体中示踪粒子的非线性输运,通过两种互补方法推导精确结果,并与IHS结果比较。

Comments 36 pages; 16 figures; The title has been modified; 7 new figures have been added; To be published in Mathematics (MDPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00003 2026-01-01 physics.bio-ph 50%

Fractional kinetic modelling of the adsorption and desorption process from experimental SPR curves

分数动力学建模用于从实验SPR曲线中吸附和解吸过程

Higor V. M. Ferreira, Nelson H. T. Lemes, Yara L. Coelho, Luciano S. Virtuoso, Ana C. dos Santos Pires, Luis H. M. da Silva

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究利用分数阶动力学模型分析SPR曲线中吸附和解吸过程,发现整数阶模型无法准确表示实验数据,分数阶模型能更全面地描述复杂过程。

Comments 26 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08547 2026-01-01 physics.soc-ph cond-mat.stat-mech 50%

Reducibility of higher-order networks from dynamics

高阶网络的可约性从动力学角度研究

Maxime Lucas, Luca Gallo, Arsham Ghavasieh, Federico Battiston, Manlio De Domenico

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种信息论框架,用于评估高阶网络是否能被低阶结构替代,通过量化熵成本和可区分性来分析其可约性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23876 2026-01-01 math.CA math.AP 50%

A positive eigenvalue result for semilinear differential equations in Banach spaces with functional initial conditions

关于Banach空间中带有函数初始条件的半线性微分方程的正特征值结果

Gennaro Infante, Paola Rubbioni

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了Banach空间中半线性微分方程在非局部初始条件下的正特征值存在性,并通过反应扩散方程示例展示了其应用。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23832 2026-01-01 cs.LG 50%

Exploiting the Prior of Generative Time Series Imputation

利用生成时间序列填补的先验

YuYang Miao, Chang Li, Zehua Chen

机构 * Imperial College London, Department of Electronic and Electrical Engineering(帝国理工学院伦敦校区电子与电气工程系) University of Science and Technology of China(中国科学技术大学) Tsinghua University, Department of CST(清华大学计算机科学与技术系) Shengshu AI(盛数人工智能)

专题命中 扩散模型 :diffusion(abstract)

AI总结 Bridge-TS通过引入专家先验和组合先验,提升生成时间序列填补的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23817 2026-01-01 quant-ph cs.AI cs.LG 50%

Quantum Error Mitigation with Attention Graph Transformers for Burgers Equation Solvers on NISQ Hardware

使用注意力图Transformer进行Burgers方程求解器的量子误差缓解

Seyed Mohamad Ali Tousi, Adib Bazgir, Yuwen Zhang, G. N. DeSouza

机构 * Vision-Guided and Intelligent Robotics Lab (ViGIR) - EECS Department - University of Missouri - Columbia(智能机器人实验室(ViGIR)- 电子工程与计算机科学系 - 密苏里大学 - 哥伦比亚) Department of Mechanical and Aerospace Engineering - University of Missouri - Columbia(机械与航空航天工程系 - 密苏里大学 - 哥伦比亚)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用注意力图Transformer模型,通过学习误差缓解方法,提升NISQ硬件上Burgers方程求解的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20049 2026-01-01 cs.RO cs.AI 50%

Robust Robotic Exploration and Mapping Using Generative Occupancy Map Synthesis

使用生成占用地图合成的鲁棒机器人探索与建图

Lorin Achey, Alec Reed, Brendan Crowe, Bradley Hayes, Christoffer Heckman

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于生成占用地图合成的鲁棒机器人探索方法,通过实时融合预测提升地图质量和可通行性,实验表明其在不同环境中提升了探索一致性。

Comments arXiv admin note: text overlap with arXiv:2409.10681

Journal ref Auton Robot 50, 8 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2501.05710 2026-01-01 cs.CV 79%

EmotiCrafter: Text-to-Emotional-Image Generation based on Valence-Arousal Model

EmotiCrafter:基于愉悦-唤醒模型的文本到情感图像生成

Shengqi Dang, Yi He, Long Ling, Ziqing Qian, Nanxuan Zhao, Nan Cao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Adobe Research(Adobe研究院)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 EmotiCrafter基于Valence-Arousal模型,通过文本提示和情感值生成情感丰富的图像,提升情感表达的准确性和可控性。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23361 2026-01-01 cs.CV 72%

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions

OmniVCus: 基于多模态控制条件的前馈主体驱动视频定制

Yuanhao Cai, He Zhang, Xi Chen, Jinbo Xing, Yiwei Hu, Yuqian Zhou, Kai Zhang, Zhifei Zhang, Soo Ye Kim, Tianyu Wang, Yulun Zhang, Xiaokang Yang, Zhe Lin, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract,comments);image editing(abstract);分类 cs.CV

AI总结 OmniVCus通过多模态控制条件和改进的嵌入机制实现高效的多主体视频定制。

Comments NeurIPS 2025; A data construction pipeline and a diffusion Transformer framework for controllable subject-driven video customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03119 2026-01-01 cs.CV 57%

Controllable Human-centric Keyframe Interpolation with Generative Prior

可控的人本关键帧插值与生成先验

Zujin Guo, Size Wu, Zhongang Cai, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。

Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 5 篇

2512.23986 2026-01-01 cs.CV physics.geo-ph 79%

Anomaly detection in satellite imagery through temporal inpainting

通过时间修复在卫星图像中进行异常检测

Bertrand Rouet-Leduc, Claudia Hulbert

机构 * Disaster Prevention Research Institute, Kyoto University(京都大学灾害预防研究所) Geolabe

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本研究提出了一种基于时间修复的深度学习方法,通过卫星时间序列的冗余性检测地表变化,实现了更高的灵敏度和特异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01519 2026-01-01 cs.CV 79%

DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration Models

DiffIR2VR-Zero: 无需额外训练的扩散图像修复模型用于视频修复

Chang-Han Yeh, Hau-Shiang Shiu, Chin-Yang Lin, Zhixiang Wang, Chi-Wei Hsiao, Ting-Hsuan Chen, Yu-Lun Liu

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffIR2VR-Zero通过层次化潜在扭曲和混合token合并机制,实现无需额外训练的视频修复,提升时间一致性与修复质量。

Comments Project page: https://jimmycv07.github.io/DiffIR2VR_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23983 2026-01-01 cs.CV 57%

DriveExplorer: Images-Only Decoupled 4D Reconstruction with Progressive Restoration for Driving View Extrapolation

DriveExplorer: 基于图像的解耦4D重建与渐进修复用于驾驶视角外推

Yuang Jia, Jinlong Wang, Jiayi Zhao, Chunlam Li, Shunzhou Wang, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省级超高清沉浸媒体技术重点实验室) School of Electronic and Computer Engineering(电子与计算机工程学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 DriveExplorer通过图像解耦和渐进修复实现驾驶视角外推,利用4D高斯框架和扩散模型提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03913 2026-01-01 cs.SD eess.AS 50%

STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling

STSR:通过频谱-瞬态上下文建模实现高质量语音超分辨率

Jiajun Yuan, Xiaochen Wang, Yuhang Xiao, Yulin Wu, Chenhao Hu, Xueyang Lv

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science(多媒体软件国家工程研究中心,计算机科学学院) School of Artificial Intelligence(人工智能学院)

专题命中 图像修复 :diffusion(abstract)

AI总结 STSR通过频谱-瞬态上下文建模实现高质量语音超分辨率,结合MDCT域的统一端到端框架,提升谐波一致性和瞬态锐利度,优于现有基线。

Comments 5 pages Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏