arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-09 至 2025-12-09 共收录 95 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70 篇

2512.06508 2025-12-09 cond-mat.stat-mech physics.flu-dyn 50%

Convective Viscous Cahn-Hilliard/Allen-Cahn Equation with memory effects

具有记忆效应的对流粘性Cahn-Hilliard/Allen-Cahn方程

P. O. Mchedlov-Petrosyan, L. N. Davydov

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种结合记忆效应的对流粘性Cahn-Hilliard/Allen-Cahn方程,用于描述表面过程,并获得了精确解以分析场、耗散和记忆的综合作用。

Comments 7 pages, without figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06503 2025-12-09 astro-ph.HE astro-ph.SR 50%

Optical Study of TRAPUM Pulsars and Modelling of the Redbacks: PSR J1036$-$4353 and PSR J1803$-$6707

TRAPUM脉冲星的光学研究及红背星伴星建模:PSR J1036$-$4353和PSR J1803$-$6707

A. Phosrisom, R. P. Breton, C. J. Clark, M. Burgay, J. Strader, L. Chomiuk, K. V. Sokolovsky, I. Molina, R. Urquhart, M. R. Kennedy, S. J. Wagner, V. S. Dhillon, O. G. Dodge, B. W. Stappers, T. Thongmeearkom

专题命中 扩散模型 :diffusion(abstract)

AI总结 TRAPUM项目通过光学观测发现两颗红背伴星,并利用不同辐射模型拟合其光变曲线,揭示辐射能量沉积在恒星光球深处。

Comments Accepted for publication in Monthly Notices of the Royal Astronomical Society. 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06402 2025-12-09 econ.TH 50%

Innovation, Spillovers and Economic Geography

创新、外溢与经济地理

José M. Gaspar, Minoru Osawa

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了创新、知识外溢与经济地理的关系,探讨了内在与地区间外溢权重如何影响经济活动的空间分布及长期均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06047 2025-12-09 physics.flu-dyn 50%

From Time Series Expansion to Proper Generalized Decomposition via Graph-Theoretical Connection: Stabilized Simulation of Fluids Flow

从时间序列扩展到proper generalized decomposition:通过图论连接实现流体流动的稳定模拟

Ahmad Deeb, Vladimir Parezanovic, Denys Dutykh

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过图论连接时间序列扩展与proper generalized decomposition方法,提出稳定时间序列扩展和简化PGD框架,用于模拟流体流动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06031 2025-12-09 physics.flu-dyn cs.LG physics.comp-ph 50%

Multi-resolution Physics-Aware Recurrent Convolutional Neural Network for Complex Flows

多分辨率物理感知递归卷积神经网络用于复杂流体

Xinlun Cheng, Joseph Choi, H. S. Udaykumar, Stephen Baek

机构 * School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学) Department of Mechanical Engineering, University of Iowa(机械工程系,爱荷华大学) Department of Mechanical and Aerospace Engineering, University of Virginia(机械与航空航天工程系,弗吉尼亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 MRPARCv2通过多分辨率架构和物理约束提升复杂流体模拟精度与效率,显著优于单分辨率模型。

Journal ref APL Mach. Learn. 3, 046110 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05994 2025-12-09 eess.AS cs.AI cs.CL cs.SD 50%

KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening

KidSpeak: 一个通用的多用途大语言模型用于儿童语音识别与筛查

Rohan Sharma, Dancheng Liu, Jingchen Sun, Shijie Zhou, Jiayu Qin, Jinjun Xiong, Changyou Chen

机构 * Department of Computer Science and Engineering, State University of New York at Buffalo(计算机科学与工程系,纽约州立大学布法罗分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 KidSpeak是首个为儿童语音识别与筛查设计的多用途大语言模型,结合语音增强技术与FASA对齐工具,实现87%的准确率,提升儿童语音数据质量13.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00940 2025-12-09 cond-mat.mes-hall 50%

Anisotropic linear magnetoresistance in nanoflakes of Dirac semimetal NiTe2

NiTe₂狄拉克半金属纳米薄片中的各向异性线性磁电阻

Ding Bang Zhou, Kuang Hong Gao, Tie Lin, Yang Yang, Meng Fan Zhao, Zhi Yan Jia, Xiao Xia Hu, Qian Jin Guo, Zhi Qing Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示NiTe₂纳米薄片中各向异性线性磁电阻的两种物理机制,发现厚度依赖性和非经典效应源于狄拉克点附近的非线性带效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07118 2025-12-09 cs.RO 50%

DexFruit: Dexterous Manipulation and Gaussian Splatting Inspection of Fruit

DexFruit:灵巧操作与高分辨率3D高斯点云损伤检测

Aiden Swann, Alex Qiu, Matthew Strong, Angelina Zhang, Samuel Morstein, Kai Rayle, Monroe Kennedy

机构 * Department of Mechanical Engineering(机械工程系) Department of Computer Science(计算机科学系) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 DexFruit通过光学触觉传感实现对水果的自主操作,减少损伤并提升抓取成功率,引入FruitSplat技术量化3D高斯点云中的视觉损伤。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22370 2025-12-09 cs.RO cs.LG 50%

Grasping a Handful: Sequential Multi-Object Dexterous Grasp Generation

抓取一束:序列多物体灵巧抓取生成

Haofei Lu, Yifei Dong, Zehang Weng, Florian T. Pokorny, Jens Lundell, Danica Kragic

机构 * Robotics, Perception, and Learning (RPL) at KTH(KTH机器人、感知与学习中心) Robotics and Autonomous Systems at University of Turku(图尔库大学机器人与自主系统中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出SeqGrasp和SeqDiffuser,通过序列生成方法在仿真和真实机器人上实现了比MultiGrasp更高的抓取成功率和更快的生成速度。

Comments We replace the sets in Section II with an odered sequences

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 11, pp. 11880-11887, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10777 2025-12-09 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Prolonging Carrier Lifetime in P-type 4H-SiC Epilayer by Thermal Oxidation and Hydrogen Annealing

通过热氧化和氢退火延长P型4H-SiC外延层载流子寿命

Ruijun Zhang, Mingkun Zhang, Guoliang Zhang, Yujian Chen, Jia Liu, Ziqian Tian, Ye Yu, Peng Zhao, Shaoxiong Wu, Yuning Zhang, Dingqu Lin, Xiaping Chen, Jiafa Cai, Rongdun Hong, Feng Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过热氧化和氢退火工艺有效延长P型4H-SiC外延层的少数载流子寿命,提升高电压SiC双极器件性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00681 2025-12-09 stat.ML cs.LG 50%

Alpha-VI DeepONet: A prior-robust variational Bayesian approach for enhancing DeepONets with uncertainty quantification

Alpha-VI DeepONet:一种用于增强DeepONet的先验鲁棒变分贝叶斯方法,用于不确定性量化

Soban Nasir Lone, Subhayan De, Rajdip Nayek

机构 * Department of Applied Mechanics(应用力学系) Indian Institute of Technology Delhi(印度理工学院德里) Department of Mechanical Engineering(机械工程系) Northern Arizona University(北亚利桑那大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 Alpha-VI DeepONet通过引入Rényi的α-分歧改进DeepONet,提升不确定性量化能力,在机械系统中表现出更高的预测准确性和鲁棒性。

Journal ref Computer Methods in Applied Mechanics and Engineering, 449(B), 118552, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16028 2025-12-09 cs.LG cs.AI 50%

TimeAutoDiff: A Unified Framework for Generation, Imputation, Forecasting, and Time-Varying Metadata Conditioning of Heterogeneous Time Series Tabular Data

TimeAutoDiff:一个统一框架,用于生成、填补缺失数据、预测以及时间变化元数据条件下的异质时间序列表格数据

Namjoon Suh, Yuning Yang, Din-Yin Hsieh, Qitong Luan, Shirong Xu, Shixiang Zhu, Guang Cheng

机构 * UCLA(美国大学联盟) Microsoft(微软公司) Xiamen Univ.(厦门大学) CMU(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 TimeAutoDiff通过统一框架实现时间序列生成、填补、预测及元数据条件生成,结合轻量级VAE和扩散模型,提升效率与泛化能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15710 2025-12-09 math.OC 50%

Properties for transposition solutions to operator-valued BSEEs, and applications to robust second order necessary conditions for controlled SEEs

关于算子值BSEEs的交换解性质,及其在受控SEEs鲁棒二阶必要条件中的应用

Guangdong Jing

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在传统Pontryagin型最大原理退化情况下,随机演化方程的鲁棒二阶必要条件,通过交换方法和Malliavin算子推导点wise鲁棒最优性条件。

Comments 39 pages

Journal ref Journal of Mathematical Analysis and Applications. Volume 549, Issue 1, 1 September 2025, 129445

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16607 2025-12-09 math.PR math-ph math.MP 50%

Spectral gap of the symmetric inclusion process

对称包含过程的谱间隙

Seonwoo Kim, Federico Sau

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了对称包含过程的谱间隙,通过建立其与同一图上随机游走谱间隙的关系,验证了Aldous的谱间隙猜想,并扩展到布朗能量过程。

Comments 21 pages. Appendix added. Final journal version

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00631 2025-12-09 econ.GN q-fin.CP q-fin.EC 50%

Optimal Investment, Consumption, and Insurance with Durable Goods under Stochastic Depreciation Risk

在随机折旧风险下耐用消费品的最优投资、消费与保险

Aleksandar Arandjelović, Ryle S. Perera, Pavel V. Shevchenko, Tak Kuen Siu, Jin Sun

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在随机折旧风险下,经济代理人如何通过最优投资、消费和保险策略最大化CRRA效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2512.07170 2025-12-09 cs.CV cs.AI 79%

Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach

迈向统一的语义和可控图像融合:一种扩散变换器方法

Jiayang Li, Chengjie Jiang, Junjun Jiang, Pengwei Liang, Jiayi Ma, Liqiang Nie

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electronic Information School, Wuhan University(武汉大学电子信息学院)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 DiTFuse通过融合图像与自然语言指令,实现端到端、语义感知的图像融合,统一了多种融合任务并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12175 2025-12-09 cs.SD eess.AS 78%

Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis

音频调色盘:一种多信号条件的扩散变压器用于可控的 Foley 合成

Junnuo Wang

机构 * New York University(纽约大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 Audio Palette通过多信号条件和LoRA技术实现可控Foley合成,提供高效、可解释的音频生成与控制方法。

Comments Accepted for publication in the Artificial Intelligence Technology Research (AITR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 57%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01254 2025-12-09 cs.CV 57%

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation

EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中

Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV 57%

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10339 2025-12-09 cs.CV 57%

Towards Unsupervised Domain Bridging via Image Degradation in Semantic Segmentation

通过图像退化实现无监督领域桥接的语义分割方法

Wangkai Li, Rui Sun, Huayu Mai, Tianzhu Zhang

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DiDA通过图像退化构建中间领域并补偿语义偏移,提升语义分割在不同领域间的适应性能。

Comments Accepted by Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15703 2025-12-09 math.OC 50%

Robust pointwise second order necessary conditions for singular stochastic optimal control with model uncertainty

具有模型不确定性的奇异随机最优控制的鲁棒点wise二次必要条件

Guangdong Jing

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种针对具有模型不确定性的奇异随机最优控制问题的鲁棒点wise二次必要条件,结合凸变分方法和极小极大定理,通过例子验证了方法的有效性。

Comments 35 pages

Journal ref Volume 92, article number 66, (2025)https://link.springer.com/article/10.1007/s00245-025-10297-9

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 4 篇

2308.09388 2025-12-09 cs.CV 83%

Diffusion Models for Image Restoration and Enhancement: A Comprehensive Survey

扩散模型在图像修复与增强中的应用:全面综述

Xin Li, Yulin Ren, Xin Jin, Cuiling Lan, Xingrui Wang, Wenjun Zeng, Xinchao Wang, Zhibo Chen

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) Eastern Institute for Advanced Study(东部高级研究机构) Microsoft Research Asia(微软亚洲研究院)

专题命中 图像修复 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文首次全面综述了基于扩散模型的图像修复与增强方法,涵盖学习范式、条件策略、框架设计等,并提出未来研究方向。

Comments Accepted by IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06392 2025-12-09 eess.AS cs.SD 78%

Janssen 2.0: Audio Inpainting in the Time-frequency Domain

Janssen 2.0:时频域中的音频修复

Ondřej Mokrý, Peter Balušík, Pavel Rajmic

机构 * Dept.\ of Telecommunications Brno University of Technology Czech Republic

专题命中 图像修复 :inpainting(title,abstract)

AI总结 Janssen 2.0通过改进的时频域方法实现音频修复,优于深度先验神经网络方法。

Comments Accepted to EUSIPCO 2025

Journal ref 2025 33rd European Signal Processing Conference (EUSIPCO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20101 2025-12-09 cs.SD cs.CL eess.AS 78%

Is Self-Supervised Learning Enough to Fill in the Gap? A Study on Speech Inpainting

自监督学习是否足以填补空白?语音修复研究

Ihab Asaad, Maxime Jacquelin, Olivier Perrotin, Laurent Girin, Thomas Hueber

机构 * Univ. Grenoble Alpes, CNRS, Grenoble-INP, GIPSA-lab(格陵兰大学阿尔卑斯分校、国家科学研究中心、格勒诺布尔INP、GIPSA实验室)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本研究探讨了使用自监督学习训练的语音编码器进行语音修复,发现其在单人语音场景中表现更佳,而在多人语音场景中预训练编码器更有效。

Comments Accepted for publication to Computer Speech and Language journal (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04433 2025-12-09 eess.AS cs.SD 78%

Tweaking autoregressive methods for inpainting of gaps in audio signals

调整自回归方法以修复音频信号中的缺口

Ondřej Mokrý, Pavel Rajmic

机构 * Department of Telecommunications Brno University of Technology Czech Republic(电信系布拉格技术大学捷克共和国)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本文提出了一种改进的Janssen方法,用于音频信号中缺口的修复,通过实验验证了其在客观指标和听觉测试中的优越性。

Comments Accepted to EUSIPCO 2025

Journal ref 2025 33rd European Signal Processing Conference (EUSIPCO)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 4 篇

2512.07584 2025-12-09 cs.CV 81%

LongCat-Image Technical Report

LongCat-Image 技术报告

Meituan LongCat Team, Hanghang Ma, Haoxian Tan, Jiale Huang, Junqiang Wu, Jun-Yan He, Lishuai Gao, Songlin Xiao, Xiaoming Wei, Xiaoqi Ma, Xunliang Cai, Yayong Guan, Jie Hu

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 LongCat-Image通过双语开源模型提升多语言图像生成与编辑能力,实现高效部署与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07328 2025-12-09 cs.CV cs.AI 79%

ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation

ContextAnyone: 基于上下文的扩散模型用于一致的文本到视频生成

Ziyang Mai, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 ContextAnyone通过上下文感知扩散模型实现从文本和参考图像生成一致的角色视频,结合双引导损失和Gap-RoPE位置嵌入提升视觉质量和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07618 2025-12-09 cs.CV cs.AI 79%

Moyun: A Diffusion-Based Model for Style-Specific Chinese Calligraphy Generation

莫云:一种基于扩散模型的风格特定中文书法生成模型

Kaiyuan Liu, Jiahao Mei, Hengyu Zhang, Yihuai Zhang, Daoguo Dong, Liang He

机构 * School of Computer Science and Technology(计算机科学与技术学院) East China Normal University(华东师范大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 莫云模型通过引入Vision Mamba和TripleLabel机制,实现了基于书法家、字体和字符风格的可控书法生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10826 2025-12-09 cs.SD cs.MM eess.AS 57%

SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing

SteerMusic: 增强零射文本引导和个性化音乐编辑的音乐一致性

Xinlei Niu, Kin Wai Cheuk, Jing Zhang, Naoki Murata, Chieh-Hsin Lai, Michele Mancusi, Woosung Choi, Giorgio Fabbro, Wei-Hsiang Liao, Charles Patrick Martin, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 SteerMusic通过delta去噪分数和概念令牌实现零射文本引导和个性化音乐编辑,提升音乐一致性与编辑保真度。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏