arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-19 至 2025-12-19 共收录 56 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 35 篇

2502.21141 2025-12-19 econ.GN q-fin.EC 50%

Tracks to Modernity: Railroads, Growth, and Social Movements in Denmark

轨道与现代性:铁路发展、经济增长与社会运动在丹麦的影响

Tom Görges, Magnus Ørberg Rove, Paul Sharp, Christian Vedel

专题命中 扩散模型 :diffusion(abstract)

AI总结 铁路发展推动了丹麦19世纪经济转型和公民参与机构的扩散,通过提高人口和结构性变化加速了社会文化变革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16449 2025-12-19 cs.RO 50%

Single-View Shape Completion for Robotic Grasping in Clutter

单视角形状补全用于机器人抓取中的杂乱环境

Abhishek Kashyap, Yuxuan Yang, Henrik Andreasson, Todor Stoyanov

机构 * Örebro University(奥雷布罗大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究利用扩散模型实现单视角下杂乱环境中物体的3D形状补全,提升机器人抓取成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16388 2025-12-19 physics.flu-dyn 50%

Marangoni instabilities of cylindrical drops in a vertical Hele-Shaw cell immersed in stratified liquids

垂直海利-沙瓦细胞中浸没在分层液体中的圆柱形液滴的马兰戈尼不稳定性

Li-Chen Huang, Yanshen Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了垂直海利-沙瓦细胞中浸没在分层液体中的圆柱形液滴的马兰戈尼不稳定性,发现两种不同的不稳定性模式,并提出统一的标度理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16288 2025-12-19 cond-mat.soft nlin.AO nlin.PS physics.bio-ph physics.flu-dyn 50%

Explosive dispersal of non-motile microbes through metabolic buoyancy

非运动微生物通过代谢浮力实现爆炸性扩散

Jimreeves David, Shashi Thutupalli

专题命中 扩散模型 :diffusion(abstract)

AI总结 非运动微生物通过代谢浮力驱动对流实现细胞团块的爆炸性扩散,形成分形图案并增强代谢活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15958 2025-12-19 cond-mat.mtrl-sci 50%

Active Learning Discovery of High Temperature Oxidation Resistant Refractory Complex Concentrated Alloys

主动学习发现高温度氧化抗性复杂浓缩型耐火合金

Akhil Bejjipurapu, Sharmila Karumuri, Joseph C. Flanagan, Victoria Tucker, Ilias Bilionis, Alejandro Strachan, Kenneth H. Sandhage, Michael S. Titus

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过主动学习框架发现两种高温度氧化抗性合金,兼具高硬度和热膨胀兼容性,为极端环境材料开发提供新策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15814 2025-12-19 astro-ph.IM astro-ph.SR 50%

Asteroseismology of white dwarfs in the 2040s

2040年代白矮星的星震学

Murat Uzundag, Ingrid Pelisoli, Stephane Charpinet, Alejandro H. Corsico, Leandro G. Althaus, V. Van Grootel, Suzanna Randall, Thomas Kupfer, Roberto Raddi

专题命中 扩散模型 :diffusion(abstract)

AI总结 2040年代,通过结合高精度空间光度计与地面光谱学观测,将提高白矮星脉动观测的数量和质量,以解决白矮星质量测定和内部结构理解的挑战。

Comments White paper in response to ESO's "Expanding Horizons" call

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15743 2025-12-19 cs.AI 50%

Prompt-to-Parts: Generative AI for Physical Assembly and Scalable Instructions

Prompt-to-Parts: 生成式AI用于物理装配和可扩展指令

David Noever

专题命中 扩散模型 :diffusion(abstract)

AI总结 Prompt-to-Parts通过生成式AI生成物理可实现的装配指令,结合LDraw中间表示和Python库,实现复杂结构的可建造输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10506 2025-12-19 cs.SI 50%

WorldMove, a global open data for human mobility

WorldMove,一个全球开放的人类移动数据集

Yuan Yuan, Yuheng Zhang, Jingtao Ding, Yong Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 WorldMove通过基于扩散的生成模型,生成全球1600多个城市的高质量合成移动数据,填补数据缺口并支持隐私保护的移动研究。

Comments Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17314 2025-12-19 cond-mat.mes-hall 50%

Photoluminescence efficiency of MBE-grown MoSe$_2$ monolayers featuring sharp excitonic lines and diverse grain structures

MBE生长的MoSe₂单层的光致发光效率,具有锐利的激子线和多样的晶粒结构

Mateusz Raczyński, Julia Kucharek, Kacper Oreszczuk, Aleksander Rodek, Tomasz Kazimierczuk, Rafał Bożek, Takashi Taniguchi, Kenji Watanabe, Wojciech Pacuski, Piotr Kossacki

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过比较MBE生长的MoSe₂单层与剥离单层的发光效率,揭示了发光效率与样品覆盖率的关系,并发现激子扩散和边缘效应在纳米级晶体中可忽略。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2511.06833 2025-12-19 cs.CV 79%

ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search

ConsistTalk: 可控强度的时序一致说话头生成与扩散噪声搜索

Zhenjie Liu, Jianzhang Lu, Renjie Lu, Cong Liang, Shangfei Wang

机构 * The corresponding author.(通讯作者)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 ConsistTalk通过引入光流引导时间模块、音频到强度模型和扩散噪声初始化策略,实现了可控强度和时序一致的说话头生成,有效减少闪烁并提升音频视频同步质量。

Comments AAAI26 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16270 2025-12-19 cs.CV cs.AI 70%

TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering

TextEditBench: 评估超出渲染的推理-aware文本编辑

Rui Gui, Yang Wan, Haochen Han, Dongxing Mao, Fangming Liu, Min Li, Alex Jinpeng Wang

机构 * Central South University(中南大学) Pengcheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 TextEditBench 旨在评估文本编辑中超出渲染的推理能力,通过引入语义期望维度,推动多模态生成中的文本引导编辑技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16913 2025-12-19 cs.CV 57%

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

全景深度估计的基础模型:Depth Any Panoramas

Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi

机构 * Insta360 Research(Insta360研究院) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种全景深度估计的基础模型,通过三阶段伪标签流程和优化方法提升模型在不同场景下的鲁棒性和泛化能力。

Comments Project Page: https://insta360-research-team.github.io/DAP_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12998 2025-12-19 cs.CV 57%

PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching

PerTouch:基于VLM的个性化和语义图像润色代理

Zewei Chang, Zheng-Peng Duan, Jianxing Zhang, Chun-Le Guo, Siyu Liu, Hyungju Chun, Hyunhee Park, Zikun Liu, Chongyi Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PerTouch通过VLM驱动代理实现个性化和语义图像润色,结合语义替换与参数扰动机制,提升用户意图匹配与长期偏好捕捉能力。

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16330 2025-12-19 hep-ph hep-ex hep-th nucl-ex nucl-th 50%

Ultra fast, event-by-event heavy-ion simulations for next generation experiments

超快、事件级重离子模拟用于下一代实验

Manjunath Omana Kuttan, Kai Zhou, Jan Steinheimer, Horst Stoecker

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于概率扩散模型的新型框架,用于快速生成重离子碰撞事件的点云输出,能够高效模拟并再现UrQMD分布。

Comments Matches published version. 17 pages, 9 figures

Journal ref Phys.Rev.C 112 (2025) 5, 054907

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15996 2025-12-19 eess.SY cs.SY 50%

Lyapunov-based Adaptive Transformer (LyAT) for Control of Stochastic Nonlinear Systems

基于李雅普诺夫的自适应变换器(LyAT)用于随机非线性系统的控制

Saiedeh Akbari, Xuehui Shen, Wenqian Xue, Jordan C. Insinger, Warren E. Dixon

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出LyAT控制器,通过基于李雅普诺夫的稳定性分析实现随机非线性系统的实时自适应控制,保证跟踪和参数估计误差的有界性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03303 2025-12-19 math.OC cs.LG cs.NA math.NA 50%

Machine Learning and Control: Foundations, Advances, and Perspectives

机器学习与控制:基础、进展与展望

Enrique Zuazua

机构 * Chair for Dynamics, Control, Machine Learning, and Numerics, Alexander von Humboldt-Professorship, Department of Mathematics, Friedrich-Alexander-Universität Erlangen-Nürnberg(动力学、控制、机器学习和数值学主席,亚历山大·冯·洪堡教授职位,数学系,弗里德里希-亚历山大-大学埃尔兰根-纽伦堡) Departamento de Matemáticas, Universidad Autónoma de Madrid(数学系,马德里自治大学) Chair of Computational Mathematics, Deusto University(计算数学教授,德图斯大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文探讨了控制理论与机器学习的交叉领域,提出混合协作学习方法,结合机械与数据驱动方法,并利用扩散过程性质解释生成式AI的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2512.16688 2025-12-19 cs.CV 79%

Detecting Localized Deepfakes: How Well Do Synthetic Image Detectors Handle Inpainting?

检测局部深度伪造:合成图像检测器如何处理修补?

Serafino Pandolfini, Lorenzo Pellegrini, Matteo Ferrara, Davide Maltoni

机构 * University of Bologna, Italy(博洛尼亚大学)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本文评估了现有合成图像检测器在局部修补检测中的表现,发现训练于大规模生成器数据的模型能有效检测中等和大区域的修补,优于现有方法。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15119 2025-12-19 cs.CV cs.LG 70%

Deep generative priors for 3D brain analysis

深度生成先验用于3D脑分析

Ana Lawry Aguila, Dina Zemlyanker, You Cheng, Sudeshna Das, Daniel C. Alexander, Oula Puonti, Annabel Sorby-Adams, W. Taylor Kimberly, Juan Eugenio Iglesias

机构 * Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital and Harvard Medical School(阿提诺拉A.马丁诺斯生物医学成像中心、麻省总医院和哈佛医学院) Department of Neurology, Massachusetts General Hospital(麻省总医院神经科) Hawkes Institute, University College London(霍克斯研究所、伦敦大学学院) Danish Research Centre for Magnetic Resonance Department of Radiology and Nuclear Medicine, Copenhagen University Hospital – Amager and Hvidovre(丹麦磁共振研究中心放射科和核医学科、哥本哈根大学医院-阿马格和赫维多雷) Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL)、麻省理工学院)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出利用扩散模型作为先验,解决多种医学影像逆问题,通过训练和灵活的正向模型提升解剖结构的保真度,实现高质量的3D脑分析。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 1 篇

2512.16853 2025-12-19 cs.CV cs.AI 79%

GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation

GenEval 2:解决文本到图像评估中的基准漂移问题

Amita Kamath, Kai-Wei Chang, Ranjay Krishna, Luke Zettlemoyer, Yushi Hu, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR 部门) University of Washington(华盛顿大学) University of California, Los Angeles(洛杉矶大学) Allen Institute for AI(人工智能研究院)

专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV

AI总结 GenEval 2通过改进的视觉概念覆盖和组合性,解决文本到图像评估中的基准漂移问题,提供更符合人类判断的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2401.16764 2025-12-19 cs.CV 83%

BoostDream: Efficient Refining for High-Quality Text-to-3D Generation from Multi-View Diffusion

BoostDream: 高效细化用于多视角扩散模型生成高质量文本到3D生成

Yonghao Yu, Shunan Zhu, Huai Qin, Haorui Li

机构 * Waseda University(早稻田大学) Southeast University(东南大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 BoostDream通过高效细化方法,结合多视角SDS损失和法线图指导,实现快速生成高质量的3D资产,提升生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16093 2025-12-19 cs.CV cs.AI cs.LG 79%

TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times

TurboDiffusion:通过100-200倍加速视频扩散模型

Jintao Zhang, Kaiwen Zheng, Kai Jiang, Haoxu Wang, Ion Stoica, Joseph E. Gonzalez, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(盛舒科技) UC Berkeley(加州大学伯克利分校)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 TurboDiffusion通过低比特注意力、步骤蒸馏和W8A8量化等技术,实现视频扩散模型100-200倍加速并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00878 2025-12-19 cs.CL cs.AI 67%

Less is More: Resource-Efficient Low-Rank Adaptation

少即是多:资源高效的低秩适应

Chunlin Tian, Xuyang Wei, Huanrong Liu, Zhijiang Guo, Li Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)

AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16915 2025-12-19 cs.CV 57%

StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors

StereoPilot: 通过生成先验学习统一且高效的立体转换

Guibao Shen, Yihua Du, Wenhang Ge, Jing He, Chirui Chang, Donghao Zhou, Zhen Yang, Luozhou Wang, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 StereoPilot通过生成先验学习实现高效立体转换,提升视觉保真度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11403 2025-12-19 math.NA cs.NA 50%

Hadamard Langevin dynamics for sampling the l1-prior

Hadamard Langevin动态用于采样l1先验

Ivan Cheltsov, Federico Cornalba, Clarice Poon, Tony Shardlow

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出Hadamard Langevin动态方法,用于采样l1先验,通过非光滑对数密度的参数化,实现精确后验恢复,并建立理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16430 2025-12-19 cs.LG cs.NA math.NA 50%

Multi-Fidelity Delayed Acceptance: hierarchical MCMC sampling for Bayesian inverse problems combining multiple solvers through deep neural networks

多保真度延迟接受:用于贝叶斯反问题的分层MCMC采样,通过深度神经网络结合多个求解器

Filippo Zacchei, Paolo Conti, Attilio Alberto Frangi, Andrea Manzoni

机构 * The Alan Turing Institute, London, NW1 2DB, UK(艾伦·图灵研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出多保真度延迟接受方法,通过深度神经网络结合多个求解器,提升贝叶斯反问题的计算效率和精度。

Comments 28 pages, 8 tables, 3 algorithms, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2512.16910 2025-12-19 cs.CV cs.LG 57%

SFTok: Bridging the Performance Gap in Discrete Tokenizers

SFTok: 缩小离散分词器在性能上的差距

Qihang Rao, Borui Zhang, Wenzhao Zheng, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 SFTok通过多步骤迭代机制和自引导视觉重建策略,提升图像重建质量,实现高压缩率下的高性能表现。

Comments Under review. Code is available at https://github.com/Neur-IO/SFTok

详情

展开后加载摘要…

URL PDF HTML 收藏