arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-17 至 2025-12-17 共收录 59 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 37 篇

2507.19044 2025-12-17 astro-ph.HE cond-mat.stat-mech physics.plasm-ph 50%

Cosmic-ray transport in inhomogeneous media

宇宙射线在非均匀介质中的传输

Robert J. Ewart, Patrick Reichherzer, Shuzhe Ren, Stephen Majeski, Francesco Mori, Michael L. Nastac, Archie F. A. Bott, Matthew W. Kunz, Alexander A. Schekochihin

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究多相介质中宇宙射线传输的理论,揭示其在不同时间尺度下的扩散特性及影响因素

Comments 14 pages 8 figures

Journal ref Mon Not R Astron Soc (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12316 2025-12-17 physics.flu-dyn astro-ph.EP astro-ph.SR physics.geo-ph 50%

Large-scale clustering of inertial particles in a rotating, stratified and inhomogeneous turbulence

旋转、分层且不均匀湍流中惰性粒子的大尺度聚类

Nathan Kleeorin, Igor Rogachevskii

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究旋转湍流中惰性粒子的大尺度聚类现象,揭示其在不同相互作用模式下的分布特征及形成时间尺度。

Comments 18 pages, revtex4-2, revised, final version

Journal ref Physics of Fluids 37, 065152 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14301 2025-12-17 math.NA cs.NA math.OC 50%

Separation-free exponential fitting with structured noise, with applications to inverse problems in parabolic PDEs

无分离指数拟合与结构噪声,应用于抛物型PDE逆问题

Rami Katz, Dmitry Batenkov, Giulia Giordano

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种在结构噪声下无分离指数拟合方法,证明了Prony方法在无分离情况下仍能保持最优误差衰减,并应用于抛物型PDE逆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14105 2025-12-17 cs.IT math.IT 50%

Target Detection in Clustered Mobile Nanomachine Networks

集群移动纳米机器网络中的目标检测

Nithin V. Sabu, Kaushlendra Pandey, Abhishek K. Gupta, Sameer S. M

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于扩散的分子通信网络分析框架,用于在三维介质中通过集群部署的纳米机检测目标,分析了集群结构对检测性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13846 2025-12-17 astro-ph.HE 50%

A wide-field X-ray search for the Geminga pulsar halo with SRG/ART-XC

为Geminga脉冲星halo进行宽视场X射线搜索

Roman Krivonos, Silvia Manconi, Vadim Arefiev, Andrei Bykov, Fiorenza Donato, Ekaterina Filippova, Alexander Lutovinov, Mattia Di Mauro, Kaya Mori, Alexey Tkachenko, Jooyun Woo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文利用SRG/ART-XC对Geminga脉冲星halo进行宽视场X射线搜索,首次提供了直接成像并设定了磁感应强度约束。

Comments 7 pages, 6 figures. Accepted for publication in Astronomy & Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13735 2025-12-17 cs.LG cs.AI 50%

DARTs: A Dual-Path Robust Framework for Anomaly Detection in High-Dimensional Multivariate Time Series

DARTs:一种用于高维多变量时间序列异常检测的双路径稳健框架

Xuechun Liu, Heli Sun, Xuecheng Wu, Ruichen Cao, Yunyun Shi, Dingkang Yang, Haoran Li

机构 * Xi’an Jiaotong University, School of Computer Science and Technology(西安交通大学计算机科学与技术学院) Fudan University, College of Intelligent Robotics and Advanced Manufacturing(复旦大学智能机器人与先进制造学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 DARTs通过双路径框架和窗口感知机制,提升高维多变量时间序列异常检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07342 2025-12-17 cs.CR cs.LG 50%

PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning

PrivORL: 用于离线强化学习的差分隐私合成数据集

Chen Gong, Zheng Liu, Kecen Li, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 PrivORL通过差分隐私技术合成离线强化学习数据集,利用扩散模型和好奇心驱动预训练提升合成数据的多样性和保真度。

Comments Accepted at NDSS 2026; code available at https://github.com/2019ChenGong/PrivORL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17558 2025-12-17 eess.SP cs.AI 50%

WaveC2R: Wavelet-Driven Coarse-to-Refined Hierarchical Learning for Radar Retrieval

WaveC2R: 基于小波的粗到精细分层学习用于雷达检索

Chunlei Shi, Han Xu, Yinghao Li, Yi-Lin Wei, Yongchao Feng, Yecheng Zhang, Dan Niu

专题命中 扩散模型 :diffusion(abstract)

AI总结 WaveC2R通过小波驱动的粗到精细分层学习,整合多源数据,提升卫星雷达检索中降水模式和气象边界的准确捕捉能力。

Comments This work has been accepted by AAAI2026, AAAI2026 Project's webpage at this URL:https://spring-lovely.github.io/WaveC2R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13201 2025-12-17 cs.IR 50%

Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation

Cog-RAG: 基于认知的双超图主题对齐检索增强生成

Hao Hu, Yifan Feng, Ruoxue Li, Rundong Xue, Xingliang Hou, Zhiqiang Tian, Yue Gao, Shaoyi Du

专题命中 扩散模型 :diffusion(abstract)

AI总结 Cog-RAG通过双超图结构和主题对齐策略,提升检索增强生成的语义对齐与生成一致性。

Comments Accepted by AAAI 2026 main conference

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01653 2025-12-17 cond-mat.quant-gas hep-ph 50%

Anomalous non-thermal fixed point in a quasi-two-dimensional dipolar Bose gas

准二维各向异性玻色气体中异常非热固定点

Niklas Rasch, Lauriane Chomaz, Thomas Gasenzer

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究准二维各向异性玻色气体中异常非热固定点的尺度行为,发现亚扩散指数$\beta\approx0.2$,并通过涡旋-反涡旋湮灭过程揭示非热固定点的转变。

Comments 20 pages, 11 figures

Journal ref Phys. Rev. A 112, 053310 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10649 2025-12-17 cond-mat.stat-mech cond-mat.mtrl-sci 50%

Thermal response functions and second sound in single-layer hexagonal boron nitride

单层六方氮化硼中的热响应函数与第二声

Patrick K. Schelling, Antonio Martinez Margolles, Logan Echazabal

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过分子动力学模拟研究单层六方氮化硼中的热响应函数与第二声现象,揭示了第二声在特定条件下可被观测,并探讨了其理论方法和材料特性。

Comments 27 pages, 11 figures, to be submitted to Phys. Rev. B

Journal ref Phys. Rev. B 112, 024307 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.08643 2025-12-17 math.DS math.CA 50%

Morse index theorem for heteroclinic, homoclinic and halfclinic orbits of Lagrangian systems

Lagrangian系统中异宿轨道、同宿轨道和半clinic轨道的莫尔斯指数定理

Xijun Hu, Alessandro Portaluri, Li Wu, Qin Xing

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种更通用的Lagrangian系统中异宿、同宿和半clinic轨道莫尔斯指数定理,并通过具体模型计算了相关指数。

Comments 38 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2512.14061 2025-12-17 cs.CV 79%

Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution

弥合保真度与现实的差距:可控制的一步扩散用于图像超分辨率

Hao Chen, Junyang Chen, Jinshan Pan, Jiangxin Dong

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CODSR通过LQ引导特征调制、区域自适应生成先验激活和文本匹配指导策略,提升图像超分辨率的保真度与感知质量。

Comments Project page: https://github.com/Chanson94/CODSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07712 2025-12-17 cs.CV 57%

UnCageNet: Tracking and Pose Estimation of Caged Animal

UnCageNet: 有笼动物的跟踪与姿态估计

Sayak Dutta, Harish Katti, Shashikant Verma, Shanmuganathan Raman

机构 * Indian Institute of Technology Gandhinagar(印度古吉拉特邦理工学院加尔各答分校) National Institutes of Health (NIH)(美国国家卫生研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 UnCageNet通过三阶段预处理流程有效解决笼子结构和遮挡对动物跟踪与姿态估计的影响,提升姿态估计和关键点检测精度。

Comments 9 pages, 2 figures, 2 tables. Accepted to the Indian Conference on Computer Vision, Graphics, and Image Processing (ICVGIP 2025), Mandi, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14217 2025-12-17 cs.CV cs.RO 57%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14162 2025-12-17 cs.CV 57%

FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation

FastDDHPose: 向统一、高效且解耦的3D人体姿态估计迈进

Qingyuan Cai, Linxin Zhang, Xuecai Hu, Saihui Hou, Yongzhen Huang

机构 * Watrix Technology Limited Company Ltd(沃特克斯技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FastDDHPose通过解耦扩散模型提升3D人体姿态估计的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2025-12-17 cs.CV 57%

Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14291 2025-12-17 cs.SD 50%

GLM-TTS Technical Report

GLM-TTS 技术报告

Jiayan Cui, Zhihan Yang, Naihan Li, Jiankun Tian, Xingyu Ma, Yi Zhang, Guangyu Chen, Runxuan Yang, Yuqing Cheng, Yizhi Zhou, Guochen Yu, Xiaotao Gu, Jie Tang

机构 * Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 GLM-TTS通过优化的语音分词器和多奖励强化学习框架,实现高效可控的生产级语音生成系统,同时支持参数高效定制和混合输入方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 4 篇

2507.11252 2025-12-17 cs.CV eess.IV 70%

MFGDiffusion: Mask-Guided Smoke Synthesis for Enhanced Forest Fire Detection

MFGDiffusion:基于掩码的烟雾合成以提升森林火灾检测

Guanghao Wu, Yunqing Shang, Chen Xu, Hai Song, Chong Wang, Qixing Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图像修复 :image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 MFGDiffusion通过掩码引导的烟雾合成提升森林火灾检测性能

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14185 2025-12-17 cs.MM cs.AI 57%

End-to-End Learning-based Video Streaming Enhancement Pipeline: A Generative AI Approach

端到端学习基于的视频流增强管道:一种生成AI方法

Emanuele Artioli, Farzad Tashtarian, Christian Timmerer

机构 * Alpen-Adria-Universitaet(阿尔卑斯-亚得里亚大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.MM

AI总结 本文提出ELVIS框架,通过端到端学习结合服务器端编码优化与客户端生成填充,提升视频流质量并减少带宽需求。

Comments The 35th edition of the Workshop on Network and Operating System Support for Digital Audio and Video (NOSSDAV '25), March 31-April 4, 2025, Stellenbosch, South Africa

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13729 2025-12-17 cs.LG cs.AI cs.CV 57%

Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution

多模态条件下的风动力超分辨率复合分类器引导方法

Jacob Schnell, Aditya Makkar, Gunadi Gani, Aniket Srinivasan Ashok, Darren Lo, Mike Optis, Alexander Wong, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学) Veer Renewables

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出复合分类器引导方法,用于多模态条件下的风动力超分辨率重建,实现高保真度与低成本的风数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22780 2025-12-17 cs.LG physics.geo-ph 50%

Multimodal Atmospheric Super-Resolution With Deep Generative Models

多模态大气超分辨率与深度生成模型

Dibyajyoti Chakraborty, Haiwen Guan, Jason Stock, Troy Arcomano, Guido Cervone, Romit Maulik

机构 * Information Sciences and Technology(信息科学与技术系) The Pennsylvania State University(宾夕法尼亚州立大学) Environmental Science Division(环境科学部) Argonne National Laboratory(阿贡国家实验室) Department of Geography(地理系)

专题命中 图像修复 :diffusion(abstract)

AI总结 本文提出利用基于分数的扩散模型进行多模态大气超分辨率,通过结合稀疏观测数据提升高维状态恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2512.14542 2025-12-17 cs.CV 57%

HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion

HiFi-Portrait: 零样本身份保留肖像生成的高保真多脸融合

Yifang Xu, Benxiang Zhai, Yunzhuo Sun, Ming Li, Yang Li, Sidan Du

机构 * Nanjing University(南京大学) Dalian University of Technology(大连理工大学) Nanjing University of Information Science and Technology(南京信息科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 HiFi-Portrait通过高保真多脸融合技术实现零样本身份保留肖像生成,提升了面部相似性和可控性,同时兼容SDXL工作。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2512.14620 2025-12-17 cs.CL cs.AI cs.CV 57%

JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction

JMMMU-Pro:通过Vibe基准构建的基于图像的日本多学科多模态理解基准

Atsuyuki Miyai, Shota Onohara, Jeonghun Baek, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 JMMMU-Pro通过构建基于图像的多模态理解基准,评估LMMs在日文处理能力,提出Vibe基准构建方法以提高基准质量。

Comments Project page: https://mmmu-japanese-benchmark.github.io/JMMMU_Pro/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20865 2025-12-17 cs.CV 57%

AI-GenBench: A New Ongoing Benchmark for AI-Generated Image Detection

AI-GenBench: 一个面向AI生成图像检测的新持续性基准

Lorenzo Pellegrini, Davide Cozzolino, Serafino Pandolfini, Davide Maltoni, Matteo Ferrara, Luisa Verdoliva, Marco Prati, Marco Ramilli

机构 * Dipartimento di Informatica - Scienza e Ingegneria (DISI) Università di Bologna(博洛尼亚大学信息学院-科学与工程系) Dipartimento di Ingegneria Elettrica e delle Tecnologie dell’Informazione (DIETI) Università degli Studi di Napoli Federico II(那不勒斯费德里科二世大学电子工程与信息科技系) IdentifAI

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Ai-GenBench提出一个持续性基准,用于评估AI生成图像检测方法在面对新生成模型时的泛化能力,提供全面数据集和标准化评估流程,促进可重复性和实际应用。

Comments Accepted at Verimedia workshop, IJCNN 2025. 9 pages, 6 figures, 4 tables, code available: https://github.com/MI-BioLab/AI-GenBench

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 4 篇

2512.14697 2025-12-17 cs.CV cs.AI cs.LG eess.SP 57%

Spherical Leech Quantization for Visual Tokenization and Generation

球面Leech量化用于视觉标记化与生成

Yue Zhao, Hanwen Jiang, Zhenlin Xu, Chutong Yang, Ehsan Adeli, Philipp Krähenbühl

机构 * UT Austin(得克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Adobe Research(Adobe研究院) Mistral AI

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于Leech格的球面量化方法,通过提高对称性和均匀分布,实现了更高效的图像标记化与生成。

Comments Tech report; project page: https://zhaoyue-zephyrus.github.io/npq/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01510 2025-12-17 cs.CV 57%

Luminance-Aware Statistical Quantization: Unsupervised Hierarchical Learning for Illumination Enhancement

具有亮度意识的统计量化:无监督分层学习用于照明增强

Derong Kong, Zhixiong Yang, Shengxi Li, Shuaifeng Zhi, Li Liu, Zhen Liu, Jingyuan Xia

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学与技术学院,国防科技大学) College of Electronic and Information Engineering, Beihang University(电子与信息工程学院,北航)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LASQ框架,通过无监督分层学习实现照明增强,改进亮度转换建模,提升低光照图像恢复的适应性和泛化能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14095 2025-12-17 cs.CV 57%

AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation

AnchorHOI: 通过基于锚点的先验蒸馏实现零样本4D人-物交互生成

Sisi Dai, Kai Xu

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 AnchorHOI通过基于锚点的先验蒸馏策略,结合视频扩散模型提升4D人-物交互生成的多样性和泛化能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14681 2025-12-17 cs.CL 50%

Fast and Accurate Causal Parallel Decoding using Jacobi Forcing

快速且准确的因果并行解码使用雅可比强迫

Lanxiang Hu, Siqi Kou, Yichao Fu, Samyam Rajbhandari, Tajana Rosing, Yuxiong He, Zhijie Deng, Hao Zhang

机构 * UC San Diego(UC圣迭戈大学) Shanghai Jiao Tong University(上海交通大学) Snowflake(Snowflake公司)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出雅可比强迫方法,通过渐进蒸馏将AR模型转化为高效的并行解码器,实现3.8倍的速度提升并保持性能,同时引入多块解码与拒绝回收进一步提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏