arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-19 至 2025-12-19 共收录 56 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2503.09560 2025-12-19 eess.IV cs.CV 89%

StructDiff: Structure-aware Diffusion Model for 3D Fine-grained Medical Image Synthesis

StructDiff: 一种结构感知的扩散模型用于3D细粒度医学图像合成

Jiahao Xia, Yutao Hu, Yaolei Qi, Zhenliang Li, Wenqi Shao, Junjun He, Ying Fu, Longjiang Zhang, Guanyu Yang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及跨学科应用关键实验室(东南大学),中华人民共和国教育部,中国) Jiangsu Province Joint International Research Laboratory of Medical Information Processing, Southeast University, Nanjing, China(江苏省医疗信息处理联合国际研究实验室(东南大学),南京市,中国) Univ Rennes, CHU Rennes, Inserm, LTSI– UMR 1099, F-35000 Rennes, France(里昂大学,里昂大学医院,Inserm,LTSI– UMR 1099,法国里昂,法国) Shanghai AI Laboratory(上海人工智能实验室) School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(计算机科学与技术学院,北京理工大学,北京,中国) Department of Radiology, Jinling Hospital, Affiliated Hospital of Medical School, Nanjing University, Nanjing, China(放射科,南京大学附属医院,南京大学,南京,中国)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);分类 cs.CV

AI总结 StructDiff通过结构感知扩散模型解决3D医学图像细粒度生成中的拓扑一致性和细节还原问题,提升下游分割性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16905 2025-12-19 cs.CV 83%

Alchemist: Unlocking Efficiency in Text-to-Image Model Training via Meta-Gradient Data Selection

Alchemist: 通过元梯度数据选择提升文本到图像模型训练效率

Kaixin Ding, Yang Zhou, Xi Chen, Miao Yang, Jiarong Ou, Rui Chen, Xin Tao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Alchemist通过元梯度数据选择提升文本到图像模型训练效率,实现高效的数据筛选和模型性能提升。

Comments project page: https://kxding.github.io/project/Alchemist/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2512.16920 2025-12-19 cs.CV cs.AI 57%

EasyV2V: A High-quality Instruction-based Video Editing Framework

EasyV2V: 一种高质量的基于指令的视频编辑框架

Jinjie Mai, Chaoyang Wang, Guocheng Gordon Qian, Willi Menapace, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Ashkan Mirzaei

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 EasyV2V通过简化设计和灵活输入实现高质量视频编辑,超越现有系统。

Comments Project page: https://snap-research.github.io/easyv2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16906 2025-12-19 cs.CV 57%

VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

VIVA: 基于VLM的指令式视频编辑与奖励优化

Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma

机构 * Brown University(布朗大学) Intelligent Creation, ByteDance(字节跳动智能创作)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 VIVA通过VLM引导编码和奖励优化,实现更高效、高质量的指令式视频编辑,提升对复杂指令的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 35 篇

2503.18352 2025-12-19 cs.CV 90%

Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models

Diffusion-4K: 基于潜在扩散模型的超高清图像合成

Jinjin Zhang, Qiuyu Huang, Junjie Liu, Xiefan Guo, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 Diffusion-4K通过引入Aesthetic-4K基准和基于小波的微调方法,实现了高质量超高清图像合成。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16670 2025-12-19 cs.CV cs.GR 84%

FrameDiffuser: G-Buffer-Conditioned Diffusion for Neural Forward Frame Rendering

FrameDiffuser: 基于G-Buffer的扩散神经渲染

Ole Beisswenger, Jan-Niklas Dihlmann, Hendrik P. A. Lensch

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 FrameDiffuser通过基于G-buffer的自回归框架实现时间一致的神经渲染,结合结构引导和时间一致性,提升逼真度和效率。

Comments Project Page: https://framediffuser.jdihlmann.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16586 2025-12-19 cs.CV cs.AI 83%

Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks

Yuan-TecSwin: 一种基于Swin-transformer块的文本条件扩散模型

Shaohua Wu, Tong Yu, Shenling Wang, Xudong Zhao

机构 * Yuan-Tec(元 Tec)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Yuan-TecSwin通过引入Swin-transformer块替代CNN,提升文本条件扩散模型在图像生成中的非局部建模能力,达到ImageNet生成基准的最优FID分数1.37。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13107 2025-12-19 cs.CV cs.AI 79%

Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather

基于扩散的多模态3D物体检测在恶劣天气中的修复

Zhijian He, Feifei Liu, Yuwei Li, Zhanpeng Luo, Jintao Cheng, Xieyuanli Chen, Xiaoyu Tang

机构 * School of Xingzhi College, South China Normal University(星智学院,华南师范大学) College of Big Data and Internet, Shenzhen Technology University(大数据与互联网学院,深圳科技大学) School of Data Science and Engineering, Xingzhi College, South China Normal University(数据科学与工程学院,星智学院,华南师范大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffFusion通过基于扩散的修复和自适应跨模态融合,提升多模态3D物体检测在恶劣天气中的鲁棒性与清洁数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16219 2025-12-19 cs.CV eess.IV 79%

Learning High-Quality Initial Noise for Single-View Synthesis with Diffusion Models

基于扩散模型的学习高质量初始噪声用于单视图合成

Zhihao Zhang, Xuejun Yang, Weihua Liu, Mouquan Shen

机构 * College of Electrical Engineering and Control Science, Nanjing Tech University(电气工程与控制科学学院,南京理工大学) Yongjiang Laboratory(永江实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于编码器-解码器网络的框架,通过注入图像语义信息将随机噪声转换为高质量噪声,提升单视图合成性能。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16075 2025-12-19 cs.CV cs.LG 79%

FOD-Diff: 3D Multi-Channel Patch Diffusion Model for Fiber Orientation Distribution

FOD-Diff: 3D多通道补丁扩散模型用于纤维方向分布

Hao Tang, Hanyu Liu, Alessandro Perelli, Xi Chen, Chao Li

机构 * University of Dundee(邓迪大学) University of Bath(巴斯大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FOD-Diff通过3D多通道补丁扩散模型,高效生成HAR-FOD,提升白质完整性表征的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16023 2025-12-19 cs.CV 79%

CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion

CoVAR: 通过多模态扩散生成视频与动作用于机器人操作

Liudi Yang, Yang Bai, George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16576 2025-12-19 cs.IR 78%

InfoDCL: Informative Noise Enhanced Diffusion Based Contrastive Learning

InfoDCL: 基于信息噪声增强扩散的对比学习

Xufeng Liang, Zhida Qin, Chong Zhang, Tianyu Huang, Gangyi Ding

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 InfoDCL通过整合噪声与语义信息的扩散过程,提升推荐系统的对比学习效果,实现生成与偏好学习的协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10352 2025-12-19 hep-ph hep-ex nucl-ex nucl-th 78%

Toward a foundation model for heavy-ion collision experiments based on point-cloud diffusion

基于点云扩散的重离子碰撞实验基础模型

Manjunath Omana Kuttan, Kai Zhou, Jan Steinheimer, Horst Stoecker

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于点云扩散的重离子碰撞基础模型,能快速生成事件级碰撞输出,适用于理论与实验研究。

Comments Matches published version. 8 pages, 6 figures

Journal ref Phys.Rev.C 112 (2025) 5, L051902

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10512 2025-12-19 cs.LG 78%

Four-hour thunderstorm nowcasting using a deep diffusion model of satellite data

利用卫星数据的深度扩散模型进行四小时雷暴现在预测

Kuai Dai, Xutao Li, Junying Fang, Yunming Ye, Demin Yu, Hui Su, Di Xian, Danyu Qin, Jingsong Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出深度扩散模型用于卫星数据的四小时雷暴现在预测,实现了全球范围的高精度预测,具有广泛的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16436 2025-12-19 math.AP 78%

Uniform vanishing damping limit for the 2D inviscid Oldroyd-B model with fractional stress tensor diffusion

二维无粘Oldroyd-B模型中分数应力张量扩散的均匀消散极限

Chen Liang, Zhaonan Luo, Zhaoyang Yin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了二维无粘Oldroyd-B模型在分数应力张量扩散下的均匀消散极限,通过改进的傅里叶分裂方法和谱分析方法,获得了具有不同阻尼系数下的最优时间衰减率和均匀阻尼消失率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16230 2025-12-19 physics.flu-dyn physics.comp-ph 78%

A unified MRT-LB framework for Navier-Stokes and nonlinear convection-diffusion equations and beyond: moment equations, auxiliary moments, multispeed lattices, and Hermite matrices

一种统一的MRT-LB框架用于纳维-斯托克斯方程和非线性对流-扩散方程及更广泛的领域:动量方程、辅助动量、多速格子和赫米特矩阵

Baochang Shi, Xiaolei Yuan, Zhenhua Chai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种统一的MRT-LB框架,用于模拟纳维-斯托克斯方程和非线性对流-扩散方程,通过多速矩形格子和赫米特矩阵实现高精度模拟。

Comments 33 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16110 2025-12-19 physics.comp-ph 78%

ClusTEK: A grid clustering algorithm augmented with diffusion imputation and origin-constrained connected-component analysis: Application to polymer crystallization

ClusTEK: 一种结合扩散填补和源约束连通分量分析的网格聚类算法:应用于聚合物结晶

Elyar Tourani, Brian J. Edwards, Bamin Khomami

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ClusTEK通过结合扩散填补和源约束连通分量分析,改进网格聚类算法,实现高精度和高效性,应用于聚合物结晶研究。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15773 2025-12-19 cs.LG cs.AI 78%

TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration

TS-DP:基于时间适应的扩散策略强化推测解码

Ye Li, Jiahe Feng, Yuan Meng, Kangye Ji, Chen Tang, Xinwan Wen, Shutao Xia, Zhi Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TS-DP通过强化学习和时间适应性方法,提升扩散策略在具身任务中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15725 2025-12-19 eess.SY cs.SY 78%

Generative design of stabilizing controllers with diffusion models: the Youla approach

基于扩散模型的稳定控制器生成设计:Youla方法

Matteo Cercola, Donatello Materassi, Simone Formentin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的稳定控制器生成方法,结合Youla参数化理论,通过生成可行参数实现控制器设计,首次展示扩散模型在生成稳定控制器方面的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23021 2025-12-19 cs.LG cs.IR 78%

Masked Diffusion for Generative Recommendation

掩码扩散用于生成性推荐

Kulin Shah, Bhuvesh Kumar, Neil Shah, Liam Collins

机构 * UT Austin(得克萨斯大学) Snap Inc(Snap公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用掩码扩散替代自回归建模,以提升生成性推荐中语义ID序列的概率建模效果,尤其在数据受限情况下表现更优。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17299 2025-12-19 cs.LG cs.AI 78%

Preference-Guided Diffusion for Multi-Objective Offline Optimization

基于偏好的扩散模型用于多目标离线优化

Yashas Annadani, Syrine Belakaria, Stefano Ermon, Stefan Bauer, Barbara E Engelhardt

机构 * TU Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Helmholtz AI(海德堡人工智能研究所) Gladstone Institutes(加利福尼亚大学旧金山分校格拉德石研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于偏好的扩散模型,用于生成多目标离线优化中的帕累托最优解,通过引入多样性感知的偏好引导,提升生成解的质量与分布性。

Comments Accepted in NeurIPS (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01384 2025-12-19 stat.ML cs.AI cs.CL cs.LG 78%

Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods

使用策略梯度方法微调离散扩散模型

Oussama Zekri, Nicolas Boullé

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SEPO算法,用于高效微调离散扩散模型,通过理论支持和实验验证展示了其在非可微奖励下的有效性。

Comments 33 pages, 8 figures, 8 tables

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00329 2025-12-19 cs.SI 71%

When Small Acts Scale: Ethical Thresholds in Network Diffusion

当小行为扩大:网络扩散中的伦理阈值

Masoud Makrehchi

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出一个信息传递模型,研究网络扩散中的伦理阈值,揭示不同平台设计因素如何影响下游责任,应用于流行病防控和规范放大。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16900 2025-12-19 cs.CV 57%

FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction

FlashPortrait: 6倍更快的无限人物动画生成

Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Kai Qiu, Chong Luo, Zuxuan Wu

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tencent Inc.(腾讯公司) Tongyi Lab, Alibaba Group(阿里云通义实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FlashPortrait通过归一化面部表情块和动态滑动窗口方案,实现6倍加速的无限长人物动画生成,保持身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16771 2025-12-19 cs.CV 57%

FlowDet: Unifying Object Detection and Generative Transport Flows

FlowDet: 用现代条件流匹配技术统一目标检测与生成运输流

Enis Baty, C. P. Bridges, Simon Hadfield

机构 * CVSSP, University of Surrey(CVSSP,萨里大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FlowDet通过条件流匹配技术统一目标检测与生成运输流,实现更高效的检测性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15949 2025-12-19 cs.CV 57%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15747 2025-12-19 cs.LG cs.CL cs.CV cs.CY 57%

D3G: Diverse Demographic Data Generation Increases Zero-Shot Image Classification Accuracy within Multimodal Models

D3G:多样化的人口数据生成提高多模态模型中的零样本图像分类准确性

Javon Hickmon

机构 * Javon Hickmon(独立研究者)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 D3G通过生成多样化的人口数据,减少多模态模型中的偏见,提高零样本图像分类的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12796 2025-12-19 cs.CV cs.AI 57%

DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

DriveVLA-W0:世界模型放大数据扩展定律在自动驾驶中的应用

Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yuqi Wang, Yuntao Chen, Xiaoman Wang, Yasong An, Chufeng Tang, Lu Hou, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(国家工程实验室、自动化研究所、中国科学院(CASIA)) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DriveVLA-W0通过世界建模预测未来图像,提升自动驾驶中数据扩展定律,实现更高效的驾驶智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07796 2025-12-19 cs.CV cs.AI cs.LG 57%

WildFit: Autonomous In-situ Model Adaptation for Resource-Constrained IoT Systems

WildFit:面向资源受限物联网系统的自主现场模型适应

Mohammad Mehdi Rastikerdar, Jin Huang, Hui Guan, Deepak Ganesan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 WildFit通过自主现场适应框架,利用背景变化更频繁的特性,在资源受限的物联网系统中实现更高效的模型适应。

Comments Accepted by ACM SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15582 2025-12-19 physics.flu-dyn 50%

Three-dimensional numerical study on hydrogen bubble growth at electrode

电极处氢气气泡生长的三维数值研究

Wei Qin, Tian Long, Jacob Maarek, Stéphane Zaleski

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过三维数值模拟分析电极处氢气气泡生长与脱离机制,发现成核位点数量影响气体传输,表面张力主导气泡附着力,且成核位点增加促进气泡合并与脱离。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏