arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2607.01775 2026-07-03 cs.LG 新提交 88%

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

Set Diffusion: 在自回归与扩散之间插值令牌顺序以实现快速灵活的解码

Marianne Arriola, Volodymyr Kuleshov

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Set Diffusion模型,通过将似然参数化为灵活位置和长度的令牌集,并设计集因果扩散架构,支持任意顺序解码和KV缓存更新,在数学推理、摘要和无条件生成上优于先前的扩散语言模型。

Comments ICML 2026. We provide the code at https://github.com/kuleshov-group/setdlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14172 2026-08-17 cs.CV cs.AI cs.LG 新提交 88%

Concept Guidance: Precise, Training-Free Latent Control for Text-to-Image Generation

概念引导:文本到图像生成的精确无训练潜在控制

Nikolai Röhrich, Isabell Hans, Felix Krause, Björn Ommer

机构 * LMU Munich(慕尼黑大学) Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·祖斯可靠人工智能卓越学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型缺乏特定概念引导和局部一致性可靠性不足的问题,提出无训练的CoG方法,利用概念互信息强化相关层影响,在PixArt-alpha等模型上实现性能提升。

Comments Accepted at GCPR 2026 (Oral). 28 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04820 2026-08-06 cs.CV 新提交 88%

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions

当扩散模型忘记你是谁:大遮挡下人脸修复中的身份保留

Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 针对大遮挡和冲突文本引导下人脸修复的身份保留难题,提出级联扩散框架ReSem-Face,在CelebAHQ-IDI-5等数据集上验证其身份保留修复及文本编辑质量优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21904 2026-07-27 cs.CV cs.CL 新提交 88%

Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions

医学图像修复中的扩散模型:挑战、解决方案分类及未来方向

Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo, Pedro Henriques Abreu

机构 * Aeronautics Institute of Technology(航空技术学院) Science and Technology Institute, Federal University of São Paulo(圣保罗联邦大学科学与技术研究所) LASIGE, Faculdade de Ciências, Universidade de Lisboa(里斯本大学理学院LASIGE实验室) University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra(科英布拉大学CISUC/LASI - 科英布拉大学信息与系统中心) Instituto Superior Técnico, Universidade de Lisboa, Instituto de Telecomunicações(里斯本大学高等技术学院、电信研究所)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 该研究对基于扩散的医学图像修复方法进行系统回顾,涵盖多方面内容并提出分类法。分析显示相关研究兴趣快速增长,扩散模型在生成合理重建结果及辅助临床任务上表现出色,但也面临缺乏标准化基准等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03899 2026-07-07 cs.CV 新提交 88%

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交 88%

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19718 2026-06-19 cs.CV 新提交 88%

One-Shot Novel View and Pose Human Image Synthesis via 3D Prior Guided Diffusion Model

基于3D先验引导扩散模型的单样本新视角与姿态人体图像合成

Shenjian Gong, Kangkan Wang, Shanshan Zhang, Jian Yang

机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院教育部高维信息智能感知与系统重点实验室、江苏省社会安全图像与视频理解重点实验室及PCA实验室) Advanced Laser Technology Laboratory of Anhui Province, Electronic Engineering Institute, National University of Defense Technology, and Jianghuai Advance Technology Center(国防科技大学电子工程学院安徽省先进激光技术实验室及江淮前沿技术中心)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

AI总结 提出一种基于条件去噪扩散模型的方法,利用3D人体先验(法线图和颜色提示)作为几何和颜色条件,从单张参考图像合成任意姿态和视角的高质量人体图像,包括被遮挡部分。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16167 2026-08-18 eess.SP cs.LG 新提交 88%

RadioVIL: Anomaly-Aware Diffusion Models for Radio Map Inpainting and Zero-Shot Vehicle Localization

RadioVIL:用于无线电地图补全和零样本车辆定位的异常感知扩散模型

Ruixin Zhao, Xiucheng Wang, Qiming Zhang, Nan Cheng, Ruijin Sun, Conghao Zhou

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 针对现有方法无法保留动态实体散射特征的问题,提出RadioVIL框架,通过DDPM与DMILO算法实现无线电地图补全,在零样本车辆定位任务中获75.20%召回率及3.31米平均误差,为6G边缘ISAC提供支撑。

Comments 6 pages, 4 figures, 2 tables. Accepted to IEEE GLOBECOM 2026, Wireless Communications Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14801 2026-08-18 physics.data-an hep-ex nucl-ex 新提交 88%

Statistical validation of calorimeter inpainting with generative diffusion priors

基于生成式扩散先验的量能器修复的统计验证

Himanshu Raj, Roli Esha

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 本研究针对相对论重离子碰撞中量能器数据缺失问题,以预训练量能器扩散模型为先验,系统比较多种扩散修复算法并建立通用验证策略,实现缺失探测器信息的概率重建。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11732 2026-08-13 cs.CR cs.AI 新提交 88%

Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation

基于塌陷生成的文本到图像扩散模型指纹识别

Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本研究提出基于塌陷生成的非侵入式指纹框架,可在白盒和黑盒设置下验证文本到图像扩散模型的所有权,且对微调衍生模型及混淆具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06424 2026-08-10 cs.SD cs.CL cs.LG 新提交 88%

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

用于文本引导语音修复与编辑的多编解码器离散扩散模型

Iftach Shoham, Tali Dror, Oren Gal, Haim Permuter, Gilad Katz, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) University of Haifa(海法大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 该研究提出基于分层编解码器令牌的离散扩散框架SIEDD,其核心架构HiCoDD结合音素级约束等技术,在RealEdit基准中实现最优语音编辑性能,且优于自回归基线,显著提升上下文保留的语音重建与编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 88%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07072 2026-07-09 cs.LG 新提交 88%

An Hybrid Quantum-Classical Diffusion Model for Image Generation

一种用于图像生成的混合量子-经典扩散模型

Qipeng Qian, Keli Deng, Yuntao Qian

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 研究针对量子扩散模型应用于经典高维数据的限制,提出结合经典自动编码器与混合态量子去噪扩散概率模型的混合生成管道,用于图像生成,通过简化反向动力学算法展示该方法在MNIST图像生成上的效果及意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18040 2026-08-19 cs.LG cs.CV 新提交 87%

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

优化你的采样:基于贝叶斯优化的调优扩散采样

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 87%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14580 2026-07-17 cs.CV cs.LG 新提交 87%

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

先进图像生成:负提示优化与潜在分类器引导

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 该研究提出新系统,通过微调序列到序列语言模型集成负提示优化与潜在空间分类器引导,自动生成优化负提示,用混合分类器评估引导扩散步骤,减少伪影并提高语义保真度,提升Stable Diffusion图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06590 2026-07-09 cs.CV cs.LG 新提交 87%

AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

用于文化遗产纺织品的人工智能:针对新型乌洛花纹合成的微调潜在扩散模型

Humasak Tommy Argo Simanjuntak, Jesika Purba, Sitogab Girsang, Widya Manurung, Samuel Situmeang, Arlinta Barus, Daniel Oranova Siahaan

机构 * Information Systems Study Program, Faculty of Informatics and Electrical Engineering, Institut Teknologi Del(信息系统研究项目,信息与电气工程学院,技术学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 该研究针对传统乌洛编织局限,提出在高分辨率乌洛图案数据集上微调Protogen v3.4和Stable Diffusion v1.4两个潜在扩散模型来生成新颖设计,通过多种方式评估模型性能,发现特定引导尺度能平衡保真度与多样性,支持非物质文化遗产创新更新。

Comments 21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20416 2026-07-08 cs.LG cs.CV 新提交 87%

On the Redundancy of Timestep Embeddings in Diffusion Models

扩散模型中时间步嵌入的冗余性研究

José A. Chávez

机构 * Independent Researcher, Lima, Peru(独立研究者,秘鲁利马)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文通过理论和实验证明,在U-Net和Diffusion Transformer架构中,扩散模型无需显式时间步嵌入也能达到全局最优,甚至在某些指标上超越有条件模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 87%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 87%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16923 2026-08-19 cs.SI cs.LG 新提交 87%

Network Denoising Revisited: A Ricci-Flow-Inspired Graph Diffusion Method

重访网络去噪:一种受里奇流启发的图扩散方法

Ye Fang, Chuan-Xian Ren

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究针对现有网络去噪方法忽略图非欧几里得几何的问题,提出受里奇流启发的曲率引导图扩散方法Ricci-Diffusion,经实验验证其可提升结构恢复与下游性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18019 2026-08-19 math.NA cs.NA math.DS 新提交 87%

Ordered Diffusion Kernels

有序扩散核(Ordered Diffusion Kernels, ODKs)

Jack H. Soulsby, Andreas C. S. Jørgensen, Atiyo Ghosh, Vahid Shahrezaei

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出新型有序扩散核(ODKs),可近似任意伊藤SDE的无穷小生成元,通过松弛势估计为序推断实现平流与扩散解耦,经合成数据验证能准确恢复多种动力系统属性。

Comments 46 pages, 7 figures, 46 page appendix, related to work presented at ECMTB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15727 2026-08-18 cs.LG cs.AI stat.ML 新提交 87%

FirstDiff: One-Step Diffusion-Based Anomaly Detection for Multivariate Time Series via Initial Noise Prediction

FirstDiff:基于初始噪声预测的单步扩散模型多变量时间序列异常检测

Ali Boudaghi, Alireza Nemati, Hadi Zare

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 FirstDiff是一种基于初始噪声预测的单步扩散异常检测框架,采用Diffusion Transformer作为骨干,仅需一次去噪网络评估即可在五个基准数据集上实现最优多变量时间序列异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07430 2026-08-10 cs.LG cs.AI 新提交 87%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 87%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交 87%

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 87%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 87%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11655 2026-07-14 cs.CV 新提交 86%

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis

用于逼真超声图像合成的特征空间引导扩散

Marina Domínguez, Nélida Mirabet-Herranz, Valery Naranjo

机构 * Artikode Intelligence S.L.(Artikode智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对条件扩散模型合成超声图像逼真度不足问题,提出无需训练的特征空间候选引导(FSCG)采样策略,通过局部k近邻特征校正及按特征空间能量选最佳候选,缩小与真实图像差距,在多数据集上效果优于标准采样及其他基线。

Comments 11 pages, 4 figures. Pre-review manuscript version of a paper accepted at DGM4MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏