arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 215 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 19 篇

2608.21659 2026-09-01 cs.CV 版本更新 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18560 2026-09-01 cs.HC cs.CV 版本更新 57%

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

SemanticSlider3D:无需训练的3D物体连续语义编辑

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Fujitsu Research of America(富士通美国研究所)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-09-01 cs.CV 版本更新 57%

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures, accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-09-01 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S. -H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2026-09-01 cs.CV 版本更新 57%

A Study of the Design Space of Motion and Disocclusion Control in Video Generation

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01470 2026-09-01 cond-mat.soft cond-mat.stat-mech physics.comp-ph 版本更新 50%

Colloidal layer deposition with a controllable number of layers and compositional order

具有可控层数和组分有序性的胶体层沉积

Akshaya Kumar Jena, Aashima Aashima, Pritam Kumar Jana, Bortolo Matteo Mognetti

专题命中 可控生成 :diffusion(abstract)

AI总结 本文设计了一种二元悬浮液与表面结合的系统,通过DNA寡聚物调控胶体自组装,实现可控层数和组分有序的胶体聚集。

Comments These last two authors contributed equally to the work. This is the manuscript of an article accepted for publication in The Journal of Physical Chemistry B. The final published version will be available from ACS upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27700 2026-09-01 q-fin.MF 版本更新 50%

Data-Driven Stochastic Optimal Control for Intraday Electricity Trading by Renewable Producers

数据驱动的随机最优控制用于日内电力交易:可再生能源生产者

Chiheb Ben Hammouda, Michael Samet, Raul Tempone

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种数据驱动的连续时间随机最优控制框架,用于可再生能源生产者的日内电力交易,通过随机微分方程和跳跃扩散模型来应对市场波动和不平衡惩罚风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03773 2026-09-01 math.OC math.PR 版本更新 50%

Stochastic Control Problems Motivated by Sailboat Trajectory Optimization

由帆船轨迹优化启发的随机控制问题

Carlo Ciccarella, Robert C. Dalang, Laura Vinckenbosch

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出两个随机控制问题,旨在快速到达圆形迎风目标,通过分析帆船在随机风场中的运动模型,探讨了冲击控制与奇异控制的数学特性及解的存在性。

Comments 45 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 4 篇

2602.19736 2026-09-01 cs.CV 版本更新 70%

InfScene-SR: Seamless Super-Resolution of Arbitrarily Large Remote-Sensing Scenes via Variance-Preserving Joint Denoising

InfScene-SR: 通过迭代联合去噪实现任意尺寸图像超分辨率

Shoukun Sun, Zhe Wang, Xiang Que, Jiyin Zhang, Xiaogang Ma

机构 * Synthesis (NCEAS),\ of California Santa Barbara, Santa Barbara, California, USA College of Computer Forestry University, China

专题命中 图像修复 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 InfScene-SR通过迭代联合去噪方法,实现了任意尺寸图像的高保真超分辨率,解决了传统方法在处理大尺度场景时的边界伪影问题,并提升了语义分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16157 2026-09-01 cs.CV 版本更新 57%

Fast and Accurate Image Restoration and Generation with Rank Enhanced Linear Attention

基于秩增强线性注意力的快速准确图像恢复与生成

Yuang Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决Transformer自注意力二次复杂度问题,提出秩增强线性注意力(RELA)及高效视觉Transformer(LAformer),通过集成深度卷积丰富特征表示,经实验验证LAformer在图像恢复和生成任务中性能优且计算高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16305 2026-09-01 cs.LG eess.SP 版本更新 50%

Large-Scale Bayesian Tensor Reconstruction via Approximate Message Passing

大规模贝叶斯张量重建:一种近似消息传递的解决方案

Bingyang Cheng, Zhongtao Chen, Yichen Jin, Hao Zhang, Chen Zhang, Edmund Y. Lam, Yik-Chung Wu

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出CP-GAMP算法,通过近似消息传递和期望最大化方法,高效解决大规模张量重建问题,提升运行效率并保持重建精度。

Comments Accepted at IEEE ICDM 2026. Code: https://github.com/BingyangCheng/CP-GAMP

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01362 2026-09-01 stat.ML cs.LG 版本更新 50%

Autoencoders in Function Space

函数空间中的自编码器

Justin Bunker, Mark Girolami, Hefin Lambley, Andrew M. Stuart, T. J. Sullivan

机构 * Department of Engineering, University of Cambridge and Alan Turing Institute(剑桥大学工程系和艾伦·图灵研究所) Department of Engineering University of Cambridge(剑桥大学工程系) Mathematics Institute University of Warwick(沃里克大学数学系) Computing + Mathematical Sciences California Institute of Technology(加州理工学院计算与数学科学学院) Mathematics Institute & School of Engineering University of Warwick(沃里克大学数学系与工程学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出函数空间自编码器(FAE)和变分自编码器(FVAE),分析其目标函数良定性,结合神经算子架构实现自编码器在图像修复等科学数据建模的新应用。

Comments 54 pages, 24 figures. Includes corrections for error in legends of figure 7 and figures in appendix B.5 that were present in v3

Journal ref Journal of Machine Learning Research 26(165):1--54 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 8 篇

2608.31053 2026-09-01 cs.CV 新提交 77%

Identity-Conditioned Latent Consistency Distillation for Face Synthesis

用于人脸合成的身份条件潜在一致性蒸馏

Tiago Kienen Chaves, Bernardo Biesseck, David Menotti

机构 * Federal University of Paraná(巴拉那联邦大学) Federal Institute of Mato Grosso (IFMT)(马托格罗索联邦学院(IFMT))

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对扩散模型人脸合成计算成本高的问题,通过将Arc2Face知识蒸馏为潜在一致性模型,实现4.36倍加速且保持竞争力,相关方案已公开。

Comments Accepted for presentation at the 2026 Conference on Graphics, Patterns and Images (SIBGRAPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11627 2026-09-01 cs.CV 74%

LoRA-Composer: Leveraging Low-Rank Adaptation for Multi-Concept Customization in Training-Free Diffusion Models

Yang Yang, Wen Wang, Liang Peng, Chaotian Song, Yao Chen, Hengjia Li, Xiaolong Yang, Qinglin Lu, Deng Cai, Boxi Wu, Wei Liu

专题命中 个性化与一致性 :diffusion(title);分类 cs.CV

Comments project page: https://github.com/Young98CN/LoRA_Composer

Journal ref IEEE Transactions on Image Processing, vol. 34, pp. 8145-8158, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10293 2026-09-01 math.NA cs.NA 版本更新 71%

An improved estimate of the intermediate internal energy in the energy-consistent HLLD scheme

关于《HLL型MHD黎曼求解器中间状态的能量一致性》中HLLD型格式的数值扩散问题

Fan Zhang

专题命中 个性化与一致性 :diffusion(title)

AI总结 研究针对戴 - 伍德沃德激波管问题中HLLD-ec格式出现的密度振荡,提出对该格式的简单修改,核心方法是修改格式,主要贡献是消除了密度振荡。

Comments An error was found in the source code and thus the conclusion of this note is not fully valid

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23515 2026-09-01 cs.CV 版本更新 70%

FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time

FreeFuse: 通过测试时自适应的token级路由实现多主体LoRA融合

Yaoli Liu, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FreeFuse通过测试时自适应token级路由实现多主体LoRA融合,无需额外训练或模型修改,仅需主体激活词即可实现无缝图像生成。

Comments Our code is available at https://github.com/yaoliliu/FreeFuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01684 2026-09-01 cs.CV 版本更新 70%

DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing

DisCo3D:用于3D场景编辑的多视图一致性蒸馏

Yufeng Chi, Huimin Ma, Kafeng Wang, Jianmin Li

机构 * Institute for Artificial Intelligence, Beijing National Research Center for Information Science and Technology, Department of Computer Science and Technology, Tsinghua University(人工智能研究院、北京信息科学与技术国家研究中心、计算机科学与技术系、清华大学) College of Computer, National University of Defense Technology(计算机学院、国防科技大学)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出DisCo3D框架,通过微调3D生成器、一致性蒸馏训练2D编辑器并结合Gaussian Splatting,实现了稳定的3D场景编辑多视图一致性,且编辑质量优于现有SOTA方法。

Comments 14 pages, 9 figures

Journal ref SCIENCE CHINA Information Sciences (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29905 2026-09-01 cs.CV 新提交 57%

OrnaStyler: Ornament-Aware Latent Editing for Content-Preserving 3D Stylization

OrnaStyler:面向内容保留的3D风格化的感知装饰潜在编辑

Tomohiro Aizawa, Shigeru Kuriyama, Chunzhi Gu

机构 * University of Fukui(福井大学) Toyohashi University of Technology(丰桥技术科学大学) CyberAgent, Inc.(CyberAgent公司)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 OrnaStyler是一种零样本3D风格化框架,通过分阶段恢复几何与外观层面的潜在表示,实现文本引导下兼顾内容保留与风格表达的3D资产装饰编辑,性能优于现有方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01988 2026-09-01 cs.CV 版本更新 57%

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

面向以人为中心场景中AI生成图像检测的视觉证据定位与解释

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-09-01 cs.CV 版本更新 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2608.29847 2026-09-01 cs.CV cs.CL 新提交 79%

ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models

ContextBias:文本到图像模型中上下文变化下偏见持续性的可控评估

Shaghayegh Kolli, Sina Emami, Moreno D'Incà, Pouyan Nejadi, Nicu Sebe, Massimiliano Mancini, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所) University of Trento(特伦托大学) Orreco(奥雷科公司)

专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ContextBias框架与ContextBench基准,评估文本到图像模型在角色关联视觉表征随上下文变化时的偏见持续性,发现语义不相关上下文不会抑制角色关联属性,凸显偏见基准需可控上下文变化的必要性。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29335 2026-09-01 cs.CV 新提交 70%

GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling

GenFirst:用于稳定端到端隐空间生成建模的生成优先于重构方法

Guangting Zheng, Yiyuan Zhang, Tao Yang, Yunpeng Chen, Rui Zhu, Jiajun Deng, Yanyong Zhang

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出GenFirst策略,实现无隐空间塌陷的端到端隐空间生成建模,在图像生成任务上取得优异指标,并将框架扩展至多模态生成场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交 67%

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新 57%

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09974 2026-09-01 cs.AI cs.CL 版本更新 50%

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化

Seoyeon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 图像生成评测 :personalized generation(abstract)

AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。

Comments EMNLP 26 Main, 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 8 篇

2608.31159 2026-09-01 cs.CV 新提交 79%

BRF-GS: Hyperspectral Bidirectional Reflectance Factor Modeling and Image Generation Based on 3D Gaussian Splatting

BRF-GS:基于3D高斯溅射(3DGS)的高光谱双向反射因子建模与图像生成

Yiling Yao, Wenjuan Zhang, Bowen Wang, Bocheng Li, Wentao Song, Bing Zhang

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于3D高斯溅射的BRF-GS框架,通过混合BRDF驱动核、两阶段训练策略等,结合AIR-BRF数据集,实现高保真的BRF建模与多角度高光谱反射率图像生成。

Comments 58 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30129 2026-09-01 cs.CV 新提交 79%

Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

基于线性注意力的像素空间扩散实现高效高质量深度估计

Bingde Liu, Wu Ran, Jinglei Zhang, Huanhuan Yuan, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(上海交通大学人工智能研究院(教育部人工智能重点实验室))

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于线性注意力的像素空间生成框架Lapis,通过由粗到细的层级结构解决生成式深度估计的高计算成本问题,在多分辨率基准上实现SOTA精度,推理延迟大幅降低。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28670 2026-09-01 cs.CV 新提交 79%

Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache

基于BaryCache的内存高效无训练扩散Transformer加速方法

Chengjie Lu, Tianchi Deng, Zhengqi He, Zhijian Gao, Huisi Wu, Xueliang Li

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无训练加速方法BaryCache,采用重心外推器缓解扩散Transformer采样的振荡伪影,在图像与视频生成中实现最高3.30倍采样加速,兼顾内存与感知质量。

Comments Accepted by ICITES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29888 2026-09-01 cs.LG 新提交 50%

Sensitivity-Constrained Neural Operators for Data-Efficient Forward and Inverse Modeling of Partial Differential Equation Systems

用于偏微分方程系统数据高效正演与反演建模的灵敏度约束神经算子

Abdolmehdi Behroozi, Chaopeng Shen, Daniel Kifer, Kathryn Lawson

机构 * Penn State University(宾夕法尼亚州立大学) School of Electrical Engineering and Computer Science, Penn State University(宾夕法尼亚州立大学电气工程与计算机科学学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出灵敏度约束神经算子(SC-NO),通过采样灵敏度监督改进神经PDE代理,在正演预测、反演重建等任务中提升精度与效率,实现了更优的精度-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏