arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-28 至 2026-08-28 共收录 26 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 21 篇

2406.14429 2026-08-28 cs.LG cs.AI cs.CV 版本更新 83%

CollaFuse: Collaborative Diffusion Models

CollaFuse:协同扩散模型

Simeon Allmendinger, Domenique Zipperling, Lukas Struppek, Niklas Kühl

机构 * University of Bayreuth(巴耶鲁斯大学) Fraunhofer FIT(弗劳恩霍夫 FIT) FIM Research Center for Information Management(信息管理研究所以) Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CollaFuse协同扩散模型,通过本地保留数据和轻量计算,将高计算任务转移至服务器,降低客户端负担,提升性能并减少数据泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21890 2026-08-28 cs.LG cs.AI cs.GR 版本更新 80%

The Principles of Diffusion Models

扩散模型的原理

Chieh-Hsin Lai, Yang Song, Dongjun Kim, Yuki Mitsufuji, Stefano Ermon

机构 * MIT Press(MIT出版社) Sony AI(索尼人工智能) OpenAI(开放人工智能) Stanford University(斯坦福大学) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。

Comments Supplementary materials for the book are available at the book website: this https URL (https://the-principles-of-diffusion-models.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12631 2026-08-28 cs.CV cs.AI 版本更新 79%

Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation

多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成

Yushe Cao, Dianxi Shi, Xing Fu, Xuechao Zou, Haikuo Peng, Xueqi Li, Chun Yu, Junliang Xing

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-08-28 cs.CL 版本更新 78%

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07120 2026-08-28 nucl-th 版本更新 78%

Physics-Informed Neural Network for Solving the Heavy Quark Diffusion in the Expanding QCD Medium

用于求解膨胀QCD介质中重子扩散方程的物理信息神经网络

Wenhua Fan, Jiamin Liu, Huansang Yang, Baoyi Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用物理信息神经网络求解膨胀QCD介质中重子扩散方程,以研究重子演化及凝聚过程。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10147 2026-08-28 cond-mat.soft 版本更新 78%

Photothermal tuning of microparticle diffusion anisotropy in nematic lyotropic chromonic liquid crystal

向列型溶致色原液晶中微颗粒扩散各向异性的光热调控

Patrycja Kadzialka, Lech Sznitko, Pawel Karpinski

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出一种光热方法,通过切换照射光谱调控溶致色原液晶中微颗粒的扩散各向异性,实现各向异性比从3.0提升至5.5,为光控微流体分选和软物质组装提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20781 2026-08-28 cs.RO cs.LG 版本更新 78%

STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation

STITCH-OPE:基于引导扩散的轨迹拼接用于离线策略评估

Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) University of Toronto Robotics Institute(多伦多大学机器人研究所) Toyota Research Institute(丰田研究院) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 STITCH-OPE通过引导扩散生成长周期轨迹,有效降低OPE中的方差,提升在高维空间中的评估性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24558 2026-08-28 eess.AS eess.SP 版本更新 71%

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

基于扩散后验采样的阵列无关 Ambisonics 编码

Amit Milstein, Nir Shlezinger, Boaz Rafaely

专题命中 扩散模型 :diffusion(title)

AI总结 针对现有 Ambisonics 编码方案受固定阵列限制的问题,提出生成框架 ADEPS,将物理采集模型嵌入推理过程,可补偿阵列失真并实现任意阵列零样本编码,性能优于传统基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 62%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11567 2026-08-28 cs.CV cs.GR cs.LG 版本更新 62%

A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation

面向城市语义分割的低代价训练数据生成框架

Damjan Kalšan, Denis Zavadski, Tim Küchler, Haebom Lee, Stefan Roth, Carsten Rother

机构 * Computer Vision and Learning Lab, IWR, Heidelberg University, Germany(海德堡大学计算机视觉与学习实验室) AIMMO, Republic of Korea(韩国AIMMO) Department of Computer Science, TU Darmstadt, Germany(图宾根大学计算机科学系) Zuse School ELIZA, Germany(德国Zuse学校ELIZA) Hessian Center for AI (hessian.AI), Germany(黑森人工智能中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种仅用不完美伪标签适配扩散模型的框架,可从低代价合成数据生成目标域对齐图像,经实验其分割性能较最优方法提升8.0个百分点,使快速构建的合成数据集达到高代价合成数据集的效果。

Comments Updated to match the published ICPR 2026 version; updated author order, affiliations, acknowledgements, and minor textual corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24293 2026-08-28 cs.CV 版本更新 57%

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

保留还是丢弃?用于紧凑视频表示的自适应分词器

Yeonkyeong Lee, Hyunsung Go, Jongmin Kim, Sewoong Lim, Donghoon Lee

机构 * Kakao Corp.(Kakao公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对传统VAE固定压缩率无法适配视频时空内容复杂度的问题,提出基于Transformer的自适应令牌分词器KATok,结合两种位置预测策略缓解空间错位,在先进压缩率下实现出色的视频重构与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-08-28 cs.CV 版本更新 57%

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: this https URL (https://aka.ms/latent-spatial-memory), Code: this https URL (https://github.com/microsoft/LatentSpatialMemory)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04802 2026-08-28 cs.CV cs.AI 版本更新 57%

Egosurg: Arbitrary view synthesis for egocentric replay of operating room workflows from ambient cameras

EgoSurg:基于环境相机的手术室工作流程自我中心视角回放的任意视角合成

Han Zhang, Lalithkumar Seenivasan, Jose L. Porras, Roger D. Soberanis-Mukul, Hao Ding, Hongchao Shu, Benjamin D. Killeen, Ankita Ghosh, Lonny Yarmus, Jeffrey K. Jopling, Masaru Ishii, Angela C. Argento, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 EgoSurg框架基于环境相机的立体视频重建手术室场景,渲染角色特定的自我中心视角,经评估可实现高质量重建,支持手术安全审查、培训等应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
1306.0707 2026-08-28 math.NA 版本更新 56%

Convergence Analysis of a Numerical Algorithm for Spatial Segregation of Two Population Densities

关于一类具有两个种群密度的反应扩散系统空间分离数值算法收敛性的研究

Avetik Arakelyan

专题命中 扩散模型 :diffusion(abstract,comments)

AI总结 本文研究了具有两个种群密度的反应扩散系统空间分离的数值算法收敛性,证明了非负内部动态下的算法收敛性,并进行了计算测试。

Comments 16 pages, 8 figures, Keywords: Free boundary, Two-phase membrane problem, Reaction-diffusion systems, Finite difference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25104 2026-08-28 math.AP 版本更新 50%

The Financial Bubble Model with Lévy Jump Processes

具有Lévy跳跃过程的金融泡沫模型

Avetik Arakelyan, Rafayel Barkhudaryan, Vigen Khalatyan, Michael Poghosyan

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过引入Lévy跳跃过程扩展BMS模型,利用最优停止理论和Itô-Lévy公式推导出非局部偏积分微分方程,建立了完整粘性解理论并设计了数值格式。

Comments 35 pages, 6 Figures, Keywords: Financial Bubbles, Levy Process, Viscosity Solutions, Free Boundary

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23080 2026-08-28 cs.LG 版本更新 50%

The Attribution Contract for Generative Language Models

归因契约:生成式语言模型的特征归因

Giang Nguyen

机构 * Guide Labs(Guide实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对生成式语言模型中特征归因的歧义性,提出归因契约规范,明确归因对象、特征范围、生成过程等要素,并通过自回归和扩散模型案例展示不同契约下的归因效果。

Comments Preprint, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17285 2026-08-28 math.PR math.AP math.FA 版本更新 50%

A stochastic Schauder-Tychonoff type theorem and its applications

一种随机Schauder-tychonoff型定理及其应用

Erika Hausenblas, Ankit Kumar, Jonas M. Tölle

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种随机Schauder-Tychonoff定理,并将其应用于非线性随机扩散方程的存在性研究

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10981 2026-08-28 math.NA math-ph 版本更新 50%

A model order reduction based adaptive parareal method for time-dependent partial differential equations

一种基于模型降阶的自适应并行真实方法用于时间依赖偏微分方程

Xiaoying Dai, Miao Hu, Shuwei Shen

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于模型降阶的自适应并行真实方法,用于高效求解时间依赖偏微分方程,通过自适应构建粗传播器提升长期演化问题的模拟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00280 2026-08-28 math.AP 版本更新 50%

Relationship between haptotaxis and chemotaxis in cell dynamics

细胞动态中趋触性和趋化性的关系

Hiroshi Ishii, Hideki Murakawa, Yoshitaro Tanaka

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究探讨了细胞分选中趋触性和趋化性之间的关系,通过分析非局部聚集模型与Keller-Segel型趋化系统之间的联系,揭示了两种机制如何产生相似动态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21008 2026-08-28 cond-mat.str-el 版本更新 50%

Ultrafast Charge-Doping via Photo-Thermionic Injection in van der Waals Devices

范德华器件中通过光热电子注入实现超快电荷掺杂

Yiliu Li, Esteban Rojas-Gatjens, Yinjie Guo, Birui Yang, Dihao Sun, Luke Holtzman, Juseung Oh, Katayun Barmak, Cory R. Dean, James C. Hone, Nathaniel Gabor, Eric A. Arsenault, Xiaoyang Zhu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究针对双栅扭转WSe2双层莫尔器件,确立了石墨栅极光热电子注入的超快光掺杂机制,通过瞬态反射实验证实光诱导空穴注入,可通过调控激发参数选择性控制注入空穴。

Comments 16 pages, 4 figures, SI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10277 2026-08-28 physics.app-ph physics.comp-ph 版本更新 50%

Morphogenetic mechanical metamaterials: Emerging tensor properties from self-organized structures

形态发生机械超材料:自组织结构产生的张量特性

Thomas Fromentèze, Philippe Michaud, Ali Hassny, Vincent Pateloup

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究受生物形态发生启发,提出去中心化生成模型,通过适配Turing反应-扩散概念,实现无需优化循环的目标正交各向异性机械超材料设计,经机械隐身实验验证其有效性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2608.05745 2026-08-28 cs.CV cs.AI 版本更新 70%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25862 2026-08-28 cs.CV 版本更新 57%

Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation

晚学习,早引导:用于公平人脸生成的时间步解耦语义引导

Subir Kumar Parida, Rajbabu Velmurugan, Ketan Kotwal, R.S. Sengar, Swati Hiremath

机构 * Bhabha Atomic Research Centre (B.A.R.C.)(巴巴原子研究中心) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出语义边界预测器(SBP),通过时间步解耦实现公平人脸生成,无需重训练或外部数据集,在CelebA-HQ上大幅降低人口统计公平差距且保持图像质量,计算开销小易集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-28 cs.CV cs.AI 版本更新 57%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-28 cs.RO 版本更新 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2507.11515 2026-08-28 cs.LG cs.AI cs.CL 版本更新 78%

AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air

AirLLM:面向空中远程微调的基于扩散策略的自适应LoRA方法

Shiyi Yang, Xiaoxue Yu, Rongpeng Li, Jianhang Zhu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Lab(浙江实验室)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 AirLLM是一种分层扩散策略框架,通过PPO智能体与DDIM交替优化实现自适应LoRA秩配置,可提升LLM空中远程微调性能并降低传输成本。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏