arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-28 至 2026-08-28 共收录 64 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2608.27199 2026-08-28 cs.CV cs.AR 新提交 57%

Vision-centric generative AI models: A software-hardware perspective

以视觉为中心的生成式AI模型:软硬件视角

Eleni Tselepi, Cristian Sestito, Shady Agwa, Themis Prodromakis

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2608.26956 2026-08-28 cs.CV 新提交 85%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 图像编辑 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26993 2026-08-28 cs.CV 新提交 57%

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架

Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma

机构 * StepFun(阶跃星辰) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 50 篇

2608.26980 2026-08-28 cs.HC 新提交 90%

Exploring Normativity in Stable Diffusion: Insights for XAI in the Arts

探索Stable Diffusion中的规范性:面向艺术领域可解释人工智能(XAI)的见解

Michelle Dutoit, Baptiste Caramiaux

专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(abstract)

AI总结 该研究以14名创意从业者为对象,探究Stable Diffusion的规范性行为对其创作过程的影响,为艺术领域可解释人工智能(XAI)的发展提供了提示词透明度等方面的启示。

Comments In Proceedings of Explainable AI for the Arts Workshop 2026 (XAIxArts 2026) arXiv:2607.20131 (https://arxiv.org/abs/2607.20131)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26476 2026-08-28 cs.CV 新提交 88%

Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References

基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强

Cong Cao, Huanjing Yue, Xin Liu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气自动化与信息工程学院) Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT))

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对文本到图像潜在扩散模型用于视频恢复时出现的时间闪烁问题,提出结合多模态参考的零样本视频恢复增强框架,通过双提示调优反演采样等技术提升效率与时间一致性,实验验证其优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26624 2026-08-28 cs.CV 新提交 87%

Text-to-seed generation: Training-free open-vocabulary seeded semantic segmentation via re-purposing diffusion as text-guided seed generator

文本到种子生成:通过将扩散模型重新用作文本引导的种子生成器实现免训练开放词汇种子语义分割

Kumju Jo, Heesun Jung, Sungyong Baik

机构 * Hanyang University(汉阳大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本研究提出免训练框架T2S,利用Stable Diffusion生成文本引导的种子点,结合SAM实现开放词汇语义分割,在标准基准上取得优异性能。

Comments Preprint version of the work accepted for publication in Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27158 2026-08-28 cs.LG 新提交 82%

Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation

用于机器人人群导航短程规划的扩散策略

Wendong Li, Jochen Garcke

机构 * Institute for Numerical Simulation(数值模拟研究所) University of Bonn(波恩大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对机器人人群导航中现有方法难以表征多样化短期避障策略的问题,提出PDPO框架,生成短程动作块并引入边界约束,在基准测试中取得更好导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26794 2026-08-28 cs.CV 新提交 79%

Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion

环强制法:面向自回归视频扩散模型的精准长期记忆

Bowen Xue, Brandon Y. Feng, Chenguo Lin, Yuchen Lin, Yujia Zeng, Lvmin Zhang, Maneesh Agrawala, Honglei Yan, Panwang Pan

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型的长期记忆瓶颈,提出Ring Forcing框架,通过环形训练策略、压缩与时间步组合策略及稀疏RoPE机制,实现分钟级视频生成的优异连贯性与物体恒常性,性能优于现有方法。

Comments Project page: this https URL (https://ringforcing.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 79%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27080 2026-08-28 stat.ML cs.AI cs.LG 新提交 78%

Active Diffusion-Based Inference for Ill-Posed Inverse Problems under Incomplete Priors

基于主动扩散的不完备先验下不适定逆问题推理方法

Jitao Xu, Nobuo Sato, Yaohang Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对不完备先验下的不适定逆问题,提出主动扩散模型求解器,通过后验不确定性修正模型误设,在两类任务上验证了其鲁棒推理的有效性。

Comments Accepted for publication in the Proceedings of IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26748 2026-08-28 cs.LG 新提交 78%

Self-Augmented Diffusion Guidance for Physics-Informed Generation

用于物理感知生成的自增强扩散引导

Akira Osaka, Naoya Takeishi, Takehisa Yairi

机构 * The University of Tokyo(东京大学) School of Engineering(工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出一种基于自生成数据增强的扩散引导的物理感知生成方法,解耦控制方程评估与扩散模型训练采样,可显著降低生成物理信号的偏差,且与现有物理约束扩散方法结合效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26585 2026-08-28 cs.LG cs.CE q-bio.QM stat.ML 新提交 78%

GRAS: Guided Reduced-Variance Proposals and Adaptive Selection for Training-Free Reward Alignment in Discrete Diffusion

GRAS:用于离散扩散模型无训练奖励对齐的引导式降方差提议与自适应选择

Kwanyoung Kim

机构 * Gwangju Institute of Science and Technology (GIST)(光州科学技术院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出GRAS方法,通过降方差提议与自适应重采样温度改进离散扩散模型无训练奖励对齐,在调控DNA和蛋白质设计任务中表现优于现有无训练方法,效果接近或超越奖励微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26574 2026-08-28 cs.CL 新提交 78%

Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference

面向高效扩散大语言模型推理的依赖感知可撤销解码

Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔大学) Sungkyunkwan University(成均馆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26374 2026-08-28 cs.CL 新提交 78%

Survival-Guided Length Control for Efficient Diffusion Language Models

用于高效扩散语言模型的生存引导式长度控制

Ivan Kobyzev, Abbas Ghaddar, Yufei Cui

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散语言模型解码时存在不必要去噪步骤的问题,提出生存引导式长度预测器,可将推理速度最高提升7倍且保持任务准确率,同时发现模型性能对所选预测长度敏感。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26140 2026-08-28 cs.CL cs.LG 新提交 78%

Affix Cache for Diffusion Large Language Models

扩散大语言模型的词缀缓存

Kaihua Liang, An Zhong, Xin Tan, Zafar Ayyub Qazi, Hong Xu, Jian Weng, Marco Canini

机构 * KAUST(阿卜杜拉国王科技大学) CUHK(香港中文大学) LUMS(拉合尔管理科学大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散大语言模型高效推理难题,提出面向词缀的ACache缓存机制,通过复用词缀缓存并仅重新计算约20%关键锚定词元,可降低延迟、提升吞吐量并恢复精度损失。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27431 2026-08-28 math.AP math.DS 新提交 78%

Monotonicity of the propagation speed with respect to the diffusion in a Lotka-Volterra competition-diffusion system

Lotka-Volterra竞争扩散系统中传播速度相对于扩散系数的单调性

Cyrille Kenne

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文证明强竞争下Lotka-Volterra竞争扩散系统的波速在参数空间显式无界区域上随扩散比严格递减,完善了该系统行波前的光滑性结果,明确了波速符号的完整刻画。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26415 2026-08-28 math.AP 新提交 78%

Stability of equilibria of an aggregation-diffusion energy on sphere

Razvan C. Fetecau, Hansol Park

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27378 2026-08-28 physics.flu-dyn 新提交 78%

How well can Diffusion Models learn Lagrangian-Tracer Statistics in Non-reciprocal Turbulence?

扩散模型在非互易湍流中学习拉格朗日示踪剂统计的性能如何?

Pratyush Jha, Biswajit Maji, Rahul Pandit

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对非互易二元流体湍流,用二维NRCHNS模型的DNS数据,分析拉格朗日示踪剂统计,首次表征其多尺度特性,并评估扩散模型生成合成轨迹模拟该统计的性能,同时指出相关应用挑战。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27212 2026-08-28 physics.med-ph 新提交 78%

Constrained estimation of rotational invariants of the cumulant expansion (RICE) for rapid tensor-valued diffusion MRI

用于快速张量值扩散MRI的累积量展开旋转不变量(RICE)的约束估计

Jinyang Yu, Oliver Gödicke, Frederik B. Laun, Obada T. Alhalabi, Iris A. Kohler, Jürgen Hesser, Sandro M. Krieg, Bogdana Suchorska, Heinz-Peter Schlemmer, Mark E. Ladd, David Bonekamp, Johann M. E. Jende, Tristan A. Kuder

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出用约束加权线性最小二乘(CWLLS)稳定快速累积量展开旋转不变量(RICE)的拟合,其速度比约束q空间轨迹成像(QTI)快160倍,可生成高质量dMRI参数图谱,提升组织表征可靠性。

Comments 11 pages, 5 figures. Jinyang Yu and Oliver Gödicke contributed equally to this work. Submitted to Magnetic Resonance in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27077 2026-08-28 hep-ph cs.AI 新提交 78%

Learning Transverse Momentum Distributions from Raw Scattering Events via Conditional Diffusion

基于条件扩散模型从原始散射事件学习横动量分布

Jitao Xu, Christopher Cocuzza, Kevin Braga, Daniel Lersch, Nobuo Sato, Yaohang Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出条件扩散模型,直接从原始SIDIS事件运动学映射得到TMD PDFs,在模拟数据上表现良好,少至1000个事件即可给出可靠估计,适用于相关实验。

Comments Accepted at Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27090 2026-08-28 cond-mat.stat-mech 新提交 78%

Localization Delocalization Transition in Diffusion with Adaptive Resetting

自适应重置扩散中的定域-离域转变

Tommer D. Keidar, Shlomi Reuveni

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对重置率依赖位置的自适应扩散,确定了λ=-2为临界阈值,发现平方反比重置对应平衡态对数势,存在温度依赖幂律尾部的离域转变,明确了空间依赖型重置的定域条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26773 2026-08-28 cond-mat.stat-mech 新提交 78%

Brownian yet non-Gaussian diffusion through equilibrium nonlinear friction

平衡态非线性摩擦下的布朗运动却非高斯扩散

Jakob Mihatsch, Andreas M. Menzel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对布朗运动却非高斯扩散现象,通过引入随机平衡条件下的非线性摩擦机制,解释了均匀环境中出现的中间时刻非高斯、长期过渡为高斯的位移统计特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26524 2026-08-28 astro-ph.IM 新提交 78%

Background Intensity Estimation for Cassini-ISS Image Using Deep Learning-Based Diffusion Model

基于深度学习扩散模型的卡西尼-ISS图像背景强度估计

Yongxin Chen, Qingfeng Zhang, Tianle Zhou, Kai Tang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对卡西尼-ISS图像背景估计的传统方法缺陷,提出基于DDPM的深度学习框架,在环隙背景估计及卫星质心定位上精度显著提升,可应用于多天文任务。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 74%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27039 2026-08-28 cs.CV cs.AI 新提交 70%

Multi-Person Human Motion Forecasting in Complex Scenes

复杂场景下的多人人体运动预测

Serdar Ozsoy, Lars Doorenbos, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对复杂场景下多人运动预测中物体信息与社会交互整合的挑战,提出OCSD模型,在HiK和HOI-M3基准上实现最优路径误差降低,生成更逼真长期预测。

Comments Accepted to GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27073 2026-08-28 cs.CV cs.RO 新提交 57%

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26714 2026-08-28 cs.CV cs.AI 新提交 57%

LiveVVT: High-Fidelity Video Virtual Try-On in Real Time

LiveVVT:高保真实时视频虚拟试穿

Yushe Cao, Shikun Feng, Ruxiang Duan, Liyong Wang, Dianxi Shi, Chun Yu, Junliang Xing

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) South China University of Technology(华南理工大学) Beijing Jiaotong University(北京交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LiveVVT是一种滚动式流式扩散框架,通过保留双向建模与互补内存维持一致性,结合渐进式蒸馏优化,实现了比同等规模模型延迟降26倍、吞吐量提11倍的高保真实时视频虚拟试穿。

Comments 16 pages, 13 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26648 2026-08-28 cs.CV cs.LG 新提交 57%

Hierarchical Channel Stacking: A Structured Decision Framework for AI-Generated Image Detection

分层通道堆叠:一种用于AI生成图像检测的结构化决策框架

Saifullah Shoaib, Akash Borigi, Rupendra Lekkala, Amaury Lendasse, Edward Ratner, Sai Sowjanya Bhamidipati, Alexander Schlager, Peggy Lindner

机构 * Missouri University of Science & Technology(密苏里科学技术大学) University of Houston(休斯顿大学) Cranium AI, Inc.(颅人工智能公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出分层通道堆叠(HCS)框架,将CNN中间激活转为结构化60维表示,在涵盖GAN和扩散生成器的基准测试中获86.7%准确率,可用于AI生成图像检测及相关证据整合机制研究。

Comments 12 pages, 4 figures. Accepted for publication at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26363 2026-08-28 cs.CV 新提交 57%

A Unified Framework for the Mechanics of Information in Convolutional Neural Network Image Space

卷积神经网络图像空间中信息力学的统一框架

Aryan Shukla, Matthew Toews

机构 * École de technologie supérieure(蒙特魁北克大学工程学院(École de technologie supérieure))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CNN图像空间信息力学的统一数学框架,建立离散滤波器对称性与相对论能量-动量关系的对应,经3D图像验证可在多尺度图像中生成尺度不变莫尔斯临界点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26907 2026-08-28 stat.AP 新提交 50%

Climate Physics Dynamic Matching

气候物理动态匹配

Gurjeet Sangra Singh, Frantzeska Lavda, Alexandros Kalousis

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对深度生成模型忽略物理结构、物理模型不完善的问题,提出ClimPhyDM框架,在ERA5基准上优于对比模型,可在单12GB消费级GPU训练,提升了天气预报的长时稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏