Vision-centric generative AI models: A software-hardware perspective
以视觉为中心的生成式AI模型:软硬件视角
机构 * The University of Edinburgh(爱丁堡大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
以视觉为中心的生成式AI模型:软硬件视角
机构 * The University of Edinburgh(爱丁堡大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。
RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Alibaba DAMO Academy(阿里巴巴达摩院)
专题命中 图像编辑 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。
Comments Accepted to EMNLP 2026 Main Conference
Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架
机构 * StepFun(阶跃星辰) ; Fudan University(复旦大学)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV
AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。
探索Stable Diffusion中的规范性:面向艺术领域可解释人工智能(XAI)的见解
专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(abstract)
AI总结 该研究以14名创意从业者为对象,探究Stable Diffusion的规范性行为对其创作过程的影响,为艺术领域可解释人工智能(XAI)的发展提供了提示词透明度等方面的启示。
Comments In Proceedings of Explainable AI for the Arts Workshop 2026 (XAIxArts 2026) arXiv:2607.20131 (https://arxiv.org/abs/2607.20131)
基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气自动化与信息工程学院) ; Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT))
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对文本到图像潜在扩散模型用于视频恢复时出现的时间闪烁问题,提出结合多模态参考的零样本视频恢复增强框架,通过双提示调优反演采样等技术提升效率与时间一致性,实验验证其优越性。
文本到种子生成:通过将扩散模型重新用作文本引导的种子生成器实现免训练开放词汇种子语义分割
机构 * Hanyang University(汉阳大学)
专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV
AI总结 本研究提出免训练框架T2S,利用Stable Diffusion生成文本引导的种子点,结合SAM实现开放词汇语义分割,在标准基准上取得优异性能。
Comments Preprint version of the work accepted for publication in Knowledge-Based Systems
用于机器人人群导航短程规划的扩散策略
机构 * Institute for Numerical Simulation(数值模拟研究所) ; University of Bonn(波恩大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对机器人人群导航中现有方法难以表征多样化短期避障策略的问题,提出PDPO框架,生成短程动作块并引入边界约束,在基准测试中取得更好导航成功率。
环强制法:面向自回归视频扩散模型的精准长期记忆
机构 * Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ByteDance(字节跳动)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对自回归视频扩散模型的长期记忆瓶颈,提出Ring Forcing框架,通过环形训练策略、压缩与时间步组合策略及稀疏RoPE机制,实现分钟级视频生成的优异连贯性与物体恒常性,性能优于现有方法。
Comments Project page: this https URL (https://ringforcing.com)
面向扩散多模态大语言模型的视觉信息引导并行解码
机构 * Seoul National University(首尔大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。
基于主动扩散的不完备先验下不适定逆问题推理方法
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对不完备先验下的不适定逆问题,提出主动扩散模型求解器,通过后验不确定性修正模型误设,在两类任务上验证了其鲁棒推理的有效性。
Comments Accepted for publication in the Proceedings of IJCAI-ECAI 2026
用于物理感知生成的自增强扩散引导
机构 * The University of Tokyo(东京大学) ; School of Engineering(工学院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究提出一种基于自生成数据增强的扩散引导的物理感知生成方法,解耦控制方程评估与扩散模型训练采样,可显著降低生成物理信号的偏差,且与现有物理约束扩散方法结合效果更佳。
GRAS:用于离散扩散模型无训练奖励对齐的引导式降方差提议与自适应选择
机构 * Gwangju Institute of Science and Technology (GIST)(光州科学技术院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出GRAS方法,通过降方差提议与自适应重采样温度改进离散扩散模型无训练奖励对齐,在调控DNA和蛋白质设计任务中表现优于现有无训练方法,效果接近或超越奖励微调模型。
面向高效扩散大语言模型推理的依赖感知可撤销解码
机构 * Seoul National University(首尔大学) ; Sungkyunkwan University(成均馆大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。
用于高效扩散语言模型的生存引导式长度控制
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对扩散语言模型解码时存在不必要去噪步骤的问题,提出生存引导式长度预测器,可将推理速度最高提升7倍且保持任务准确率,同时发现模型性能对所选预测长度敏感。
Comments EMNLP 2026 (Main Conference)
扩散大语言模型的词缀缓存
机构 * KAUST(阿卜杜拉国王科技大学) ; CUHK(香港中文大学) ; LUMS(拉合尔管理科学大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对扩散大语言模型高效推理难题,提出面向词缀的ACache缓存机制,通过复用词缀缓存并仅重新计算约20%关键锚定词元,可降低延迟、提升吞吐量并恢复精度损失。
Comments 15 pages, 7 figures
Lotka-Volterra竞争扩散系统中传播速度相对于扩散系数的单调性
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文证明强竞争下Lotka-Volterra竞争扩散系统的波速在参数空间显式无界区域上随扩散比严格递减,完善了该系统行波前的光滑性结果,明确了波速符号的完整刻画。
Comments 21 pages
专题命中 扩散模型 :diffusion(title,abstract)
扩散模型在非互易湍流中学习拉格朗日示踪剂统计的性能如何?
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究针对非互易二元流体湍流,用二维NRCHNS模型的DNS数据,分析拉格朗日示踪剂统计,首次表征其多尺度特性,并评估扩散模型生成合成轨迹模拟该统计的性能,同时指出相关应用挑战。
Comments 29 pages, 16 figures
用于快速张量值扩散MRI的累积量展开旋转不变量(RICE)的约束估计
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究提出用约束加权线性最小二乘(CWLLS)稳定快速累积量展开旋转不变量(RICE)的拟合,其速度比约束q空间轨迹成像(QTI)快160倍,可生成高质量dMRI参数图谱,提升组织表征可靠性。
Comments 11 pages, 5 figures. Jinyang Yu and Oliver Gödicke contributed equally to this work. Submitted to Magnetic Resonance in Medicine
基于条件扩散模型从原始散射事件学习横动量分布
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究提出条件扩散模型,直接从原始SIDIS事件运动学映射得到TMD PDFs,在模拟数据上表现良好,少至1000个事件即可给出可靠估计,适用于相关实验。
Comments Accepted at Physics and AI at Stanford University (PAI 2026)
自适应重置扩散中的定域-离域转变
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文针对重置率依赖位置的自适应扩散,确定了λ=-2为临界阈值,发现平方反比重置对应平衡态对数势,存在温度依赖幂律尾部的离域转变,明确了空间依赖型重置的定域条件。
平衡态非线性摩擦下的布朗运动却非高斯扩散
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对布朗运动却非高斯扩散现象,通过引入随机平衡条件下的非线性摩擦机制,解释了均匀环境中出现的中间时刻非高斯、长期过渡为高斯的位移统计特性。
基于深度学习扩散模型的卡西尼-ISS图像背景强度估计
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对卡西尼-ISS图像背景估计的传统方法缺陷,提出基于DDPM的深度学习框架,在环隙背景估计及卫星质心定位上精度显著提升,可应用于多天文任务。
Comments 10 pages, 4 figures, 4 tables
手术视频生成:从扩散模型到世界模型:综述
专题命中 扩散模型 :diffusion(title);分类 cs.CV
AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。
Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)
复杂场景下的多人人体运动预测
机构 * University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 针对复杂场景下多人运动预测中物体信息与社会交互整合的挑战,提出OCSD模型,在HiK和HOI-M3基准上实现最优路径误差降低,生成更逼真长期预测。
Comments Accepted to GCPR 2026
SpatialCrafter:基于生成式3D代理的单图像世界建模
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; ManyCore Tech Inc.(ManyCore科技公司) ; Jilin University(吉林大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。
Comments 12 pages
LiveVVT:高保真实时视频虚拟试穿
机构 * Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院) ; South China University of Technology(华南理工大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 LiveVVT是一种滚动式流式扩散框架,通过保留双向建模与互补内存维持一致性,结合渐进式蒸馏优化,实现了比同等规模模型延迟降26倍、吞吐量提11倍的高保真实时视频虚拟试穿。
Comments 16 pages, 13 figures,
分层通道堆叠:一种用于AI生成图像检测的结构化决策框架
机构 * Missouri University of Science & Technology(密苏里科学技术大学) ; University of Houston(休斯顿大学) ; Cranium AI, Inc.(颅人工智能公司)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出分层通道堆叠(HCS)框架,将CNN中间激活转为结构化60维表示,在涵盖GAN和扩散生成器的基准测试中获86.7%准确率,可用于AI生成图像检测及相关证据整合机制研究。
Comments 12 pages, 4 figures. Accepted for publication at ICANN 2026
卷积神经网络图像空间中信息力学的统一框架
机构 * École de technologie supérieure(蒙特魁北克大学工程学院(École de technologie supérieure))
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 本文提出CNN图像空间信息力学的统一数学框架,建立离散滤波器对称性与相对论能量-动量关系的对应,经3D图像验证可在多尺度图像中生成尺度不变莫尔斯临界点。
气候物理动态匹配
专题命中 扩散模型 :diffusion(abstract)
AI总结 该研究针对深度生成模型忽略物理结构、物理模型不完善的问题,提出ClimPhyDM框架,在ERA5基准上优于对比模型,可在单12GB消费级GPU训练,提升了天气预报的长时稳定性。