Vision-centric generative AI models: A software-hardware perspective
以视觉为中心的生成式AI模型:软硬件视角
机构 * The University of Edinburgh(爱丁堡大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
以视觉为中心的生成式AI模型:软硬件视角
机构 * The University of Edinburgh(爱丁堡大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV
AI总结 本文从软硬件视角指出视觉生成式AI发展中硬件被动适配模型的问题,提出软硬件协同设计方法,以实现生成式AI在边缘等多平台的可持续部署。
RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Alibaba DAMO Academy(阿里巴巴达摩院)
专题命中 图像编辑 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。
Comments Accepted to EMNLP 2026 Main Conference
Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架
机构 * StepFun(阶跃星辰) ; Fudan University(复旦大学)
专题命中 图像编辑 :image editing(abstract);分类 cs.CV
AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。
探索Stable Diffusion中的规范性:面向艺术领域可解释人工智能(XAI)的见解
专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(abstract)
AI总结 该研究以14名创意从业者为对象,探究Stable Diffusion的规范性行为对其创作过程的影响,为艺术领域可解释人工智能(XAI)的发展提供了提示词透明度等方面的启示。
Comments In Proceedings of Explainable AI for the Arts Workshop 2026 (XAIxArts 2026) arXiv:2607.20131 (https://arxiv.org/abs/2607.20131)
基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气自动化与信息工程学院) ; Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学(LUT))
专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对文本到图像潜在扩散模型用于视频恢复时出现的时间闪烁问题,提出结合多模态参考的零样本视频恢复增强框架,通过双提示调优反演采样等技术提升效率与时间一致性,实验验证其优越性。
文本到种子生成:通过将扩散模型重新用作文本引导的种子生成器实现免训练开放词汇种子语义分割
机构 * Hanyang University(汉阳大学)
专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV
AI总结 本研究提出免训练框架T2S,利用Stable Diffusion生成文本引导的种子点,结合SAM实现开放词汇语义分割,在标准基准上取得优异性能。
Comments Preprint version of the work accepted for publication in Knowledge-Based Systems
CollaFuse:协同扩散模型
机构 * University of Bayreuth(巴耶鲁斯大学) ; Fraunhofer FIT(弗劳恩霍夫 FIT) ; FIM Research Center for Information Management(信息管理研究所以) ; Technical University of Darmstadt(达姆施塔特技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出CollaFuse协同扩散模型,通过本地保留数据和轻量计算,将高计算任务转移至服务器,降低客户端负担,提升性能并减少数据泄露风险。
用于机器人人群导航短程规划的扩散策略
机构 * Institute for Numerical Simulation(数值模拟研究所) ; University of Bonn(波恩大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对机器人人群导航中现有方法难以表征多样化短期避障策略的问题,提出PDPO框架,生成短程动作块并引入边界约束,在基准测试中取得更好导航成功率。
扩散模型的原理
机构 * MIT Press(MIT出版社) ; Sony AI(索尼人工智能) ; OpenAI(开放人工智能) ; Stanford University(斯坦福大学) ; Sony Group Corporation(索尼集团)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR
AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。
Comments Supplementary materials for the book are available at the book website: this https URL (https://the-principles-of-diffusion-models.github.io/)
环强制法:面向自回归视频扩散模型的精准长期记忆
机构 * Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ByteDance(字节跳动)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对自回归视频扩散模型的长期记忆瓶颈,提出Ring Forcing框架,通过环形训练策略、压缩与时间步组合策略及稀疏RoPE机制,实现分钟级视频生成的优异连贯性与物体恒常性,性能优于现有方法。
Comments Project page: this https URL (https://ringforcing.com)
面向扩散多模态大语言模型的视觉信息引导并行解码
机构 * Seoul National University(首尔大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。
多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。
基于主动扩散的不完备先验下不适定逆问题推理方法
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对不完备先验下的不适定逆问题,提出主动扩散模型求解器,通过后验不确定性修正模型误设,在两类任务上验证了其鲁棒推理的有效性。
Comments Accepted for publication in the Proceedings of IJCAI-ECAI 2026
用于物理感知生成的自增强扩散引导
机构 * The University of Tokyo(东京大学) ; School of Engineering(工学院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究提出一种基于自生成数据增强的扩散引导的物理感知生成方法,解耦控制方程评估与扩散模型训练采样,可显著降低生成物理信号的偏差,且与现有物理约束扩散方法结合效果更佳。
GRAS:用于离散扩散模型无训练奖励对齐的引导式降方差提议与自适应选择
机构 * Gwangju Institute of Science and Technology (GIST)(光州科学技术院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出GRAS方法,通过降方差提议与自适应重采样温度改进离散扩散模型无训练奖励对齐,在调控DNA和蛋白质设计任务中表现优于现有无训练方法,效果接近或超越奖励微调模型。
面向高效扩散大语言模型推理的依赖感知可撤销解码
机构 * Seoul National University(首尔大学) ; Sungkyunkwan University(成均馆大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。
用于高效扩散语言模型的生存引导式长度控制
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对扩散语言模型解码时存在不必要去噪步骤的问题,提出生存引导式长度预测器,可将推理速度最高提升7倍且保持任务准确率,同时发现模型性能对所选预测长度敏感。
Comments EMNLP 2026 (Main Conference)
扩散大语言模型的词缀缓存
机构 * KAUST(阿卜杜拉国王科技大学) ; CUHK(香港中文大学) ; LUMS(拉合尔管理科学大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对扩散大语言模型高效推理难题,提出面向词缀的ACache缓存机制,通过复用词缀缓存并仅重新计算约20%关键锚定词元,可降低延迟、提升吞吐量并恢复精度损失。
Comments 15 pages, 7 figures
Lotka-Volterra竞争扩散系统中传播速度相对于扩散系数的单调性
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文证明强竞争下Lotka-Volterra竞争扩散系统的波速在参数空间显式无界区域上随扩散比严格递减,完善了该系统行波前的光滑性结果,明确了波速符号的完整刻画。
Comments 21 pages
专题命中 扩散模型 :diffusion(title,abstract)
扩散模型在非互易湍流中学习拉格朗日示踪剂统计的性能如何?
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究针对非互易二元流体湍流,用二维NRCHNS模型的DNS数据,分析拉格朗日示踪剂统计,首次表征其多尺度特性,并评估扩散模型生成合成轨迹模拟该统计的性能,同时指出相关应用挑战。
Comments 29 pages, 16 figures
用于快速张量值扩散MRI的累积量展开旋转不变量(RICE)的约束估计
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究提出用约束加权线性最小二乘(CWLLS)稳定快速累积量展开旋转不变量(RICE)的拟合,其速度比约束q空间轨迹成像(QTI)快160倍,可生成高质量dMRI参数图谱,提升组织表征可靠性。
Comments 11 pages, 5 figures. Jinyang Yu and Oliver Gödicke contributed equally to this work. Submitted to Magnetic Resonance in Medicine
基于条件扩散模型从原始散射事件学习横动量分布
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究提出条件扩散模型,直接从原始SIDIS事件运动学映射得到TMD PDFs,在模拟数据上表现良好,少至1000个事件即可给出可靠估计,适用于相关实验。
Comments Accepted at Physics and AI at Stanford University (PAI 2026)
自适应重置扩散中的定域-离域转变
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文针对重置率依赖位置的自适应扩散,确定了λ=-2为临界阈值,发现平方反比重置对应平衡态对数势,存在温度依赖幂律尾部的离域转变,明确了空间依赖型重置的定域条件。
平衡态非线性摩擦下的布朗运动却非高斯扩散
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对布朗运动却非高斯扩散现象,通过引入随机平衡条件下的非线性摩擦机制,解释了均匀环境中出现的中间时刻非高斯、长期过渡为高斯的位移统计特性。
基于深度学习扩散模型的卡西尼-ISS图像背景强度估计
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 该研究针对卡西尼-ISS图像背景估计的传统方法缺陷,提出基于DDPM的深度学习框架,在环隙背景估计及卫星质心定位上精度显著提升,可应用于多天文任务。
Comments 10 pages, 4 figures, 4 tables
无前向过程的扩散语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。
用于求解膨胀QCD介质中重子扩散方程的物理信息神经网络
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出利用物理信息神经网络求解膨胀QCD介质中重子扩散方程,以研究重子演化及凝聚过程。
Comments 11 pages, 6 figures
向列型溶致色原液晶中微颗粒扩散各向异性的光热调控
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本研究提出一种光热方法,通过切换照射光谱调控溶致色原液晶中微颗粒的扩散各向异性,实现各向异性比从3.0提升至5.5,为光控微流体分选和软物质组装提供了新方案。
STITCH-OPE:基于引导扩散的轨迹拼接用于离线策略评估
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; University of Toronto Robotics Institute(多伦多大学机器人研究所) ; Toyota Research Institute(丰田研究院) ; Vector Institute(向量研究所)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 STITCH-OPE通过引导扩散生成长周期轨迹,有效降低OPE中的方差,提升在高维空间中的评估性能。
Comments NeurIPS 2025 Spotlight