arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-24 至 2026-08-24 共收录 37 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2608.20382 2026-08-24 cs.CL cs.CV 新提交 70%

Decoupled Vision-Language System for Multimodal Understanding and Generation

用于多模态理解与生成的解耦式视觉-语言系统

Yifan Xu, Baochen Xiong, Xiaoshan Yang, Donglin Di, Yaowei Wang, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) Li Auto(理想汽车)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出多模态大语言模型Libra的解耦式视觉-语言架构,通过开关注意力与FFN模块实现自模态与跨模态解耦,在理解与生成任务上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20886 2026-08-24 cs.CV cs.LG 新提交 57%

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

EviRank:用于多模态图像重排序的结构化相关性证据

Enjun Du, Siyi Liu, Zirong Chen, Xinyu Zuo, Jinwen Luo, Ruiwen Tao, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) The University of Hong Kong(香港大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对现有多模态图像重排序器的不足,提出EviRank将查询解析为结构化证据包,通过证据条件验证实现重排序,在五个基准上达SOTA,蒸馏学生模型保留超90%能力且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 31 篇

2608.20515 2026-08-24 cs.CV 新提交 83%

DiffVC-ONE: Diffusion-based Generative Video Compression with One-Step Video Diffusion Transformer

DiffVC-ONE:基于扩散模型的生成式视频压缩,采用单步视频扩散Transformer

Wenzhuo Ma, Zhenzhong Chen

机构 * school of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVC-ONE是基于扩散模型的生成式视频压缩框架,采用单步视频扩散Transformer,通过三类组件实现低推理成本下的高感知质量与时间一致性,在多基准上达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21229 2026-08-24 cs.CV 新提交 79%

Anchoring Instruction Outside Mask: Exact Reference Caching for Efficient In-Context Diffusion Transformers

在掩码外锚定指令:用于高效上下文扩散Transformer的精确引用缓存

Yangshuai Liu, Zheming Li, Jiaao Li, Kang He, Ziliang Lai, Zhitai Liu, Chengru Song

机构 * Harbin Institute of Technology(哈尔滨工业大学) KlingAI Research(KlingAI研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对上下文扩散Transformer中引用增多导致计算量过大的问题,提出掩码外锚定指令的精确引用缓存方法,通过静态文本锚点结合速度蒸馏实现高效图像编辑,在保持生成质量的同时大幅提升了去噪速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20818 2026-08-24 cs.LG cs.AI cs.CV 新提交 79%

Scaling Muon for Diffusion Transformers

针对扩散Transformer的Muon优化器的缩放研究

Chenghao Li, Xiao Han, Xinxin Huang, Wei Liu, Boyang Li, Bing Xiao, Heran Zhang, Juanma Perez Rua, Ke Xu, Kangning Liu, Linjun Kuang, Na Li, Tan Wang, Tian Xie, Wei Peng, Yang Pei, Yifan Xu, Yuanhao Zhai, Yuwei Lin, Zhe Wang, Zihao He, Daniel Li, Junbiao Tang, Ziyang Jiang, Dake Chen

机构 * University of Southern California(南加州大学) Meta

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20759 2026-08-24 cs.CV 新提交 79%

DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

DiGS-Avatar:基于UV空间扩散的单图像可动画三维人体重建

Jiakun Li, Li Fang, Hao Zhu, Fei Hu, Long Ye, Yuan Zhang, Jinyao Yan

机构 * Key Laboratory of Media Audio and Video (Communication University of China)(中国传媒大学媒体音频与视频重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiGS-Avatar,将单图像可动画三维人体重建转化为UV空间扩散的潜变量补全任务,通过师生框架优化后解码为三维高斯基元,实现了高效高质量的重建与零样本泛化。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21188 2026-08-24 eess.AS 新提交 78%

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

SlimDiffuSE:使用可瘦身网络实现高效的基于扩散模型的语音增强

Nagashree K. S. Rao, Shrishti Saha Shetu, Mohamed Elminshawi, Emanuël A. P. Habets, Andreas Brendel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出SlimDiffuSE可瘦身扩散模型,采用贪心搜索算法优化网络宽度调度,在PESQ、SI-SDR指标无显著下降的情况下,将计算复杂度最高降低87.5%,实现高效语音增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20635 2026-08-24 stat.ML cs.LG 新提交 78%

Minimax Optimality of Score-Entropy Discrete Diffusion

得分-熵离散扩散的极小极大最优性

Cholyeon Cho, Yuchen Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究得分-熵离散扩散(SEDD)的统计极限,针对均匀和掩码离散扩散模型建立极小极大下界,提出匹配下界的MLE阈值估计器,证明SEDD经合适设置可达到接近最优的极小极大样本复杂度。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20366 2026-08-24 q-bio.BM cs.LG 新提交 78%

Harmonic Torsional Diffusion for Protein-Ligand Flexible Docking

用于蛋白质-配体柔性对接的调和扭转扩散

Maksim Zhdanov, Pavel Strashnov, Vladislav Kurenkov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Harmony调和扭转扩散框架,通过对齐得分参数化与扩散过程几何,在PDBBind、PoseBusters基准及EBNA1、KRAS G12D案例中提升了蛋白质-配体柔性对接的精度与有效性。

Comments Accepted at the 2026 Workshop on Generative and Agentic AI for Biology (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21040 2026-08-24 cs.SI 新提交 78%

From Propagation to Protection: Risk-Aware Diffusion for Harm Minimization in Signed Social Networks

从传播到保护:用于符号社交网络中危害最小化的风险感知扩散模型

Aaqib Zahoor, Janibul Bashir, Iqra Altaf Gillani

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对符号社交网络中敌对关系传播的危害问题,提出风险感知扩散模型RASH,构建危害最小化模型HM,在六个网络上实现最高危害减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20935 2026-08-24 cs.CE 新提交 78%

An Imaging-Informed Reaction-Diffusion Model of Infarct Growth

基于影像信息的梗死生长反应-扩散模型

Muhammad Hussnain Abbas, Michal Balcerak, Asif Ahmad, Bjoern Menze, Ezequiel de la Rosa

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对卒中梗死体积预测的临床痛点,提出首个从急性MRI参数化Fisher-KPP反应-扩散PDE的影像驱动框架,在ISLES 2017数据集上验证其性能优于传统rCBF阈值法,兼具生理可解释性,推动卒中预测从纯数据驱动转向患者特异性生物物理预测。

Comments Accepted at MICCAI 2026 Satellite Events (LNCS). 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20839 2026-08-24 cs.CL cs.CR cs.LG 新提交 78%

SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel Fields

SAC-Copula:基于平滑相关Gumbel场的扩散语言模型质量保留水印

Baixin Li, Haiyun He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型的水印方法与迭代并行去掩蔽不兼容的问题,提出SAC-Copula方法,通过高斯Copula构建平滑相关Gumbel扰动场实现质量保留水印,在LLaDA等数据集上验证了其质量-可检测性权衡优势。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20804 2026-08-24 cs.CL cs.AI 新提交 78%

Denoising the Future: Context-Aware Spectral Diffusion for Temporal Knowledge Graph Extrapolation

去噪未来:用于时序知识图谱外推的上下文感知谱扩散

Yanglei Gan, Peng He, Run Lin, Peiyuan Jiang, Yifan Wang, Qiao Liu

机构 * Southwest Minzu University(西南民族大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有扩散式时序知识图谱外推方法的目标判别信号削弱问题,提出FreqDiff频率感知扩散框架,通过双流去噪器与频域正则化项提升性能,在四个公开基准上达最优表现。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-08-24 cs.AI 新提交 78%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20795 2026-08-24 math.AP 新提交 78%

Propagation Direction of Bistable Traveling Fronts in the Lotka--Volterra Competition--Diffusion System

两物种Lotka–Volterra竞争-扩散系统中双稳行波前的传播方向

Shizhao Ma, Dongyuan Xiao, Maolin Zhou

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对两物种Lotka–Volterra竞争-扩散系统强竞争下双稳行波前传播方向问题,结合麦克斯韦型恒等式与相平面刚性论证建立波速为零的全局充要判据,明确了该系统强竞争参数区域内的传播方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21061 2026-08-24 physics.chem-ph 新提交 78%

A differentiable photon-by-photon likelihood for continuous free-energy landscapes and diffusion coefficients from single-molecule FRET

用于从单分子FRET获取连续自由能景观和扩散系数的逐光子可微似然

Lars Dingeldein, Roberto Covino

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种逐光子可微似然,可从单分子FRET数据联合推断连续自由能景观、扩散系数等参数,该方法高效且支持不确定性评估,可扩展至大型数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20519 2026-08-24 physics.med-ph cs.AI 新提交 78%

An integrated diffusion-weighted imaging processing and interpretation platform for MR-guided radiotherapy

用于磁共振引导放疗的扩散加权成像处理与解释一体化平台

Yunxiang Li, Yan Dai, Yen-Peng Liao, Jie Deng, Jill B De Vis, You Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究开发了一体化网络平台,整合MR-Linac的DWI后处理与可追溯的RAG临床解释,经专家评分验证其在胶质母细胞瘤病例中具有高临床实用性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20489 2026-08-24 cond-mat.quant-gas physics.atm-clus physics.atom-ph 新提交 67%

Self-limiting electrostriction of a single ion in an ultracold polar gas: From mesoscopic ions to crystalline molecular rings

超冷极性气体中单个离子的自限电致伸缩:从介观离子到结晶分子环

Ruiren Shi, Saajid Chowdhury, Leon Karpa, Jesús Pérez-Ríos

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究探究超冷极性气体中单个离子周围极性分子的自组装,结合全局优化与扩散蒙特卡洛方法,揭示了离子结合极性分子团簇的特殊结构与稳定性,为研究量子浴中带电杂质提供新途径。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20621 2026-08-24 cs.CV 新提交 57%

RECOUNT: Reference-guided Counting with Synthetic Visual Exemplars

RECOUNT:基于合成视觉示例的参考引导计数

Adriano D'Alessandro, Ali Mahdavi-Amiri, Ghassan Hamarneh

机构 * Simon Fraser University(西蒙菲莎大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RECOUNT是基于合成视觉示例的图像引导零样本计数即插即用框架,通过扩散模型扩展参考图像生成示例库,在两个基准上实现最优零样本计数准确率,大幅降低计数误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 57%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20561 2026-08-24 eess.IV cs.AI cs.CV cs.LG physics.med-ph 新提交 57%

Consistency Models for Fast MRI Reconstruction Using Regularization by Denoising

基于去噪正则化的快速MRI重建一致性模型

Merve Gülle, Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CM-RED方法,将一致性模型整合到去噪正则化框架中,仅用4次网络函数评估,在fastMRI数据集上实现优于现有方法的快速高质量MRI重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20965 2026-08-24 cs.LG 新提交 56%

Training, learning and inference: unified dynamics of neural systems

训练、学习与推理:神经系统的统一动力学

Mian Wang

专题命中 扩散模型 :diffusion(abstract,comments)

AI总结 该研究定义原子生成事实并构建生成事实图,基于nanoGPT等建立训练-学习统一动力学,二阶预测器在四转换上获91.43%准确率等,还将推理确立为训练-学习动力学的冻结投影。

Comments 39 pages, 2 figures, 3 tables. Evidence spans 22 indexed experimental programmes: held-out prediction (91.43% accuracy), causal interventions, and cross-system validation in nanoGPT, ResNet/CIFAR-100 and diffusion/CIFAR-10. Code: this https URL (https://github.com/wind342/gfg-training-learning-inference-experiments). Evidence: this https URL (https://doi.org/10.5281/zenodo.22032772)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20530 2026-08-24 cs.CL 新提交 50%

LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding

LiLiCorr:用于推测解码的并行草稿轻量级似然关联模型

Matan Rusanovsky, Yoav Miron, Roy Uziel, Omer Belhasin, Ran Zilberstein, Maor Ashkenazi, Michael Elad

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract)

AI总结 LiLiCorr是关联并行草稿边际分布的轻量级模型,联合训练草稿生成器后,在多数设置下提升了推测解码的接受长度与吞吐量,且对长输入仍保持性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20375 2026-08-24 cs.CL 新提交 50%

GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring

GRAFT:基于自适应DLM的草稿树构建与目标蒸馏边评分

Xuming Ye, Zeming Ma, Runjie Yu, Yuan Liu, Tianle Li, Shuhan Bai, Jian Zhou, Fei Wu

专题命中 扩散模型 :diffusion(abstract)

AI总结 GRAFT 是用于基于 DLM 的推测解码的草稿树构建框架,通过 TDES 和 SABA 解决现有方法的父子兼容性与预算适配问题,实现了 2.13 倍至 6.36 倍的端到端加速,每轮开销不足 0.5 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20346 2026-08-24 cs.CL cs.SD eess.AS 新提交 50%

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

构建并评估面向电信客服场景的合成孟加拉语语音资源

Kawshik Kumar Paul, Md. Nafiul Alam Fuji

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文构建并公开了面向电信客服场景的合成孟加拉语语音数据集,经评估其文本与音频一致性强,同时探讨了合成语音及STT评估的局限性。

Comments Dataset URL: this https URL (https://huggingface.co/datasets/kawshikbuet17/bengali-telecom-customer-care-speech)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21213 2026-08-24 math.DG math.AP 新提交 50%

Differential Harnack Estimates for the Filtration Equations on Riemannian Manifolds via Nash--Moser Iteration

基于Nash–Moser迭代的黎曼流形上过滤方程的微分Harnack估计

Jian-Hua Hao, Yu-Zhao Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对黎曼流形上过滤方程的光滑正解,通过Bochner判别式结合Nash–Moser迭代推导微分Harnack估计,恢复了两类方程的经典估计并拓展了过滤律类型。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20996 2026-08-24 math.OC 新提交 50%

Bridging Semantics and Behavior: An Agent-Based Evolutionary Model of Topic Competition with BERTopic

衔接语义与行为:基于智能体的BERTopic主题竞争演化模型

Blekanov I., Gubar E., Fan X

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出结合BERTopic、演化博弈论与智能体模拟的框架,揭示社交媒体主题传播的微观机制,复现真实传播趋势,为在线集体行为研究及相关应用提供支撑。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20950 2026-08-24 math.AP 新提交 50%

Concentration-compactness for the geometric polyharmonic heat flow

几何多重调和热流的集中紧性

James McCoy, Scott Parkins, Glen Wheeler, Valentina Wheeler

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对任意高阶几何演化方程建立集中紧性理论,以三维欧氏空间闭浸入曲面的几何多重调和热流为模型,结合多种估计与性质,证明满足无迹曲率阈值条件的连通初始浸入对应的解全局存在且指数收敛到圆球面。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20441 2026-08-24 cs.LG math.NA physics.comp-ph 新提交 50%

Shared Physics Responses Recover Hidden Rankings in Neural Operator Libraries

共享物理响应在神经算子库中恢复隐藏排名

Hanbing Liang, Fujun Liu

机构 * Changchun University of Science and Technology(长春理工大学) School of Physics(物理学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对无高保真参考解时神经算子部署的最优选择难题,提出利用共享物理响应的方法,恢复模型库隐藏排名,准确率超99%,实现无需真值数据的高效科学代理部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20439 2026-08-24 cs.LG physics.comp-ph 新提交 50%

Wrong-Physics Backdoors in Neural PDE Operators

神经PDE算子中的错误物理后门

Hanbing Liang, Fujun Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出跨参数重链接数据投毒原语,在神经PDE算子中构造错误物理后门,在保持低干净误差的同时实现高攻击成功率,暴露了其结构性验证缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏