Eliminating Hallucination in Diffusion-Augmented Interactive Text-to-Image Retrieval
消除扩散增强交互式文本到图像检索中的幻觉
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract)
AI总结 本文提出DMCL框架,通过引入语义一致性和扩散感知对比目标,有效消除DAI-TIR中的幻觉问题,提升检索性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
消除扩散增强交互式文本到图像检索中的幻觉
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract)
AI总结 本文提出DMCL框架,通过引入语义一致性和扩散感知对比目标,有效消除DAI-TIR中的幻觉问题,提升检索性能。
GenAgent:通过代理多模态推理扩展文本到图像生成
机构 * Fudan University(复旦大学) ; Tongyi Lab(通义实验室) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV
AI总结 GenAgent通过代理多模态推理提升文本到图像生成性能,采用两阶段训练策略实现自主多轮交互与任务自适应推理。
在电子商务目录中评估多模态大语言模型用于缺失模态补全
机构 * University of Glasgow(格拉斯哥大学) ; Telefónica Scientific Research(电信科研机构) ; National University of Singapore(新加坡国立大学) ; Shandong University(山东大学)
专题命中 文生图 :text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。
TeleStyle: 图像和视频中的内容保持风格迁移
机构 * TeleAI
专题命中 图像编辑 :diffusion(abstract);分类 cs.CV
AI总结 TeleStyle通过课程持续学习框架实现图像和视频内容保持的风格迁移,提升风格相似性和内容一致性,达到最佳性能。
BLENDER: 用于深度度量学习中类内图像合成的混合文本嵌入与扩散残差
机构 * Meta Reality Labs(Meta现实实验室) ; Technical University of Darmstadt(达姆斯塔特技术大学)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV
AI总结 BLENDER通过集合论操作提升深度度量学习中类内图像合成的可控多样性,实现性能提升。
通过互信息引导的修复生成进行扩散音色转移
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Sony Computer Science Laboratories(索尼计算机科学实验室)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(title)
AI总结 本文提出通过互信息引导的修复生成方法,在无需额外训练的情况下实现音乐音频的音色转移,通过潜在空间噪声注入和早期步骤钳制机制,有效控制音色变化与结构保持的平衡。
Comments 5 pages, 2 figures, 3 tables
可逆高效扩散用于图像融合
机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) ; School of Artificial Intelligence, Tianjin University(人工智能学院,天津大学) ; Low-Altitude Intelligence Laboratory, Xiong’an National Innovation Center(低空智能实验室,雄安国家创新中心) ; Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) ; National University of Defense Technology(国防科技大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文提出可逆高效扩散模型,通过显式监督提升图像融合的生成能力,解决传统扩散模型在融合任务中的细节损失问题。
从预测到完美:引入精修到自回归图像生成
机构 * Xi’an Jiaotong University(西安交通大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Tsinghua University(清华大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室)
专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 TensorAR通过引入张量预测机制,改进自回归图像生成的质量和性能。
Comments Published as a conference paper at ICLR 2026
FreeFix: 通过无微调扩散模型提升3D高斯散射
机构 * Zhejiang University(浙江大学) ; University of Maryland, College Park(马里兰大学学院 park 分校) ; Huawei(华为)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 FreeFix通过无微调扩散模型提升3D高斯散射,实现高质量视图合成与强泛化能力。
Comments Our project page is at https://xdimlab.github.io/freefix
FAIRT2V:无需训练的文本到视频扩散模型去偏框架
机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。
DiffRatio: 无需教师监督训练一步扩散模型
机构 * Bosch (China) Investment Ltd.(博世(中国)投资有限公司) ; University of Cambridge(剑桥大学) ; Imperial College London(伦敦帝国理工学院) ; Max Planck Institute for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所,图宾根)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffRatio通过直接估计分数差来训练一步扩散模型,减少梯度偏差并提升生成质量,同时提高计算效率。
Comments 22 pages, 8 figures, 5 tables, 2 algorithms
DiffVC-RT: 向实用的实时扩散式感知神经视频压缩迈进
机构 * School of Remote Sensing and Information Engineering, Wuhan University, Wuhan, China(遥感与信息工程学院,武汉大学,武汉,中国)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffVC-RT通过高效架构、显式隐式一致性建模和异步并行解码实现实时扩散式视频压缩,显著提升压缩效率和质量。
Comments 17 pages, 10 figures
高效的自回归视频扩散模型与Dummy头
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。
Comments Technical Report
SemBind: 通过学习语义遮罩将潜在信号绑定到图像语义以对抗黑盒伪造攻击
机构 * School of Cyber Science and Technology, University of Science and Technology of China, Anhui, China(中国科学技术大学网络安全学院) ; Anhui Province Key Laboratory of Digital Security, Anhui, China(安徽省数字安全重点实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SemBind通过学习语义遮罩将潜在信号绑定到图像语义,以对抗黑盒伪造攻击,提高水印的抗伪造能力和鲁棒性平衡。
结构约束的语言引导扩散模型用于无配对低剂量计算机断层扫描血管造影重建
机构 * Key Lab of Optoelectronic Technology and Systems and Engineering Research Center of Industrial Computed Tomography Nondestructive Testing, Ministry of Education, Chongqing University(光电技术与系统国家重点实验室和工业计算机断层非破坏检测工程研究中心,教育部,重庆大学) ; School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) ; Department of Radiology, Beijing Anzhen Hospital, Capital Medical University(北京安贞医院放射科,首都医科大学) ; School of Information Engineering, Nanchang, Jiangxi(信息工程学院,南昌,江西) ; Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出结构约束的语言引导扩散模型,通过整合结构协同和空间智能,提升低剂量CT血管造影重建的准确性与对比度。
GeoDiff3D: 基于几何约束的2D扩散引导的自监督3D场景生成
机构 * Nanjing University(南京大学) ; Simon Fraser university(西蒙弗雷泽大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 GeoDiff3D通过几何约束的2D扩散模型和自监督机制,实现高效且高质量的3D场景生成,减少对标注数据的依赖,提升复杂场景的生成质量。
WaveletGaussian: 基于小波域的稀疏视角3D高斯物体重建
机构 * Video Processing Lab, UC San Diego(UC San Diego视频处理实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 WaveletGaussian通过将扩散模型应用于小波域的低分辨率子带,结合高效在线随机掩码策略,实现了更高效的稀疏视角3D高斯物体重建。
Comments Accepted to ICASSP 2026
AGFS-束测:一种基于图谱的精细束测方法,用于利用弥散MRI束图进行增强的沿束群体统计比较
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇曼妇女医院) ; Boston University(波士顿大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 AGFS-束测提出了一种基于图谱的精细束测方法,通过利用弥散MRI束图信息和排列检验,提高沿束群体统计比较的敏感性和特异性,有效识别白质群体差异。
Comments 31 pages and 7 figures
超越人脸交换:一种基于扩散模型的多模态深度伪造检测基准
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DigiFakeAV数据集和DigiShield检测模型,用于多模态深度伪造检测,通过融合时空和跨模态特征提升检测性能。
GCRayDiffusion:基于几何一致射线扩散的无姿态表面重建
机构 * Beijing Normal University(北京师范大学) ; VAST(中国科学院软件研究所) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 GCRayDiffusion通过几何一致射线扩散实现无姿态表面重建,提升稀疏视角下的3D一致性与精度。
Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (ICCV), 2025, pp. 25335-25345
通过聚合多个扩散模型实现更精细的控制
机构 * Sun Yat-Sen University(中山大学) ; Game AI Center, Tencent(腾讯游戏AI中心) ; University of Toronto(多伦多大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出AMDM算法,通过聚合多个扩散模型实现无需训练的细粒度生成控制,提升生成质量和一致性,减少复杂数据集和模型架构设计的需求。
扩散噪声特征:准确且快速的生成图像检测
机构 * Zhejiang University(浙江大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出扩散噪声特征(DNF)以提高生成图像检测的准确性和泛化能力,通过训练ResNet-50实现高鲁棒性的检测。
Comments Accepted by ECAI 2025
Journal ref ECAI 2025
连续时间扩散模型能否生成并解决全局约束的离散问题?一项关于数独的研究
机构 * University of Geneva(日内瓦大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了连续时间扩散模型在解决全局约束离散问题中的能力,通过数独任务验证模型生成和求解约束满足问题的可行性。
Comments 26 pages, 5 figures. Empirical study of continuous-time diffusion and flow models on Sudoku. Code available at https://github.com/MariiaDrozdova/sudoku_generation
利用扩散模型对人马座A*的多波段光变曲线进行概率插值
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出利用扩散模型对Sgr A*多波段光变曲线进行概率插值,以提高多波段变异性重建的精度和不确定性估计。
Comments 19 pages, 7 figures, 4 tables. Published in The Astrophysical Journal
快速失败,大获成功:通过扩散大语言模型重新思考推测解码的起草策略
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Google(谷歌) ; Rice University(里士满大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 FailFast通过动态调整推测长度,利用扩散大语言模型的并行解码优势,实现快速失败和大获成功,提升推测解码效率。
基于扩散图的非线性降维实践
机构 * Institute of Physics and Astronomy, University of Potsdam(物理与天文学系,波茨坦大学) ; Faculty of Physics and Earth System Sciences, University of Leipzig(物理与地球系统科学系,莱比锡大学) ; University of Leipzig(莱比锡大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文探讨了扩散图在非线性降维中的实践应用,指出数据预处理和参数设置对结果的影响,并提出了一种识别关键成分的新方法。
强化学习在部分观测的 regime-switching 随机过程扩散模型中的红利优化
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出基于强化学习的连续时间方法,在部分观测的regime-switching扩散模型中优化红利,通过探索性随机控制框架解决信息不完全问题,利用多项式近似和actor-critic算法实现最优策略学习。
Comments 41 pages, 4 figures, 3 tables
层状自旋液体中拓扑激发的扩散与弛豫
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 研究层状自旋液体中拓扑激发的扩散与弛豫,通过理论模型和模拟揭示激发在三维材料中的传播特性及实验检测方法。
Comments v2. New section discussing an ultraclean limit where ballistic motion is important
时间二阶有限元方案用于曲线缩短流及曲线扩散
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出二阶时间有限元方法用于曲线缩短流和曲线扩散,证明了最优误差界并展示了数值收敛性与等分布性。
Comments 23 pages, 2 figures
Journal ref SIAM J. Numer. Anal. 64 (2026) 103--124
快速扩散方程:具有移动奇点的解的唯一性
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文研究了超临界快速扩散方程中,具有沿预定曲线移动的狄拉克源项的分布解的唯一性问题。
Comments 9 pages, accepted for publication in Tohoku Mathematical Journal