Learning Sparse Visual Representations via Spatial-Semantic Factorization
通过空间-语义分解学习稀疏视觉表示
机构 * Microsoft(微软)
专题命中 可控生成 :generative vision(abstract);分类 cs.CV
AI总结 STELLAR通过空间-语义分解实现稀疏视觉表示,在保持高重建质量的同时达到与密集模型相当的语义性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
通过空间-语义分解学习稀疏视觉表示
机构 * Microsoft(微软)
专题命中 可控生成 :generative vision(abstract);分类 cs.CV
AI总结 STELLAR通过空间-语义分解实现稀疏视觉表示,在保持高重建质量的同时达到与密集模型相当的语义性能。
SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击
机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) ; Nanyang Technological University(南洋理工大学) ; School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)
专题命中 可控生成 :text-to-image(abstract);分类 cs.CV
AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。
GLAD: 生成式语言辅助低语义模板视觉跟踪
机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 GLAD通过生成式多模态融合提升低语义模板视觉跟踪性能,实现更高效的多模态特征融合与语义增强。
带有记忆项的粘性Burgers方程的全局稳定性及有限元分析及Neumann边界反馈控制
专题命中 可控生成 :diffusion(abstract)
AI总结 本文研究了带有记忆项的粘性Burgers方程的全局稳定性,采用Neumann边界反馈控制并结合有限元方法进行分析,验证了稳定性及误差估计。
通过潜在嵌入学习模态混合的思考链推理
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 可控生成 :diffusion(abstract)
AI总结 本文提出模态混合CoT方法,通过潜在嵌入结合视觉与文本信息,提升多模态推理性能。
在近红外光学成像反射模式中使用散射减少剂以增强成像深度和灵敏度
专题命中 可控生成 :diffusion(abstract)
AI总结 本研究通过使用柠檬黄染料作为散射减少剂,在近红外反射模式成像中提升深度灵敏度和弱吸收体检测能力,利用折射率梯度增强反射信号。
Comments 26 pages, 10 figures