ESMC: MLLM-Based Embedding Selection for Explainable Multiple Clustering
ESMC: 基于多模态大语言模型的可解释多聚类嵌入选择
专题命中 其他VLM :MLLM(title,abstract);分类 cs.LG
AI总结 ESMC利用多模态大语言模型实现用户驱动的可解释多聚类,通过嵌入选择和伪标签学习提升聚类准确性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
ESMC: 基于多模态大语言模型的可解释多聚类嵌入选择
专题命中 其他VLM :MLLM(title,abstract);分类 cs.LG
AI总结 ESMC利用多模态大语言模型实现用户驱动的可解释多聚类,通过嵌入选择和伪标签学习提升聚类准确性。
视觉-语言模型中的动态多模态原型学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Sichuan University(四川大学) ; National University of Singapore(新加坡国立大学) ; Shenzhen University(深圳大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。
Comments ICCV 2025
通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。
OmniSVG: 一种统一的可扩展矢量图形生成模型
机构 * Fudan University(复旦大学) ; StepFun Project(StepFun项目)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 OmniSVG通过统一框架和预训练视觉-语言模型,实现高效多模态SVG生成,提升复杂结构的表达能力,并引入大规模数据集推动SVG合成发展。
Comments 20 pages; Project Page: https://omnisvg.github.io/
NeuroVolve:通过可编程神经目标演化视觉刺激
机构 * Cornell University(康奈尔大学) ; Cornell Tech(康奈尔科技) ; Weill Cornell Medicine(韦尔医学院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 NeuroVolve通过可编程神经目标生成视觉刺激,揭示大脑区域间的协同与对抗性调节关系,实现脑引导的图像编辑与首选刺激生成的统一。