Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
突破大语言模型与视觉语言模型:机制、评估与统一防御
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
突破大语言模型与视觉语言模型:机制、评估与统一防御
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。
V-Agent:一种利用视觉-语言模型的交互式视频搜索系统
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 V-Agent通过多智能体协作和视觉-语言模型提升视频搜索性能,实现多模态交互与零样本性能。
Comments CIKM 2025 MMGENSR Workshop
HemBLIP:一种用于可解释性白血病细胞形态分析的视觉-语言模型
机构 * Department of Computer Science, University College London, United Kingdom(计算机科学系,伦敦大学学院,英国)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 HemBLIP是一种基于视觉-语言模型的白血病细胞形态分析工具,通过可解释的描述提升诊断透明度和效率。
FIRE-VLM:一种基于视觉-语言驱动的强化学习框架,用于在物理基础火灾数字孪生中无人机火灾跟踪
机构 * Clemson University(克莱姆森大学) ; University of Nevada, Reno(内华达大学拉斯维加斯分校) ; NSF NCAR(国家科学基金会NCAR)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)
AI总结 FIRE-VLM是一种基于视觉-语言模型的强化学习框架,用于在物理基础火灾数字孪生中实现无人机火灾跟踪,通过结合物理术语与VLM语义的奖励设计,提升了火灾检测效率。
Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解
机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) ; Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) ; Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.AI
AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。
Comments Accepted by IEEE International Conference on Computer Communications 2026
FROST-Drive: 可扩展且高效的端到端驾驶方法,采用冻结的视觉编码器
机构 * Stony Brook University(石溪大学) ; Rutgers University(罗格斯大学) ; Sunrise Technology Inc.(Sunrise技术公司)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 FROST-Drive通过冻结预训练视觉编码器,结合适配器和解码器,实现高效端到端驾驶,优于全微调方法。
MoTE:混合三元专家用于内存高效的大型多模态模型
机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG
AI总结 MoTE通过训练更多低精度三元专家,实现内存高效的大规模多模态模型训练,提升端任务性能并降低内存需求。
Comments Work in progress
为下一代医学超声图像分析适应视觉-语言基础模型
机构 * Department of Health Technology and Informatics, The Hong Kong Polytechnic University(健康科技与信息学系,香港理工大学) ; Centre for Smart Health and School of Nursing, The Hong Kong Polytechnic University(智能健康中心及护理学院,香港理工大学) ; Department of Imaging and Interventional Radiology, The Chinese University of Hong Kong(影像与介入放射学系,香港中文大学) ; Suzhou Hospital of Traditional Chinese Medicine Affiliated to Nanjing University of Chinese Medicine(南京中医药大学附属苏州中医医院) ; Department of Ultrasound, The Affiliated Changzhou No. 2 People's Hospital of Nanjing Medical University(南京医科大学附属常州第二人民医院超声科)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出混合微调策略,通过频域过滤和多尺度特征聚合提升CLIP模型在超声图像分析中的性能,实现更高效和鲁棒的医学诊断应用。