arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 27 篇

2608.21762 2026-08-25 cs.CV cs.CL 新提交 91%

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

重新学习观察:面向视觉语言模型的自由格式裁剪重路由的损失间隙监督

Jinchang Zhu, Rong Fu, Yi Ding, Chenghao Wu, Ying Liu, Menglin Yang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出GapSight框架,利用损失间隙监督让VLMs选择性重读图像局部区域,在多个基准测试中显著提升了LLaVA、InternVL2.5等VLMs的细节类任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23253 2026-08-25 cs.CV cs.AI 新提交 89%

E2S-Pruner: Progressive Two-Stage Evidence Fusion for Visual Token Pruning in Vision-Language Models

E2S-Pruner:用于视觉-语言模型中视觉令牌剪枝的渐进式两阶段证据融合方法

Taoyu Qian, Qi Wang, Daqian Shi, Yuanhao Jiang, Shang Gao, Hualong Yu

机构 * Digital Environment Research Institute (DERI), Queen Mary University of London(伦敦大学玛丽女王学院数字环境研究所(DERI)) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) National Institute of Education, Nanyang Technological University(南洋理工大学国家教育学院) School of Computer Science and Engineering, Jiangsu University of Science and Technology(江苏科技大学计算机科学与工程学院)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需额外参数或微调的E2S-Pruner,通过两阶段证据融合实现视觉-语言模型的视觉令牌剪枝,在LLaVA-1.5-7B上显著提升吞吐量并保留性能,且具跨模型泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22833 2026-08-25 cs.MA cs.AI 新提交 89%

Minimal Local Simulation Foundations for LLM- and VLM-Driven Agents in 2D and 3D Environments

用于二维和三维环境中大型语言模型(LLM)与视觉语言模型(VLM)驱动智能体的极简局部仿真基础

Ryuki Hyodo

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 该研究提出SD-AgentFoundry-2D和3D两款极简仿真基础,可在多系统本地运行,用于教育与快速原型设计,为学习生成式社会仿真及构建特定领域扩展提供便捷起点。

Comments GitHub Repositories: this https URL (https://github.com/ryukih/SD-AgentFoundry-2D) and this https URL (https://github.com/ryukih/SD-AgentFoundry-3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04001 2026-08-25 cs.CV 版本更新 89%

Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos

Sa2VA:将SAM2与多模态大语言模型结合用于图像与视频的密集接地理解

Haobo Yuan, Xiangtai Li, Tao Zhang, Yueyi Sun, Zilong Huang, Shilin Xu, Shunping Ji, Yunhai Tong, Lu Qi, Jiashi Feng, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Bytedance Seed(字节跳动种子) Wuhan University(武汉大学) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(title,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出Sa2VA,结合SAM2与MLLM实现图像视频密集接地理解,引入Ref-SAV数据集,在多任务中表现优异且可扩展至多款开源MLLM,代码模型已公开。

Comments Accepted by IEEE TPAMI. Code: this https URL (https://github.com/Bytedance/Sa2VA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21810 2026-08-25 cs.LG cs.CV 新提交 88%

MSM-Mem: A Universal Medical Structured Multimodal Memory Framework for Medical AI Agents

MSM-Mem:面向医疗AI智能体的通用医疗结构化多模态记忆框架

Md Asaduzzaman Jabin, Khoa Le, Lin Zhao, Tianming Liu

机构 * University of Georgia(佐治亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 针对现有医疗AI智能体无法内化临床经验的问题,提出MSM-Mem框架,整合多类型临床经验并逐步更新,经MoE-LLaVA评估可提升性能,助力医疗AI智能体随实践进化推理能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-25 cs.CL cs.AI cs.CV 版本更新 88%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22070 2026-08-25 cs.CE 新提交 88%

SoulGard-VL-2B: A Vision-Language Model for Edge-Based Feline Behavior Understanding

SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型

YuHang Wu, HaoXian Liu, Jia Tao

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21773 2026-08-25 cs.CR eess.SP 新提交 88%

Privacy Preserving Semantic Communications in Wireless Edge Networks with Vision Language Models

基于视觉语言模型的无线边缘网络中隐私保护语义通信

Haoran Chang, Mingzhe Chen, Qianqian Zhang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(title);vision-language model(abstract)

AI总结 该研究针对无线边缘网络语义通信的隐私泄露问题,提出基于VLM的隐私保护语义通信框架,通过私有区域移除、加密收发器和语义信息瓶颈实现隐私保护,同时保证重构质量并抑制跨设备冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21819 2026-08-25 cs.CV cs.AI cs.CL cs.LG 新提交 87%

PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models

PatchGate:在冻结的视觉-语言模型中利用固有物体清单缩小语言表述差距

Jihyung Ko, Eunji Jung, Hyeongsub Kim, Ziseok Lee, Jae Won Cho, Sanghyun Jo, Kyungsu Kim

机构 * Seoul National University(首尔大学) LG CNS Konkuk University(建国大学) OGQ

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对冻结VLMs图像字幕的物体表述问题,提出无训练框架PatchGate,通过VEX和VIED两个阶段提升可见物体覆盖率并减少物体幻觉,在AMBER数据集上取得了显著效果。

Comments 31 pages, 9 figures. Code will be available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27910 2026-08-25 cs.AI 版本更新 85%

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

跨架构视觉语言模型中基于方向的推理时防御措施审计

Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng

专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22359 2026-08-25 cs.CV cs.AI cs.SD 新提交 85%

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

面向未修剪自我中心视频的预算受限视觉-语言字幕生成的预解码音频分诊

Masoud Jalayer, Changyi Li, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对预算受限的未修剪自我中心视频视觉-语言字幕生成问题,提出预解码音频分诊策略,通过音频优先选择窗口减少VLM调用,提升动作覆盖率,在多个数据集上优于现有方法。

Comments 18 pages, 5 figures, 9 tables. Under review at IEEE BigData 2026, Industrial and Government Track. Code: this https URL (https://github.com/masjalayer/PreDecoding-AcousticTriage)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22916 2026-08-25 cs.CL 新提交 85%

Knowing Isn't Always Saying: When Do Spatial Encodings Reach Answers in Vision-Language Models?

知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?

Zeyu Wang, Xinming Xu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract)

AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。

Comments Accepted to appear in the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21486 2026-08-25 cs.CV 新提交 77%

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) TU Darmstadt(达姆施塔特工业大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。

Comments Accepted at the ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 77%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14537 2026-08-25 cs.CV 版本更新 77%

LanGuSTE: Language-Guided Coarse-to-Fine Patch Selection for Efficient Whole Slide Image Analysis

LanGuSTE:用于高效全切片图像分析的语言引导粗到细补丁选择

Yonghan Shin, Gangsu Kim, Won-Ki Jeong

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对全切片图像分析的高计算成本问题,提出LanGuSTE框架,通过跨尺度视觉提示调优和粗到细补丁选择,在保持诊断性能的同时将处理时间降至约3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22143 2026-08-25 cs.AI 新提交 74%

Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems

小型视觉-语言模型在定性力学问题上的评估

Henry Fordjour Ansah (1), Shreya Banerjee (1), Pranish Ghimire (1) ((1) Louisiana State University of New Orleans)

机构 * Louisiana State University of New Orleans(新奥尔良路易斯安那州立大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.AI

AI总结 本研究评估Gemma-3和Qwen-VL两个多模态模型解读力学问题图像的能力,通过思维链评估其推理过程,对比答案测准确率,为小型视觉-语言模型在定性力学问题上的应用提供评估依据。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22449 2026-08-25 cs.RO cs.AI 新提交 70%

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

EMPIRE:将显式操作规划作为可学习中间表征用于自我中心视角下手运动预测

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对现有手运动预测方法忽略操作过程、梯度干扰的问题,提出两阶段框架EMPIRE,构建EMPIRE-651K数据集,实现了更优的手运动预测精度。

Comments 14 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20735 2026-08-25 cs.AI cs.RO 版本更新 70%

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

ForeTime-VLA:面向传送带操作的世界动作模型的因果未来令牌蒸馏

Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云深处科技有限公司(深地机器人))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ForeTime-VLA策略,通过从冻结Fast-WAM教师模型蒸馏因果未来令牌,在传送带操控任务上降低了MAE和L2误差,提升了抓取成功率,验证了该方法的有效性。

Comments 8 pages, 5 figures. Introduces ForeTime-VLA, a causal future-token distillation method for conveyor-belt manipulation from a frozen world action model teacher

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-08-25 cs.CV 版本更新 70%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :VLM(abstract_cn);MLLM(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: this https URL (https://phi-scene.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 70%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23214 2026-08-25 cs.CL cs.IR 新提交 67%

Aligning Biomedical Texts and Knowledge Graphs: A Systematic Comparison of Lightweight Alignment Strategies

生物医学文本与知识图谱的对齐:轻量对齐策略的系统比较

Artem Bisliouk, Elizaveta Nosova, Heiko Paulheim, Andreea Iana, Rita T. Sousa

机构 * University of Mannheim(曼海姆大学)

专题命中 VLM训练与架构 :grounding(abstract,abstract_cn)

AI总结 本研究提出统一框架系统比较生物医学文本与KG的轻量对齐策略,构建CTD-Align语料库,发现三元组组合和训练方向影响最大,线性投影效果最优,为二者桥接提供实用基础。

Comments Accepted at the Third Workshop on Knowledge Graphs and Neurosymbolic AI (KG-NeSy 2026) co-located with ISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22780 2026-08-25 cs.CV 新提交 57%

Can We Perform Online RL for Image Editing without Editing Rewards?

我们能否在无编辑奖励的情况下进行图像编辑的在线强化学习?

Qichao Ma, Jikang Cheng, Ling Liang, Zhaofei Yu, Tiejun Huang, Renye Yan

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Lever-Edit框架,将文本到图像(T2I)奖励生态系统迁移至图像编辑,在无编辑奖励的情况下优化编辑策略,实验效果优于直观迁移基线且接近基于编辑奖励的微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22657 2026-08-25 cs.RO cs.AI cs.MA 新提交 57%

Physical Agentic AI: An Architecture for Orchestrating a Robot Crew with LLMs

物理智能体AI:一种用于协调机器人团队与大语言模型的架构

Xinyuan Liu, Eren Sadikoglu, Riana Chatterjee, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出Physical Agentic AI框架,通过语义规划与执行间的显式架构接口协调机器人团队,在两类任务中验证其可提升技能落地率、减少故障动作,为物理机器人团队提供可靠协调方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22485 2026-08-25 cs.CV 新提交 57%

HeatTok: Enhancing Remote Sensing Image Understanding via Thermodiffusion-based Tokenization

HeatTok:基于热扩散分词的遥感图像理解增强方法

Yingying Yan, Jiaqi Tang, Wei Wei, Qianzhou Wang, Jinjian Wu, Botong Geng, Jianmin Chen, Yuyang Xia, Lei Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出HeatTok分词器,结合热扩散聚合与G-MRoPE编码,在VRSBench、EarthVQA数据集上实现遥感图像理解的最优性能,保留对象级语义完整性。

Comments 19 pages (10 pages main text + appendix), 10 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026), Rio de Janeiro, Brazil, November 10--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22085 2026-08-25 cs.AI 新提交 57%

Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation

剖析用于合成肿瘤学数据生成的神经符号质量保障机制

Laxmigayathri Challa, Yuhan Zhou, Ana Cleveland, Haihua Chen

机构 * University of North Texas(北得克萨斯大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本研究通过三项对照研究剖析神经符号质量保障机制,明确符号门控、本体接地等组件的作用,发现其可提升合成肿瘤学数据临床有效性,且检索增强效果依赖模型。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02660 2026-08-25 cs.CY cs.AI cs.HC 版本更新 57%

AI Alignment and Fiduciary Obligation

AI对齐与受托义务

Benjamin Lange

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。

Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-25 cs.LG 版本更新 57%

Localize and Neutralize: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏