arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2403.06728 2026-06-30 cs.CV 83%

Multimodal Large Language Model driven Radiology Report Generation with Clinical Knowledge Enhancement

基于多模态大语言模型的放射科报告生成与临床知识增强

Miaojing Shi, Tianyu Cen, Zijie Yue, Meng Wei, Oluwatosin Alabi, Tom Vercauteren

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种融合多模态大语言模型与临床知识的放射科报告生成方法,通过解剖学特征提取、多模态报告生成及多任务学习提升报告的临床相关性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17423 2026-06-25 cs.CV cs.CL 版本更新 83%

Privacy-Aware Visual Language Models

隐私感知的视觉语言模型

Laurens Samson, Nimrod Barazani, Sennay Ghebreab, Yuki M. Asano

机构 * Socially-Intelligent Artificial Systems Group, University of Amsterdam(智能社会人工智能系统组,阿姆斯特丹大学) University of Amsterdam(阿姆斯特丹大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型隐私理解不足的问题,构建高质量基准数据集PrivBench和指令微调数据集PrivTune,通过少量样本微调显著提升隐私敏感性,性能超越GPT-4。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24165 2026-06-24 cs.CV 新提交 83%

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

多模态大语言模型中基于谱演化引导的令牌剪枝

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) The University of Queensland(昆士兰大学) Singapore Management University(新加坡管理大学) The University of Southern Queensland(南昆士兰大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出跨层谱演化(CLSE)框架,通过频域分析令牌表示在Transformer层间的演化来评估重要性,实现无训练剪枝,在保持性能的同时减少计算开销。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22999 2026-06-23 cs.CV 新提交 83%

Black-Box Continual Learning for Vision-Language Models

视觉语言模型的黑盒持续学习

Yuting Li, Weihang Fang, Haoyuan Gao, Linghe Kong, Yexin Li, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出黑盒持续学习基准Black-CL,仅通过输出嵌入或logits进行学习,并设计BETA方法,通过优化文本原型实现与白盒方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14507 2026-06-15 cs.AI 新提交 83%

Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models

密集坐标列表微调在视觉语言模型中诱导可控干扰面

Chenyu Zhou, Qiliang Jiang, Boguang Pan

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究生院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 研究密集坐标列表微调对视觉语言模型结构化输出(如重复、终止)的影响,发现其产生结构绑定且跨家族的干扰面,可通过目标信号分离和结构轴探针进行测量与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07641 2026-06-09 cs.CV 新提交 83%

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

可读但不可预测:视觉语言模型中的旋转结果预测

Lexin Wang, Shenghua Liu, Yiwei Wang, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 研究视觉语言模型能否仅从原图预测180°旋转后的内容,引入RotOutBench基准,发现模型能识别但无法预测旋转结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24583 2026-06-09 cs.CV 83%

Improving Vision-language Models with Perception-centric Process Reward Models

通过以感知为中心的过程奖励模型改进视觉-语言模型

Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Bytedance(字节跳动) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Perceval模型,通过token级错误定位提升视觉-语言模型的推理能力,通过感知驱动的监督策略实现细粒度训练与推理优化,实验显示在多个领域基准上显著提升性能。

Comments 8 pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 33099-33109

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05852 2026-06-03 cs.CV 83%

Interpretable Modeling of Driver Attention Shifts with a Vision-Language Model

基于视觉-语言模型的驾驶员注意力转移可解释建模

Kaiser Hamid, Khandakar Ashrafi Akbar, Peihang Li, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Towson University(托森大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过少量人工监督微调视觉-语言模型,生成可解释的驾驶员注意力转移描述,以补充传统注视热图,提升人因分析、监控和态势感知支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02580 2026-06-02 cs.CV 83%

Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models

在Blender中思考:基于视觉语言模型的分阶段可执行逆向图形

Guangzhao He, Rundong Luo, Wei-Chiu Ma, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出分阶段可执行逆向图形(SEIG)框架,利用预训练视觉语言模型直接从单张图像重建可编辑的Blender程序,无需专用基础模型或可微渲染,通过逐步细化几何、材质、组合和光照提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02273 2026-06-02 cs.CV 83%

Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset

用于驾驶员监控系统的视觉语言模型:一个驾驶员活动描述数据集

David J. Lerch, Sarath Mulugurthi, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所) Technische Hochschule Ingolstadt(图林根工业大学) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过创建Drive&Act数据集的详细自然语言版本,评估并微调视觉语言模型,以提升对驾驶员细微动作的识别能力,微调后的模型在跨数据集评估中表现更优。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00913 2026-05-28 cs.CV cs.CL 83%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO 83%

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20477 2026-05-26 cs.LG 83%

Bi-CoG: Bi-Consistency-Guided Self-Training for Vision-Language Models

Bi-CoG:面向视觉语言模型的双一致性引导自训练

Rui Zhu, Song-Lin Lv, Zi-Kang Wang, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG

AI总结 针对半监督微调中模型偏差和超参数敏感问题,提出一种利用模型间和模型内一致性以及误差感知动态伪标签分配策略的即插即用方法Bi-CoG,在14个数据集上显著提升现有方法性能。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17186 2026-05-22 cs.CV 83%

Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain

聚焦视觉关键点:通过视觉信息增益进行大视觉语言模型的定向训练

Seulbi Lee, Sangheum Hwang

机构 * Department of Data Science, Seoul National University of Science and Technology(数据科学系,首尔科学技术大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出通过视觉信息增益(VIG)指标,对大视觉语言模型进行定向训练,以提升视觉基础性并减少语言偏见,通过优先选择高VIG样本和token来提高性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17093 2026-05-19 cs.CV cs.CL 83%

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED:基于密度加权残差对齐的混合视觉-语言模型蒸馏

Yihao Liang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出HEED方法,通过密度加权残差对齐改进混合视觉-语言模型蒸馏,提升在OCR和文档任务中的性能,同时在不同教师模型和混合架构上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 83%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14129 2026-05-14 cs.CV 83%

PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution

PVLM:面向零样本深度伪造属性识别的解析感知视觉语言模型

Yaning Zhang, Jiahe Zhang, Chunjie Ma, Weili Guan, Tian Gan, Zan Gao

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) Shandong University of Science and Technology(山东科技大学) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学(深圳)) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PVLM模型,通过动态对比学习实现对未知高级生成器的细粒度追踪,利用面部解析特征捕捉伪造表示,提升深度伪造属性识别性能。

Comments Accepted to IEEE Transactions on Dependable and Secure Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00829 2026-04-28 cs.CV cs.CL 83%

LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation

LinguDistill: 通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出LinguDistill方法,通过利用冻结的原始语言模型作为教师,选择性蒸馏语言信号以恢复语言能力,同时保持视觉基础,提升了语言和知识基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04468 2026-04-28 cs.CV 83%

NVILA: Efficient Frontier Visual Language Models

NVILA:高效的前沿视觉语言模型

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。

Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14980 2026-04-23 cs.AI cs.CL cs.HC 83%

Hybrid Decision Making via Conformal VLM-generated Guidance

通过符合性VLM生成的指导实现混合决策

Debodeep Banerjee, Burcu Sayin, Stefano Teso, Andrea Passerini

机构 * University of Pisa(帕尔米斯大学) DISI, University of Trento(特伦托大学DISI研究所) CIMEC, University of Trento(特伦托大学CIMEC研究所)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.AI

AI总结 本文提出ConfGuide方法,通过符合性风险控制生成简洁精准的指导,提升多标签医学诊断任务中的决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11374 2026-04-14 cs.CV cs.CL 83%

What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?

视觉-语言模型如何编码个性化图像审美评估?

Koki Ryu, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文分析了视觉-语言模型内部表示中审美属性的分布,利用这些属性实现轻量级个性化图像审美评估,无需微调模型。

Comments To appear at ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15489 2026-04-14 cs.CV cs.CL cs.MM 83%

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

穿透欺骗:在多模态新闻中揭示误导性创作者意图

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07912 2026-04-10 cs.CV cs.RO 83%

ParkSense: Where Should a Delivery Driver Park? Leveraging Idle AV Compute and Vision-Language Models

ParkSense: 送货司机应该在哪里停车?利用空闲自动驾驶计算和视觉-语言模型

Die Hu, Henan Li

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Independent Researcher(独立研究员)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ParkSense框架,利用自动驾驶低风险状态下的空闲计算资源运行视觉-语言模型,解决精准停车问题,并提出Delivery-Aware Precision Parking问题,展示量化7B VLM在硬件上的推理速度及对司机收入的提升。

Comments 7 pages, 3 tables. No university resources were used for this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 83%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18117 2026-04-08 cs.CV 83%

Online In-Context Distillation for Low-Resource Vision Language Models

在线上下文蒸馏用于低资源视觉语言模型

Zhiqi Kang, Rahaf Aljundi, Vaggelis Dorovatas, Karteek Alahari

机构 * Inria(法国国家信息与自动化研究所) Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 83%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 VLM训练与架构 :grounding(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11683 2026-04-03 cs.RO cs.AI 83%

Robot Collapse: Supply Chain Backdoor Attacks Against VLM-based Robotic Manipulation

机器人崩溃:针对基于VLM的机器人操控的供应链后门攻击

Xianlong Wang, Hewen Pan, Hangtao Zhang, Minghui Li, Shengshan Hu, Ziqi Zhou, Lulu Xue, Peijin Guo, Aishan Liu, Leo Yu Zhang, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学) Griffith University(格里菲斯大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出TrojanRobot框架,通过在模块化机器人策略中嵌入恶意模块,操控LLM到VLM路径,验证了在18个真实任务和4个VLM上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 83%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11919 2026-04-01 cs.CV 83%

TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing

TimeSenCLIP: 一种用于遥感的时序视觉-语言模型

Pallavi Jain, Diego Marcos, Dino Ienco, Roberto Interdonato, Tristan Berchoux

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农艺研究所蒙彼利埃分校 - CIHEAM-IAMM) Inria(法国国家信息与自动化研究所) INRAE(法国国家农业、食品与环境研究院) Cirad(法国农业国际合作研究发展中心) UMR TETIS(TETIS 联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出TimeSenCLIP,一种轻量级遥感时序视觉-语言模型,通过跨视图时间对比框架对多光谱Sentinel-2时序与地理标记地面影像对齐,无需文本标注,强调时序和光谱信号,探索单像素时序信息在多种任务中的有效性。

Comments Accepted (ISPRS Journal of Photogrammetry and Remote Sensing)

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 236, June 2026, Pages 99-119

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27737 2026-03-31 cs.CV 83%

Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis

融合判别示例与自我优化经验的医学诊断基于MLLM的上下文学习

Wenkai Zhao, Zipei Wang, Mengjie Fang, Di Dong, Jie Tian, Lingwei Zhang

机构 * CAS Key Laboratory of Molecular Imaging, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所分子影像重点实验室) School of Software, North University of China(中北大学软件学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Clinician Mimetic Workflow框架,结合判别示例核心集选择与自我优化经验总结,提升医学诊断中基于MLLM的上下文学习性能,超越零样本通用和医疗MLLM,并接近全监督视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏