arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2607.25794 2026-07-29 cs.CV 新提交 84%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19515 2026-07-23 eess.IV cs.CV 新提交 84%

BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics

BLUE:用于高效视觉语言监控分析的语义保留视频压缩

Shubham Baid, Akash James, Sahil Chachra, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。

Comments 17 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18615 2026-07-22 cs.CL cs.LG 新提交 84%

Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning

随机元遗忘:连接语言主干与多模态遗忘

Zijie Liu, Jinhao Duan, Gaowen Liu, Sijia Liu, Tianlong Chen

机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Cisco Research(思科研究院) Michigan State University(密歇根州立大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG

AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05727 2026-07-08 cs.CV 新提交 84%

SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs

SAMPLe:基于SAM的视觉语言模型提示学习优化器

Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi, Hossein Kashiani, Xiaolong Ma, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) Siemens Energy (AI Lab)(西门子能源(人工智能实验室)) University of Arizona(亚利桑那大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究VLM提示学习中性能与泛化的困境,提出SAMPLe优化器,通过考虑损失曲面锐度平衡探索与利用,减少过拟合,提升泛对未见能力,在多种提示学习框架中表现出色,优于现有优化器。

Comments The manuscript has been accepted to ECCV and will be presented at the conference and published in the main proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 84%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03043 2026-07-07 cs.CV 新提交 84%

Natural Language Camera Movement Understanding

自然语言相机运动理解

Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong

机构 * Boston University(波士顿大学) Pixocial Technology(皮克索西尔科技公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06575 2026-07-07 cs.RO cs.CV 版本更新 84%

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择

Fangyuan Wang, Peng Zhou, Jiaming Qi, Shipeng Lyu, Chengyang He, David Navarro-Alarcon, Guodong Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东区技术研究所) Great Bay University(大湾大学) Northeast Forestry University(东北林业大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV

AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 84%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27947 2026-06-29 cs.CV 新提交 84%

Understanding How MLLMs Describe Artworks Using Token Activation Maps

理解多模态大语言模型如何通过Token激活图描述艺术品

Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi, Eva Cetinic, Gennaro Vessio, Giovanna Castellano

机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) University of Zurich(苏黎世大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。

Comments Accepted at PRESTIGE workshop at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19684 2026-06-19 cs.CV 新提交 84%

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval

探索多模态大语言模型与两阶段微调在时尚图像检索中的应用

Nguyen Cao Hoang, Hoang Bui Le, Nam Vo Hoang, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) Vietnam National University, Ho Chi Minh(胡志明市国家大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16161 2026-06-16 cs.CV 新提交 84%

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification

多模态大语言模型赋能的通用行人重识别重排序

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出利用多模态大语言模型(MLLM)的泛化能力,通过微调MLLM并计算μ-距离来改进推理阶段的重排序,从而提升领域泛化行人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15802 2026-06-16 cs.CV 新提交 84%

CPS4: Class Prompt driven Semi-Supervised Spine Segmentation with Class-specific Consistency Constraint

CPS4: 基于类别提示的半监督脊柱分割与类别特定一致性约束

Qingtao Pan, Hongzan Sun, Bing Ji, Shuo Li

机构 * School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Department of Nuclear Medicine, Shengjing Hospital of China Medical University(中国医科大学附属盛京医院核医学科) Department of Computer and Data Science, Case Western Reserve University(凯斯西储大学计算机与数据科学系) Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV

AI总结 提出CPS4,首个利用文本类别提示增强伪标签质量的半监督脊柱分割网络,通过两阶段训练(VLM预训练和半监督分割)实现,仅用5%标注数据即达80.44% Dice。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 84%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10142 2026-06-10 cs.CV 新提交 84%

DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估

Nanshan Jia, Zhenyu Zhao, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) Roblox Corporation(Roblox公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。

Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07642 2026-06-09 cs.CV cs.CY 新提交 84%

Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View

视觉语言模型能否感知传感器所感?一种可扩展的专家引导设计用于从街景评估轮椅可达性

Dongdong Wang, Alina Hagen, Isabelle Gatmaitan, Hao Zhou, Yiwen Dong, Shabboo Valipoor, Vivian W. H. Wong, Lingyao Li

机构 * University of Florida(佛罗里达大学) University of South Florida(南佛罗里达大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出专家引导的检索增强框架,利用视觉语言模型从谷歌街景图像识别轮椅可达性障碍,通过GPS轮椅停留行为验证,表明VLM评分与移动摩擦部分一致,但细粒度障碍识别有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16873 2026-05-29 cs.CV cs.SI 84%

Multimodal LLMs See Sentiment

多模态大语言模型感知情感

Neemias B. da Silva, John Harrison, Rodrigo Minetto, Myriam R. Delgado, Bogdan T. Nassu, Thiago H. Silva

机构 * Universidade Tecnológica Federal do Paraná(联邦技术大学帕拉纳州大学) University of Toronto(多伦多大学)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过系统评估研究,探讨多模态大语言模型在图像情感分析中的三种方法,发现基于MLLM描述的两阶段流水线在微调后性能显著优于传统基线。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20584 2026-05-21 cs.CV 84%

QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别

Dishanika Denipitiyage, Aruna Seneviratne, Suranga Seneviratne

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15300 2026-05-18 cs.CV 84%

Deep Pre-Alignment for VLMs

视觉语言模型的深度预对齐

Tianyu Yu, Kechen Fang, Zihao Wan, Kaidong Zhang, Yicheng Zhang, Jun Song, Bo Zheng, Yuan Yao

机构 * Tsinghua University Shanghai Qi Zhi Institute Taobao \& Tmall Group of Alibaba

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。

Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 84%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 84%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26334 2026-04-30 cs.DC cs.AR cs.LG 84%

Efficient, VRAM-Constrained xLM Inference on Clients

高效、受限于VRAM的xLM客户端推断

Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

机构 * Microsoft Corporation(微软公司) NVIDIA Corporation(英伟达公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.LG

AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。

Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21420 2026-04-30 cs.CV cs.CL 84%

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE:通过减少令牌数在MLLMs中实现更快更好的学习

Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 ReGATE通过参考引导的自适应令牌消除方法加速MLLM训练,减少计算量同时保持模型准确性,在多个基准测试中表现出色。

Comments ACL 2026. Project page: https://people-robots.github.io/regate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 84%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17982 2026-04-21 cs.CV cs.CL 84%

Mitigating Multimodal Hallucination via Phase-wise Self-reward

通过分阶段自奖励缓解多模态幻觉

Yu Zhang, Chuyang Sun, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen(深圳) China(中国)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PSRD框架,通过分阶段自奖励信号在推理时动态抑制幻觉,有效降低LLaVA-1.5-7B的幻觉率50%,在多个基准上优于现有方法。

Comments Self-reward for vision hallucination mitigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 84%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01261 2024-10-03 cs.CV 84%

OCC-MLLM:Empowering Multimodal Large Language Model For the Understanding of Occluded Objects

Wenmo Qiu, Xinhan Di

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(title);分类 cs.CV

Comments Accepted by CVPR 2024 T4V Workshop (5 pages, 3 figures, 2 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30716 2026-08-11 cs.CV cs.AI 版本更新 84%

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

用于病例级病理学概要报告生成的简单令牌高效视觉语言模型

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, Canada(计算机科学与软件工程系(CSSE),康科迪亚大学,蒙特利尔,加拿大) Axe Cancer, Centre de recherche du CHUM, Université de Montréal, Montreal, Canada(Axe癌症,CHUM研究中心,蒙特利尔大学,蒙特利尔,加拿大) Institut de recherche en immunologie et cancérologie (IRIC), Université de Montréal(免疫学与癌症研究所(IRIC),蒙特利尔大学) Mila - Quebec AI Institute, Montreal, Canada(魁北克AI研究所(Mila),蒙特利尔,加拿大)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一种简单令牌高效的视觉语言模型,通过5倍放大率的512×512补丁和两阶段监督训练,在有限GPU内存下实现病例级多WSI病理报告生成,显著降低序列长度并提升效率。

Comments DeLTA 2026 Conference Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22034 2026-07-27 cs.CV cs.CL cs.LG 新提交 84%

Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation

小视觉语言模型知道自己何时出错但无法表达:在现实图像退化下对陈述置信度与内部置信度的双模型研究

M M Asif Ferdous

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 研究小型视觉语言模型在现实图像退化下陈述置信度与内部置信度的差异,通过评估两个模型在六种退化情况及三种严重程度下的表现,发现内部概率是更好的延迟信号,严重低光时两种信号都不可信。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 84%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交 84%

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏