arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-18 至 2026-08-18 共收录 115 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 27 篇

2608.16514 2026-08-18 cs.CV cs.AI cs.CL cs.HC cs.MM 新提交 87%

Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans

匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * F-initiatives(F计划) Université Sorbonne Paris Nord(巴黎北索邦大学) Northwestern University(西北大学) IULM university(IULM大学)

专题命中 VLM训练与架构 :MLLM(title_cn,summary_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。

Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-08-18 cs.CV cs.AI 版本更新 86%

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18237 2026-08-18 cs.CV cs.LG 版本更新 85%

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

视觉相似性的多种意义:一种文本提示的图像感知度量

Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究人类视觉相似性判断的上下文依赖问题,通过引入大规模数据集微调VLM,产生能捕捉多种视觉相似性意义的TPIPS度量,该度量与人类感知更契合,还在多种任务中开启新功能。

Comments Project Webpage: https://peterwang512.github.io/TPIPS Code: https://github.com/adobe-research/TPIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16011 2026-08-18 cs.CL cs.CV 新提交 81%

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

ReRef-3D:空间指代表达引导的3D场景重排基准

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出ReRef-3D基准,针对3D场景语言引导放置任务,经微调的LLaVA-3D等模型在该基准上验证了关系满足度优于物理有效性等结论。

Comments 18 pages, 4 figures. Submitted to ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15425 2026-08-18 cs.CV cs.AI 新提交 81%

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

NumerosityVLM:一种受认知启发的、用于解释视觉-语言模型中数量表征的基准测试

Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

机构 * The University of Manchester(曼彻斯特大学) University of Michigan(密歇根大学) Sheffield Hallam University(谢菲尔德哈勒姆大学) Tufts University(塔夫茨大学) ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院国立高等先进技术学校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言模型数量感知研究的基准缺陷,提出受认知启发的NumerosityVLM基准,评估7个模型发现架构对性能影响最大,数量信号出现在视觉编码器早期,差异主要来自语言模型组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14797 2026-08-18 cs.CL 新提交 78%

Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models

超越令牌:大型语言与视觉-语言模型的解码方法综述

Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

机构 * Emory University(埃默里大学) Illinois Institute of Technology(伊利诺伊理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 该综述针对LLMs与LVLMs,梳理其解码方法的三种新兴范式,强调解码方法在确保模型输出与用户意图一致上的高效性,同时指出挑战并展望未来方向。

Comments ACM SIGKDD Explorations Newsletter, Volume 28, Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 77%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15913 2026-08-18 cs.CR 新提交 75%

Conjunctive Poisoning in AI Supply-Chain Applications

AI供应链应用中的联合中毒攻击

Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本研究提出AI供应链中的联合中毒攻击,通过包装器与元数据的交互改变模型行为,提出TIF-BAH防御,揭示AI部署中存在未被现有防御覆盖的部署时行为风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15075 2026-08-18 cs.CV 新提交 74%

SA-GEM: Scale-Adaptive and Geospatial Evidence-Modulated Token Pruning for Efficient Remote Sensing Large Vision-Language Models

SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝

Kexin Ma, Jing Xiao, Bowen Xing, Liang Liao, Chia-Wen Lin

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11621 2026-08-18 cs.AI cs.CL cs.LG 版本更新 73%

Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

受损多模态语言模型再现失语症患者的图片命名模式

Yong Yang, Xiang Guan, Sophie Arheix-Parras, Saeed Ahmadi, Roger Newman-Norlund, Leonardo Bonilha, Christopher Rorden, Julius Fridriksson, Rutvik H. Desai, Srihari Nelakuditi

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。

Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08024 2026-08-18 cs.CV cs.SE 版本更新 70%

A Highly Efficient Diversity-based Input Selection for DNN Improvement Using VLMs

一种基于多样性的高效输入选择方法用于通过VLMs改进DNN

Amin Abbasishahkoo, Mahboubeh Dadkhah, Lionel Briand

机构 * School of EECS, University of Ottawa(电气与计算机工程系,渥太华大学) Research Ireland Lero centre for software, University of Limerick(软件研究中心,利默里克大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 本文提出基于概念的多样性(CBD)方法,利用视觉语言模型高效改进DNN,通过混合输入选择策略在大规模数据集上实现高效且有效的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14763 2026-08-18 eess.IV cs.AI cs.CV cs.LG 新提交 67%

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习

Yuhao Huang, Yuanji Zhang, Yuhuan Lu, Dong Ni, P. Ellen Grant, Davood Karimi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。

Comments 17 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15269 2026-08-18 cs.RO 新提交 67%

Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory

更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间

Dai Zhou, Jiexi Yan, Tong Li, Yuxuan Wang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。

Comments 19 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05408 2026-08-18 cs.IR 版本更新 67%

Rich-Media Re-Ranker: A User Satisfaction-Driven LLM Re-ranking Framework for Rich-Media Search

多介质重排序:一种基于用户满意度的LLM重排序框架用于多介质搜索

Zihao Guo, Ligang Zhou, Zeyang Tang, Feicheng Li, Ying Nie, Zhiming Peng, Qingyun Sun, Jianxin Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 本文提出Rich-Media Re-Ranker框架,通过多维细粒度建模提升用户搜索满意度,整合丰富侧信息和视觉信号,通过多任务强化学习增强系统适应性,实验证明其优于现有方法。

Comments Accepted by the Full Research Track of CIKM-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08384 2026-08-18 cs.CL 版本更新 67%

jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入

Florian Hönicke, Michael Günther, Andreas Koukounas, Mohammad Kalim Akram, Saba Sturua, Han Xiao

机构 * Jina by Elastic(Jina 由 Elastic 公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。

Comments 11 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15614 2026-08-18 cs.CV cs.AI 新提交 62%

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22771 2026-08-18 cs.CV cs.AI 版本更新 62%

When Do Cheap Probes Predict Expensive Training? Probing 3D-CT Encoders for Text Generation

廉价探针预测3D-CT视觉语言模型中的昂贵训练

Renjie Liang, Zijian Xu

机构 * University of Florida(佛罗里达大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 研究为3D-CT视觉语言模型选编码器及压缩方案时,候选组合多难比较。提出用廉价探针替代,构建含验证门限的探测基准,比较读出头并配对探针与下游任务,早期结果显示廉价探针排序与昂贵微调一致,有望快速筛选方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15962 2026-08-18 cs.CL cs.CV 新提交 57%

SEER: Long-Context Reasoning via Selective Visual-Text Compression

SEER:基于选择性视觉-文本压缩的长上下文推理

Jiawei Xu, Zhilin Zhai, Jinrui Fang, Ruohan Xu, Mingfei Lu, Yi Zhang, Guanchu Wang, Tianlong Chen, Ying Ding

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Cambridge(剑桥大学) University of Technology Sydney(悉尼科技大学) The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。

Comments COLM 2026, Third Conference on Language Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15651 2026-08-18 cs.CV 新提交 57%

Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats

Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习

Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出Gaussian-JEPA,通过预测高斯令牌块潜在表示实现自监督学习,在多类任务上优于重构预训练,为3D高斯表示提供有效学习目标

Comments Joint-embedding predictive representation learning for 3D Gaussian Splatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 57%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09105 2026-08-18 cs.AI 版本更新 57%

SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling

SMA:谁说的?半黑盒RAG控制中的成员泄露审计

Shixuan Sun, Siyuan Liang, Jianjie Huang, Jingzhi Li, Xiaochun Cao

机构 * Sun Yat-Sen University(孙中山大学) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Science(中国科学院大学) Zhongguancun Academy(中关村学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.AI

AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-08-18 cs.CL 版本更新 50%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2608.15404 2026-08-18 cs.CV 新提交 89%

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

专题命中 其他VLM :MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00971 2026-08-18 cs.CV cs.AI 版本更新 62%

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

MiniGPT-反向设计:利用MiniGPT-4预测图像调整

Vahid Azizi, Fatemeh Koochaki

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过扩展和微调MiniGPT-4,使其可应用于给定源图像、编辑后图像及可选文本描述来预测图像编辑操作与参数的反向设计任务,验证了现成VLMs在复杂多模态任务中的可扩展性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 57%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏