arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-16 至 2026-02-16 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2602.12877 2026-02-16 cs.CV 83%

RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads

RoadscapesQA: 一个用于印度道路视觉问答的多任务、多模态数据集

Vijayasri Iyer, Maahin Rathinagiriswaran, Jyothikamalesh S

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 RoadscapesQA数据集通过多任务多模态方法,为印度道路场景的视觉问答提供支持,包含9000张图像及手动标注的边界框,用于提升无结构环境下的视觉场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 70%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00736 2026-02-16 cs.CV 57%

Unifying Multiple Foundation Models for Advanced Computational Pathology

统一多种基础模型以推进高级计算病理学

Wenhui Lei, Yusheng Tan, Anqi Li, Hanyu Chen, Hengrui Tian, Ruiying Li, Zhengqun Jiang, Fang Yan, Xiaofan Zhang, Shaoting Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Washington University in St. Louis(华盛顿大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) Shanghai Innovation Institute(上海创新研究院) Sensetime Research(商汤科技研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。

Comments 50 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12709 2026-02-16 cs.CL 50%

ReFilter: Improving Robustness of Retrieval-Augmented Generation via Gated Filter

ReFilter:通过门控过滤提升检索增强生成的鲁棒性

Yixin Chen, Ying Xiong, Shangyu Wu, Xiangrui Ke, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) University of Waterloo(滑铁卢大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 ReFilter通过门控过滤提升检索增强生成的鲁棒性,实现跨领域问答任务的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4 篇

2602.12395 2026-02-16 cs.CV cs.AI 84%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13041 2026-02-16 cs.CV 57%

Implicit-Scale 3D Reconstruction for Multi-Food Volume Estimation from Monocular Images

隐式尺度多食物体积估计的单目图像三维重建

Yuhao Chen, Gautham Vinod, Siddeshwar Raghavan, Talha Ibn Mahmud, Bruce Coburn, Jinge Ma, Fengqing Zhu, Jiangpeng He

机构 * University of Waterloo(滑铁卢大学) Purdue University(普渡大学) Indiana University(印第安纳大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出隐式尺度三维重建方法,用于单目图像中多食物体积估计,通过基准数据集验证了基于几何的重建方法在准确性和鲁棒性上的优势。

Comments Paper accepted to 2026 IEEE Southwest Symposium on Image Analysis and Interpretation. The dataset can be downloaded at: https://www.kaggle.com/competitions/3d-reconstruction-from-monocular-multi-food-images/data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12322 2026-02-16 cs.RO cs.AI 57%

ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

ForeAct: 通过高效的视觉前瞻性规划控制您的VLA

Zhuoyang Zhang, Shang Yang, Qinghao Hu, Luke J. Huang, James Hou, Yufei Sun, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) Caltech(加州理工学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 ForeAct通过高效的视觉前瞻性规划提升VLA在开放环境中的执行精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13086 2026-02-16 cs.RO 50%

UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph

UniManip: 通用目的零样本机器人操作的代理操作图

Haichao Liu, Yuanjiang Xue, Yuheng Zhou, Haoyuan Deng, Yinan Liang, Lihua Xie, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University, China(清华大学自动化系)

专题命中 视觉推理 :grounding(abstract)

AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。

Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 6 篇

2602.13028 2026-02-16 cs.CV cs.CL 83%

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

面向细粒度图像编辑评估的人类对齐MLLM评判:一个基准、框架和分析

Runzhou Liu, Hailey Weingord, Sejal Mittal, Prakhar Dungarwal, Anusha Nandula, Bo Ni, Samyadeep Basu, Hongjie Chen, Nesreen K. Ahmed, Li Li, Jiayi Zhang, Koustava Goswami, Subhojyoti Mukherjee, Branislav Kveton, Puneet Mathur, Franck Dernoncourt, Yue Zhao, Yu Wang, Ryan A. Rossi, Zhengzhong Tu, Hongru Du

机构 * University of Virginia(弗吉尼亚大学) Columbia University(哥伦比亚大学) Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Dolby Laboratories(杜比实验室) Cisco Research(思科研究) University of Southern California(南加州大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Oregon(俄勒冈大学) Texas A&M University(德克萨斯大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出细粒度MLLM评判框架,通过分解十二个可解释因素,提升图像编辑评估的精度与实用性,为研究和改进图像编辑方法提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 79%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07388 2026-02-16 cs.AI 79%

Invert4TVG: A Temporal Video Grounding Framework with Inversion Tasks Preserving Action Understanding Ability

Invert4TVG: 一种具有逆向任务的时序视频定位框架,以保持动作理解能力

Zhaoyu Chen, Hongnan Lin, Yongwei Nie, Fei Ma, Xuemiao Xu, Fei Yu, Chengjiang Long

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 Invert4TVG通过引入逆向任务保持动作理解能力,提升时序视频定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13013 2026-02-16 cs.CV 57%

Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions

面向具有属性结构和质量验证指令的通用视频MLLMs

Yunheng Li, Hengrui Zhang, Meng-Hao Guo, Wenzhao Gao, Shaoyong Jia, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本研究提出ASID-1M数据集、ASID-Verify验证流程和ASID-Captioner模型,通过细粒度结构化指令提升视频理解性能,实现高质量描述生成与指令遵循。

Comments Project page: https://asid-caption.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13179 2026-02-16 cs.IR 50%

Fix Before Search: Benchmarking Agentic Query Visual Pre-processing in Multimodal Retrieval-augmented Generation

在搜索前修复:多模态检索增强生成中代理查询视觉预处理的基准测试

Jiankun Zhang, Shenglai Zeng, Kai Guo, Xinnan Dai, Hui Liu, Jiliang Tang, Yi Chang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出V-QPP-Bench,通过代理决策任务评估视觉查询预处理的改进,揭示视觉不完美对检索性能的严重影响及训练方法的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12721 2026-02-16 cs.SE 50%

Reconciling Complexity and Simplicity in the Business Model Canvas Design Through Metamodelling and Domain-Specific Modelling

通过元建模和领域特定建模在商业模型画布设计中调和复杂性与简洁性

Nordine Benkeltoum

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过元建模和领域特定建模方法,提出一种严谨且易用的商业模型画布元模型,提升其建模严谨性与实用性,促进企业建模与架构实践的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2505.14381 2026-02-16 cs.AI 70%

SCAN: Semantic Document Layout Analysis for Textual and Visual Retrieval-Augmented Generation

SCAN:面向文本和视觉检索增强生成的语义文档布局分析

Nobuhiro Ueda, Yuyang Dong, Krisztián Boros, Daiki Ito, Takuya Sera, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话株式会社)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 SCAN通过语义文档布局分析提升文本和视觉检索增强生成的性能,实验显示在英语和日语数据集上分别提升9.4和10.4个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13059 2026-02-16 cs.CL 50%

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

TraceBack: 多智能体分解用于细粒度表格归因

Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究院)

专题命中 文档图表理解 :grounding(abstract)

AI总结 TraceBack通过多智能体框架实现细粒度表格归因,提供可验证的单元格支持证据,提升问题回答的透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10271 2026-02-16 cs.IR cs.CL 50%

MLDocRAG: Multimodal Long-Context Document Retrieval Augmented Generation

MLDocRAG: 多模态长上下文文档检索增强生成

Yongyue Zhang, Yaxiong Wu

机构 * Independent Researcher(独立研究者)

专题命中 文档图表理解 :grounding(abstract)

AI总结 MLDocRAG通过构建多模态片段-查询图,实现多模态长上下文文档的检索增强生成,提升问答的准确性和连贯性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2412.14058 2026-02-16 cs.RO cs.CV 70%

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 67%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08440 2026-02-16 cs.RO 67%

SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios

SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Microsoft(微软公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2412.06014 2026-02-16 cs.CV cs.LG 81%

Post-hoc Probabilistic Vision-Language Models

事后概率视觉-语言模型

Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种无需额外训练的VLMs事后不确定性估计方法,通过贝叶斯后验近似和余弦相似度不确定性量化,提升主动学习效率和预测可靠性。

Comments Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12659 2026-02-16 cs.CV cs.AI 81%

IndicFairFace: Balanced Indian Face Dataset for Auditing and Mitigating Geographical Bias in Vision-Language Models

IndicFairFace: 用于审计和缓解视觉-语言模型中地理偏见的平衡印度面部数据集

Aarish Shah Mohsin, Mohammed Tayyab Ilyas Khan, Mohammad Nadeem, Shahab Saquib Sohail, Erik Cambria, Jiechao Gao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 IndicFairFace是一个平衡的印度面部数据集,用于审计和缓解视觉-语言模型中的地理偏见,通过去偏方法减少偏见并保持检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 79%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 74%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 11 篇

2602.12618 2026-02-16 cs.CV cs.AI cs.CL 84%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08275 2026-02-16 cs.CL cs.AI 83%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01096 2026-02-16 cs.CV cs.CL 83%

Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages

评估用于低资源语言放射报告生成的视觉语言模型适应

Marco Salmè, Rosa Sicilia, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本研究评估了低资源语言中视觉语言模型在放射报告生成中的适应性,发现语言特定模型和领域特定训练能显著提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12892 2026-02-16 cs.CV cs.AI cs.CL 81%

RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training

RADAR: 揭示多模态大语言模型预训练中能力的非对称发展

Yunshuang Nie, Bingqian Lin, Minzhe Niu, Kun Xiang, Jianhua Han, Guowei Huang, Xingyue Quan, Hang Xu, Bokui Chen, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司) Huawei’s 2012 Lab(华为2012实验室)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 RADAR提出了一种高效的以能力为中心的评估框架,用于揭示多模态大语言模型预训练中感知和推理能力的非对称发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03262 2026-02-16 cs.CV cs.AI 81%

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

探究多模态大语言模型中多个视觉编码器的冗余性

Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型中多个视觉编码器的冗余性,通过分析发现编码器的专业化、冗余性和有害性,并提出了量化冗余的指标,为更高效的多模态架构设计提供依据。

Comments accepted by ICLR2026, project website: https://github.com/MaoSong2022/Encoder-Redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12774 2026-02-16 cs.CV 79%

Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting

基于MLLM的弱监督类无关物体计数

Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Qijun Chen, Miaojing Shi

机构 * College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) College of Computer Science, Wuhan University(计算机科学学院,武汉大学) College of Computer Science, Tongji University(计算机科学学院,同济大学) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出 WS-COC,基于 MLLM 的弱监督框架,通过三种策略提升类无关物体计数性能,有效降低标注成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏