arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2604.02748 2026-04-06 cs.CV 70%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 70%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04428 2026-03-30 cs.CV 70%

A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering

A.I.R.: 为视频问答实现适应性、迭代性和基于推理的帧选择

Yuanhao Zou, Shengji Jin, Andong Deng, Youpeng Zhao, Jun Wang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出A.I.R方法,通过深度语义分析和高效迭代循环提升视频问答的帧选择效果,实验表明其在性能和计算效率上均优于现有方法。

Comments ICLR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24181 2026-03-26 cs.CV 70%

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

通过提示条件和头部选择解锁LVLMs的少样本能力

Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学、国家科学研究中心、巴黎萨克雷高等师范学院、Borelli中心) École Polytechnique, AMIAD(巴黎高等理工学院、AMIAD) Institut Universitaire de France(法国高等科学研究院)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Head Ensemble Classifiers (HEC)通过提示条件和头部选择提升LVLMs在少样本和零样本分类中的性能,实现与CLIP基方法的性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02258 2026-03-24 cs.CV 70%

Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning

病理代理RAG:通过强化学习实现多模态代理检索增强生成用于病理学视觉语言模型

Wenchuan Zhang, Jingru Guo, Hengzhe Zhang, Penghao Zhang, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Patho-AgenticRAG,通过强化学习实现多模态代理检索增强生成,解决病理学视觉语言模型在高分辨率、复杂组织结构和临床语义上的挑战,提升诊断准确性。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(35): 29921-29929, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 70%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15030 2026-03-20 cs.AI 70%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18448 2026-03-20 cs.LG 70%

Seeking Universal Shot Language Understanding Solutions

寻找通用短语语言理解解决方案

Haoxin Liu, Harshavardhan Kamarthi, Zhiyuan Zhao, Hongjie Chen, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出SLU-SUITE框架,通过49万人工标注数据揭示VLM在SLU任务中的瓶颈,提出UniShot和AgentShots两种通用解决方案,实验显示在领域内任务优于专用模型,在领域外任务超越商业VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05591 2026-03-09 cs.CV 70%

Thinking with Spatial Code for Physical-World Video Reasoning

基于空间代码的物理世界视频推理

Jieneng Chen, Wenxin Ma, Ruisheng Yuan, Yunzhi Zhang, Jiajun Wu, Alan Yuille

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。

Comments Code at https://github.com/Beckschen/spatialcode

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13251 2026-03-04 cs.CV 70%

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

映射流:揭示视频大语言模型中的隐藏信息路径

Minji Kim, Taekyung Kim, Bohyung Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本研究通过机理可解释性技术揭示视频大语言模型中信息流的隐藏路径,展示了时间推理机制及提升模型可解释性和泛化能力的贡献。

Comments ICLR 2026, 32 pages, 39 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14162 2026-02-27 cs.CL cs.CV cs.IR 70%

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

索引轻,推理深:延迟视觉摄入用于视觉密集文档问答

Tao Xu

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出延迟视觉摄入框架,通过分层图号聚类构建索引,利用BM25检索和VLM分析提升视觉密集文档问答性能。

Comments 24 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07986 2026-02-26 cs.CL cs.CV 70%

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) University of California, Santa Cruz, USA(加州大学圣克ruz分校) Analogy AI East China Normal University, China(华东师范大学) Nanjing University, China(南京大学) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 VULCA-Bench通过多文化艺术批评基准评估视觉-语言模型在文化理解上的能力,包含7,410对图像-批评对,涵盖八个文化传统,通过五层框架评估文化理解,揭示更高阶推理更具挑战性。

Comments 8 pages, 4 figures, submitted to ACL 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19091 2026-02-24 cs.CV 70%

CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension

CREM: 为多模态检索与理解的压缩驱动表示增强

Lihao Liu, Yan Wang, Biao Yang, Da Li, Jiangxia Cao, Yuxiao Luo, Xiang Chen, Xiangyu Wu, Wei Yuan, Fan Yang, Guiguang Ding, Tingting Gao, Guorui Zhou

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CREM通过压缩驱动的表示增强方法,在提升多模态检索性能的同时保持生成能力,实现生成与嵌入任务的统一优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13479 2026-02-17 cs.CV cs.HC 70%

GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables

GLIMPSE:面向可穿戴设备的实时文本识别与上下文理解的视频大语言模型

Akhil Ramachandran, Ankit Arun, Ashish Shenoy, Abhay Harpale, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour, Pierce Chuang, Yichao Lu, Vikas Bhardwaj, Peyman Heidari

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 GLIMPSE通过混合架构在可穿戴设备上实现低功耗的实时文本识别与上下文理解,提升视频大语言模型在资源受限设备上的VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 70%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13261 2026-02-10 cs.CV 70%

Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges

构建第一人称程序化AI助手:方法、基准和挑战

Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang

机构 * Department of EEE(电子工程系) The Hong Kong Polytechnic University(香港理工大学) RayNeo Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出第一人称程序化AI助手,探讨其核心任务、赋能维度及挑战,通过实验评估现有方法并指明未来研究方向。

Comments Under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21355 2026-02-09 cs.LG 70%

SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning

SMMILE:一个多模态医学上下文学习的专家驱动基准

Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Lund University(隆德大学) Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院) UCSF(加州大学旧金山分校) University of Zurich(苏黎世大学) University Hospital Zurich(苏黎世大学医院) HOPPR

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 SMMILE是一个专家驱动的多模态医学上下文学习基准,评估了15个MLLMs在医学任务中的多模态ICL能力,发现其表现有限且易受无关示例和最近性偏见影响。

Comments NeurIPS 2025 (Datasets & Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17089 2026-01-27 cs.CV 70%

GRASP: Guided Region-Aware Sparse Prompting for Adapting MLLMs to Remote Sensing

GRASP: 基于区域感知的稀疏提示引导方法用于适应遥感图像的多模态大语言模型

Qigan Sun, Chaoning Zhang, Jianwei Zhang, Xudong Wang, Jiehui Xie, Pengcheng Zheng, Haoyu Wang, Sungyoung Lee, Chi-lok Andy Tai, Yang Yang, Heng Tao Shen

机构 * School of Computing, Kyung Hee University(京畿大学计算机学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) College of Computer Science and Information Engineering, Harbin Normal University(哈尔滨师范大学计算机科学与信息工程学院) College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及继续教育学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 GRASP通过引导区域感知的稀疏提示方法,提升多模态大语言模型在遥感图像任务中的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21182 2026-01-22 cs.CV cs.CL 70%

KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution

KBE-DME: 通过知识增强的基准进化实现动态多模态评估

Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 KBE-DME通过整合多模态知识和动态基准进化,实现对多模态大语言模型能力的更全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13919 2026-01-21 cs.CL cs.CV 70%

HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs

HyperWalker: 基于动态超图的多跳临床建模深度诊断方法,跨EHR和X光在医学视觉语言模型中

Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi

机构 * Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 HyperWalker通过动态超图和测试时训练,实现跨EHR和X光的多跳临床建模深度诊断,提升医疗视觉语言模型的诊断性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11976 2026-01-21 cs.CV 70%

AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering

AVIR: 为高效多页文档问答的自适应视觉在文档检索

Zongmin Li, Yachuan Li, Lei Kang, Dimosthenis Karatzas, Wenkang Ma

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shandong Xiehe University(山东谢家大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 AVIR通过自适应视觉在文档检索框架减少多页文档问答所需的页面数,提升效率并降低计算成本。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02888 2026-01-21 cs.LG 70%

RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance

RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助

Xuanyu Wang, Haisen Su, Jingtao Zhang, Xiangxiang Wang, Yongbin Yu, Manping Fan, Jialing Xiao, Bo Gong, Siqi Chen, Mingsheng Cao, Liyong Ren, Zhenglin Yang

机构 * School of Information Software Engineering, University of Electronic Science School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China School of Medicine, University of Electronic Science Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.LG

AI总结 RPIQ通过残差投影多协作闭环和单实例量化方法,实现大规模模型在4位表示下的高效压缩,显著降低内存消耗并保持高性能,适用于视障辅助系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19850 2026-01-09 cs.CV 70%

FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs

FALCONEye: 在一小时内视频中寻找答案并定位内容的多模态大语言模型

Carlos Plou, Cesar Borja, Ruben Martinez-Cantin, Ana C. Murillo

机构 * DIIS-I3A, University of Zaragoza(DIIS-I3A,西班牙阿利坎特大学)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FALCONEye通过多模态大语言模型在小时长视频中高效定位内容并回答问题,超越现有模型性能并显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01363 2026-01-06 cs.AI 70%

A unified multimodal understanding and generation model for cross-disciplinary scientific research

面向跨学科科学研究的统一多模态理解和生成模型

Xiaomeng Yang, Zhiyu Tan, Xiaohui Zhong, Mengping Yang, Qiusheng Huang, Lei Chen, Libo Wu, Hao Li

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 FuXi-Uni是一种统一多模态模型,能跨学科领域理解和生成科学数据,通过自然语言和科学数值预测提升跨学科研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09385 2026-01-06 cs.CV 70%

Towards Vision-Language Geo-Foundation Model: A Survey

迈向视觉-语言地理基础模型:一种综述

Yue Zhou, Zhihang Zhong, Xue Yang

机构 * School of GeoAI(地理人工智能学院) Hindon STAI Institute(Hindon STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室) East China Normal University(华东师范大学) School of AI(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文综述了视觉-语言地理基础模型(VLGFMs),探讨其背景、核心技术和应用,旨在构建具备多样化地理感知能力的智能模型。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 70%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03284 2025-12-04 cs.CV 70%

SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding

SpatialReasoner: 大规模3D场景理解中的主动感知

Hongpei Zheng, Shijie Li, Yanran Li, Hujun Yin

机构 * University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(信息与通信研究 institute(I2R),A*STAR,新加坡) University of Bedfordshire(贝德福德郡大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 SpatialReasoner通过主动感知框架实现大规模3D场景理解,采用两阶段训练策略在H$^2$U3D数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 70%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20460 2025-12-01 cs.CV 70%

Look Where It Matters: Training-Free Ultra-HR Remote Sensing VQA via Adaptive Zoom Search

关注关键区域:通过自适应缩放搜索实现无需训练的超高清遥感视觉问答

Yunqi Zhou, Chengjie Jiang, Chun Yuan, Jing Li

机构 * Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学) East China Normal University(华东师范大学)

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV

AI总结 ZoomSearch通过自适应缩放搜索实现无需训练的超高清遥感视觉问答,提升准确性和效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18399 2025-11-25 cs.CV 70%

ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering

ChineseVideoBench: 多模态大模型在中文视频问答中的基准测试

Yuxiang Nie, Han Wang, Yongjie Ye, Haiyang Yu, Weitao Jia, Tao Zeng, Hao Feng, Xiang Fei, Yang Li, Xiaohui Lv, Guozhi Tang, Jingqun Tang, Jinghui Lu, Zehui Dai, Jiacong Wang, Dingkang Yang, An-Lan Wang, Can Huang

机构 * Bytedance Inc.(字节跳动公司)

专题命中 视觉问答 :InternVL(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 ChineseVideoBench通过提供中文视频问答的基准测试,评估多模态大语言模型的性能,揭示了当前模型在复杂中文视频内容上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏