arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2406.14492 2024-06-21 cs.CV cs.CL 89%

Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?

Gregor Geigle, Radu Timofte, Goran Glavaš

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12537 2023-08-25 cs.RO cs.CV 89%

HuBo-VLM: Unified Vision-Language Model designed for HUman roBOt interaction tasks

Zichao Dong, Weikun Zhang, Xufeng Huang, Hang Ji, Xin Zhan, Junbo Chen

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(title);vision language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14824 2023-07-14 cs.CL cs.CV 89%

Kosmos-2: Grounding Multimodal Large Language Models to the World

Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, Furu Wei

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03553 2026-06-04 cs.CV cs.AI 89%

Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching

直播中的动态内容审核:结合监督分类与MLLM增强的相似度匹配

Wei Chee Yew, Hailun Xu, Sanjay Saha, Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Kanchan Sarkar, Zhenheng Yang, Danhui Guan

机构 * TikTok Singapore Singapore(TikTok新加坡) TikTok San Jose United States(TikTok旧金山美国) TikTok Shanghai China(TikTok上海中国)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种混合审核框架,结合监督分类和基于参考的相似度匹配,利用多模态大语言模型提升准确性,在保持轻量推理的同时实现大规模直播内容审核。

Comments To be published at KDD 2026 (ADS track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23797 2026-05-25 cs.LG cs.CV 89%

Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models

去偏负挖掘提升基于预训练视觉语言模型的分布外检测

Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对分布外检测中负标签的假阴性问题,提出通过间接近似负标签分布来校正采样偏差的理论框架,并转化为基于ID标签和未标注语料数据的蒙特卡洛采样方法,在多种OOD检测设置中达到新最优。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09879 2026-01-16 cs.CV cs.AI 89%

MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割

Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong

机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) Department of Radiology, University of Florida(佛罗里达大学放射学系) Research Computing, University of Florida(佛罗里达大学研究计算中心) Department of Medicine, University of Florida(佛罗里达大学医学系) Department of Radiology, UC San Francisco(旧金山大学放射学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14732 2026-08-17 cs.LG cs.AI cs.CV eess.IV 版本更新 89%

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理

Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) Boston Medical Center(波士顿医疗中心)

专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。

Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at https://idan-tankel.github.io/InformCT_ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 89%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18988 2026-03-20 cs.RO 89%

MERGE: Guided Vision-Language Models for Multi-Actor Event Reasoning and Grounding in Human-Robot Interaction

MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型

Joerg Deigmoeller, Nakul Agarwal, Stephan Hasler, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger

机构 * Honda Research Institute Europe(本田欧洲研究院) Honda Research Institute USA(本田美国研究院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract)

AI总结 MERGE 通过引导视觉语言模型实现动态人类机器人交互中多主体事件的推理与 grounding,提升 situational awareness 与效率,基于 GROUND 数据集验证其性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15333 2025-11-20 cs.RO 89%

C2F-Space: Coarse-to-Fine Space Grounding for Spatial Instructions using Vision-Language Models

Nayoung Oh, Dohyun Kim, Junhyeong Bang, Rohan Paul, Daehyung Park

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract)

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 89%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05861 2024-04-03 cs.CL cs.AI cs.CV cs.LG 89%

Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models

Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2024 camera-ready (23 pages), Code: https://github.com/archiki/RepARe

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02325 2024-03-05 cs.CV cs.AI cs.CL cs.LG 89%

Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training

David Wan, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project website: https://contrastive-region-guidance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18309 2026-08-20 cs.CV 新提交 89%

XRF-to-Optical Field-of-View Localization with Vision Language Models

基于视觉语言模型的X射线荧光(XRF)与光学显微镜视场(FOV)定位

Xiangyu Yin, Tatjana Paunesku, Letonia Copeland-Hardin, Martina Ralle, Zichao Wendy Di, Si Chen, Gayle E. Woloschak, Barry Lai, Mathew J. Cherukara, Stefan Vogt

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学) Oregon Health and Science University(俄勒冈健康与科学大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV

AI总结 本文针对跨模态显微图像的视场定位难题,提出结合视觉语言模型(VLM)的候选生成-验证工作流,在低对应度的相邻切片成像数据中实现了有效定位,为关联XRF与光学显微测量提供了支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09302 2026-08-12 cs.CV 版本更新 89%

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

用于宫腔镜手术场景分割的自举式视觉-语言模型

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出首个基于VLM的宫腔镜手术场景分割方法VLM-hyster,通过类别特定文本提示与掩码蒸馏分支提升性能,在自行构建的4020张图像数据集上表现优于现有模型,获多中心验证,具临床应用潜力。

Comments Accept by Biomedical Signal Processing and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09691 2026-08-11 cs.CV 新提交 89%

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

扩散目标,保留其标签:通过VLM构建的3D植被场景从少量未标记照片中整理检测器训练数据

Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann

机构 * Royal Military Academy(皇家军事学院) KU Leuven(鲁汶大学) Flanders Make(佛兰德制造研究院)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.CV

AI总结 本研究针对植被中小物体标记图像稀缺导致检测器跨站点泛化差的问题,通过VLM构建3D植被场景合成标记训练图像,实现无监督站点适应,在排雷基准上性能优于传统跨站点标签复用。

Comments Accepted at the Curated Data for Efficient Learning (CDEL) Workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01258 2026-08-04 cs.CV 新提交 89%

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2

多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2

Zirui Zhang, Yinbo Yu, Donghai Guan, Chunwei Tian, Daoqiang Zhang, Qi Zhu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05161 2026-06-23 cs.CV 版本更新 89%

Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging

基于VLM的医学图像分布外检测的Wasserstein对齐定位

Bernhard Kainz, Johanna P Mueller, Matthew Baugh, Cosmin Bercea

机构 * Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算机系) Technical University Munich, DE(慕尼黑技术大学) Munich Center for Machine Learning (MCML), DE(慕尼黑机器学习中心(MCML))

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 提出WALDO框架,利用最优传输理论通过熵加权切片Wasserstein距离、Goldilocks区域采样和自一致性聚合实现零样本异常定位,在NOVA脑MRI基准上mAP@30达43.5%,相对提升19%。

Comments submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29325 2026-05-29 cs.CV 89%

Multi-Stage VLM Pipeline for Zero-Shot Traffic Accident Understanding

用于零样本交通事故理解的多阶段VLM流水线

Fumiya Tatematsu, Fumihiko Takahashi

机构 * GO Drive Inc(GO Drive公司)

专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract);分类 cs.CV

AI总结 提出一个三阶段VLM流水线,在冻结的Qwen3-VL-32B-Instruct和235B MoE模型上实现零样本交通事故预测,通过9:1融合和车辆检测对齐赢得CVPR 2026 ACCIDENT挑战赛。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 13. Code: https://github.com/fuumin621/cvpr2026-accident-1st-place-solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00501 2026-05-28 cs.CV 89%

CPPO: Contrastive Perception Policy Optimization for VLM Agents

CPPO: 面向VLM智能体的对比感知策略优化

Ahmad Rezaei, Mohsen Gholami, Saeed Ranjbar Alvar, Kevin Cannons, Mohammad Asiful Hossain, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) Huawei Cloud(华为云)

专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract);分类 cs.CV

AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26294 2026-05-27 cs.CV 89%

CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection

用于皮肤癌检测的CNN、Transformer、混合模型和视觉语言模型

Durjoy Dey, Yuhong Yan, Hassan Hajjdiab

机构 * Department of Computer Science and Software Engineering, Concordia University, Montreal, Canada(计算机科学与软件工程系,康科迪亚大学,加拿大蒙特利尔) Ebovir Biotechnologie Inc., Montreal, Canada(Ebovir生物技术公司,加拿大蒙特利尔)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV

AI总结 本文在PAD-UFES-20数据集上统一评估了12种深度学习模型(包括CNN、ViT、混合卷积Transformer和视觉语言模型),结果表明混合模型和基于SigLIP的VLM在排名性能和临床相关操作点之间取得了最佳平衡。

Comments 13 pages, 3 figures, accepted at ICPRAI 2026, The Fifth International Conference on Pattern Recognition and Artificial Intelligence. To appear in Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14530 2026-05-20 cs.CV 89%

Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

缓解大扩散视觉-语言模型中的遮蔽先验漂移和位置注意力崩溃

Sujung Hong, Chanyong Yoon, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(首尔大学人工智能系)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了大扩散视觉-语言模型在长形式生成中的重复生成和视觉 grounding 退化问题,提出了一种无需训练的解决方案来缓解遮蔽先验漂移和位置注意力崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15951 2026-05-18 cs.CV 89%

From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

从失败到反馈:群体修订解锁对象级 grounding 的难题

Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Technical University of Munich(慕尼黑技术大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。

Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR 89%

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13054 2026-05-14 cs.CV 89%

Topo-R1: Detecting Topological Anomalies via Vision-Language Models

Topo-R1: 通过视觉-语言模型检测拓扑异常

Meilong Xu, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Xin Yu, Weimin Lyu, Kehan Qi, Dimitris Samaras, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stanford University(斯坦福大学) Penn State University(宾夕法尼亚州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17419 2026-05-08 cs.CV 89%

EAGLE: Expert-Augmented Attention Guidance for Tuning-Free Industrial Anomaly Detection in Multimodal Large Language Models

EAGLE:专家增强的注意力引导用于多模态大语言模型中的无调优工业异常检测

Xiaomeng Peng, Xilang Huang, Seon Han Choi

机构 * Ewha Womans University(峨山女子大学)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 EAGLE通过整合专家异常检测器与冻结的MLLM,提出无调优框架,提升多模态大语言模型在工业异常检测中的准确率,且在MVTec-AD和VisA数据集上达到94.4%和88.1%的异常鉴别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 89%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08508 2026-04-23 cs.CV cs.CL 89%

Re:Verse -- Can Your VLM Read a Manga?

Re:Verse -- 能读懂漫画吗?

Aaditya Baranwal, Madhav Kataria, Naitik Agrawal, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)

专题命中 视觉定位与Grounding :VLM(title,summary_cn);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。

Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16517 2026-04-21 cs.CV cs.CL 89%

SmoGVLM: A Small, Graph-enhanced Vision-Language Model

SmoGVLM:一种小型、图增强的视觉-语言模型

Debjyoti Mondal, Rituraj Singh, Subhadarshi Panda

机构 * Samsung R\&D Institute India-Bangalore

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SmoGVLM,一种结合图神经网络的视觉-语言模型,通过结构化知识提升小规模多模态推理性能,实验表明小型模型性能提升达16.24%。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏