arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-11 至 2025-08-11 共收录 21 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2508.00549 2025-08-11 cs.CV 79%

Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images

Daniel Wolf, Heiko Hillenhagen, Billurvan Taskin, Alex Bäuerle, Meinrad Beer, Michael Götz, Timo Ropinski

机构 * Visual Computing Group, Institute of Media Informatics, Ulm University, Germany(媒体信息研究所视觉计算组,乌尔姆大学,德国) Diagnostic and Interventional Radiology, Ulm University Medical Center, Germany(乌尔姆大学医学中心诊断与介入放射学) Axiom Bio, USA(Axiom Bio公司,美国)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at the International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06152 2025-08-11 cs.CV 57%

VISTAR:A User-Centric and Role-Driven Benchmark for Text-to-Image Evaluation

Kaiyuan Jiang, Ruoxi Sun, Ying Cao, Yuqi Xu, Xinran Zhang, Junyan Guo, ChengSheng Deng

机构 * Peking University(北京大学) LinkSure University of Glasgow(格拉斯哥大学) Boston University(波士顿大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 17 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08131 2025-08-11 cs.CV 57%

SAR Strikes Back: A New Hope for RSVQA

Lucrezia Tosato, Flora Weissgerber, Laurent Wendling, Sylvain Lobry

机构 * LIPADE, Université Paris Cité(巴黎Cité大学LIPADE研究所) GENCI-IDRIS French Aerospace Lab, ONERA(法国航空航天实验室ONERA)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing 13 pages, 6 figures

Journal ref 10.1109/JSTARS.2025.3596678

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 2 篇

2505.19015 2025-08-11 cs.CV cs.MM 83%

Can Multimodal Large Language Models Understand Spatial Relations?

Jingping Liu, Ziyan Liu, Zhedong Cen, Yan Zhou, Yinan Zou, Weiyan Zhang, Haiyun Jiang, Tong Ruan

机构 * School of Information Science and Engineering, East China University of Science and Technology, Shanghai, China(信息科学与工程学院,东华大学,上海,中国) School of Computer Science, Fudan University, Shanghai, China(计算机科学学院,复旦大学,上海,中国)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 13 pages, 7 figures, published to ACL 2025

Journal ref In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 620-632, 2025, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06009 2025-08-11 cs.CV 79%

MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models

Jun Feng, Zixin Wang, Zhentao Zhang, Yue Guo, Zhihan Zhou, Xiuyi Chen, Zhenyang Li, Dawei Yin

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2508.06317 2025-08-11 cs.CV 83%

Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding

Jian Hu, Zixu Cheng, Shaogang Gong, Isabel Guan, Jianye Hao, Jun Wang, Kun Shao

机构 * Queen Mary University of London(伦敦女王学院) Hong Kong University of Science and Technology(香港科学与技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05684 2025-08-11 cs.CR cs.LG 79%

MM-FusionNet: Context-Aware Dynamic Fusion for Multi-modal Fake News Detection with Large Vision-Language Models

Junhao He, Tianyu Liu, Jingyuan Zhao, Benjamin Turner

机构 * Huaiyin Institute of Technology(淮阴职业技术学院) Universidad Autónoma de Asunción(阿斯unción自治大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05976 2025-08-11 cs.CV cs.RO 77%

PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic Manipulation

Zhihao Zhu, Yifan Zheng, Siyu Pan, Yaohui Jin, Yao Mu

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室、人工智能研究院、上海交通大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. 8 pages main paper, 8 figures, plus supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24277 2025-08-11 cs.LG cs.AI 62%

Evaluating and Designing Sparse Autoencoders by Approximating Quasi-Orthogonality

Sewoong Lee, Adam Davies, Marc E. Canby, Julia Hockenmaier

机构 * Siebel School of Computing and Data Science University of Illinois Urbana-Champaign(计算与数据科学学院 耶鲁大学伊利诺伊分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05799 2025-08-11 cs.SE cs.AI cs.HC 57%

AI-Guided Exploration of Large-Scale Codebases

Yoseph Berhanu Alebachew

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2508.06492 2025-08-11 cs.CV cs.CL 79%

Effective Training Data Synthesis for Improving MLLM Chart Understanding

Yuwei Yang, Zeyu Zhang, Yunzhong Hou, Zhuowan Li, Gaowen Liu, Ali Payani, Yuan-Sen Ting, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Ohio State University(俄亥俄州立大学) Cisco(思科公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (poster). 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2508.06291 2025-08-11 cs.RO 50%

Real-Time 3D Vision-Language Embedding Mapping

Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

机构 * Technical University of Leoben(莱博恩技术大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 5 篇

2508.05669 2025-08-11 cs.IR cs.AI cs.CL cs.CV cs.LG 85%

Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports

Jin Khye Tan, En Jun Choong, Ethan Jeremiah Chitty, Yan Pheng Choo, John Hsin Yang Wong, Chern Eu Cheah

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 28 pages, 14 figures, 5 tables. Evaluation code (LLM-as-a-judge and Markdown TEDS) is available at https://github.com/jinkhye/MyFinMarkdown. The development dataset and evaluation benchmark are available on Hugging Face at https://huggingface.co/datasets/jinkhye/MyFinMarkdown-sample and https://huggingface.co/datasets/jinkhye/MyFinMarkdown-bench respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09105 2025-08-11 cs.CV cs.AI cs.CL cs.LG 80%

INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance

Chenwei Lin, Hanjia Lyu, Xian Xu, Jiebo Luo

机构 * School of Computer Science Fudan University(复旦大学计算机科学学院) Department of Computer Science University of Rochester(罗切斯特大学计算机科学系) School of Economics Fudan University(复旦大学经济学院)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments To appear in the International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23543 2025-08-11 cs.CV cs.AI 73%

ART: Adaptive Relation Tuning for Generalized Relation Prediction

Gopika Sudhakaran, Hikaru Shindo, Patrick Schramowski, Simone Schaub-Meyer, Kristian Kersting, Stefan Roth

机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) Hessian Center for AI (hessian.AI)(海德堡人工智能中心) German Research Center for AI (DFKI)(德国人工智能研究中心)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05954 2025-08-11 cs.CV cs.AI cs.CL 62%

Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents

Han Lin, Jaemin Cho, Amir Zadeh, Chuan Li, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Lambda

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://bifrost-1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06036 2025-08-11 cs.CV 57%

More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment

Jun Xie, Yingjian Zhu, Feng Chen, Zhenghao Zhang, Xiaohui Fan, Hongzhu Yi, Xinming Wang, Chen Yu, Yue Bi, Zhaoran Zhao, Xiongjun Guan, Zhepeng Wang

机构 * Lenovo Research(联想研究) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学) Shandong University(山东大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 4 篇

2508.05898 2025-08-11 cs.CV 79%

ETTA: Efficient Test-Time Adaptation for Vision-Language Models through Dynamic Embedding Updates

Hamidreza Dastmalchi, Aijun An, Ali cheraghian

机构 * York University(约克大学) The Australian National University(澳大利亚国立大学) Data61-CSIRO

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

Comments BMVC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06072 2025-08-11 cs.CV cs.AI 62%

Can Large Models Fool the Eye? A New Turing Test for Biological Animation

Zijian Chen, Lirong Deng, Zhengyu Chen, Kaiwei Zhang, Qi Jia, Yuan Tian, Yucheng Zhu, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06342 2025-08-11 cs.CV cs.SI 57%

Street View Sociability: Interpretable Analysis of Urban Social Behavior Across 15 Cities

Kieran Elrod, Katherine Flanigan, Mario Bergés

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05661 2025-08-11 cs.IR cs.AI 57%

Zero-Shot Retrieval for Scalable Visual Search in a Two-Sided Marketplace

Andre Rusli, Shoma Ishimoto, Sho Akiyama, Aman Kumar Singh

机构 * Mercari, Inc.(Mercari公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments 6 pages, KDD 2025 Workshop on Two-sided Marketplace Optimization: Search, Pricing, Matching & Growth (TSMO)

详情

展开后加载摘要…

URL PDF HTML 收藏