arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-01 至 2025-10-01 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2509.25696 2025-10-01 cs.LG cs.CL eess.SP 83%

Can VLM Pseudo-Labels Train a Time-Series QA Model That Outperforms the VLM?

Takuya Fujimura, Kota Dohi, Natsuo Yamashita, Yohei Kawaguchi

机构 * Nagoya University(名古屋大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14446 2025-10-01 cs.CV cs.CY cs.LG 73%

Neglected Risks: The Disturbing Reality of Children's Images in Datasets and the Urgent Call for Accountability

Carlos Caetano, Gabriel O. dos Santos, Caio Petrucci, Artur Barros, Camila Laranjeira, Leo S. F. Ribeiro, Júlia F. de Mendonça, Jefersson A. dos Santos, Sandra Avila

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26235 2025-10-01 cs.CV 70%

Interpret, prune and distill Donut : towards lightweight VLMs for VQA on document

Adnan Ben Mansour, Ayoub Karine, David Naccache

机构 * DIENS, École Normale Supérieure of Paris, Paris, France(巴黎高等师范学院DIENS) Université Paris Cité, LIPADE, F-75006 Paris, France(巴黎大学) Be-ys Research, Paris, France(Be-ys研究所)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at Workshop on Machine Learning in Document Analysis and Recognition (ICDAR WML 2025), Wuhan, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25654 2025-10-01 cs.CV 70%

DescribeEarth: Describe Anything for Remote Sensing Images

Kaiyu Li, Zixuan Jiang, Xiangyong Cao, Jiayu Wang, Yuchen Xiao, Deyu Meng, Zhi Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) School of Computer Science and Technology and Ministry of Education Key Lab For Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院和教育部智能网络与网络安全重点实验室) School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

专题命中 视觉问答 :vision-language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04943 2025-10-01 cs.CV cs.CL 70%

ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding

Jianjiang Yang, Yanshu li, Ziyan Huang

机构 * University of Bristol(布里斯托大学) Brown University(布朗大学) South China University of Technology(华南理工大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by conference EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07966 2025-10-01 cs.CV cs.AI cs.CL 62%

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

机构 * NVIDIA MIT(麻省理工学院) HKU(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 18 篇

2509.25916 2025-10-01 cs.CV cs.CL 85%

VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs

Peng Liu, Haozhan Shen, Chunxin Fang, Zhicheng Sun, Jiajia Liao, Tiancheng Zhao

机构 * Om AI Research(Om AI研究机构) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25559 2025-10-01 cs.AI cs.LG 84%

Radiology's Last Exam (RadLE): Benchmarking Frontier Multimodal AI Against Human Experts and a Taxonomy of Visual Reasoning Errors in Radiology

Suvrankar Datta, Divya Buchireddygari, Lakshmi Vennela Chowdary Kaza, Mrudula Bhalke, Kautik Singh, Ayush Pandey, Sonit Sai Vasipalli, Upasana Karnwal, Hakikat Bir Singh Bhatti, Bhavya Ratan Maroo, Sanjana Hebbar, Rahul Joseph, Gurkawal Kaur, Devyani Singh, Akhil V, Dheeksha Devasya Shama Prasad, Nishtha Mahajan, Ayinaparthi Arisha, Rajesh Vanagundi, Reet Nandy, Kartik Vuthoo, Snigdhaa Rajvanshi, Nikhileswar Kondaveeti, Suyash Gunjal, Rishabh Jain, Rajat Jain, Anurag Agrawal

机构 * Centre for Responsible Autonomous Systems in Healthcare (CRASH) Lab, Koita Centre for Digital Health(负责任的自主医疗系统中心(CRASH)实验室、Koita数字健康中心) Ashoka University(阿什oka大学) Independent Researcher(独立研究者) Koita Centre for Digital Health(Koita数字健康中心)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG

Comments 29 pages, 7 figures, 7 tables, includes Annexure (1). Part of the work accepted at RSNA 2025 (Cutting Edge Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06266 2025-10-01 cs.CV 83%

Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes

Mohsen Gholami, Ahmad Rezaei, Zhou Weimin, Sitong Mao, Shunbo Zhou, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada(华为技术加拿大分公司) Huawei Cloud Project Page Code Ego3D-Bench(华为云项目页面代码Ego3D-Bench)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26330 2025-10-01 cs.CV cs.IR 81%

SQUARE: Semantic Query-Augmented Fusion and Efficient Batch Reranking for Training-free Zero-Shot Composed Image Retrieval

Ren-Di Wu, Yu-Yen Lin, Huei-Fang Yang

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25757 2025-10-01 cs.AI cs.CL cs.CV cs.SC 79%

NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language

Danial Kamali, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06105 2025-10-01 cs.CV 74%

PathoHR: Hierarchical Reasoning for Vision-Language Models in Pathology

Yating Huang, Ziyan Huang, Lintao Xiang, Qijun Yang, Hujun Yin

机构 * University of Manchester(曼彻斯特大学) South China University of Technology(华南理工大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

Comments Accept by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25811 2025-10-01 cs.CV cs.LG 73%

Logo-VGR: Visual Grounded Reasoning for Open-world Logo Recognition

Zichen Liang, Jingjing Fei, Jie Wang, Zheming Yang, Changqing Li, Pei Wu, Minghui Qiu, Fei Yang, Xialei Liu

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03214 2025-10-01 cs.CL cs.AI cs.CV 73%

iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs

Julius Mayer, Mohamad Ballout, Serwan Jassim, Farbod Nosrat Nezami, Elia Bruni

机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25525 2025-10-01 cs.CR cs.LG 70%

Defeating Cerberus: Concept-Guided Privacy-Leakage Mitigation in Multimodal Language Models

Boyang Zhang, Istemi Ekin Akkus, Ruichuan Chen, Alice Dethise, Klaus Satzke, Ivica Rimac, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25502 2025-10-01 cs.CV 70%

Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Junyan Ye, Ke-Yue Zhang, Yue Zhou, Peng Jin, Bin Li, Taiping Yao, Shouhong Ding

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security, and SZU-AFS Joint Innovation Center for AI Technology(广东省智能信息处理重点实验室、深圳媒体安全重点实验室及深圳大学-AFS联合人工智能技术创新中心) Tencent Youtu Lab(腾讯优图实验室) Peking University(北京大学) Sun Yat-Sen University(中山大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25852 2025-10-01 cs.RO 67%

Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation

Zitong Bo, Yue Hu, Jinming Ma, Mingliang Zhou, Junhui Yin, Yachen Kang, Yuqi Liu, Tong Wu, Diyun Xiang, Hao Chen

机构 * Xiaomi Robotics Lab(小米机器人实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20328 2025-10-01 cs.LG cs.AI cs.CV cs.RO 67%

Video models are zero-shot learners and reasoners

Thaddäus Wiedemer, Yuxuan Li, Paul Vicol, Shixiang Shane Gu, Nick Matarese, Kevin Swersky, Been Kim, Priyank Jaini, Robert Geirhos

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://video-zero-shot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26594 2025-10-01 cs.LG cs.CL cs.CV 62%

Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces

John Gkountouras, Ivan Titov

机构 * ILLC, University of Amsterdam(伊拉斯谟范例学院、阿姆斯特丹大学) ILCC, University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04909 2025-10-01 cs.CV cs.AI 62%

HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding

Yuxuan Cai, Jiangning Zhang, Zhenye Gan, Qingdong He, Xiaobin Hu, Junwei Zhu, Yabiao Wang, Chengjie Wang, Zhucun Xue, Chaoyou Fu, Xinwei He, Xiang Bai

机构 * Fantasyele

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25946 2025-10-01 cs.AI 57%

Automated Model Discovery via Multi-modal & Multi-step Pipeline

Lee Jung-Mok, Nam Hyeon-Woo, Moon Ye-Bin, Junhyun Nam, Tae-Hyun Oh

机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) Samsung Electronics(三星电子) School of Computing, KAIST(KAIST计算机科学学院)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24304 2025-10-01 cs.CV 57%

FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20873 2025-10-01 cs.CV 57%

Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models

Chaeyoung Jung, Youngjoon Jang, Jongmin Choi, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26542 2025-10-01 eess.AS cs.MM cs.SD 50%

Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap

Yueqian Lin, Zhengmian Hu, Qinsi Wang, Yudong Liu, Hengfan Zhang, Jayakumar Subramanian, Nikos Vlassis, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Adobe

专题命中 视觉推理 :grounding(abstract)

Comments Code and data available at https://github.com/linyueqian/VERA

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 13 篇

2509.25794 2025-10-01 cs.CV cs.AI 88%

Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding

Haotian Xue, Yunhao Ge, Yu Zeng, Zhaoshuo Li, Ming-Yu Liu, Yongxin Chen, Jiaojiao Fan

机构 * Georgia Tech(佐治亚理工学院) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25669 2025-10-01 cs.AI 86%

GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination

Xinxi Chen, Tianyang Chen, Lijia Hong

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(title);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19294 2025-10-01 cs.CV cs.AI cs.CL 84%

Object Detection with Multimodal Large Vision-Language Models: An In-depth Review

Ranjan Sapkota, Manoj Karkee

专题命中 视觉定位与Grounding :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

Comments First Peer Reviewed Review Paper for Object Detection with Vision-Language Models (VLMs)

Journal ref Information Fusion, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25564 2025-10-01 cs.CV 83%

FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology

Faizan Farooq Khan, Yousef Radwan, Eslam Abdelrahman, Abdulwahab Felemban, Aymen Mir, Nico K. Michiels, Andrew J. Temple, Michael L. Berumen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Red Sea Research Center, KAUST(红海研究中心,KAUST) Tübingen University(图宾根大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 3 figures 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21500 2025-10-01 cs.CV cs.AI cs.CL 81%

ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models

Dingming Li, Hongxing Li, Zixuan Wang, Yuchen Yan, Hang Zhang, Siqi Chen, Guiyang Hou, Shengpei Jiang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Project: https://zju-real.github.io/ViewSpatial-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26039 2025-10-01 cs.CV 70%

SGS: Segmentation-Guided Scoring for Global Scene Inconsistencies

Gagandeep Singh, Samudi Amarsinghe, Urawee Thani, Ki Fung Wong, Priyanka Singh, Xue Li

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏