arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-23 至 2025-10-23 共收录 33 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2510.19818 2025-10-23 cs.LG cs.AI cs.RO 79%

Semantic World Models

Jacob Berg, Chuning Zhu, Yanda Bao, Ishan Durugkar, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Sony AI(索尼人工智能)

专题命中 视觉问答 :vision-language model(abstract);vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19001 2025-10-23 cs.CV cs.AI cs.RO 73%

Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts

Seungjun Yu, Junsung Park, Youngsun Lim, Hyunjung Shim

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19626 2025-10-23 cs.CV 70%

MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom

Yifan Li, Fenghe Tang, Yingtai Li, Shaohua Kevin Zhou

机构 * 1 School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Technology of China, Hefei, Anhui, 230026, P.R. China 2 Center for Medical Imaging, Robotics Analytic Computing \& LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, P.R. China 3 Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123 4 State Key Laboratory of Precision

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments The code, checkpoints, and dataset are available at: https://github.com/Leevan001/MedReason-R1

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 11 篇

2506.16962 2025-10-23 cs.CV cs.AI cs.CL 86%

Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search

Haoran Sun, Yankai Jiang, Wenjie Lou, Yujie Zhang, Wenjie Li, Lilong Wang, Mianxin Liu, Lei Liu, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19559 2025-10-23 cs.CV cs.AI cs.IR cs.MM 84%

A Matter of Time: Revealing the Structure of Time in Vision-Language Models

Nidham Tekaya, Manuela Waldner, Matthias Zeppelzauer

机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19358 2025-10-23 cs.CL cs.AI 83%

M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models

Yejin Kwon, Taewoo Kang, Hyunsoo Yoon, Changouk Kim

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments Submitted to LREC 2026. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19451 2025-10-23 cs.CV cs.MM 79%

Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis

Xueqi Ma, Yanbei Jiang, Sarah Erfani, James Bailey, Weifeng Liu, Krista A. Ehinger, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学) China University of Petroleum (East China)(中国石油大学(华东))

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24625 2025-10-23 cs.CV cs.AI 73%

Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19555 2025-10-23 cs.CV cs.CL 70%

[De|Re]constructing VLMs' Reasoning in Counting

Simone Alghisi, Gabriel Roccabruna, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi

机构 * University of Trento(特伦托大学) Amazon(亚马逊公司) SISLab(SIS实验室) Department of Information Engineering and Computer Science(信息工程与计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12323 2025-10-23 cs.CV 70%

Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback

Janet Wang, Yunbei Zhang, Zhengming Ding, Jihun Hamm

机构 * Tulane University(路易斯安那州立大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19808 2025-10-23 cs.CV cs.CL cs.LG 62%

Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing

Yusu Qian, Eli Bocek-Rivele, Liangchen Song, Jialing Tong, Yinfei Yang, Jiasen Lu, Wenze Hu, Zhe Gan

机构 * Apple(苹果公司)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16814 2025-10-23 cs.LG cs.CV 62%

Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning

Junhao Shen, Haiteng Zhao, Yuzhe Gu, Songyang Gao, Kuikun Liu, Haian Huang, Jianfei Gao, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19055 2025-10-23 cs.AI cs.SD eess.AS 57%

The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS

Brandon James Carone, Iran R. Roman, Pablo Ripollés

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21776 2025-10-23 cs.CV 57%

Video-R1: Reinforcing Video Reasoning in MLLMs

Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) CUHK (SZ)(香港中文大学(深圳)) Tsinghua University(清华大学) UCAS(中国科学院大学) CUHK HCCL(香港中文大学高性能计算实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2509.18582 2025-10-23 cs.CV 79%

The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers

Daiqing Qi, Handong Zhao, Jing Shi, Simon Jenni, Yifei Fan, Franck Dernoncourt, Scott Cohen, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Adobe(Adobe公司)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12718 2025-10-23 cs.CV cs.MM 79%

ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding

Zhenxing Zhang, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Dan Guo, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology, China(计算机科学与信息工程学院,合肥工业大学,中国) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, China(人工智能研究所,合肥综合性国家科学中心,中国)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19599 2025-10-23 cs.CV cs.AI 79%

XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography

Haozhe Luo, Shelley Zixin Shu, Ziyu Zhou, Sebastian Otalora, Mauricio Reyes

机构 * ARTORG Center for Biomedical Engineering Research, University of Bern, Switzerland(ARTORG生物医学工程研究中心,伯尔尼大学,瑞士) Shanghai Jiao Tong University, China(上海交通大学,中国) Kaiko.AI, Switzerland(Kaiko.AI,瑞士) Dept. of Radiation Oncology, Inselspital, Bern University Hospital(放射肿瘤科,因斯普尔茨医院,伯尔尼大学医院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19574 2025-10-23 cs.CV cs.CR 57%

Can You Trust What You See? Alpha Channel No-Box Attacks on Video Object Detection

Ariana Yi, Ce Zhou, Liyang Xiao, Qiben Yan

机构 * Mission San Jose High School(Mission San Jose 高中) Missouri University of Science and Technology(密苏里科学与技术大学) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19878 2025-10-23 cs.CL cs.IR 50%

CausalRAG: Integrating Causal Graphs into Retrieval-Augmented Generation

Nengbo Wang, Xiaotian Han, Jagdip Singh, Jing Ma, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) Department of Design and Innovation, Case Western Reserve University(设计与创新系,凯斯西储大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments Accepted at Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2510.19817 2025-10-23 cs.CV cs.CL 70%

olmOCR 2: Unit Test Rewards for Document OCR

Jake Poznanski, Luca Soldaini, Kyle Lo

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments https://olmocr.allen.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2510.19245 2025-10-23 cs.CY cs.AI cs.HC cs.LG cs.MM 81%

See, Think, Act: Online Shopper Behavior Simulation with VLM Agents

Yimeng Zhang, Jiri Gesi, Ran Xue, Tian Wang, Ziyi Wang, Yuxuan Lu, Sinong Zhan, Huimin Zeng, Qingjun Cui, Yufan Guo, Jing Huang, Mubarak Shah, Dakuo Wang

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Northeastern University(东北大学) Northwestern University(西北大学) University of Central Florida(佛罗里达中央大学)

专题命中 GUI与屏幕智能体 :VLM(title);grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19336 2025-10-23 cs.CV 70%

DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents

Kai Shi, Jun Yang, Ni Yang, Binqiang Pan, Qingsong Xie, Chao Zhang, Zhenyu Yang, Tianhuang Su, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19488 2025-10-23 cs.CL cs.AI cs.LG 62%

VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos

Dunjie Lu, Yiheng Xu, Junli Wang, Haoyuan Wu, Xinyuan Wang, Zekun Wang, Junlin Yang, Hongjin Su, Jixuan Chen, Junda Chen, Yuchen Mao, Jingren Zhou, Junyang Lin, Binyuan Hui, Tao Yu

机构 * The University of Hong Kong(香港大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 57%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 2 篇

2510.19307 2025-10-23 cs.CV 79%

Unified Reinforcement and Imitation Learning for Vision-Language Models

Byung-Kwan Lee, Ryo Hachiuma, Yong Man Ro, Yu-Chiang Frank Wang, Yueh-Hua Wu

机构 * NVIDIA KAIST(韩国科学技术院) National Taiwan University(国立台湾大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments NeurIPS 2025, Project page: https://byungkwanlee.github.io/RIL-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17150 2025-10-23 cs.RO 67%

OmniVIC: A Self-Improving Variable Impedance Controller with Vision-Language In-Context Learning for Safe Robotic Manipulation

Heng Zhang, Wei-Hsing Huang, Gokhan Solak, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,美国亚特兰大)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract)

Comments Code, video and RAG dataset are available at \url{https://sites.google.com/view/omni-vic}

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2510.19160 2025-10-23 cs.LG 83%

Preliminary Use of Vision Language Model Driven Extraction of Mouse Behavior Towards Understanding Fear Expression

Paimon Goulart, Jordan Steinhauser, Kylene Shuler, Edward Korzus, Jia Chen, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01822 2025-10-23 cs.CV 83%

VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models

Byung-Kwan Lee, Ryo Hachiuma, Yu-Chiang Frank Wang, Yong Man Ro, Yueh-Hua Wu

机构 * NVIDIA KAIST(韩国科学技术院) National Taiwan University(国立台湾大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://byungkwanlee.github.io/VLsI-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19802 2025-10-23 cs.CV 79%

Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models

Xiaozhen Qiao, Jingkai Zhao, Yuqiu Jiang, Xianda Guo, Zhe Sun, Hongyuan Zhang, Xuelong Li

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom, P. R. China(人工智能研究所(TeleAI),中国电信,中华人民共和国) College of Computer Science, Wuhan University(计算机科学学院,武汉大学) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院,光学与电子学(iOPEN),西北工业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19678 2025-10-23 cs.CV cs.AI 62%

I Spy With My Model's Eye: Visual Search as a Behavioural Test for MLLMs

John Burden, Jonathan Prunty, Ben Slater, Matthieu Tehenan, Greg Davis, Lucy Cheke

机构 * Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心、剑桥大学) Department of Engineering, University of Cambridge(工程系、剑桥大学) Department of Psychology, University of Cambridge(心理学系、剑桥大学) Department of Computer Science, University of Cambridge(计算机科学系、剑桥大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏