arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2507.05330 2025-07-09 cs.CL cs.AI 57%

MindFlow: Revolutionizing E-commerce Customer Support with Multimodal LLM Agents

Ming Gong, Xucheng Huang, Chenghan Yang, Xianhan Peng, Haoxin Wang, Yang Liu, Ling Jiang

机构 * Xiaoduo AI(小多AI) University of Dayton(代顿大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16427 2025-07-08 cs.CV 57%

Fine-Grained Captioning of Long Videos through Scene Graph Consolidation

Sanghyeok Chu, Seonguk Seo, Bohyung Han

机构 * ECE, Seoul National University, Korea.(电子工程系,首尔国立大学,韩国) IPAI, Seoul National University, Korea.(人工智能研究所,首尔国立大学,韩国)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05079 2025-07-08 cs.AI eess.SP 57%

Multimodal-to-Text Prompt Engineering in Large Language Models Using Feature Embeddings for GNSS Interference Characterization

Harshith Manjunath, Lucas Heublein, Tobias Feigl, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.AI

Journal ref IEEE Wireless Communications and Networking Conference (WCNC), March 2025, Milan, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01949 2025-07-03 cs.CV 57%

Kwai Keye-VL Technical Report

Kwai Keye Team, Biao Yang, Bin Wen, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Hao Peng, Haojie Ding, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Jin Ouyang, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yang Zhou, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zhenhua Wu, Zhenyu Li, Zhixin Ling, Ziming Li, Dehua Ma, Di Xu, Haixuan Gao, Hang Li, Jiawei Guo, Jing Wang, Lejian Ren, Muhao Wei, Qianqian Wang, Qigen Hu, Shiyao Wang, Tao Yu, Xinchen Luo, Yan Li, Yiming Liang, Yuhang Hu, Zeyi Lu, Zhuoran Yang, Zixing Zhang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Technical Report: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01485 2025-07-03 cs.RO cs.AI cs.MA q-bio.QM 57%

BioMARS: A Multi-Agent Robotic System for Autonomous Biological Experiments

Yibo Qiu, Zan Huang, Zhiyu Wang, Handi Liu, Yiling Qiao, Yifeng Hu, Shu'ang Sun, Hangke Peng, Ronald X Xu, Mingzhai Sun

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23725 2025-07-01 cs.RO cs.AI 57%

PAC Bench: Do Foundation Models Understand Prerequisites for Executing Manipulation Policies?

Atharva Gundawar, Som Sagar, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07503 2025-07-01 cs.CV 57%

Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * HKUST(香港理工大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Project page: https://danielshkao.github.io/thinkfirst.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22176 2025-06-30 cs.RO cs.CV 57%

KnotDLO: Toward Interpretable Knot Tying

Holly Dinkel, Raghavendra Navaratna, Jingyi Xiang, Brian Coltin, Trey Smith, Timothy Bretl

机构 * Department of Aerospace Engineering and Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(航空航天工程系和协调科学实验室,伊利诺伊大学厄巴纳-香槟分校) Department of Electrical Engineering and Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(电气工程系和协调科学实验室,伊利诺伊大学厄巴纳-香槟分校) Intelligent Robotics Group, NASA Ames Research Center(智能机器人组,美国国家航空航天局阿姆斯研究中心)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 4 pages, 5 figures, presented at the Workshop on 3D Visual Representations for Manipulation at the 2023 IEEE International Conference on Robotics and Automation in Yokohama, Japan. Video presentation [https://youtu.be/mg30uCUtpOk]. Poster [https://hollydinkel.github.io/assets/pdf/ICRA20243DVRM_poster.pdf] 3DVRM Workshop [https://3d-manipulation-workshop.github.io/]

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21277 2025-06-27 cs.CV cs.CL 57%

HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context

Qize Yang, Shimin Yao, Weixuan Chen, Shenghao Fu, Detao Bai, Jiaxing Zhao, Boyuan Sun, Bowen Yin, Xihan Wei, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20601 2025-06-26 cs.CV 57%

Video Perception Models for 3D Scene Synthesis

Rui Huang, Guangyao Zhai, Zuria Bauer, Marc Pollefeys, Federico Tombari, Leonidas Guibas, Gao Huang, Francis Engelmann

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18472 2025-06-24 cs.CV 57%

AViLA: Asynchronous Vision-Language Agent for Streaming Multimodal Data Interaction

Gengyuan Zhang, Tanveer Hannan, Hermine Kleiner, Beste Aydemir, Xinyu Xie, Jian Lan, Thomas Seidl, Volker Tresp, Jindong Gu

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments preprint version; 23 pages (including references and appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17612 2025-06-24 cs.CV 57%

JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent

Yunlong Lin, Zixu Lin, Kunjie Lin, Jinbin Bai, Panwang Pan, Chenxin Li, Haoyu Chen, Zhongdao Wang, Xinghao Ding, Wenbo Li, Shuicheng Yan

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Bytedance(字节跳动) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments 40 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23091 2025-06-24 cs.AI cs.CL 57%

Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models

Zeyu Liu, Yuhang Liu, Guanghao Zhu, Congkai Xie, Zhen Li, Jianbo Yuan, Xinyao Wang, Qing Li, Shing-Chi Cheung, Shengyu Zhang, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Reallm Labs(Reallm 实验室) Amazon(亚马逊) The Hong Kong University of Science and Technology(香港理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16755 2025-06-23 cs.CL cs.AI 57%

Language-Informed Synthesis of Rational Agent Models for Grounded Theory-of-Mind Reasoning On-The-Fly

Lance Ying, Ryan Truong, Katherine M. Collins, Cedegao E. Zhang, Megan Wei, Tyler Brooke-Wilson, Tan Zhi-Xuan, Lionel Wong, Joshua B. Tenenbaum

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Brown University(布朗大学) Yale University(耶鲁大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

Comments 5 figures, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09149 2025-06-23 cs.CV cs.MM 57%

Memory-enhanced Retrieval Augmentation for Long Video Understanding

Huaying Yuan, Zheng Liu, Minghao Qin, Hongjin Qian, Yan Shu, Zhicheng Dou, Ji-Rong Wen, Nicu Sebe

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光华学院人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Trento(特伦托大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13102 2025-06-17 cs.CL cs.AI cs.CY 57%

Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs

Gyutaek Oh, Seoyeon Kim, Sangjoon Park, Byung-Hoon Kim

机构 * Department of Biomedical Systems Informatics, Yonsei University College of Medicine(生物医学系统信息学系,延世大学医学院) Yonsei University College of Medicine(延世大学医学院) Department of Radiation Oncology, Yonsei University College of Medicine(放射肿瘤学系,延世大学医学院) Department of Biomedical Systems Informatics and the Department of Psychiatry, Yonsei University College of Medicine(生物医学系统信息学系和精神病学系,延世大学医学院) Institute for Innovation in Digital Healthcare, Yonsei University(数字医疗创新研究所,延世大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12538 2025-06-17 cs.CL cs.AI 57%

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking

Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng, Jinfeng Xu, Jinze Li, Zhenzhe Ying, Weiqiang Wang, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) University College London(伦敦大学学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11737 2025-06-16 cs.CV cs.CL cs.MM 57%

Quizzard@INOVA Challenge 2025 -- Track A: Plug-and-Play Technique in Interleaved Multi-Image Model

Dinh Viet Cuong, Hoang-Bao Le, An Pham Ngoc Nguyen, Liting Zhou, Cathal Gurrin

机构 * School of Computing, Dublin City University(都柏林城市大学计算机学院) ADAPT Centre(ADAPT中心)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11114 2025-06-16 cs.CL cs.AI 57%

KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations

Junyu Liu, Kaiqi Yan, Tianyang Wang, Qian Niu, Momoko Nagai-Tanima, Tomoki Aoyama

机构 * Kyoto University(京都大学) The Hong Kong University of Science and Technology(香港科技大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The University of Tokyo(东京大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 9pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08700 2025-06-12 cs.CL cs.CV 57%

ClimateViz: A Benchmark for Statistical Reasoning and Fact Verification on Scientific Charts

Ruiran Su, Jiasheng Si, Zhijiang Guo, Janet B. Pierrehumbert

机构 * University of Oxford(牛津大学) Qilu University of Technology(Shandong Academy of Sciences)(齐鲁工业大学(山东科学院)) Hong Kong University of Science and Technology(香港科学大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学大学(广州))

专题命中 视觉推理 :InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16033 2025-06-12 cs.CL cs.AI 57%

Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models

Qianqi Yan, Yue Fan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) eBay(eBay公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20024 2025-06-11 cs.CV 57%

SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning

Wufei Ma, Yu-Cheng Chou, Qihao Liu, Xingrui Wang, Celso de Melo, Jianwen Xie, Alan Yuille

机构 * DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室) Lambda Inc(Lambda公司)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Project page: https://spatial-reasoner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07643 2025-06-10 cs.CV 57%

Synthetic Visual Genome

Jae Sung Park, Zixian Ma, Linjie Li, Chenhao Zheng, Cheng-Yu Hsieh, Ximing Lu, Khyathi Chandu, Quan Kong, Norimasa Kobori, Ali Farhadi, Yejin Choi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能艾伦研究所) Stanford University(斯坦福大学) Woven by Toyota(丰田编织)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07418 2025-06-10 cs.AI 57%

Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests

Arnau Igualde Sáez, Lamyae Rhomrasi, Yusef Ahsini, Ricardo Vinuesa, Sergio Hoyas, Jose P. García Sabater, Marius J. Fullana i Alfonso, J. Alberto Conejero

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06218 2025-06-09 cs.CV 57%

STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving

Christian Fruhwirth-Reisinger, Dušan Malić, Wei Lin, David Schinagl, Samuel Schulter, Horst Possegger

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Dataset: https://huggingface.co/datasets/ivc-lrp/STSBench, Code: https://github.com/LRP-IVC/STSBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05331 2025-06-06 cs.CV 57%

MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning

Xinyan Chen, Renrui Zhang, Dongzhi Jiang, Aojun Zhou, Shilin Yan, Weifeng Lin, Hongsheng Li

机构 * CUHK MMLab(香港大学MMLab)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Code is released at https://github.com/xinyan-cxy/MINT-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04633 2025-06-06 cs.CV 57%

Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations

Linjie Li, Mahtab Bigverdi, Jiawei Gu, Zixian Ma, Yinuo Yang, Ziang Li, Yejin Choi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Sun Yat-sen University(中山大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments STARE is available at https://github.com/STARE-bench/STARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24875 2025-06-06 cs.CV cs.CL 57%

ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL

Yu Zhang, Yunqi Li, Yifan Yang, Rui Wang, Yuqing Yang, Dai Qi, Jianmin Bao, Dongdong Chen, Chong Luo, Lili Qiu

机构 * ShanghaiTech University(上海科技大学) Microsoft Corporation(微软公司) Fudan University(复旦大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05237 2025-06-05 cs.CL cs.CV 57%

MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale

Jarvis Guo, Tuney Zheng, Yuelin Bai, Bo Li, Yubo Wang, King Zhu, Yizhi Li, Graham Neubig, Wenhu Chen, Xiang Yue

机构 * Carnegie Mellon University(卡内基梅隆大学) M-A-P Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The University of Manchester(曼彻斯特大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01795 2025-06-03 cs.CV 57%

R2SM: Referring and Reasoning for Selective Masks

Yu-Lin Shih, Wei-En Tai, Cheng Sun, Yu-Chiang Frank Wang, Hwann-Tzong Chen

机构 * National Tsing Hua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏