arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2412.11936 2025-05-21 cs.CL 78%

A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges

Yibo Yan, Jiamin Su, Jianxiang He, Fangteng Fu, Xu Zheng, Yuanhuiyi Lyu, Kun Wang, Shen Wang, Qingsong Wen, Xuming Hu

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments Accepted by The 63rd Annual Meeting of the Association for Computational Linguistics (ACL Findings 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15863 2025-05-21 cs.RO 78%

Task-oriented Robotic Manipulation with Vision Language Models

Nurhan Bulus Guran, Hanchi Ren, Jingjing Deng, Xianghua Xie

机构 * Department of Computer Science, Swansea University(计算机科学系,萨瑟兰大学) Department of Computer Science, Durham University(计算机科学系,杜ham大学)

专题命中 视觉推理 :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09120 2025-05-20 cs.CL 78%

Can Vision-Language Models Infer Speaker's Ignorance? The Role of Visual and Linguistic Cues

Ye-eun Cho, Yunho Maeng

机构 * Sungkyunkwan University(顺天妇女大学) Ewha Womans University & LLM Experimental Lab, MODULABS(成均馆大学及LLM实验实验室,MODULABS)

专题命中 视觉推理 :vision-language model(title,abstract)

Comments 11 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02569 2025-05-06 cs.RO cs.HC 78%

HapticVLM: VLM-Driven Texture Recognition Aimed at Intelligent Haptic Interaction

Muhammad Haris Khan, Miguel Altamirano Cabrera, Dmitrii Iarchuk, Yara Mahmoud, Daria Trinitatova, Issatay Tokmurziyev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室、数字工程中心、斯克尔科沃科学与技术研究所)

专题命中 视觉推理 :VLM(title);vision-language model(abstract)

Comments Submitted to IEEE conf

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05132 2025-03-11 cs.AI cs.CV cs.LG 78%

R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Hengguang Zhou, Xirui Li, Ruochen Wang, Minhao Cheng, Tianyi Zhou, Cho-Jui Hsieh

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11903 2025-03-11 cs.CL 78%

MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation

Haochen Xue, Feilong Tang, Ming Hu, Yexin Liu, Qidong Huang, Yulong Li, Chengzhi Liu, Zhongxing Xu, Chong Zhang, Chun-Mei Feng, Yutong Xie, Imran Razzak, Zongyuan Ge, Jionglong Su, Junjun He, Yu Qiao

专题命中 视觉推理 :multimodal large language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08603 2024-12-31 cs.CL 78%

A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine

Hanguang Xiao, Feizhong Zhou, Xingyue Liu, Tianqi Liu, Zhipeng Li, Xin Liu, Xiaoxuan Huang

专题命中 视觉推理 :multimodal large language model(title,abstract)

Journal ref Information Fusion, 117 (2025) 102888

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11496 2024-12-02 cs.CL 78%

Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models

Chenhang Cui, Gelei Deng, An Zhang, Jingnan Zheng, Yicong Li, Lianli Gao, Tianwei Zhang, Tat-Seng Chua

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00855 2024-11-05 cs.LG cs.AI cs.CL cs.CV 78%

Vision-Language Models Can Self-Improve Reasoning via Reflection

Kanzhi Cheng, Yantao Li, Fangzhi Xu, Jianbing Zhang, Hao Zhou, Yang Liu

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20927 2024-11-01 cs.RO 78%

VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions

Guanyan Chen, Meiling Wang, Te Cui, Yao Mu, Haoyang Lu, Tianxing Zhou, Zicai Peng, Mengxiao Hu, Haizhou Li, Yuan Li, Yi Yang, Yufeng Yue

专题命中 视觉推理 :vision language model(title,abstract)

Comments accepted for publication in the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14917 2024-10-21 cs.CL 78%

With Ears to See and Eyes to Hear: Sound Symbolism Experiments with Multimodal Large Language Models

Tyler Loakman, Yucheng Li, Chenghua Lin

专题命中 视觉推理 :multimodal large language model(title);vision language model(abstract)

Comments Accepted to EMNLP 2024 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09489 2024-10-15 cs.CL 78%

Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks

Sungkyung Kim, Adam Lee, Junyoung Park, Andrew Chung, Jusang Oh, Jay-Yoon Lee

专题命中 视觉推理 :visual reasoning(title,abstract)

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03907 2024-10-08 cs.CL 78%

ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities

Ying Su, Zhan Ling, Haochen Shi, Jiayang Cheng, Yauwai Yim, Yangqiu Song

专题命中 视觉推理 :visual language model(title);vision language model(abstract)

Comments 13 pages, 9 figures, 8 tables, accepted to EMNLP 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00257 2024-10-07 cs.CL 78%

Are Large Vision Language Models up to the Challenge of Chart Comprehension and Reasoning? An Extensive Investigation into the Capabilities and Limitations of LVLMs

Mohammed Saidul Islam, Raian Rahman, Ahmed Masry, Md Tahmid Rahman Laskar, Mir Tafseer Nayeem, Enamul Hoque

专题命中 视觉推理 :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04929 2024-07-31 cs.RO 78%

RoboMP$^2$: A Robotic Multimodal Perception-Planning Framework with Multimodal Large Language Models

Qi Lv, Hao Li, Xiang Deng, Rui Shao, Michael Yu Wang, Liqiang Nie

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments Accepted by ICML 2024; Project page: https://aopolin-lv.github.io/RoboMP2.github.io/

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:33558-33574, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04615 2024-06-10 eess.AS cs.CL cs.SD 78%

What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models

Enis Berk Çoban, Michael I. Mandel, Johanna Devaney

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13601 2024-05-29 cs.CL 78%

MM-LLMs: Recent Advances in MultiModal Large Language Models

Duzhen Zhang, Yahan Yu, Jiahua Dong, Chenxing Li, Dan Su, Chenhui Chu, Dong Yu

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments Accepted by ACL2024 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20194 2024-04-26 cs.MM 78%

ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models

Shuo Liu, Kaining Ying, Hao Zhang, Yue Yang, Yuqi Lin, Tianle Zhang, Chuanhao Li, Yu Qiao, Ping Luo, Wenqi Shao, Kaipeng Zhang

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06528 2024-03-08 cs.AI cs.CV cs.LG 78%

Learning Abstract Visual Reasoning via Task Decomposition: A Case Study in Raven Progressive Matrices

Jakub Kwiatkowski, Krzysztof Krawiec

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13577 2024-02-22 cs.CL 78%

BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models

Xueliang Zhao, Xinting Huang, Tingchen Fu, Qintong Li, Shansan Gong, Lemao Liu, Wei Bi, Lingpeng Kong

专题命中 视觉推理 :vision-language model(title,abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09203 2023-10-31 cs.AI cs.CV cs.LG 78%

Interactive Visual Reasoning under Uncertainty

Manjie Xu, Guangyuan Jiang, Wei Liang, Chi Zhang, Yixin Zhu

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at NeurIPS 2023 (Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16504 2022-11-30 cs.CV cs.AI cs.LG 78%

Improving Commonsense in Vision-Language Models via Knowledge Graph Riddles

Shuquan Ye, Yujia Xie, Dongdong Chen, Yichong Xu, Lu Yuan, Chenguang Zhu, Jing Liao

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Code: https://github.com/pleaseconnectwifi/DANCE Project page: shuquanye.com/DANCE_website

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01319 2022-09-07 cs.RO cs.HC 78%

Kinova Gemini: Interactive Robot Grasping with Visual Reasoning and Conversational AI

Hanxiao Chen, Jiankun Wang, Max Q. -H. Meng

专题命中 视觉推理 :visual reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06838 2022-06-08 cs.CV cs.AI cs.LG 78%

Stratified Rule-Aware Network for Abstract Visual Reasoning

Sheng Hu, Yuqing Ma, Xianglong Liu, Yanlu Wei, Shihao Bai

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments AAAI 2021 paper. Code: https://github.com/husheng12345/SRAN

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08994 2021-09-21 cs.CL 78%

ReaSCAN: Compositional Reasoning in Language Grounding

Zhengxuan Wu, Elisa Kreiss, Desmond C. Ong, Christopher Potts

专题命中 视觉推理 :grounding(title,abstract)

Comments 26 pages, 8 figures

Journal ref NeurIPS 2021 (Dataset and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.05398 2020-06-11 cs.LG cs.AI cs.CV cs.RO stat.ML 78%

Deep Visual Reasoning: Learning to Predict Action Sequences for Task and Motion Planning from an Initial Scene Image

Danny Driess, Jung-Su Ha, Marc Toussaint

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments Robotics: Science and Systems (R:SS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00453 2017-10-03 cs.CL 78%

Visual Reasoning with Natural Language

Stephanie Zhou, Alane Suhr, Yoav Artzi

专题命中 视觉推理 :visual reasoning(title,abstract)

Comments AAAI NCHRC 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08165 2025-06-27 cs.LG cs.CV 77%

Chain-of-Sketch: Enabling Global Visual Reasoning

Aryo Lotfi, Enrico Fini, Samy Bengio, Moin Nabi, Emmanuel Abbe

机构 * Apple(苹果公司)

专题命中 视觉推理 :visual reasoning(title,comments);分类 cs.CV、cs.LG

Comments additional experiments added, title changed from "Visual Scratchpads: Enabling Global Reasoning in Vision" to "Chain-of-Sketch: Enabling Global Visual Reasoning"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20161 2026-08-21 cs.AI 新提交 77%

DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

DARS:用于基于指令的图像编辑的带结构化推理的双层级信用分配强化学习

Haoxiang Cao, Jiajiong Cao, Xuanpu Zhang, Changqian Yu, Chaoqun Wang

机构 * South China Normal University(华南师范大学) KlingAI Research(可灵AI研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出DARS框架,解决基于指令的图像编辑系统仅用最终奖励训练效率低的问题,通过双层级信用分配实现更好性能,在推理密集型编辑上增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-08-21 cs.CV 版本更新 77%

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏