arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26403 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4524 篇

2505.21177 2025-06-10 cs.CG 50%

SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry

Peijie Wang, Chao Yang, Zhong-Zhi Li, Fei Yin, Dekang Ran, Mi Tian, Zhilong Ji, Jinfeng Bai, Cheng-Lin Liu

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00316 2025-06-09 cs.CL 50%

MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models

Mahir Labib Dihan, Md Tanvir Hassan, Md Tanvir Parvez, Md Hasebul Hasan, Md Almash Alam, Muhammad Aamir Cheema, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学) Statistics, Islamic University, Bangladesh(统计学,伊斯兰大学,孟加拉国) Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉推理 :visual reasoning(abstract)

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04055 2025-06-06 cs.CL 50%

Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks

Jiayi He, Hehai Lin, Qingyun Wang, Yi Fung, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :vision-language model(abstract)

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24714 2025-06-02 cs.CL 50%

FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation

Junyu Luo, Zhizhuo Kou, Liming Yang, Xiao Luo, Jinsheng Huang, Zhiping Xiao, Jingshu Peng, Chengzhong Liu, Jiaming Ji, Xuanzhe Liu, Sirui Han, Ming Zhang, Yike Guo

机构 * State Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab(多媒体信息处理国家重点实验室,PKU-Anker LLM实验室) School of Computer Science, Peking University(北京大学计算机学院) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12567 2025-06-02 cs.CL 50%

FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning

Seunghee Kim, Changhyeon Kim, Taeuk Kim

机构 * Hanyang University(翰阳大学)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19510 2025-05-30 cs.CL 50%

LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical Study

Dongil Yang, Minjin Kim, Sunghwan Kim, Beong-woo Kwak, Minjun Park, Jinseok Hong, Woontack Woo, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Metaverse, KAIST(元宇宙研究生院,韩国科学技术院) Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

专题命中 视觉推理 :grounding(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14030 2025-05-30 cs.RO 50%

AutoBio: A Simulation and Benchmark for Robotic Automation in Digital Biology Laboratory

Zhiqian Lan, Yuxuan Jiang, Ruiqi Wang, Xuanbing Xie, Rongkui Zhang, Yicheng Zhu, Peihang Li, Tianshuo Yang, Tianxing Chen, Haoyu Gao, Xiaokang Yang, Xuelong Li, Hongyuan Zhang, Yao Mu, Ping Luo

机构 * HKU(香港大学) TeleAI THU(清华大学) SJTU(上海交通大学) HKU Shanghai Intelligent Computing Center(香港大学上海智能计算中心)

专题命中 视觉推理 :visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12583 2025-05-30 cs.CL 50%

LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data

Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Shengjie Ma, Aofan Liu, Hui Xiong, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArc Tech Ltd.(DataArc科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(Hithink皇家Flush信息网络有限公司)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20828 2025-05-29 cs.RO 50%

GET: Goal-directed Exploration and Targeting for Large-Scale Unknown Environments

Lanxiang Zheng, Ruidong Mei, Mingxin Wei, Hao Ren, Hui Cheng

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Systems Science and Engineering(系统科学与工程学院) School of Artificial Intelligence(人工智能学院)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04281 2025-05-27 cs.RO 50%

WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving

Yiheng Li, Cunxin Fan, Chongjian Ge, Zhihao Zhao, Chenran Li, Chenfeng Xu, Huaxiu Yao, Masayoshi Tomizuka, Bolei Zhou, Chen Tang, Mingyu Ding, Wei Zhan

专题命中 视觉推理 :LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18319 2025-05-27 cs.CE 50%

Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials Science

Sifan Wu, Huan Zhang, Yizhan Li, Farshid Effaty, Amirreza Ataei, Bang Liu

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14035 2025-05-21 cs.MM cs.CL 50%

ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs

Shiyao Cui, Qinglin Zhang, Xuan Ouyang, Renmiao Chen, Zhexin Zhang, Yida Lu, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University China(清华大学人工智能对话组,国防科技大学,清华大学)

专题命中 视觉推理 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19877 2025-05-05 cs.HC 50%

Towards Multimodal Large-Language Models for Parent-Child Interaction: A Focus on Joint Attention

Weiyan Shi, Viet Hai Le, Kenny Tsu Wei Choo

专题命中 视觉推理 :multimodal large language model(abstract)

Comments Accepted at CHI 2025 Late Breaking Work

Journal ref Proceedings of the Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, 2025, Article No. 535, Pages 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00153 2025-05-02 cs.HC cs.DC 50%

Audo-Sight: Enabling Ambient Interaction For Blind And Visually Impaired Individuals

Bhanuja Ainary

专题命中 视觉推理 :multimodal large language model(abstract)

Comments This thesis was conducted under the guidance of Mohsen Amini Salehi. Special thanks to Minseo Kim and Jacob Bradshaw for their valuable contributions and support throughout the research process. 60 pages, 13 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12597 2025-04-25 cs.CL 50%

GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning

Liangyu Xu, Yingxiu Zhao, Jingyun Wang, Yingyao Wang, Bu Pi, Chen Wang, Mingliang Zhang, Jihao Gu, Xiang Li, Xiaoyong Zhu, Jun Song, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba Beijing China(阿里巴巴北京公司)

专题命中 视觉推理 :multimodal large language model(abstract)

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07229 2025-04-24 cs.MM 50%

MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks

Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang, Daling Wang, Yang Li, Qi Sun, Yifei Zhang, Xiaoming Fu, Soujanya Poria

专题命中 视觉推理 :multimodal large language model(abstract)

Comments Accepted by the Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10222 2025-04-15 cs.MM 50%

PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search

Pengfei Hu, Zhenrong Zhang, Qikai Chang, Shuhang Liu, Jiefeng Ma, Jun Du, Jianshu Zhang, Quan Liu, Jianqing Gao, Feng Ma, Qingfeng Liu

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09130 2025-04-15 cs.CL 50%

VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search

Yikun Wang, Siyin Wang, Qinyuan Cheng, Zhaoye Fei, Liang Ding, Qipeng Guo, Dacheng Tao, Xipeng Qiu

专题命中 视觉推理 :vision-language model(abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15335 2025-04-15 cs.CL 50%

Stepwise Informativeness Search for Efficient and Effective LLM Reasoning

Siyuan Wang, Enda Zhao, Zhongyu Wei, Xiang Ren

专题命中 视觉推理 :grounding(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19134 2025-03-26 cs.CL cs.CR 50%

MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks

Wenhao You, Bryan Hooi, Yiwei Wang, Youke Wang, Zong Ke, Ming-Hsuan Yang, Zi Huang, Yujun Cai

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05787 2025-03-18 cs.CL 50%

Chain of Evidences and Evidence to Generate: Prompting for Context Grounded and Retrieval Augmented Reasoning

Md Rizwan Parvez

专题命中 视觉推理 :grounding(abstract)

Comments Accepted at NAACL KnowledgeNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10814 2025-03-17 cs.CL 50%

Thinking Machines: A Survey of LLM based Reasoning Strategies

Dibyanayan Bandyopadhyay, Soham Bhattacharjee, Asif Ekbal

专题命中 视觉推理 :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09307 2025-03-11 cs.RO 50%

RoboReflect: A Robotic Reflective Reasoning Framework for Grasping Ambiguous-Condition Objects

Zhen Luo, Yixuan Yang, Yanfu Zhang, Feng Zheng

专题命中 视觉推理 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14668 2025-03-03 cs.CL 50%

MiCEval: Unveiling Multimodal Chain of Thought's Quality via Image Description and Reasoning Steps

Xiongtao Zhou, Jie He, Lanyu Chen, Jingyu Li, Haojing Chen, Víctor Gutiérrez-Basulto, Jeff Z. Pan, Hanjie Chen

专题命中 视觉推理 :multimodal large language model(abstract)

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14669 2025-02-26 cs.CL 50%

AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPO

Alan Dao, Dinh Bach Vu

专题命中 视觉推理 :visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13042 2025-02-26 cs.CL 50%

Does Table Source Matter? Benchmarking and Improving Multimodal Scientific Table Understanding and Reasoning

Bohao Yang, Yingji Zhang, Dong Liu, André Freitas, Chenghua Lin

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13187 2025-01-28 cs.NE 50%

Evolutionary Optimization of Model Merging Recipes

Takuya Akiba, Makoto Shing, Yujin Tang, Qi Sun, David Ha

专题命中 视觉推理 :VLM(abstract)

Comments Authors' submitted version before final edits. Published in Nature Machine Intelligence on January 27, 2025: https://www.nature.com/articles/s42256-024-00975-8

Journal ref Nat Mach Intell (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14620 2025-01-09 cs.LO cs.CC 50%

Structure-Guided Automated Reasoning

Max Bannach, Markus Hecher

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05212 2024-11-11 cs.RO 50%

RT-Grasp: Reasoning Tuning Robotic Grasping via Multi-modal Large Language Model

Jinxuan Xu, Shiyu Jin, Yutian Lei, Yuqian Zhang, Liangjun Zhang

专题命中 视觉推理 :VLM(abstract)

Comments Accepted to IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03622 2024-10-24 cs.CL 50%

Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models

Wenshan Wu, Shaoguang Mao, Yadong Zhang, Yan Xia, Li Dong, Lei Cui, Furu Wei

专题命中 视觉推理 :multimodal large language model(abstract)

Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏