arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4484 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2411.15714 2024-11-26 cs.CV 83%

ROOT: VLM based System for Indoor Scene Understanding and Beyond

Yonghui Wang, Shi-Yong Chen, Zhenxing Zhou, Siyi Li, Haoran Li, Wengang Zhou, Houqiang Li

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11360 2024-11-19 cs.CV 83%

CCExpert: Advancing MLLM Capability in Remote Sensing Change Captioning with Difference-Aware Integration and a Foundational Dataset

Zhiming Wang, Mingze Wang, Sheng Xu, Yanjing Li, Baochang Zhang

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09052 2024-11-15 cs.RO cs.LG 83%

ClevrSkills: Compositional Language and Visual Reasoning in Robotics

Sanjay Haresh, Daniel Dijkman, Apratim Bhattacharyya, Roland Memisevic

专题命中 视觉推理 :visual reasoning(title);vision language model(abstract);VLM(abstract);分类 cs.LG

Comments To appear at NeurIPS 2024 (D&B track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05755 2024-11-11 cs.RO cs.CL cs.CV 83%

End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering

Dylan Goetting, Himanshu Gaurav Singh, Antonio Loquercio

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20883 2024-11-04 cs.CV 83%

Improving Generalization in Visual Reasoning via Self-Ensemble

Tien-Huy Nguyen, Quang-Khai Tran, Anh-Tuan Quang-Hoang

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13438 2024-10-31 cs.CV 83%

SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors

Chenyang Ma, Kai Lu, Ta-Ying Cheng, Niki Trigoni, Andrew Markham

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments NeurIPS 2024; Project Page: https://dannymcy.github.io/zeroshot_task_hallucination/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03659 2024-10-14 cs.CV cs.CL 83%

Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models

Tinghui Zhu, Qin Liu, Fei Wang, Zhengzhong Tu, Muhao Chen

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Website: https://darthzhu.github.io/cross-modality-knowledge-conflict/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06765 2024-10-10 cs.CL cs.CV 83%

To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models

Junyan Lin, Haoran Chen, Dawei Zhu, Xiaoyu Shen

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09788 2024-09-17 cs.CV cs.CL 83%

Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models

Yuan-Hong Liao, Rafid Mahmood, Sanja Fidler, David Acuna

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02231 2024-08-06 cs.CV 83%

REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models

Agneet Chatterjee, Yiran Luo, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project Page : https://agneetchatterjee.com/revision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19666 2024-07-30 cs.CV 83%

Take A Step Back: Rethinking the Two Stages in Visual Reasoning

Mingyu Zhang, Jiting Cai, Mingyu Liu, Yue Xu, Cewu Lu, Yong-Lu Li

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ECCV 2024, Project page: https://mybearyzhang.github.io/projects/TwoStageReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16500 2024-07-30 cs.CV 83%

LLMGA: Multimodal Large Language Model based Generation Assistant

Bin Xia, Shiyin Wang, Yingfan Tao, Yitong Wang, Jiaya Jia

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments The paper is accepted by ECCV2024. The code is available at https://github.com/dvlab-research/LLMGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12884 2024-07-23 cs.CV 83%

HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning

Fucai Ke, Zhixi Cai, Simindokht Jahangard, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by ECCV2024. Project page: https://hydra-vl4ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02666 2024-07-04 cs.RO cs.AI 83%

Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models

Annie S. Chen, Alec M. Lessing, Andy Tang, Govind Chada, Laura Smith, Sergey Levine, Chelsea Finn

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02042 2024-07-03 cs.CL cs.AI 83%

Fake News Detection and Manipulation Reasoning via Large Vision-Language Models

Ruihan Jin, Ruibo Fu, Zhengqi Wen, Shuai Zhang, Yukun Liu, Jianhua Tao

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15359 2024-06-25 cs.CL cs.CV 83%

Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models

Jesse Atuhurra, Iqra Ali, Tatsuya Hiraoka, Hidetaka Kamigaito, Tomoya Iwakura, Taro Watanabe

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15915 2024-06-21 cs.CV 83%

ChartBench: A Benchmark for Complex Visual Reasoning in Charts

Zhengzhuo Xu, Sinan Du, Yiyan Qi, Chengjin Xu, Chun Yuan, Jian Guo

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06865 2024-06-12 cs.AI 83%

Eyeballing Combinatorial Problems: A Case Study of Using Multimodal Large Language Models to Solve Traveling Salesman Problems

Mohammed Elhenawy, Ahmed Abdelhay, Taqwa I. Alhadidi, Huthaifa I Ashqar, Shadi Jaradat, Ahmed Jaber, Sebastien Glaser, Andry Rakotonirainy

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01031 2024-05-28 cs.CL cs.AI 83%

Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks

Fakhraddin Alwajih, El Moatez Billah Nagoudi, Gagan Bhatia, Abdelrahman Mohamed, Muhammad Abdul-Mageed

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16006 2024-04-25 cs.CV 83%

MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI

Kaining Ying, Fanqing Meng, Jin Wang, Zhiqian Li, Han Lin, Yue Yang, Hao Zhang, Wenbo Zhang, Yuqi Lin, Shuo Liu, Jiayi Lei, Quanfeng Lu, Runjian Chen, Peng Xu, Renrui Zhang, Haozhe Zhang, Peng Gao, Yali Wang, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao

专题命中 视觉推理 :vision-language model(title,abstract);InternVL(abstract);分类 cs.CV

Comments 77 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03052 2024-04-08 cs.CV cs.CL 83%

Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models

Yushi Hu, Otilia Stretcu, Chun-Ta Lu, Krishnamurthy Viswanathan, Kenji Hata, Enming Luo, Ranjay Krishna, Ariel Fuxman

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12966 2024-03-22 cs.CV 83%

Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models

Zuyan Liu, Yuhao Dong, Yongming Rao, Jie Zhou, Jiwen Lu

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Project Page: https://sites.google.com/view/chain-of-spot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11574 2024-02-20 cs.CV cs.CL 83%

Visual In-Context Learning for Large Vision-Language Models

Yucheng Zhou, Xiang Li, Qianning Wang, Jianbing Shen

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08670 2024-02-14 cs.AI 83%

Rec-GPT4V: Multimodal Recommendation with Large Vision-Language Models

Yuqing Liu, Yu Wang, Lichao Sun, Philip S. Yu

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11035 2024-01-23 cs.CV 83%

Image Safeguarding: Reasoning with Conditional Vision Language Model and Obfuscating Unsafe Content Counterfactually

Mazal Bethany, Brandon Wherry, Nishant Vishwamitra, Peyman Najafirad

专题命中 视觉推理 :vision language model(title);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06805 2024-01-19 cs.CL cs.AI 83%

Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning

Yiqi Wang, Wentao Chen, Xiaotian Han, Xudong Lin, Haiteng Zhao, Yongfei Liu, Bohan Zhai, Jianbo Yuan, Quanzeng You, Hongxia Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16217 2023-12-29 cs.CV cs.RO 83%

ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation

Xiaoqi Li, Mingxu Zhang, Yiran Geng, Haoran Geng, Yuxing Long, Yan Shen, Renrui Zhang, Jiaming Liu, Hao Dong

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06739 2023-12-13 cs.CV 83%

SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models

Yuzhou Huang, Liangbin Xie, Xintao Wang, Ziyang Yuan, Xiaodong Cun, Yixiao Ge, Jiantao Zhou, Chao Dong, Rui Huang, Ruimao Zhang, Ying Shan

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://yuzhou914.github.io/SmartEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11860 2023-11-28 cs.CV 83%

LION : Empowering Multimodal Large Language Model with Dual-Level Visual Knowledge

Gongwei Chen, Leyang Shen, Rui Shao, Xiang Deng, Liqiang Nie

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report. Project page: https://rshaojimmy.github.io/Projects/JiuTian-LION Code: https://github.com/rshaojimmy/JiuTian

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04901 2023-11-09 cs.CV 83%

GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEs

Zhenfang Chen, Rui Sun, Wenjun Liu, Yining Hong, Chuang Gan

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏