arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2406.09403 2024-11-12 cs.CV cs.CL 57%

Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models

Yushi Hu, Weijia Shi, Xingyu Fu, Dan Roth, Mari Ostendorf, Luke Zettlemoyer, Noah A Smith, Ranjay Krishna

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024. Project and codes url: https://visualsketchpad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11161 2024-11-05 cs.AI cs.MM 57%

Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

Zebang Cheng, Zhi-Qi Cheng, Jun-Yan He, Jingdong Sun, Kai Wang, Yuxiang Lin, Zheng Lian, Xiaojiang Peng, Alexander Hauptmann

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2024. 49 pages, 13 figures, Project: https://github.com/ZebangCheng/Emotion-LLaMA, Demo: https://huggingface.co/spaces/ZebangCheng/Emotion-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00081 2024-11-04 cs.RO cs.AI 57%

PARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent Tasks

Matthew Chang, Gunjan Chhablani, Alexander Clegg, Mikael Dallaire Cote, Ruta Desai, Michal Hlavac, Vladimir Karashchuk, Jacob Krantz, Roozbeh Mottaghi, Priyam Parashar, Siddharth Patki, Ishita Prasad, Xavier Puig, Akshara Rai, Ram Ramrakhya, Daniel Tran, Joanne Truong, John M. Turner, Eric Undersander, Tsung-Yen Yang

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments Alphabetical author order

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14515 2024-10-31 cs.CV cs.MM 57%

MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding

Xinyu Fang, Kangrui Mao, Haodong Duan, Xiangyu Zhao, Yining Li, Dahua Lin, Kai Chen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17503 2024-10-31 cs.SE cs.AI cs.CL cs.PL 57%

Code Repair with LLMs gives an Exploration-Exploitation Tradeoff

Hao Tang, Keya Hu, Jin Peng Zhou, Sicheng Zhong, Wei-Long Zheng, Xujie Si, Kevin Ellis

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02793 2024-10-30 cs.CV cs.CL 57%

ImageInWords: Unlocking Hyper-Detailed Image Descriptions

Roopal Garg, Andrea Burns, Burcu Karagol Ayan, Yonatan Bitton, Ceslee Montgomery, Yasumasa Onoe, Andrew Bunner, Ranjay Krishna, Jason Baldridge, Radu Soricut

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Webpage (https://google.github.io/imageinwords), GitHub (https://github.com/google/imageinwords), HuggingFace (https://huggingface.co/datasets/google/imageinwords)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18537 2024-10-25 cs.CV 57%

Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics

Jinghao Hu, Yuhe Zhang, GuoHua Geng, Liuyuxin Yang, JiaRui Yan, Jingtao Cheng, YaDong Zhang, Kang Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 13 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15364 2024-10-22 cs.CV cs.MM 57%

Scene Graph Generation with Role-Playing Large Language Models

Guikun Chen, Jin Li, Wenguan Wang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2024. Code: https://github.com/guikunchen/SDSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13851 2024-10-18 cs.RO cs.CV cs.GR 57%

Differentiable Robot Rendering

Ruoshi Liu, Alper Canberk, Shuran Song, Carl Vondrick

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments Project Page: https://drrobot.cs.columbia.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13666 2024-10-18 cs.CV cs.CL 57%

VL-GLUE: A Suite of Fundamental yet Challenging Visuo-Linguistic Reasoning Tasks

Shailaja Keyur Sampat, Mutsumi Nakamura, Shankar Kailas, Kartik Aggarwal, Mandy Zhou, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12773 2024-10-17 cs.RO cs.AI 57%

Harmon: Whole-Body Motion Generation of Humanoid Robots from Language Descriptions

Zhenyu Jiang, Yuqi Xie, Jinhan Li, Ye Yuan, Yifeng Zhu, Yuke Zhu

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

Comments Accepted for oral presentation at 8th Annual Conference on Robot Learning. Project website: https://ut-austin-rpl.github.io/Harmon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11538 2024-10-16 cs.CV 57%

MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark

Bin Shan, Xiang Fei, Wei Shi, An-Lan Wang, Guozhi Tang, Lei Liao, Jingqun Tang, Xiang Bai, Can Huang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments 12 pages, 5 figures, project page: https://github.com/xfey/MCTBench?tab=readme-ov-file

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07394 2024-10-11 cs.CV 57%

Structured Spatial Reasoning with Open Vocabulary Object Detectors

Negar Nejatishahidin, Madhukar Reddy Vongala, Jana Kosecka

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07391 2024-10-11 cs.AI 57%

The Cognitive Capabilities of Generative AI: A Comparative Analysis with Human Benchmarks

Isaac R. Galatzer-Levy, David Munday, Jed McGiffin, Xin Liu, Danny Karmon, Ilia Labzovsky, Rivka Moroshko, Amir Zait, Daniel McDuff

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12877 2024-10-10 cs.CL cs.AI 57%

ReFeR: Improving Evaluation and Reasoning through Hierarchy of Models

Yaswanth Narsupalli, Abhranil Chandra, Sreevatsa Muppirala, Manish Gupta, Pawan Goyal

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

Comments Paper Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06166 2024-10-10 cs.CV cs.CL 57%

Temporal Reasoning Transfer from Text to Video

Lei Li, Yuanxin Liu, Linli Yao, Peiyuan Zhang, Chenxin An, Lean Wang, Xu Sun, Lingpeng Kong, Qi Liu

专题命中 视觉推理 :InternVL(abstract);分类 cs.CV

Comments Project page: https://video-t3.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11823 2024-10-08 cs.CV cs.CL 57%

On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning

Geewook Kim, Minjoon Seo

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04148 2024-10-08 cs.CL cs.AI 57%

Reasoning with Natural Language Explanations

Marco Valentino, André Freitas

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments Tutorial to be presented at EMNLP 2024. Website: https://sites.google.com/view/reasoning-with-explanations

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13444 2024-10-07 cs.CL cs.CV 57%

VDebugger: Harnessing Execution Feedback for Debugging Visual Programs

Xueqing Wu, Zongyu Lin, Songyan Zhao, Te-Lin Wu, Pan Lu, Nanyun Peng, Kai-Wei Chang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13682 2024-09-23 cs.RO cs.AI cs.CL 57%

ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation

Abrar Anwar, John Welsh, Joydeep Biswas, Soha Pouya, Yan Chang

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12878 2024-09-20 cs.LG cs.SE 57%

Impact of ML Optimization Tactics on Greener Pre-Trained ML Models

Alexandra González Álvarez, Joel Castaño, Xavier Franch, Silverio Martínez-Fernández

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06351 2024-09-11 cs.AI 57%

MAGDA: Multi-agent guideline-driven diagnostic assistance

David Bani-Harouni, Nassir Navab, Matthias Keicher

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09481 2024-09-10 cs.CL cs.AI 57%

PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis

Meng Luo, Hao Fei, Bobo Li, Shengqiong Wu, Qian Liu, Soujanya Poria, Erik Cambria, Mong-Li Lee, Wynne Hsu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted by ACM MM 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18799 2024-09-10 cs.CV cs.CL 57%

X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning

Artemis Panagopoulou, Le Xue, Ning Yu, Junnan Li, Dongxu Li, Shafiq Joty, Ran Xu, Silvio Savarese, Caiming Xiong, Juan Carlos Niebles

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00147 2024-09-04 cs.CL cs.AI 57%

MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models

Shuai Peng, Di Fu, Liangcai Gao, Xiuqin Zhong, Hongguang Fu, Zhi Tang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16160 2024-08-22 cs.AI cs.CL 57%

UniMEL: A Unified Framework for Multimodal Entity Linking with Large Language Models

Liu Qi, He Yongyi, Lian Defu, Zheng Zhi, Xu Tong, Liu Che, Chen Enhong

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments CIKM 2024. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06281 2024-08-21 cs.CV cs.CL 57%

MMBench: Is Your Multi-modal Model an All-around Player?

Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, Kai Chen, Dahua Lin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted in ECCV2024 as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08431 2024-08-19 cs.AI 57%

Multi-Modal Dialogue State Tracking for Playing GuessWhich Game

Wei Pang, Ruixue Duan, Jinfu Yang, Ning Li

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments Published at CICAI 2023 (CAAI-A), codes at https://github.com/xubuvd/GuessWhich

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06781 2024-08-14 cs.CV 57%

Do Vision-Language Foundational models show Robust Visual Perception?

Shivam Chandhok, Pranav Tandon

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments UBC Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11129 2024-08-06 cs.CV 57%

Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales

Minghe Gao, Shuang Chen, Liang Pang, Yuan Yao, Jisheng Dang, Wenqiao Zhang, Juncheng Li, Siliang Tang, Yueting Zhuang, Tat-Seng Chua

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏