arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2412.14835 2024-12-20 cs.CL cs.AI cs.CV cs.IR 62%

Progressive Multimodal Reasoning via Active Retrieval

Guanting Dong, Chenghao Zhang, Mengjie Deng, Yutao Zhu, Zhicheng Dou, Ji-Rong Wen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09596 2024-12-13 cs.CV cs.AI cs.CL 62%

InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions

Pan Zhang, Xiaoyi Dong, Yuhang Cao, Yuhang Zang, Rui Qian, Xilin Wei, Lin Chen, Yifei Li, Junbo Niu, Shuangrui Ding, Qipeng Guo, Haodong Duan, Xin Chen, Han Lv, Zheng Nie, Min Zhang, Bin Wang, Wenwei Zhang, Xinyue Zhang, Jiaye Ge, Wei Li, Jingwen Li, Zhongying Tu, Conghui He, Xingcheng Zhang, Kai Chen, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Github Repo: https://github.com/InternLM/InternLM-XComposer/tree/main/InternLM-XComposer-2.5-OmniLive

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11021 2024-12-04 cs.CV cs.AI 62%

Towards Neuro-Symbolic Video Understanding

Minkyu Choi, Harsh Goel, Mohammad Omama, Yunhao Yang, Sahil Shah, Sandeep Chinchali

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by The European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07154 2024-12-03 cs.LG cs.AI 62%

Recurrent Aggregators in Neural Algorithmic Reasoning

Kaijia Xu, Petar Veličković

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments Presented at the Third Learning on Graphs Conference (LoG 2024). 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19500 2024-12-02 cs.CL cs.AI cs.LG 62%

COLD: Causal reasOning in cLosed Daily activities

Abhinav Joshi, Areeb Ahmad, Ashutosh Modi

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments Paper accepted at NeurIPS 2024; Total 37 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16554 2024-11-26 cs.LG cs.CV 62%

Generating Out-Of-Distribution Scenarios Using Language Models

Erfan Aasi, Phat Nguyen, Shiva Sreeram, Guy Rosman, Sertac Karaman, Daniela Rus

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05591 2024-11-26 cs.CV cs.AI cs.CL 62%

Multimodal Foundation Models Exploit Text to Make Medical Image Predictions

Thomas Buckley, James A. Diao, Pranav Rajpurkar, Adam Rodman, Arjun K. Manrai

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15955 2024-11-26 cs.CV cs.AI 62%

Beyond the Doors of Perception: Vision Transformers Represent Relations Between Objects

Michael A. Lepori, Alexa R. Tartaglini, Wai Keen Vong, Thomas Serre, Brenden M. Lake, Ellie Pavlick

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14794 2024-11-25 cs.CV cs.AI cs.CL 62%

VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection

Songhao Han, Wei Huang, Hairong Shi, Le Zhuo, Xiu Su, Shifeng Zhang, Xu Zhou, Xiaojuan Qi, Yue Liao, Si Liu

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13243 2024-11-21 cs.CV cs.AI 62%

XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation

Ziyi Wang, Yanbo Wang, Xumin Yu, Jie Zhou, Jiwen Lu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12591 2024-11-20 cs.CV cs.AI 62%

Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination

Haojie Zheng, Tianyang Xu, Hanchi Sun, Shu Pu, Ruoxi Chen, Lichao Sun

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02389 2024-11-19 cs.CV cs.AI cs.RO 62%

Multi-modal Situated Reasoning in 3D Scenes

Xiongkun Linghu, Jiangyong Huang, Xuesong Niu, Xiaojian Ma, Baoxiong Jia, Siyuan Huang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2024 Datasets and Benchmarks Track. Project page: https://msr3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01652 2024-11-13 cs.RO cs.AI cs.CV 62%

ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation

Wenlong Huang, Chen Wang, Yunzhu Li, Ruohan Zhang, Li Fei-Fei

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01801 2024-11-11 cs.CV cs.LG 62%

Bootstrapping Top-down Information for Self-modulating Slot Attention

Dongwon Kim, Seoyeon Kim, Suha Kwak

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17791 2024-11-11 cs.AI cs.CV 62%

Untrained neural networks can demonstrate memorization-independent abstract reasoning

Tomer Barak, Yonatan Loewenstein

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Journal ref Sci Rep 14, 27249 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09949 2024-10-25 cs.AI cs.LG cs.SC 62%

Neural Concept Binder

Wolfgang Stammer, Antonia Wüst, David Steinmann, Kristian Kersting

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13246 2024-10-14 cs.CL cs.CV cs.LG 62%

GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs

Navid Rajabi, Jana Kosecka

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Accepted to NeurIPS 2024 Workshop on Compositional Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08164 2024-10-11 cs.AI cs.CL cs.CV 62%

Agent S: An Open Agentic Framework that Uses Computers Like a Human

Saaket Agashe, Jiuzhou Han, Shuyu Gan, Jiachen Yang, Ang Li, Xin Eric Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 16 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07230 2024-10-11 cs.CV cs.AI 62%

Needle In A Multimodal Haystack

Weiyun Wang, Shuibo Zhang, Yiming Ren, Yuchen Duan, Tiantong Li, Shuo Liu, Mengkang Hu, Zhe Chen, Kaipeng Zhang, Lewei Lu, Xizhou Zhu, Ping Luo, Yu Qiao, Jifeng Dai, Wenqi Shao, Wenhai Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024 Track Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06001 2024-10-10 cs.LG cs.AI cs.CL 62%

LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit

Ruihao Gong, Yang Yong, Shiqiao Gu, Yushi Huang, Chengtao Lv, Yunchen Zhang, Xianglong Liu, Dacheng Tao

专题命中 视觉推理 :VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by EMNLP 2024 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19603 2024-10-01 cs.CV cs.AI 62%

One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos

Zechen Bai, Tong He, Haiyang Mei, Pichao Wang, Ziteng Gao, Joya Chen, Lei Liu, Zheng Zhang, Mike Zheng Shou

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurlPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15451 2024-09-25 cs.RO cs.AI cs.CV 62%

Tag Map: A Text-Based Map for Spatial Reasoning and Navigation with Large Language Models

Mike Zhang, Kaixian Qu, Vaishakh Patil, Cesar Cadena, Marco Hutter

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15019 2024-08-19 cs.RO cs.AI cs.LG 62%

Agentic Skill Discovery

Xufeng Zhao, Cornelius Weber, Stefan Wermter

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments Webpage see https://agentic-skill-discovery.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02882 2024-08-07 cs.AI cs.CR cs.LG 62%

Compromising Embodied Agents with Contextual Backdoor Attacks

Aishan Liu, Yuguang Zhou, Xianglong Liu, Tianyuan Zhang, Siyuan Liang, Jiakai Wang, Yanjun Pu, Tianlin Li, Junqi Zhang, Wenbo Zhou, Qing Guo, Dacheng Tao

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15745 2024-08-07 cs.CL cs.AI cs.CV 62%

GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation

Yi Zong, Xipeng Qiu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17911 2024-07-26 cs.MM cs.AI cs.CV 62%

ReCorD: Reasoning and Correcting Diffusion for HOI Generation

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Lo, Yi-Ning Huang, Terence Lin, Jhih-Ciang Wu, Hong-Han Shuai, Wen-Huang Cheng

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM 2024. Project website: https://alberthkyhky.github.io/ReCorD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10107 2024-07-22 cs.CV cs.AI cs.MM 62%

Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning

Hang Zhang, Wenxiao Zhang, Haoxuan Qu, Jun Liu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09548 2024-07-16 cs.CV cs.AI 62%

Towards Temporal Change Explanations from Bi-Temporal Satellite Images

Ryo Tsujimoto, Hiroki Ouchi, Hidetaka Kamigaito, Taro Watanabe

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09136 2024-07-15 cs.CL cs.AI cs.LG 62%

Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors

Nico Daheim, Jakub Macina, Manu Kapur, Iryna Gurevych, Mrinmaya Sachan

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments Preprint. Nico Daheim and Jakub Macina contributed equally. Code and dataset can be found under: https://github.com/eth-lre/verify-then-generate

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12742 2024-06-19 cs.CV cs.AI cs.CL 62%

Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning

Bingchen Zhao, Yongshuo Zong, Letian Zhang, Timothy Hospedales

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV、cs.AI

Comments First three authors contributed equally. Dataset: https://huggingface.co/datasets/VLLMs/MIRB

详情

展开后加载摘要…

URL PDF HTML 收藏