arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2404.16375 2025-01-22 cs.CV cs.AI cs.CL 62%

List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs

An Yan, Zhengyuan Yang, Junda Wu, Wanrong Zhu, Jianwei Yang, Linjie Li, Kevin Lin, Jianfeng Wang, Julian McAuley, Jianfeng Gao, Lijuan Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments published at COLM-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10221 2025-01-13 cs.CV cs.AI cs.CL 62%

Long Story Short: Story-level Video Understanding from 20K Short Films

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04155 2025-01-09 cs.CV cs.CL cs.LG 62%

MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation

Siddharth Joshi, Besmira Nushi, Vidhisha Balachandran, Varun Chandrasekaran, Vibhav Vineet, Neel Joshi, Baharan Mirzasoleiman

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11780 2024-12-19 cs.CL cs.AI 62%

SwitchCIT: Switching for Continual Instruction Tuning

Xinbo Wu, Max Hartman, Vidhata Arjun Jayaraman, Lav R. Varshney

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12952 2024-12-12 cs.CV cs.AI cs.LG 62%

Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models

Elaine Sui, Xiaohan Wang, Serena Yeung-Levy

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00083 2024-12-09 cs.LG cs.AI cs.CV stat.AP 62%

Visual Error Patterns in Multi-Modal AI: A Statistical Approach

Ching-Yi Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17788 2024-12-03 cs.CV cs.AI cs.LG 62%

Geometric Point Attention Transformer for 3D Shape Reassembly

Jiahan Li, Chaoran Cheng, Jianzhu Ma, Ge Liu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14690 2024-10-22 cs.LG cs.AI cs.CV 62%

Rethinking VLMs and LLMs for Image Classification

Avi Cooper, Keizo Kato, Chia-Hsien Shih, Hiroaki Yamane, Kasper Vinken, Kentaro Takemoto, Taro Sunagawa, Hao-Wei Yeh, Jin Yamanaka, Ian Mason, Xavier Boix

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00274 2024-10-03 cs.HC cs.AI cs.CL cs.ET 62%

Social Conjuring: Multi-User Runtime Collaboration with AI in Building Virtual 3D Worlds

Amina Kobenova, Cyan DeVeaux, Samyak Parajuli, Andrzej Banburski-Fahey, Judith Amores Fernandez, Jaron Lanier

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 27 pages + Appendix, 16 figures; fixed some minor UTF-8 encoding issues in arXiv compilation

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18286 2024-09-30 cs.CV cs.AI cs.CL 62%

Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing

Huthaifa I. Ashqar, Ahmed Jaber, Taqwa I. Alhadidi, Mohammed Elhenawy

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09039 2024-09-17 cs.LG cs.AI cs.CV 62%

AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding

Zihan Huang, Tao Wu, Wang Lin, Shengyu Zhang, Jingyuan Chen, Fei Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04952 2024-08-30 cs.CL cs.AI 62%

Quantifying Geospatial in the Common Crawl Corpus

Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted as a poster to ACM SIGSPATIAL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11788 2024-08-22 cs.AI cs.CL cs.CV cs.SE 62%

DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework

Zhifei Xie, Daniel Tang, Dingwei Tan, Jacques Klein, Tegawend F. Bissyand, Saad Ezzini

专题命中 视觉空间推理 :CoT(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04482 2024-08-09 cs.CV cs.AI cs.LG cs.RO 62%

SegXAL: Explainable Active Learning for Semantic Segmentation in Driving Scene Scenarios

Sriram Mandalika, Athira Nambiar

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 7 figures. To appear in the proceedings of the 27th International Conference on Pattern Recognition (ICPR), 01-05 December, 2024, Kolkata, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16364 2024-08-06 cs.CL cs.LG cs.MM 62%

Where Do We Go from Here? Multi-scale Allocentric Relational Inference from Natural Spatial Descriptions

Tzuf Paz-Argaman, Sayali Kulkarni, John Palowitch, Jason Baldridge, Reut Tsarfaty

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Journal ref EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15941 2024-07-09 cs.RO cs.AI cs.CV cs.LG 62%

Explore until Confident: Efficient Exploration for Embodied Question Answering

Allen Z. Ren, Jaden Clark, Anushri Dixit, Masha Itkina, Anirudha Majumdar, Dorsa Sadigh

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Robotics: Science and Systems (RSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19967 2024-07-01 cs.CL cs.AI 62%

Into the Unknown: Generating Geospatial Descriptions for New Environments

Tzuf Paz-Argaman, John Palowitch, Sayali Kulkarni, Reut Tsarfaty, Jason Baldridge

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11069 2024-06-18 cs.CV cs.AI cs.CL 62%

WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences

Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments link: https://hf.co/spaces/WildVision/vision-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09455 2024-06-17 cs.CV cs.AI cs.CL 62%

Pandora: Towards General World Model with Natural Language Actions and Video States

Jiannan Xiang, Guangyi Liu, Yi Gu, Qiyue Gao, Yuting Ning, Yuheng Zha, Zeyu Feng, Tianhua Tao, Shibo Hao, Yemin Shi, Zhengzhong Liu, Eric P. Xing, Zhiting Hu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Website: https://world-model.maitrix.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17272 2024-06-07 cs.LG cs.AI 62%

DPN: Decoupling Partition and Navigation for Neural Solvers of Min-max Vehicle Routing Problems

Zhi Zheng, Shunyu Yao, Zhenkun Wang, Xialiang Tong, Mingxuan Yuan, Ke Tang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01031 2024-05-28 cs.CL cs.AI 62%

Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks

Fakhraddin Alwajih, El Moatez Billah Nagoudi, Gagan Bhatia, Abdelrahman Mohamed, Muhammad Abdul-Mageed

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00876 2024-05-03 cs.CV cs.AI cs.LG 62%

Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis

Prateek Verma, Minh-Hao Van, Xintao Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03480 2024-04-16 cs.RO cs.AI cs.CL 62%

Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration for Zero-Shot Object Navigation

Vishnu Sashank Dorbala, James F. Mullen, Dinesh Manocha

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 10 pages

Journal ref IEEE Robotics and Automation Letters 9.5 (2024) 4083-4090

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14178 2024-04-01 cs.CL cs.CV cs.LG 62%

mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality

Qinghao Ye, Haiyang Xu, Guohai Xu, Jiabo Ye, Ming Yan, Yiyang Zhou, Junyang Wang, Anwen Hu, Pengcheng Shi, Yaya Shi, Chenliang Li, Yuanhong Xu, Hehong Chen, Junfeng Tian, Qi Qian, Ji Zhang, Fei Huang, Jingren Zhou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Working in Process

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12921 2024-03-15 cs.LG cs.AI 62%

Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Juan Rocamonde, Victoriano Montesinos, Elvis Nava, Ethan Perez, David Lindner

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Presented at International Conference on Learning Representations (ICLR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03170 2024-03-12 cs.MM cs.AI cs.CL cs.CV cs.CY 62%

SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection

Peng Qi, Zehong Yan, Wynne Hsu, Mong Li Lee

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments To appear in CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11971 2024-03-04 cs.CV cs.CL cs.LG cs.MM 62%

EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE

Junyi Chen, Longteng Guo, Jia Sun, Shuai Shao, Zehuan Yuan, Liang Lin, Dongyu Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05188 2024-02-09 cs.RO cs.AI cs.CL 62%

InCoRo: In-Context Learning for Robotics Control with Feedback Loops

Jiaqiang Ye Zhu, Carla Gomez Cano, David Vazquez Bermudez, Michal Drozdzal

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17600 2024-02-01 cs.CL cs.AI cs.CV 62%

Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data

Chenhui Zhang, Sherrie Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 62 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06082 2024-01-25 cs.AI cs.CL cs.CV 62%

VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View

Raphael Schumann, Wanrong Zhu, Weixi Feng, Tsu-Jui Fu, Stefan Riezler, William Yang Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏