arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2404.15228 2024-08-27 cs.CV cs.CL 57%

Re-Thinking Inverse Graphics With Large Language Models

Peter Kulits, Haiwen Feng, Weiyang Liu, Victoria Abrevaya, Michael J. Black

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments TMLR camera-ready; 31 pages; project page: https://ig-llm.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10388 2024-08-21 cs.CV cs.CL 57%

Narrowing the Gap between Vision and Action in Navigation

Yue Zhang, Parisa Kordjamshidi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12488 2024-07-24 cs.CV cs.AI 57%

DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM

Yixuan Wu, Yizhou Wang, Shixiang Tang, Wenhao Wu, Tong He, Wanli Ouyang, Philip Torr, Jian Wu

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04699 2024-07-17 cs.CV cs.AI 57%

LaRa: Efficient Large-Baseline Radiance Fields

Anpei Chen, Haofei Xu, Stefano Esposito, Siyu Tang, Andreas Geiger

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Project Page: https://apchenstu.github.io/LaRa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08470 2024-07-12 cs.CV cs.AI 57%

Brain Tumor Segmentation in MRI Images with 3D U-Net and Contextual Transformer

Thien-Qua T. Nguyen, Hieu-Nghia Nguyen, Thanh-Hieu Bui, Thien B. Nguyen-Tat, Vuong M. Ngo

专题命中 视觉空间推理 :CoT(abstract);分类 cs.AI

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00632 2024-07-02 cs.RO cs.CL cs.CV cs.MA 57%

CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations

Pengying Wu, Yao Mu, Kangjie Zhou, Ji Ma, Junting Chen, Chang Liu

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL

Comments Accepted to the RSS 2024 Workshop: GROUND

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18115 2024-06-27 cs.RO cs.AI cs.CV 57%

Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps

Dicong Qiu, Wenzong Ma, Zhenfu Pan, Hui Xiong, Junwei Liang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments Open-vocabulary, Mobile Manipulation, Dynamic Environments, 3D Semantic Maps, Zero-shot, LLMs, VLMs, 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17455 2024-06-17 cs.CV cs.CL 57%

CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers

Dachuan Shi, Chaofan Tao, Anyi Rao, Zhendong Yang, Chun Yuan, Jiaqi Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments ICML 2024. Code: https://github.com/sdc17/CrossGET

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06865 2024-06-12 cs.AI 57%

Eyeballing Combinatorial Problems: A Case Study of Using Multimodal Large Language Models to Solve Traveling Salesman Problems

Mohammed Elhenawy, Ahmed Abdelhay, Taqwa I. Alhadidi, Huthaifa I Ashqar, Shadi Jaradat, Ahmed Jaber, Sebastien Glaser, Andry Rakotonirainy

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04218 2024-06-05 cs.CL 57%

Distortions in Judged Spatial Relations in Large Language Models

Nir Fulman, Abdulkadir Memduhoğlu, Alexander Zipf

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments This manuscript has been accepted for publication in The Professional Geographer

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19586 2024-05-31 cs.CV cs.LG cs.RO 57%

SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation

Junjie Zhang, Chenjia Bai, Haoran He, Wenke Xia, Zhigang Wang, Bin Zhao, Xiu Li, Xuelong Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments ICML 2024. Project page: https://sam-embodied.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10171 2024-05-28 cs.AI cs.CV 57%

AUTONODE: A Neuro-Graphic Self-Learnable Engine for Cognitive GUI Automation

Arkajit Datta, Tushar Verma, Rajat Chawla, Mukunda N. S, Ishaan Bhola

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted in MIPR-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07630 2024-05-28 cs.LG 57%

G-Retriever: Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering

Xiaoxin He, Yijun Tian, Yifei Sun, Nitesh V. Chawla, Thomas Laurent, Yann LeCun, Xavier Bresson, Bryan Hooi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15684 2024-05-27 cs.CV cs.AI 57%

Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models

Yue Zhang, Hehe Fan, Yi Yang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14128 2024-05-27 cs.RO cs.CV cs.LG 57%

Transformers for Image-Goal Navigation

Nikhilanj Pelluri

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments NOTE: This work was submitted as part of a Master's Capstone Project and must be treated as such. This is still an early work in progress and not the final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19838 2024-05-10 cs.CV cs.AI 57%

Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving

Akshay Gopalkrishnan, Ross Greer, Mohan Trivedi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 9 pages, 3 figures, Accepted at CVPR 2024 Vision and Language for Autonomous Driving and Robotics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00962 2024-05-07 cs.CV cs.AI 57%

RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding

Jihan Yang, Runyu Ding, Weipeng Deng, Zhe Wang, Xiaojuan Qi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments To appear in CVPR2024 .project page: https://jihanyang.github.io/projects/RegionPLC

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10586 2024-04-30 cs.CV cs.CL 57%

VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools

Ji Qi, Kaixuan Ji, Jifan Yu, Duokang Wang, Bin Xu, Lei Hou, Juanzi Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03602 2024-04-17 cs.CV cs.CL 57%

A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation

Liuyi Wang, Zongtao He, Jiagui Tang, Ronghao Dang, Naijia Wang, Chengju Liu, Qijun Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments Accepted by IJCAI 2023

Journal ref International Joint Conferences on Artificial Intelligence Organization 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08855 2024-04-16 cs.RO cs.LG 57%

WROOM: An Autonomous Driving Approach for Off-Road Navigation

Dvij Kalaria, Shreya Sharma, Sarthak Bhagat, Haoru Xue, John M. Dolan

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04173 2024-04-08 cs.AR cs.LG 57%

H3DFact: Heterogeneous 3D Integrated CIM for Factorization with Holographic Perceptual Representations

Zishen Wan, Che-Kai Liu, Mohamed Ibrahim, Hanchen Yang, Samuel Spetalnick, Tushar Krishna, Arijit Raychowdhury

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments 2024 Design Automation and Test in Europe (DATE); The first two authors have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02176 2024-04-04 cs.RO cs.AI 57%

Versatile Navigation under Partial Observability via Value-guided Diffusion Policy

Gengyu Zhang, Hao Tang, Yan Yan

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 13 pages, 7 figures, CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19336 2024-03-29 cs.CV cs.AI 57%

IVLMap: Instance-Aware Visual Language Grounding for Consumer Robot Navigation

Jiacui Huang, Hongtao Zhang, Mingbo Zhao, Zhou Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09412 2024-03-29 cs.CV cs.AI cs.RO 57%

OpenGraph: Open-Vocabulary Hierarchical 3D Graph Representation in Large-Scale Outdoor Environments

Yinan Deng, Jiahui Wang, Jingyu Zhao, Xinyu Tian, Guangyan Chen, Yi Yang, Yufeng Yue

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16081 2024-03-27 cs.CV cs.AI 57%

ViT-Lens: Towards Omni-modal Representations

Weixian Lei, Yixiao Ge, Kun Yi, Jianfeng Zhang, Difei Gao, Dylan Sun, Yuying Ge, Ying Shan, Mike Zheng Shou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments This work is a follow-up of arXiv:2308.10185. Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10670 2024-03-26 cs.CL cs.RO 57%

OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models

Yuxuan Kuang, Hai Lin, Meng Jiang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13666 2024-03-21 cs.CL 57%

Grounding Spatial Relations in Text-Only Language Models

Gorka Azkune, Ander Salaberria, Eneko Agirre

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments Accepted in Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08833 2024-03-15 cs.CV cs.AI 57%

TINA: Think, Interaction, and Action Framework for Zero-Shot Vision Language Navigation

Dingbang Li, Wenzhou Chen, Xin Lin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00389 2024-03-04 cs.AI 57%

Multimodality Representation Learning: A Survey on Evolution, Pretraining and Its Applications

Muhammad Arslan Manzoor, Sarah Albarri, Ziting Xian, Zaiqiao Meng, Preslav Nakov, Shangsong Liang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11574 2024-02-20 cs.CV cs.CL 57%

Visual In-Context Learning for Large Vision-Language Models

Yucheng Zhou, Xiang Li, Qianning Wang, Jianbing Shen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏