arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3396 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3396 篇

2408.05075 2025-02-24 cs.CV 50%

DeepInteraction++: Multi-Modality Interaction for Autonomous Driving

Zeyu Yang, Nan Song, Wei Li, Xiatian Zhu, Li Zhang, Philip H. S. Torr

机构 * Nanyang Technological University(南洋理工大学) University of Surrey(萨里大学) University of Oxford(牛津大学)

专题命中 视觉空间推理 :planning(abstract)

Comments Journal extension of NeurIPS 2022. arXiv admin note: text overlap with arXiv:2208.11112

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18295 2025-02-19 cs.CV 50%

Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention

Weitai Kang, Mengxue Qu, Jyoti Kini, Yunchao Wei, Mubarak Shah, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Beijing Jiaotong University(北京交通大学) University of Central Florida(中佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13785 2025-02-18 cs.CV 50%

A Spatiotemporal Approach to Tri-Perspective Representation for 3D Semantic Occupancy Prediction

Sathira Silva, Savindu Bhashitha Wannigama, Gihan Jayatilaka, Muhammad Haris Khan, Roshan Ragel

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to the 2025 Workshop on Machine Learning for Autonomous Driving at AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02863 2025-02-12 cs.SE 50%

Beyond Pass or Fail: Multi-Dimensional Benchmarking of Foundation Models for Goal-based Mobile UI Navigation

Dezhi Ran, Mengzhou Wu, Hao Yu, Yuetong Li, Jun Ren, Yuan Cao, Xia Zeng, Haochuan Lu, Zexin Xu, Mengqian Xu, Ting Su, Liangchao Yao, Ting Xiong, Wei Yang, Yuetang Deng, Assaf Marron, David Harel, Tao Xie

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05396 2025-02-11 eess.IV cs.CV 50%

A Novel Convolutional-Free Method for 3D Medical Imaging Segmentation

Canxuan Gang

机构 * AI Geeks

专题命中 视觉空间推理 :planning(abstract)

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20551 2025-02-10 cs.RO 50%

UniAff: A Unified Representation of Affordances for Tool Usage and Articulation with Vision-Language Models

Qiaojun Yu, Siyuan Huang, Xibin Yuan, Zhengkai Jiang, Ce Hao, Xin Li, Haonan Chang, Junbo Wang, Liu Liu, Hongsheng Li, Peng Gao, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Rutgers University(罗格斯大学) Hefei University of Technology(合肥工业大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19457 2025-02-10 cs.RO 50%

A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping

Houjian Yu, Mingen Li, Alireza Rezazadeh, Yang Yang, Changhyun Choi

机构 * Univ. of Minnesota(明尼苏达大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted for ICRA 2025. Project page: https://sites.google.com/umn.edu/etog-etrg/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18594 2025-01-31 cs.CV 50%

Foundational Models for 3D Point Clouds: A Survey and Outlook

Vishal Thengane, Xiatian Zhu, Salim Bouzerdoum, Son Lam Phung, Yunpeng Li

机构 * University of Surrey(萨里大学) University of Wollongong(卧龙岗大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Initial submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20631 2025-01-28 cs.CV 50%

Slow Perception: Let's Perceive Geometric Figures Step-by-step

Haoran Wei, Youyang Yin, Yumeng Li, Jia Wang, Liang Zhao, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11327 2025-01-24 cs.CV 50%

ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension

Tianren Ma, Lingxi Xie, Yunjie Tian, Boyu Yang, Qixiang Ye

机构 * CMRI

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR 2025. Code is available at github.com/martian422/ClawMachine

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10733 2025-01-23 cs.CV 50%

A CNN-Transformer for Classification of Longitudinal 3D MRI Images -- A Case Study on Hepatocellular Carcinoma Prediction

Jakob Nolte, Maureen M. J. Guichelaar, Donald E. Bouman, Stephanie M. van den Berg, Maryam Amir Haeri

专题命中 视觉空间推理 :planning(abstract)

Comments Submitted for publication to Biomedical Signal Processing and Control; Incorrect notation corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12128 2025-01-22 cs.RO cs.HC 50%

Evaluating Efficiency and Engagement in Scripted and LLM-Enhanced Human-Robot Interactions

Tim Schreiter, Jens V. Rüppel, Rishi Hazra, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

机构 * Technical University of Munich(慕尼黑工业大学) Chemnitz University of Technology(Chemnitz工业大学) Örebro University(厄勒布鲁大学) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted as a Late-Breaking Report to the 2025, 20th ACM/IEEE International Conference on Human-Robot Interaction (HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09624 2025-01-22 cs.CV cs.RO 50%

GenEx: Generating an Explorable World

Taiming Lu, Tianmin Shu, Junfei Xiao, Luoxin Ye, Jiahao Wang, Cheng Peng, Chen Wei, Daniel Khashabi, Rama Chellappa, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视觉空间推理 :planning(abstract)

Comments Website: GenEx.world

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09167 2025-01-17 cs.CV cs.RO 50%

Embodied Scene Understanding for Vision Language Models via MetaVQA

Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract)

Comments for the project webpage, see https://metadriverse.github.io/metavqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06946 2025-01-14 cs.RO 50%

Learning Implicit Social Navigation Behavior using Deep Inverse Reinforcement Learning

Tribhi Kathuria, Ke Liu, Junwoo Jang, X. Jessie Yang, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 8 pages, Submitted to IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11210 2025-01-13 cs.CV 50%

ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction

Yi Feng, Yu Han, Xijing Zhang, Tanghui Li, Yanting Zhang, Rui Fan

机构 * Tongji University(同济大学) Donghua University(东华大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments accepted to AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11559 2025-01-10 cs.CV 50%

Semi-supervised 3D Semantic Scene Completion with 2D Vision Foundation Model Guidance

Duc-Hai Pham, Duc-Dung Nguyen, Anh Pham, Tuan Ho, Phong Nguyen, Khoi Nguyen, Rang Nguyen

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted at AAAI2025. Project Page: https://vinairesearch.github.io/SemiSSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20742 2024-12-31 cs.CV 50%

UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models

Yujie Li, Wenjia Xu, Guangzuo Li, Zijian Yu, Zhiwei Wei, Jiuniu Wang, Mugen Peng

专题命中 视觉空间推理 :reasoning(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20233 2024-12-31 cs.MA 50%

Decentralized Unlabeled Multi-Agent Navigation in Continuous Space

Stepan Dergachev, Konstantin Yakovlev

专题命中 视觉空间推理 :planning(abstract)

Comments This is a pre-print of the paper accepted to ICR 2024. It contains 16 pages, 5 figures, 1 table

Journal ref In: International conference on interactive collaborative robotics. pp. 186-200. Springer (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19920 2024-12-31 cs.CV 50%

Not all Views are Created Equal: Analyzing Viewpoint Instabilities in Vision Foundation Models

Mateusz Michalkiewicz, Sheena Bai, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

专题命中 视觉空间推理 :reasoning(abstract)

Comments 8 pages + 3 pages of references. 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05985 2024-12-30 cs.RO 50%

Topo-Field: Topometric mapping with Brain-inspired Hierarchical Layout-Object-Position Fields

Jiawei Hou, Wenhao Guan, Longfei Liang, Jianfeng Feng, Xiangyang Xue, Taiping Zeng

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16418 2024-12-24 cs.CV 50%

Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities

Huan Liu, Lingyu Xiao, Jiangjiang Liu, Xiaofan Li, Ze Feng, Sen Yang, Jingdong Wang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01644 2024-12-24 cs.HC 50%

InsightLens: Augmenting LLM-Powered Data Analysis with Interactive Insight Management and Navigation

Luoxuan Weng, Xingbo Wang, Junyu Lu, Yingchaojie Feng, Yihan Liu, Haozhe Feng, Danqing Huang, Wei Chen

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to IEEE TVCG (PacificVis 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00220 2024-12-24 cs.CV 50%

A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering

Xiaofei Huang, Hongfang Gong

专题命中 视觉空间推理 :reasoning(abstract)

Journal ref IEEE Transactions on Medical Imaging, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12502 2024-12-18 cs.CV 50%

Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues

Yan Zhang, Gangyan Zeng, Huawen Shen, Daiqing Wu, Yu Zhou, Can Ma

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06442 2024-12-13 cs.CV cs.RO 50%

QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding

Yash Mehan, Kumaraditya Gupta, Rohit Jayanti, Anirudh Govil, Sourav Garg, Madhava Krishna

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) as Oral Presentation. Also presented at the 2nd Workshop on Open-Vocabulary 3D Scene Understanding (OpenSUN3D) at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08859 2024-12-13 cs.CV 50%

ViUniT: Visual Unit Tests for More Robust Visual Programming

Artemis Panagopoulou, Honglu Zhou, Silvio Savarese, Caiming Xiong, Chris Callison-Burch, Mark Yatskar, Juan Carlos Niebles

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07518 2024-12-11 cs.CV 50%

Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios

Jiaqi Fan, Jianhua Wu, Hongqing Chu, Quanbo Ge, Bingzhao Gao

专题命中 视觉空间推理 :chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10799 2024-12-10 cs.CV 50%

Towards Foundation Models for 3D Vision: How Close Are We?

Yiming Zuo, Karhan Kayan, Maggie Wang, Kevin Jeon, Jia Deng, Thomas L. Griffiths

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05526 2024-12-09 cs.RO 50%

Benchmarking Neural Radiance Fields for Autonomous Robots: An Overview

Yuhang Ming, Xingrui Yang, Weihan Wang, Zheng Chen, Jinglun Feng, Yifan Xing, Guofeng Zhang

专题命中 视觉空间推理 :planning(abstract)

Comments 32 pages, 5 figures, 8 tables

Journal ref Engineering Applications of Artificial Intelligence, Volume 140, 15 January 2025, 109685

详情

展开后加载摘要…

URL PDF HTML 收藏