arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2503.17709 2025-03-25 cs.CV cs.AI 57%

GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration

Yuchen Sun, Shanhui Zhao, Tao Yu, Hao Wen, Samith Va, Mengwei Xu, Yuanchun Li, Chongyang Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17142 2025-03-24 cs.CV cs.LG 57%

Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci, Nicola Strisciuglio

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Camera-ready version for CVPR 2025 (with Supp.Mat.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16326 2025-03-21 cs.AI 57%

OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence

Long Yuan, Fengran Mo, Kaiyu Huang, Wenjie Wang, Wangyuxuan Zhai, Xiaoyu Zhu, You Li, Jinan Xu, Jian-Yun Nie

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 15 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01250 2025-03-19 cs.AI 57%

Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent Dialogues

Francesco Taioli, Edoardo Zorzi, Gianni Franchi, Alberto Castellini, Alessandro Farinelli, Marco Cristani, Yiming Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments https://intelligolabs.github.io/CoIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13369 2025-03-18 cs.AI cs.CV cs.HC 57%

Sightation Counts: Leveraging Sighted User Feedback in Building a BLV-aligned Dataset of Diagram Descriptions

Wan Ju Kang, Eunki Kim, Na Min An, Sangryul Kim, Haemin Choi, Ki Hoon Kwak, James Thorne

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 37 pages, 10 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13356 2025-03-18 cs.LG 57%

Agents Play Thousands of 3D Video Games

Zhongwen Xu, Xianliang Wang, Siyi Li, Tao Yu, Liang Wang, Qiang Fu, Wei Yang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06269 2025-03-18 cs.AI 57%

AI's Spatial Intelligence: Evaluating AI's Understanding of Spatial Transformations in PSVT:R and Augmented Reality

Uttamasha Monjoree, Wei Yan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06254 2025-03-17 cs.CR cs.LG 57%

Poisoned-MRAG: Knowledge Poisoning Attacks to Multimodal Retrieval Augmented Generation

Yinuo Liu, Zenghui Yuan, Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun, Neil Zhenqiang Gong

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19419 2025-03-12 cs.CL 57%

KAHANI: Culturally-Nuanced Visual Storytelling Tool for Non-Western Cultures

Hamna, Deepthi Sudharsan, Agrima Seth, Ritvik Budhiraja, Deepika Khullar, Vyshak Jain, Kalika Bali, Aditya Vashistha, Sameer Segal

专题命中 视觉空间推理 :CoT(abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04732 2025-03-12 cs.RO cs.AI 57%

Is the House Ready For Sleeptime? Generating and Evaluating Situational Queries for Embodied Question Answering

Vishnu Sashank Dorbala, Prasoon Goyal, Robinson Piramuthu, Michael Johnston, Reza Ghanadhan, Dinesh Manocha

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06026 2025-03-11 cs.RO cs.AI cs.CV 57%

Zero-Shot Peg Insertion: Identifying Mating Holes and Estimating SE(2) Poses with Vision-Language Models

Masaru Yajima, Kei Ota, Asako Kanezaki, Rei Kawakami

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15648 2025-03-11 cs.RO cs.AI 57%

Unifying Large Language Model and Deep Reinforcement Learning for Human-in-Loop Interactive Socially-aware Navigation

Weizheng Wang, Ike Obi, Aniket Bera, Byung-Cheol Min

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04952 2025-03-10 cs.AI cs.RO 57%

INTENT: Trajectory Prediction Framework with Intention-Guided Contrastive Clustering

Yihong Tang, Wei Ma

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13097 2025-03-07 cs.CV cs.AI 57%

Digital Divides in Scene Recognition: Uncovering Socioeconomic Biases in Deep Learning Systems

Michelle R. Greene, Mariam Josyula, Wentao Si, Jennifer A. Hart

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 28 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13923 2025-03-05 cs.CV cs.CL 57%

Qwen2.5-VL Technical Report

Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, Junyang Lin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15589 2025-03-04 cs.CV cs.LG 57%

Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models

Amir Mohammad Karimi Mamaghan, Samuele Papa, Karl Henrik Johansson, Stefan Bauer, Andrea Dittadi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19750 2025-02-28 cs.LG cs.CV 57%

CirT: Global Subseasonal-to-Seasonal Forecasting with Geometry-inspired Transformer

Yang Liu, Zinan Zheng, Jiashun Cheng, Fugee Tsung, Deli Zhao, Yu Rong, Jia Li

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14044 2025-02-26 cs.CV cs.LG 57%

Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data

Yucheng Shi, Quanzheng Li, Jin Sun, Xiang Li, Ninghao Liu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Accepted by ICLR 2025. Code: https://github.com/sycny/SelfSynthX

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17425 2025-02-25 cs.CV cs.LG 57%

Introducing Visual Perception Token into Multimodal Large Language Model

Runpeng Yu, Xinyin Ma, Xinchao Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16690 2025-02-25 cs.AI 57%

From Text to Space: Mapping Abstract Spatial Models in LLMs during a Grid-World Navigation Task

Nicolas Martorell

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14004 2025-02-20 cs.CV cs.AI 57%

ME-CPT: Multi-Task Enhanced Cross-Temporal Point Transformer for Urban 3D Change Detection

Luqi Zhang, Haiping Wang, Chong Liu, Zhen Dong, Bisheng Yang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11427 2025-02-18 cs.CL cs.CV 57%

Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models

Zikang Liu, Kun Zhou, Wayne Xin Zhao, Dawei Gao, Yaliang Li, Ji-Rong Wen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11913 2025-02-17 cs.AI cs.RO 57%

On-Board Vision-Language Models for Personalized Autonomous Vehicle Motion Control: System Design and Real-World Validation

Can Cui, Zichong Yang, Yupeng Zhou, Juntong Peng, Sung-Yeon Park, Cong Zhang, Yunsheng Ma, Xu Cao, Wenqian Ye, Yiheng Feng, Jitesh Panchal, Lingxi Li, Yaobin Chen, Ziran Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2410.15281

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09587 2025-02-14 cs.LG cs.RO 57%

Rolling Ahead Diffusion for Traffic Scene Simulation

Yunpeng Liu, Matthew Niedoba, William Harvey, Adam Scibior, Berend Zwartsenberg, Frank Wood

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments Accepted to Workshop on Machine Learning for Autonomous Driving at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00708 2025-02-04 cs.CV cs.AI 57%

PhiP-G: Physics-Guided Text-to-3D Compositional Scene Generation

Qixuan Li, Chao Wang, Zongjin He, Yan Peng

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 13 pages.8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16300 2025-01-28 cs.CV cs.AI 57%

Large Models in Dialogue for Active Perception and Anomaly Detection

Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted to International Conference of Pattern Recognition (ICPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09041 2025-01-17 cs.CV cs.CL 57%

Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing

Fan Yuan, Xiaoyuan Fang, Rong Quan, Jing Li, Wei Bi, Xiaogang Xu, Piji Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03879 2025-01-08 cs.CV cs.AI 57%

CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds

Keonwoo Kim, Yeongjae Cho, Taebaek Hwang, Minsoo Jo, Sangdo Han

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03722 2025-01-08 cs.CV cs.AI 57%

Self-adaptive vision-language model for 3D segmentation of pulmonary artery and vein

Xiaotong Guo, Deqian Yang, Dan Wang, Haochen Zhao, Yuan Li, Zhilin Sui, Tao Zhou, Lijun Zhang, Yanda Meng

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03700 2025-01-08 cs.CV cs.AI 57%

AuxDepthNet: Real-Time Monocular 3D Object Detection with Depth-Sensitive Features

Ruochen Zhang, Hyeung-Sik Choi, Dongwook Jung, Phan Huy Nam Anh, Sang-Ki Jeong, Zihao Zhu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏