arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3396 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3396 篇

2412.03735 2025-04-02 cs.CV 50%

VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding

Chaoyu Li, Eun Woo Im, Pooyan Fazli

专题命中 视觉空间推理 :reasoning(abstract)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07135 2025-03-31 cs.RO cs.CV 50%

VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation

Hanzhi Chen, Boyang Sun, Anran Zhang, Marc Pollefeys, Stefan Leutenegger

机构 * Technical University of Munich(慕尼黑工业大学) ETH Zürich(苏黎世联邦理工学院) Microsoft(微软公司)

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20682 2025-03-27 cs.CV 50%

GLRD: Global-Local Collaborative Reason and Debate with PSL for 3D Open-Vocabulary Detection

Xingyu Peng, Si Liu, Chen Gao, Yan Bai, Beipeng Mu, Xiaofei Wang, Huaxia Xia

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Meituan(美团)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20382 2025-03-27 cs.CV 50%

RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task

Chunshan Li, Rong Wang, Xiaofei Yang, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Communication Engineering, Guangzhou University(广州大学电子与通信工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20020 2025-03-27 cs.RO 50%

Gemini Robotics: Bringing AI into the Physical World

Gemini Robotics Team, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Montserrat Gonzalez Arenas, Travis Armstrong, Ashwin Balakrishna, Robert Baruch, Maria Bauza, Michiel Blokzijl, Steven Bohez, Konstantinos Bousmalis, Anthony Brohan, Thomas Buschmann, Arunkumar Byravan, Serkan Cabi, Ken Caluwaerts, Federico Casarini, Oscar Chang, Jose Enrique Chen, Xi Chen, Hao-Tien Lewis Chiang, Krzysztof Choromanski, David D'Ambrosio, Sudeep Dasari, Todor Davchev, Coline Devin, Norman Di Palo, Tianli Ding, Adil Dostmohamed, Danny Driess, Yilun Du, Debidatta Dwibedi, Michael Elabd, Claudio Fantacci, Cody Fong, Erik Frey, Chuyuan Fu, Marissa Giustina, Keerthana Gopalakrishnan, Laura Graesser, Leonard Hasenclever, Nicolas Heess, Brandon Hernaez, Alexander Herzog, R. Alex Hofer, Jan Humplik, Atil Iscen, Mithun George Jacob, Deepali Jain, Ryan Julian, Dmitry Kalashnikov, M. Emre Karagozler, Stefani Karp, Chase Kew, Jerad Kirkland, Sean Kirmani, Yuheng Kuang, Thomas Lampe, Antoine Laurens, Isabel Leal, Alex X. Lee, Tsang-Wei Edward Lee, Jacky Liang, Yixin Lin, Sharath Maddineni, Anirudha Majumdar, Assaf Hurwitz Michaely, Robert Moreno, Michael Neunert, Francesco Nori, Carolina Parada, Emilio Parisotto, Peter Pastor, Acorn Pooley, Kanishka Rao, Krista Reymann, Dorsa Sadigh, Stefano Saliceti, Pannag Sanketi, Pierre Sermanet, Dhruv Shah, Mohit Sharma, Kathryn Shea, Charles Shu, Vikas Sindhwani, Sumeet Singh, Radu Soricut, Jost Tobias Springenberg, Rachel Sterneck, Razvan Surdulescu, Jie Tan, Jonathan Tompson, Vincent Vanhoucke, Jake Varley, Grace Vesom, Giulia Vezzani, Oriol Vinyals, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Fei Xia, Ted Xiao, Annie Xie, Jinyu Xie, Peng Xu, Sichun Xu, Ying Xu, Zhuo Xu, Yuxiang Yang, Rui Yao, Sergey Yaroshenko, Wenhao Yu, Wentao Yuan, Jingwei Zhang, Tingnan Zhang, Allan Zhou, Yuxiang Zhou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18746 2025-03-25 cs.CV 50%

Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition

Yifei Zhang, Chang Liu, Jin Wei, Xiaomeng Yang, Yu Zhou, Can Ma, Xiangyang Ji

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) College of Computer Science, Nankai University(南开大学计算机学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Tsinghua University(清华大学) Lenovo Research(联想研究院) College of Engineering, Northeastern University(东北大学工学院)

专题命中 视觉空间推理 :reasoning(abstract)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09006 2025-03-25 cs.HC 50%

From Interaction to Impact: Towards Safer AI Agents Through Understanding and Evaluating Mobile UI Operation Impacts

Zhuohao Jerry Zhang, Eldon Schoop, Jeffrey Nichols, Anuj Mahajan, Amanda Swearngin

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07411 2025-03-24 cs.CV cs.MM 50%

EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering

Sheng Zhou, Junbin Xiao, Qingyun Li, Yicong Li, Xun Yang, Dan Guo, Meng Wang, Tat-Seng Chua, Angela Yao

机构 * Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15091 2025-03-20 cs.RO cs.CV 50%

Intelligent Spatial Perception by Building Hierarchical 3D Scene Graphs for Indoor Scenarios with the Help of LLMs

Yao Cheng, Zhe Han, Fengyang Jiang, Huaizhen Wang, Fengyu Zhou, Qingshan Yin, Lei Wei

机构 * Shandong New Generation Information Industrial Technology Research Institute(山东省新一代信息技术产业技术研究院) Inspur Intelligent Terminal Co., Ltd.(浪潮智能终端有限公司) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 视觉空间推理 :planning(abstract)

Comments accepted by WRC SARA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11989 2025-03-20 cs.RO 50%

Dynamic Open-Vocabulary 3D Scene Graphs for Long-term Language-Guided Mobile Manipulation

Zhijie Yan, Shufei Li, Zuoxu Wang, Lixiu Wu, Han Wang, Jun Zhu, Lijiang Chen, Jihong Liu

机构 * Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Minzu University of China(中央民族大学) Afanti Tech LLC(阿凡提科技有限公司)

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted by IEEE Robotics and Automation Letters (RA-L), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13642 2025-03-20 cs.SE 50%

A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion

Md Nakhla Rafi, Dong Jae Kim, Tse-Hsun Chen, Shaowei Wang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14304 2025-03-19 eess.IV cs.CV 50%

RoMedFormer: A Rotary-Embedding Transformer Foundation Model for 3D Genito-Pelvic Structure Segmentation in MRI and CT

Yuheng Li, Mingzhe Hu, Richard L. J. Qiu, Maria Thor, Andre Williams, Deborah Marshall, Xiaofeng Yang

机构 * Emory University(埃默里大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14161 2025-03-19 cs.CV 50%

CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models

Yiqi Zhu, Ziyue Wang, Can Zhang, Peng Li, Yang Liu

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10630 2025-03-19 cs.CV cs.RO 50%

UniGoal: Towards Universal Zero-shot Goal-oriented Navigation

Hang Yin, Xiuwei Xu, Lingqing Zhao, Ziwei Wang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to CVPR 2025. Project page: https://bagh2178.github.io/UniGoal/

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07308 2025-03-18 cs.CV 50%

Counterfactual Vision-and-Language Navigation via Adversarial Path Sampling

Tsu-Jui Fu, Xin Eric Wang, Matthew Peterson, Scott Grafton, Miguel Eckstein, William Yang Wang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉空间推理 :reasoning(abstract)

Comments ECCV'20 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16412 2025-03-18 cs.RO 50%

SARO: Space-Aware Robot System for Terrain Crossing via Vision-Language Model

Shaoting Zhu, Derun Li, Linzhan Mou, Yong Liu, Ningyi Xu, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09758 2025-03-14 cs.RO cs.MA 50%

Multi-Agent LLM Actor-Critic Framework for Social Robot Navigation

Weizheng Wang, Ike Obi, Byung-Cheol Min

机构 * Purdue University(普渡大学)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07933 2025-03-14 cs.CV 50%

From Slices to Sequences: Autoregressive Tracking Transformer for Cohesive and Consistent 3D Lymph Node Detection in CT Scans

Qinji Yu, Yirui Wang, Ke Yan, Dandan Zheng, Dashan Ai, Dazhou Guo, Zhanghexuan Ji, Yanzhou Su, Yun Bian, Na Shen, Xiaowei Ding, Le Lu, Xianghua Ye, Dakai Jin

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩学院) Shanghai Jiao Tong University(上海交通大学) The First Affiliated Hospital of Zhejiang University(浙江大学医学院附属第一医院) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院) Changhai Hospital(长海医院) Zhongshan Hospital, Fudan University(复旦大学中山医院)

专题命中 视觉空间推理 :planning(abstract)

Comments Technical report (11 pages plus supplementary)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08474 2025-03-12 cs.RO 50%

Collaborative Dynamic 3D Scene Graphs for Open-Vocabulary Urban Scene Understanding

Tim Steinke, Martin Büchner, Niclas Vödisch, Abhinav Valada

机构 * University of Freiburg(弗莱堡大学)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08165 2025-03-12 cs.CV 50%

Multimodal Generation of Animatable 3D Human Models with AvatarForge

Xinhang Liu, Yu-Wing Tai, Chi-Keung Tang

机构 * HKUST(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06219 2025-03-11 cs.CV 50%

VLScene: Vision-Language Guidance Distillation for Camera-Based 3D Semantic Scene Completion

Meng Wang, Huilong Pi, Ruihui Li, Yunchuan Qin, Zhuo Tang, Kenli Li

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accept by AAAI-2025(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13573 2025-03-11 cs.RO 50%

Human-Robot Cooperative Distribution Coupling for Hamiltonian-Constrained Social Navigation

Weizheng Wang, Chao Yu, Yu Wang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :planning(abstract)

Comments ICRA2025

Journal ref ICRA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15505 2025-03-10 cs.RO 50%

Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs

Angelos Mavrogiannis, Dehao Yuan, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04034 2025-03-07 cs.CV 50%

GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding

Xihan Wang, Dianyi Yang, Yu Gao, Yufeng Yue, Yi Yang, Mengyin Fu

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) National Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统全国重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.09715 2025-03-06 cs.CV 50%

ARM3D: Attention-based relation module for indoor 3D object detection

Yuqing Lan, Yao Duan, Chenyi Liu, Chenyang Zhu, Yueshan Xiong, Hui Huang, Kai Xu

专题命中 视觉空间推理 :reasoning(abstract)

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02111 2025-03-05 cs.RO 50%

NavG: Risk-Aware Navigation in Crowded Environments Based on Reinforcement Learning with Guidance Points

Qianyi Zhang, Wentao Luo, Boyi Liu, Ziyang Zhang, Yaoyuan Wang, Jingtai Liu

机构 * Institute of Robotics and Automatic Information System, Nankai University(南开大学机器人与自动信息系统研究所) Huawei 2012 Lab(华为2012实验室)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20041 2025-03-05 cs.CV cs.RO 50%

3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds

Hengshuo Chu, Xiang Deng, Qi Lv, Xiaoyang Chen, Yinchuan Li, Jianye Hao, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11087 2025-03-05 cs.CV 50%

Locality Alignment Improves Vision-Language Models

Ian Covert, Tony Sun, James Zou, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03878 2025-03-04 cs.CV 50%

SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models

Yue Zhang, Zhiyang Xu, Ying Shen, Parisa Kordjamshidi, Lifu Huang

机构 * Michigan State University(密歇根州立大学) Virginia Tech(弗吉尼亚理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05748 2025-02-28 cs.RO 50%

Autonomous Guidewire Navigation for Robot-assisted Endovascular Interventions: A Knowledge-Driven Visual Guidance Approach

Wentao Liu, Weijin Xu, Xiaochuan Li, Bowen Liang, Ziyang He, Mengke Zhu, Jingzhou Song, Huihua Yang, Qingsheng Lu

机构 * Wandong Medical Technology Co., Ltd(万东医疗科技有限公司) Beijing Police College(北京警察学院) School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) Department of Vascular Surgery, Shanghai Changhai Hospital, Naval Medical University(海军军医大学上海长海医院血管外科) Beijing Institute of Satellite Information Engineering(北京卫星信息工程研究所)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏