arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-04 至 2025-11-04 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 10 篇

2511.00054 2025-11-04 cs.LG cs.AI 84%

SpatialTraceGen: High-Fidelity Traces for Efficient VLM Spatial Reasoning Distillation

Gio Huh, Dhruv Sheth, Rayhan Zirvi, Frank Xiao

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01618 2025-11-04 cs.CV cs.CL 79%

Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models

Xiaoyu Zhan, Wenxuan Huang, Hao Sun, Xinyu Fu, Changfeng Ma, Shaosheng Cao, Bohan Jia, Shaohui Lin, Zhenfei Yin, Lei Bai, Wanli Ouyang, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) University of Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12508 2025-11-04 cs.CV cs.AI cs.RO 79%

MindJourney: Test-Time Scaling with World Models for Spatial Reasoning

Yuncong Yang, Jiageng Liu, Zheyuan Zhang, Siyuan Zhou, Reuben Tan, Jianwei Yang, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) JHU(约翰·霍普金斯大学) HKUST(香港科技大学) Microsoft Research(微软研究院) Harvard(哈佛大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments Project Page: https://umass-embodied-agi.github.io/MindJourney

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25760 2025-11-04 cs.CV 78%

Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks

Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, Chenfei Liao, Dingcheng Zhen, Yuanhuiyi Lyu, Yuqian Fu, Bin Ren, Linfeng Zhang, Danda Pani Paudel, Nicu Sebe, Luc Van Gool, Xuming Hu

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00916 2025-11-04 cs.CV 71%

Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs

Yan Shu, Chi Liu, Robin Chen, Derek Li, Bryan Dai

机构 * Ubiquant(乌比量化)

专题命中 视觉空间推理 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05227 2025-11-04 cs.RO cs.CV cs.LG cs.MM cs.SY eess.SY 70%

NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving

Qucheng Peng, Chen Bai, Guoxiang Zhang, Bo Xu, Xiaotong Liu, Xiaoyin Zheng, Chen Chen, Cheng Lu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00933 2025-11-04 cs.RO cs.CV 67%

Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation

Xiangyu Shi, Zerui Li, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, the University of Adelaide(澳大利亚机器学习研究所、阿德莱德大学) CREATE Lab, Swiss Federal Institute of Technology Lausanne (EPFL)(洛桑联邦理工学院CREATE实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00362 2025-11-04 cs.CV cs.AI cs.GR 57%

Oitijjo-3D: Generative AI Framework for Rapid 3D Heritage Reconstruction from Street View Imagery

Momen Khandoker Ope, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Md Rashedul Islam, Jungpil Shin

机构 * University of Rajshahi(拉贾沙希大学) Marshall University(马歇尔大学) University of Aizu(御所大学) University of Asia Pacific(亚洲太平洋大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 6 Pages, 4 figures, 2 Tables, Submitted to ICECTE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00120 2025-11-04 cs.CV cs.AI 57%

VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images

Md Selim Sarowar, Sungho Kim

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments This paper has been accepted to IEIE( The Institute Of Electronics and Information Engineering, South Korea) Fall,2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23603 2025-11-04 cs.CV 50%

PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity

Yuqian Yuan, Wenqiao Zhang, Xin Li, Shihao Wang, Kehan Li, Wentong Li, Jun Xiao, Lei Zhang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云图研究院) Hupan Lab(鸿篇实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏