arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2506.15677 2025-07-31 cs.AI cs.CL cs.CV cs.MM cs.RO 73%

Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence

Yining Hong, Rui Sun, Bingxuan Li, Xingcheng Yao, Maxine Wu, Alexander Chien, Da Yin, Ying Nian Wu, Zhecan James Wang, Kai-Wei Chang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18945 2025-07-29 cs.CV cs.AI cs.LG cs.RO 73%

Aether: Geometric-Aware Unified World Modeling

Aether Team, Haoyi Zhu, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Tong He

机构 * USTC Shanghai AI Lab(USTC上海人工智能实验室) SII SJTU(SJTU信息研究所) ZJU FDU(浙江大学福州大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments Project Page: https://aether-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20897 2025-06-24 cs.CV cs.AI cs.CL cs.RO 73%

Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation

Pingrui Zhang, Yifei Su, Pengyuan Wu, Dong An, Li Zhang, Zhigang Wang, Dong Wang, Yan Ding, Bin Zhao, Xuelong Li

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Science and Technology of China(中国科学技术大学) TeleAI, China Telecom Corp Ltd(中国电信TeleAI)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09848 2025-04-15 cs.AI cs.CL 73%

A Survey of Large Language Model-Powered Spatial Intelligence Across Scales: Advances in Embodied Agents, Smart Cities, and Earth Science

Jie Feng, Jinwei Zeng, Qingyue Long, Hongyi Chen, Jie Zhao, Yanxin Xi, Zhilun Zhou, Yuan Yuan, Shengyuan Wang, Qingbin Zeng, Songwei Li, Yunke Zhang, Yuming Lin, Tong Li, Jingtao Ding, Chen Gao, Fengli Xu, Yong Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09819 2025-02-17 cs.CV cs.AI cs.GR cs.LG cs.PL 73%

A Solver-Aided Hierarchical Language for LLM-Driven CAD Design

Benjamin T. Jones, Felix Hähnlein, Zihan Zhang, Maaz Ahmad, Vladimir Kim, Adriana Schulz

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10404 2024-07-30 cs.CV cs.AI cs.LG 73%

LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation

Kibum Kim, Kanghoon Yoon, Jaehyeong Jeon, Yeonjun In, Jinyoung Moon, Donghyun Kim, Chanyoung Park

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 8 pages; CVPR 2024

Journal ref CVPR (2024), 28306-28316

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14562 2024-06-21 cs.CL cs.AI cs.CV 73%

Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities

Sachit Menon, Richard Zemel, Carl Vondrick

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Project website: whiteboard.cs.columbia.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02537 2024-06-05 cs.CL cs.CV cs.LG 73%

TopViewRS: Vision-Language Models as Top-View Spatial Reasoners

Chengzu Li, Caiqi Zhang, Han Zhou, Nigel Collier, Anna Korhonen, Ivan Vulić

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures, 3 tables (21 pages, 4 figures, 15 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02651 2024-05-24 cs.LG cs.AI cs.CV 73%

Vision-Language Models Provide Promptable Representations for Reinforcement Learning

William Chen, Oier Mees, Aviral Kumar, Sergey Levine

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09631 2024-03-15 cs.CV cs.AI cs.CL cs.RO 73%

3D-VLA: A 3D Vision-Language-Action Generative World Model

Haoyu Zhen, Xiaowen Qiu, Peihao Chen, Jincheng Yang, Xin Yan, Yilun Du, Yining Hong, Chuang Gan

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Project page: https://vis-www.cs.umass.edu/3dvla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11854 2024-02-27 cs.LG cs.AI stat.ML 73%

Multimodal Web Navigation with Instruction-Finetuned Foundation Models

Hiroki Furuta, Kuang-Huei Lee, Ofir Nachum, Yutaka Matsuo, Aleksandra Faust, Shixiang Shane Gu, Izzeddin Gur

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments Accepted to ICLR 2024. Website: https://sites.google.com/view/mm-webnav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07872 2024-02-13 cs.RO cs.CL cs.CV cs.LG 73%

PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs

Soroush Nasiriany, Fei Xia, Wenhao Yu, Ted Xiao, Jacky Liang, Ishita Dasgupta, Annie Xie, Danny Driess, Ayzaan Wahid, Zhuo Xu, Quan Vuong, Tingnan Zhang, Tsang-Wei Edward Lee, Kuang-Huei Lee, Peng Xu, Sean Kirmani, Yuke Zhu, Andy Zeng, Karol Hausman, Nicolas Heess, Chelsea Finn, Sergey Levine, Brian Ichter

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07757 2024-02-13 cs.LG cs.AI 73%

Towards an Understanding of Stepwise Inference in Transformers: A Synthetic Graph Navigation Model

Mikail Khona, Maya Okawa, Jan Hula, Rahul Ramesh, Kento Nishi, Robert Dick, Ekdeep Singh Lubana, Hidenori Tanaka

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02777 2024-01-31 cs.CL cs.AI 73%

From LLM to Conversational Agent: A Memory Enhanced Architecture with Fine-Tuning of Large Language Models

Na Liu, Liangyu Chen, Xiaoyu Tian, Wei Zou, Kaijiang Chen, Ming Cui

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03042 2023-12-07 cs.CL cs.AI 73%

Inherent limitations of LLMs regarding spatial information

He Yan, Xinyao Hu, Xiangpeng Wan, Chengyu Huang, Kai Zou, Shiqi Xu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04385 2023-08-04 cs.CV cs.AI cs.CL cs.RO 73%

BEVBert: Multimodal Map Pre-training for Language-guided Navigation

Dong An, Yuankai Qi, Yangguang Li, Yan Huang, Liang Wang, Tieniu Tan, Jing Shao

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments ICCV 2023, project page: https://github.com/MarSaKi/VLN-BEVBert

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21438 2026-08-25 cs.CV cs.MA 新提交 71%

DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning

DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑

Xiujin Liu, Tianyu Yang, Yilun Zhao, Xiangliang Zhang

机构 * University of Michigan(密歇根大学) University of Notre Dame(圣母大学) Yale University(耶鲁大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20720 2026-08-24 cs.CV 新提交 71%

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现

Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua

专题命中 视觉空间推理 :reasoning(title)

AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。

Comments The code and dataset are publicly available. Code: https://github.com/lzlfwow/AffordAny. Dataset: https://modelscope.cn/datasets/lzlfwow/AffordAny

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新 71%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉空间推理 :reasoning(title)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05979 2026-08-11 cs.CV 版本更新 71%

Multi-Year Geospatial Reasoning using Interannually-Consistent Historical Predictions as a Free Input Modality

利用年际一致的历史预测作为免费输入模态的多年地理空间推理

Syed Roshaan Ali Shah, Kasper Bonte, David Bekaert, Kristof Van Tricht, Dieter Wens

机构 * VITO Remote Sensing(VITO遥感公司)

专题命中 视觉空间推理 :reasoning(title)

AI总结 该研究将过往预测和BVL掩码纳入模型,提出CTY嵌入编码器,在540万像素的泛欧数据集上使作物F1提升,纠正召回偏差,为地理空间模型提供低成本方案。

Comments 17 pages, 7 figures Updated abstract to match with arxiv submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04798 2026-08-06 cs.HC 新提交 71%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 视觉空间推理 :reasoning(title)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01954 2026-08-04 cs.CV 新提交 71%

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

StyleForge:基于超图场中反事实推理的室内家具风格生成

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

专题命中 视觉空间推理 :reasoning(title)

AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19340 2026-06-23 cs.RO 新提交 71%

ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

零样本长时程灵巧操作:基于多视图3D接地VLM推理

Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10840 2026-06-16 cs.CV 版本更新 71%

PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning

PoseGAM: 通过几何感知多视图推理实现鲁棒的未见物体姿态估计

Jianqi Chen, Biao Zhang, Xiangjun Tang, Peter Wonka

机构 * KAUST(卡塔尔科技大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 提出PoseGAM,一种基于多视图基础模型的几何感知框架,直接预测未见物体的6D姿态,无需显式匹配,通过点云几何和特征网络整合几何信息,在多个基准上平均AR提升5.1%。

Comments Accepted by CVPR 2026 (Oral). Project page: https://windvchen.github.io/PoseGAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24300 2026-04-28 cs.CV 71%

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理

Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science(香港科学大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))

专题命中 视觉空间推理 :reasoning(title)

AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。

Comments Project Page: https://3dlg-hcvc.github.io/revsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV 71%

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视觉空间推理 :reasoning(title)

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11627 2026-04-14 cs.CV 71%

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs

POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM

Haicheng Wang, Yuan Liu, Yikun Liu, Zhemeng Yu, Zhongyin Zhao, Yangxiu You, Zilin Yu, Le Tian, Xiao Zhou, Jie Zhou, Weidi Xie, Yanfeng Wang

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 视觉空间推理 :reasoning(title)

AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV 71%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视觉空间推理 :reasoning(title)

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03696 2026-04-07 cs.CV 71%

FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning

FunFact:通过因子图推理构建概率性功能3D场景图

Zhengyu Fu, René Zurbrügg, Kaixian Qu, Marc Pollefeys, Marco Hutter, Hermann Blum, Zuria Bauer

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft(微软) University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)

专题命中 视觉空间推理 :reasoning(title)

AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13133 2026-03-27 cs.RO 71%

DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation

DecoVLN:解耦观察、推理与修正以实现视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Bin Wang, Runmin Cong, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 DecoVLN通过优化长期记忆构建和修正策略,提升长周期导航的鲁棒性与稳定性,实验证明其在真实环境中的有效性。

Comments 16 pages, 8 figures, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏