arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-23 至 2025-12-23 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 11 篇

2512.07276 2025-12-23 cs.CV 82%

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现

Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。

Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 70%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15178 2025-12-23 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

GUIDEd Agents: Enhancing Navigation Policies through Task-Specific Uncertainty Abstraction in Localization-Limited Environments

GUIDEd Agents: 通过在定位受限环境中任务特定的不确定性抽象增强导航策略

Gokul Puthumanaillam, Paulo Padrao, Jose Fuentes, Leonardo Bobadilla, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Providence College(普罗维登斯学院) Florida International University(佛罗里达国际大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 GUIDE通过任务特定不确定性抽象提升机器人在定位受限环境中的导航策略,实现任务完成与不确定性管理的平衡。

Comments Accepted for publication at RAL (Robotics and automation letters). Updated with the final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 57%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06118 2025-12-23 cs.CV cs.AI 57%

ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling

ViGoR:通过细粒度奖励建模提升大视觉语言模型的视觉 grounding

Siming Yan, Min Bai, Weifeng Chen, Xiong Zhou, Qixing Huang, Li Erran Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AWS AI(AWS人工智能)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 ViGoR通过细粒度奖励建模提升大视觉语言模型的视觉 grounding 能力,采用更经济的人类评估和自动化方法,有效提高视觉推理准确性。

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17953 2025-12-23 cs.CV cs.AI 57%

Seeing Beyond the Scene: Analyzing and Mitigating Background Bias in Action Recognition

超越场景:分析和缓解动作识别中的背景偏见

Ellie Zhou, Jihoon Chung, Olga Russakovsky

机构 * Westmont High School(韦斯蒙特高中) Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了动作识别中背景偏见的问题,并提出缓解策略,通过输入分割和提示调优降低背景偏见,提升模型对人类动作的识别能力。

Comments Accepted to NeurIPS 2025 Workshops: SPACE in Vision, Language, and Embodied AI; and What Makes a Good Video: Next Practices in Video Generation and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18684 2025-12-23 cs.CV 50%

A Study of Finetuning Video Transformers for Multi-view Geometry Tasks

对多视角几何任务进行视频变换器微调的研究

Huimin Wu, Kwang-Ting Cheng, Stephen Lin, Zhirong Wu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文通过微调视频基础模型,提出了一种简单有效的方法,实现了多视角几何任务如光流估计的高性能表现。

Comments AAAI 20206, Project website: geovit-aaai26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08930 2025-12-23 cs.CV cs.GR 50%

Selfi: Self Improving Reconstruction Engine via 3D Geometric Feature Alignment

Selfi: 通过3D几何特征对齐实现自改进的重建引擎

Youming Deng, Songyou Peng, Junyi Zhang, Kathryn Heal, Tiancheng Sun, John Flynn, Steve Marschner, Lucy Chai

机构 * Cornell University(康奈尔大学) Google(谷歌) UC Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Selfi通过特征对齐提升3D重建精度,利用VGGT输出作为伪地面真实值,实现NVS和姿态估计的高性能表现。

Comments Project Page: https://denghilbert.github.io/selfi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18448 2025-12-23 cs.CV 50%

Object-Centric Framework for Video Moment Retrieval

面向视频时刻检索的对象中心框架

Zongyao Li, Yongkang Wong, Satoshi Yamazaki, Jianquan Liu, Mohan Kankanhalli

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出面向对象的视频时刻检索框架,通过场景图解析和关系跟踪器变压器,提升对对象层面语义和动态的建模能力,从而在多个基准上取得更优性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 50%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05769 2025-12-23 cs.CV 50%

Digital Twin Buildings: 3D Modeling, GIS Integration, and Visual Descriptions Using Gaussian Splatting, ChatGPT/Deepseek, and Google Maps Platform

数字孪生建筑:利用高斯点扩散、ChatGPT/DeepSeek和Google地图平台进行3D建模、GIS集成和视觉描述

Kyle Gao, Dening Lu, Liangzhi Li, Nan Chen, Hongjie He, Linlin Xu, Jonathan Li

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于高斯点扩散、ChatGPT和Google地图平台的数字孪生建筑框架,用于实现建筑的3D建模、GIS集成和视觉描述。

Comments -Fixed minor typo

Journal ref IEEE Geoscience and Remote Sensing Letters 22 (2025) 6013405

详情

展开后加载摘要…

URL PDF HTML 收藏