arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-11 至 2025-12-11 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2512.09251 2025-12-11 cs.CV cs.AI 79%

GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model

GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理

Lalit Maurya, Saurabh Kaushik, Beth Tellman

机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09215 2025-12-11 cs.CV 78%

View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs

视图-图:通过场景图上的视觉-语言推理实现零样本3D视觉定位

Yuanyuan Liu, Haiyang Mei, Dongyang Zhan, Jiayue Zhao, Dongsheng Zhou, Bo Dong, Xin Yang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出视图-图方法,通过场景图上的视觉-语言推理实现零样本3D视觉定位,有效解决空间语义关系处理难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09619 2025-12-11 cs.RO 50%

GLaD: Geometric Latent Distillation for Vision-Language-Action Models

GLaD:面向视觉-语言-动作模型的几何潜在蒸馏

Minghao Guo, Meng Cao, Jiachen Tao, Rongtao Xu, Yan Yan, Xiaodan Liang, Ivan Laptev, Xiaojun Chang

机构 * MBZUAI University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GLaD通过引入几何意识的预训练机制,提升了视觉-语言-动作模型的空间推理和策略泛化能力,无需依赖深度传感器或3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09364 2025-12-11 cs.CV 50%

ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation

ASSIST-3D: 为无类别3D实例分割适应的场景合成

Shengchao Zhou, Jiehong Lin, Jiahui Liu, Shizhen Zhao, Chirui Chang, Xiaojuan Qi

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ASSIST-3D通过异构对象选择、场景布局生成和点云构建,提升无类别3D实例分割的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00718 2025-12-11 cs.CV 50%

VFM-ISRefiner: Towards Better Adapting Vision Foundation Models for Interactive Segmentation of Remote Sensing Images

VFM-ISRefiner: 向更适应交互分割遥感图像的视觉基础模型迈进

Deliang Wang, Peng Liu, Yan Ma, Rongkai Zhuang, Lajiao Chen, Bing Li, Yi Zeng

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Information Science and Technology, Beijing Forestry University(北京林业大学信息科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VFM-ISRefiner提出了一种基于点击的交互分割框架,通过适配器调优和混合注意力机制提升遥感图像分割的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏