arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-27 至 2025-11-27 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2509.12718 2025-11-27 cs.CV 82%

EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer

EvoEmpirBench: 基于智能体经验的动态空间推理

Pukun Zhao, Longxiang Wang, Miaowei Wang, Chen Chen, Fanqing Zhou, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东金融学院) Chongqing University(重庆大学) University of Edinburgh(爱丁堡大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 EvoEmpirBench通过动态空间基准评估模型在部分可观测和动态环境下的空间推理与记忆能力,揭示主流模型的限制并提供未来研究平台。

Comments Accepted by AAAI 2026, 29 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20726 2025-11-27 cs.LG cs.AI 62%

Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge

从风险学习:利用先验知识的LLM引导的安全关键场景生成

Yuhang Wang, Heye Huang, Zhenhua Xu, Kailai Sun, Baoshen Guo, Jinhua Zhao

机构 * Chinese Academy of Sciences, China(中国科学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM和CVAE生成安全关键场景的方法,通过知识驱动优化提升自动驾驶系统在罕见高风险事件下的鲁棒性与可控性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 50%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 50%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20784 2025-11-27 cs.CV 50%

One Patch is All You Need: Joint Surface Material Reconstruction and Classification from Minimal Visual Cues

一个补丁就够了:从最小的视觉线索联合表面材料重建与分类

Sindhuja Penchala, Gavin Money, Gabriel Marques, Samuel Wood, Jessica Kirschman, Travis Atkison, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SMARC通过单个补丁实现表面材料重建与分类,以应对稀疏视觉输入下的挑战,取得最佳性能。

Comments 9 pages,3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏