arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-12 至 2025-12-12 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2505.13886 2025-12-12 cs.CL 79%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10927 2025-12-12 cs.CV 78%

FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos

FoundationMotion: 自动标注与视频中空间运动的推理

Yulu Gan, Ligeng Zhu, Dandan Shan, Baifeng Shi, Hongxu Yin, Boris Ivanovic, Song Han, Trevor Darrell, Jitendra Malik, Marco Pavone, Boyi Li

机构 * MIT(麻省理工学院) NVIDIA(英伟达) UMich(密歇根大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 FoundationMotion通过自动数据整理管道生成大规模细粒度运动数据集,提升开源模型在运动理解与空间推理任务中的性能。

Comments Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08511 2025-12-12 cs.CV 75%

Thinking with Images via Self-Calling Agent

通过自我调用代理进行图像思考

Wenxi Yang, Yuzhong Zhao, Fang Wan, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出sCoT范式,通过自我调用代理实现无需多模态交错的高效视觉推理,实验显示其在HR-Bench 4K上性能提升达1.9%且训练效率提高75%。

Comments Code is available at https://github.com/YWenxi/think-with-images-through-self-calling

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10956 2025-12-12 cs.CV 50%

Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision

通过立体视觉和中等层次视觉增强动态城市导航

Wentao Zhou, Xuweiyi Chen, Vignesh Rajagopal, Jeffrey Chen, Rohan Chandra, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出StereoWalker,通过引入立体视觉和中等层次视觉模块,提升动态城市导航性能,仅用1.5%数据即可达到先进水平。

Comments Project Page: https://www.cs.virginia.edu/~tsx4zn/stereowalk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09583 2025-12-12 cs.CV 50%

UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision

UnReflectAnything:通过渲染合成镜面监督实现仅RGB的高光去除

Alberto Rota, Mert Kiray, Mert Asim Karaoglu, Patrick Ruhkamp, Elena De Momi, Nassir Navab, Benjamin Busam

机构 * Politecnico di Milano(米兰理工学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ImFusion(ImFusion公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 UnReflectAnything通过渲染合成镜面监督,实现仅RGB图像的高光去除,适用于自然和手术领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02427 2025-12-12 cs.CV cs.RO 50%

From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics

从实验室到现实应用:评估边缘设备上用于移动机器人的零样本场景解读

Nicolas Schuler, Lea Dewald, Nick Baldig, Jürgen Graf

机构 * Laboratories for Cognitive Systems and Robotics(认知系统与机器人实验室) University of Luxembourg(卢森堡大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文评估了适用于移动机器人边缘设备的小型视觉语言模型在零样本场景解读任务中的性能与应用潜力。

Comments 15 pages, 6 figures, 1 table; accepted for AI-2025 Forty-fifth SGAI International Conference on Artificial Intelligence CAMBRIDGE, ENGLAND 16-18 DECEMBER 2025

Journal ref Artificial Intelligence XLII. SGAI-AI 2025. Lecture Notes in Computer Science, vol 16302. Springer, Cham (2026), pp 301-315

详情

展开后加载摘要…

URL PDF HTML 收藏