arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-19 至 2025-12-19 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 11 篇

2512.16561 2025-12-19 cs.CV 85%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16698 2025-12-19 cs.AI cs.CG 79%

Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning

多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Mohammad Nehad Alam, Proma Hossain Progga, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Center for Computational & Data Sciences(计算与数据科学中心) Independent University, Bangladesh(孟加拉国独立大学) Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。

Comments Accepted to the ARR October 2025 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI 79%

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 78%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16461 2025-12-19 cs.CV cs.RO 78%

SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning

SNOW:基于世界知识的时空场景理解用于开放世界具身推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 78%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 62%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 62%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16755 2025-12-19 cs.AI 57%

CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?

CitySeeker: VLMS如何通过隐含人类需求探索具身城市导航

Siqi Wang, Chao Liang, Yunfan Gao, Erxin Yu, Sen Li, Yushi Li, Jing Li, Haofen Wang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Tongji University(同济大学) Nanjing Institute of Geography and Limnology, Chinese Academy of Sciences(中国科学院南京地理与湖泊研究所) Research Centre for Data Science & Artificial Intelligence(数据科学与人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CitySeeker通过评估VLMs在动态城市环境中探索具身导航的能力,揭示了隐含需求理解中的关键瓶颈,并提出改进策略以提升空间推理和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16245 2025-12-19 cs.AI 57%

AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints

AlignMerge - 通过Fisher引导的几何约束实现的保持对齐的大语言模型合并

Aniruddha Roy, Jyoti Patel, Aman Chadha, Vinija Jain, Amitava Das

机构 * AI Institute, University of South Carolina(AI研究院,南卡罗来纳大学) Indian Institute of Technology, Kharagpur(印度理工学院,Khargpur分校) Islamic University of Technology(伊斯兰科技大学) Stanford University, USA(斯坦福大学,美国) Amazon AI, USA(亚马逊AI,美国) HCL(HCL公司) Evalueserve(Evalueserve公司) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, Goa(Pragya实验室, BITS Pilani,Goa分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 AlignMerge通过Fisher引导的几何约束实现大语言模型合并,提升对齐度量并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16724 2025-12-19 cs.RO cs.CV 50%

VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation

VERM:利用基础模型创建虚拟眼睛以实现高效的3D机器人操作

Yixiang Chen, Yan Huang, Keji He, Peiyan Li, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室,多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges Shandong University(山东大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 VERM通过利用基础模型创建虚拟视图,提升3D机器人操作的效率和准确性,实现训练和推理速度的显著提升。

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏