arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-05 至 2025-12-05 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2511.23075 2025-12-05 cs.CV cs.AI 79%

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04276 2025-12-05 cs.AI cs.LG math.ST stat.TH 79%

The Geometry of Benchmarks: A New Path Toward AGI

基准的几何学:通向通用人工智能的新路径

Przemyslaw Chojecki

机构 * Przemyslaw Chojecki(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于几何框架的基准评估方法,通过自主AI尺度和GVU操作符,为通用人工智能的发展提供了新的理论视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 67%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 视觉空间推理 :chain-of-thought(abstract);CoT(abstract)

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 62%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04797 2025-12-05 cs.AI cs.RO 57%

SIMA 2: A Generalist Embodied Agent for Virtual Worlds

SIMA 2: 一种通用的具身代理用于虚拟世界

SIMA team, Adrian Bolton, Alexander Lerchner, Alexandra Cordell, Alexandre Moufarek, Andrew Bolt, Andrew Lampinen, Anna Mitenkova, Arne Olav Hallingstad, Bojan Vujatovic, Bonnie Li, Cong Lu, Daan Wierstra, Daniel P. Sawyer, Daniel Slater, David Reichert, Davide Vercelli, Demis Hassabis, Drew A. Hudson, Duncan Williams, Ed Hirst, Fabio Pardo, Felix Hill, Frederic Besse, Hannah Openshaw, Harris Chan, Hubert Soyer, Jane X. Wang, Jeff Clune, John Agapiou, John Reid, Joseph Marino, Junkyung Kim, Karol Gregor, Kaustubh Sridhar, Kay McKinney, Laura Kampis, Lei M. Zhang, Loic Matthey, Luyu Wang, Maria Abi Raad, Maria Loks-Thompson, Martin Engelcke, Matija Kecman, Matthew Jackson, Maxime Gazeau, Ollie Purkiss, Oscar Knagg, Peter Stys, Piermaria Mendolicchio, Raia Hadsell, Rosemary Ke, Ryan Faulkner, Sarah Chakera, Satinder Singh Baveja, Shane Legg, Sheleem Kashem, Tayfun Terzi, Thomas Keck, Tim Harley, Tim Scholtes, Tyson Roberts, Volodymyr Mnih, Yulan Liu, Zhengdong Wang, Zoubin Ghahramani

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SIMA 2是一种基于Gemini模型的通用具身代理,能够理解和行动于多种3D虚拟世界,具备自我改进能力,显著提升了与人类表现的接近程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04790 2025-12-05 cs.IR 50%

Spatially-Enhanced Retrieval-Augmented Generation for Walkability and Urban Discovery

空间增强的检索增强生成用于步行性和城市探索

Maddalena Amendola, Chiara Pugliese, Raffaele Perego, Chiara Renso

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 WalkRAG通过空间增强的检索增强生成框架,结合信息检索与空间推理,为用户提供步行性城市探索的推荐服务。

详情

展开后加载摘要…

URL PDF HTML 收藏