arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-18 至 2025-12-18 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2512.15388 2025-12-18 cs.AI 74%

Bilateral Spatial Reasoning about Street Networks: Graph-based RAG with Qualitative Spatial Representations

双重视觉推理关于街道网络:基于图的RAG与定性空间表示

Reinhard Moratz, Niklas Daute, James Ondieki, Markus Kattenbeck, Mario Krajina, Ioannis Giannopoulos

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22657 2025-12-18 cs.CV cs.AI cs.CL cs.LG 67%

3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model

3DLLM-Mem: 长期空间-时间记忆用于具身3D大语言模型

Wenbo Hu, Yining Hong, Yanjun Wang, Leison Gao, Zibu Wei, Xingcheng Yao, Nanyun Peng, Yonatan Bitton, Idan Szpektor, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 3DLLM-Mem通过引入动态内存管理和融合模型,提升LLMs在复杂3D环境中的长期空间-时间记忆推理与行动能力。

Comments demos at: https://3dllm-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14725 2025-12-18 cs.LG cs.AI 62%

Generative Urban Flow Modeling: From Geometry to Airflow with Graph Diffusion

生成性城市风场建模:从几何到气流的图扩散

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Petros Koumoutsakos, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid(应用数学系、ETSIAE航空学院、马德里理工大学) Microflown Technologies(Microflown技术公司) Computational Science and Engineering Laboratory, Harvard University(计算科学与工程实验室、哈佛大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于图扩散的生成模型,用于在非结构化网格上合成城市风场,通过结合层次图神经网络和分数扩散建模,实现对复杂几何形状的高效风场模拟与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 50%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14222 2025-12-18 cs.CV cs.RO 50%

History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation

基于历史增强的双阶段变压器用于空域视觉与语言导航

Xichen Ding, Jianzhe Gao, Cong Pan, Wenguan Wang, Jie Qin

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出HETT框架,通过粗到细的导航流程整合全局环境推理与局部场景理解,提升无人机在大规模城市环境中基于语言指令的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏