Bilateral Spatial Reasoning about Street Networks: Graph-based RAG with Qualitative Spatial Representations
双重视觉推理关于街道网络:基于图的RAG与定性空间表示
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
双重视觉推理关于街道网络:基于图的RAG与定性空间表示
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。
3DLLM-Mem: 长期空间-时间记忆用于具身3D大语言模型
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 3DLLM-Mem通过引入动态内存管理和融合模型,提升LLMs在复杂3D环境中的长期空间-时间记忆推理与行动能力。
Comments demos at: https://3dllm-mem.github.io
生成性城市风场建模:从几何到气流的图扩散
机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid(应用数学系、ETSIAE航空学院、马德里理工大学) ; Microflown Technologies(Microflown技术公司) ; Computational Science and Engineering Laboratory, Harvard University(计算科学与工程实验室、哈佛大学)
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于图扩散的生成模型,用于在非结构化网格上合成城市风场,通过结合层次图神经网络和分数扩散建模,实现对复杂几何形状的高效风场模拟与预测。
VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官
机构 * Stanford University(斯坦福大学) ; Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。
Comments 14 pages, 8 figures
基于历史增强的双阶段变压器用于空域视觉与语言导航
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出HETT框架,通过粗到细的导航流程整合全局环境推理与局部场景理解,提升无人机在大规模城市环境中基于语言指令的导航性能。