IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation
IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构
机构 * Yonsei University(延世大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构
机构 * Yonsei University(延世大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。
EgoHandICL: 以自身为中心的3D手重建与上下文学习
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) ; Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) ; Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。
Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL
RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成
机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) ; Nanyang Technological University(南洋理工大学) ; Peng Cheng Laboratory(鹏城实验室) ; Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。
通过视觉属性增强描述性标题以实现多模态感知
机构 * NJUST(南京理工大学) ; Baidu VIS(百度视觉部) ; HKU(香港大学) ; NJU(南京大学) ; SUTD(新加坡科技设计大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出EDC方法,通过整合视觉专家的低级和细粒度属性,提升图像标题的描述质量,以增强多模态感知能力。
Comments An open-source Agent for generating detailed image captions
用于多模态场景理解的声学场视频
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。
视觉-语言模型的空间盲区
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。
Comments Work done as part of the EleutherAI SOAR Program
通过合成视频评估VLMs的情境与空间意识
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。
通过视觉语言模型探索社交合规机器人导航的提示设计
机构 * Hokkaido University(北海道大学) ; The University of Tokyo(东京大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文通过设计社交合规的提示策略,提升小型视觉语言模型在机器人导航中的行动准确性,发现与自我竞争的提示设计效果最佳。
RoboBrain 2.5:视觉深度,思维时间
机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 RoboBrain 2.5通过提升3D空间推理和时间值估计,增强具身智能在复杂精细操作中的物理基础和执行感知能力。
Comments 37 pages, 13 figures, Technical Report
重新审视多任务视觉表示学习
机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI) ; ByteDance Seed(字节跳动种子)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 MTV框架通过多任务学习结合视觉-语言对比、自监督和密集空间目标,提升空间推理能力的同时保持全局语义理解。
Comments Code: https://github.com/Becomebright/MTV
通过样条基础调和势场在杂乱环境中实现安全导航
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出了一种基于样条调和势场的方法,用于在杂乱环境中安全导航,通过控制策略引导代理沿预设单元序列移动,确保目标跟踪和障碍回避。
GeoSurDepth:利用基础模型实现以空间几何一致性为导向的自监督周围视图深度估计
机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(1 智能绿色车辆与移动国家重点实验室,车辆与移动学院,清华大学,北京100084,中国) ; California PATH, University of California, Berkeley, CA, United States(2 加州PATH,加州大学伯克利分校,加州,美国)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 GeoSurDepth通过利用基础模型和几何一致性,实现了更鲁棒的自监督周围视图深度估计,验证了其在自动驾驶中的有效性。
空间视觉导航:具有显式空间感知和探索的零样本视觉-语言导航
机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院,以及湍流与复杂系统国家重点实验室,北京大学) ; Defense Innovation Institute, Academy of Military Sciences, Beijing(国防科技创新研究院,军事科学院,北京) ; Tianjin Artificial Intelligence Innovation Center, Tianjin(天津人工智能创新中心,天津) ; Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能学院,哈尔滨工业大学(深圳))
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 Spatial-VLN通过增强空间感知和探索机制,提升零样本视觉-语言导航在复杂环境中的泛化与鲁棒性。
通过极低剂量协议实时重建3D骨模型
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学电子与计算机工程系) ; Koln 3D Technology (Medical) Limited, Hong Kong SAR(香港特别行政区科隆3D技术(医疗)有限公司) ; Department of Physics, Beihang University, Beijing, China(北京航空航天大学物理系) ; Union Hospital, Hong Kong SAR(香港特别行政区联合医院) ; Dental Materials Science, Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong, Hong Kong SAR(香港大学牙科学院牙体材料科学系) ; Department of Orthopaedics and Traumatology, The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学骨科及创伤外科学系) ; Department of Management Science and Engineering, Stanford University, Stanford, CA, USA(斯坦福大学管理科学与工程系) ; Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(斯坦福大学生物医学数据科学系)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本研究提出SSR-KD框架,通过双平面X光在30秒内快速重建高精度3D骨模型,降低辐射暴露并提升术中应用的实用性。
Comments Accepted to npj Digital Medicine
LLM-Glasses: 基于生成式AI的具有触觉反馈的眼镜用于盲人导航
机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 LLM-Glasses通过生成式AI和触觉反馈为视障人士提供导航支持,实验显示其在不同障碍物环境下具有较高的导航准确性。
基于扩散的多智能体编队导航
机构 * Department of Mechatronics, School of Mechanical Engineering, Hanoi University of Science and Technology(机械工程系,河内科学与技术大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出基于扩散模型的多智能体编队导航方法,通过生成领头者中点轨迹实现平滑运动,有效应对复杂环境中的编队控制问题。
Comments 8 pages, 3 figures, full version of a paper submitted to a conference
通过多视角对应分析评估基础模型的3D理解
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出一种无需微调的3D场景理解基准,评估基础模型在多视角下的3D推理能力,展示DINO编码器在大视角变化下的竞争力。
Comments NeurIPS 2025 UniReps workshop, to be published in PMLR
地形自适应移动三维打印与分层控制
机构 * Department of Electrical and Computer Engineering, University of Washington, USA(电气与计算机工程系,华盛顿大学) ; Department of Applied Mathematics, University of Washington, USA(应用数学系,华盛顿大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本研究提出了一种结合人工智能与分层控制的地形自适应移动三维打印框架,通过多传感器融合和闭环控制实现高精度打印与移动性平衡。
Comments Submitted to the 43rd International Symposium on Automation and Robotics in Construction (ISARC 2026)
EZBlender:基于计划与反应代理的高效3D编辑
专题命中 视觉空间推理 :planning(abstract)
AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。
从二维空间到三维空间:教视觉语言模型感知和推理三维世界
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出了一种基于2D空间数据生成和标注的管道,构建了SPAR-7M数据集和SPAR-Bench基准,通过训练和微调提升视觉语言模型在三维空间感知和推理中的性能。
Comments Project page: https://logosroboticsgroup.github.io/SPAR/
跟随标识:利用文本线索和大语言模型引导高效的机器人导航
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出利用大语言模型和符号模式提升机器人在稀疏环境中高效导航的能力,通过文本线索预测目标位置并优化路径规划。
AIVD:自适应边缘-云协作用于准确高效的工业视觉检测
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。
TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解
机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) ; Togg/Trutek AI Team(Togg/Trutek人工智能团队)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。
Comments Project page: https://artest08.github.io/TopoBDA.github.io/
Journal ref Neurocomputing, Vol. 670, 132360 (2026)
BREATH-VL:基于视觉-语言引导的6自由度支气管镜定位:通过语义-几何融合
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院呼吸与危重症医学科) ; Centre of AI and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(香港科学院人工智能与机器人中心) ; School of Biomedical Engineering and Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 BREATH-VL通过融合语义和几何信息,实现高精度的6自由度支气管镜定位,减少定位误差并提升效率。
FIRE-VLM:一种基于视觉-语言驱动的强化学习框架,用于在物理基础火灾数字孪生中无人机火灾跟踪
机构 * Clemson University(克莱姆森大学) ; University of Nevada, Reno(内华达大学拉斯维加斯分校) ; NSF NCAR(国家科学基金会NCAR)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 FIRE-VLM是一种基于视觉-语言模型的强化学习框架,用于在物理基础火灾数字孪生中实现无人机火灾跟踪,通过结合物理术语与VLM语义的奖励设计,提升了火灾检测效率。
I-Scene: 3D实例模型是隐式可泛化的空间学习者
机构 * Purdue University(普渡大学) ; NVIDIA Research(英伟达研究)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 I-Scene提出了一种基于3D实例模型的隐式空间学习方法,通过重新编程生成器实现跨场景的泛化能力,展示了其在空间推理和生成中的潜力。
利用Swin Transformer U-Net 3D进行FDG-PET/CT病变分割:一种稳健的深度学习框架
机构 * Machine Learning (of Aff.) Institute of Engineering(人工智能与机器学习研究所)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出SwinUNet3D框架,结合Transformer与U-Net,实现FDG-PET/CT病变分割,提升分割精度与效率。
Comments 8 pages, 3 figures, 3 tables
弥合视觉直觉与化学专业性:通过导师-工程师-学生协作的自主分析框架实现非绝热动力学模拟分析
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 VisU通过导师-工程师-学生协作框架,实现非绝热动力学模拟分析的自动化,减少人工依赖,提升机理发现的直观性和可扩展性。
CADMorph: 通过计划-生成-验证循环实现几何驱动的参数化CAD编辑
机构 * Fudan University(复旦大学) ; Microsoft Research, Asia(微软亚洲研究院) ; University of Toronto(多伦多大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 CADMorph通过计划-生成-验证循环实现几何驱动的参数化CAD编辑,利用预训练模型在数据稀少情况下保持结构、语义和形状保真度,超越现有方法并支持下游应用。
Comments NeurIPS 2025
通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。
Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent