Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning
关系感知的层次3D场景图用于任务推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。
Comments ICRA 2026, 8 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
关系感知的层次3D场景图用于任务推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。
Comments ICRA 2026, 8 pages
LongVPO:从锚定线索到自我推理的长视频偏好优化
机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; JIUTIAN Research(Jiutian研究) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。
Comments NeurIPS 2025
Med3D-R1: 促进3D医学视觉-语言模型的临床推理
机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) ; Stanford University(斯坦福大学) ; Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) ; The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。
迈向多模态大语言模型的认知超感知
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。
从感知到行动:空间AI代理与世界模型
机构 * AtlasPro AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种统一的三轴分类法,将代理能力与空间任务联系起来,强调空间定位与符号定位的区别,并指出世界模型对跨尺度安全部署的重要性。
Comments 61 pages, 742 citations, 1 figure, 3 tables. Survey paper on spatial AI agents, embodied AI, graph neural networks, and world models
UniDWM: 通过多维表征学习实现统一的驾驶世界模型
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; Xpeng Motors Technology Co Ltd(小鹏汽车科技有限公司)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 UniDWM通过多维表征学习实现统一驾驶世界模型,提升自动驾驶中的轨迹规划和4D重建能力。
LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型
机构 * UCF(佛罗里达大学) ; UW-Madison(威斯康星大学麦迪逊分校) ; USC(南加州大学) ; UIC(伊利诺伊大学香槟分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。
Comments Accepted to ICCV 2025. First Version is released in 2024/03
迈向机器伯林:为什么可视化需要为机器认知设计原则
机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。
Comments Preprint submitted to IEEE TVCG on February 2026
迈向自主实验室安全监控:通过场景结构学习识别危险
机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) ; Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。
基于图的外部记忆模型编辑
机构 * University of Virginia(弗吉尼亚大学) ; UC Berkeley(伯克利大学) ; UCSF(旧金山加州大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 HYPE通过双曲几何和图神经网络实现稳定的模型编辑,提升编辑稳定性、事实准确性和多跳推理能力。
Distill3R: 一种在通用硬件上普及3D基础模型的流水线
机构 * Immersive and Creative Technologies Lab(沉浸与创意技术实验室) ; Concordia University(康科迪亚大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 Distill3R通过压缩蒸馏技术,在通用硬件上实现3D基础模型的高效训练,使实验室能以低成本进行3D视觉研究与部署。
Comments Submitted to the Canadian Conference on Robotics and Vision (CRV). 10 pages, 5 figures
一种用于高效3D医学图像分割的混合Mamba-SAM架构
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出一种混合Mamba-SAM架构,结合冻结SAM编码器与Mamba模型,提升3D医学图像分割的效率与精度。
PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成
机构 * East China University of Science and Technology(东华大学) ; Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。
Comments Accepted to ICASSP2026