Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
将视觉与语言接地于3D遮罩以实现长周期箱子整理
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
将视觉与语言接地于3D遮罩以实现长周期箱子整理
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。
3DCity-LLM:赋能多模态大语言模型进行3D城市级感知与理解
机构 * School of Geospatial Engineering and Science(测绘工程与科学学院) ; Sun Yat-sen University(中山大学) ; College of Electronic Science(电子科学学院) ; National University of Defense Technology(国防科技大学) ; Department of Civil and Environmental Engineering(土木与环境工程系) ; Norwegian University of Science and Technology(挪威科技大学) ; National Geomatics Center of China(中国国家测绘地理信息中心)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出3DCity-LLM框架,通过粗到细的特征编码策略和120万高质量数据集,提升城市级多模态感知与理解能力,实验表明其在空间推理和城市智能方面优于现有方法。
Comments 24 pages, 11 figures, 12 tables
心灵超越空间:多模态大语言模型能否进行心理导航?
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) ; School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) ; college of AI, Tsinghua University(清华大学人工智能学院) ; Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。
Perceptio:通过空间标记生成增强视觉语言模型
机构 * Amazon(亚马逊)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。
SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准
机构 * Xiamen University, China(厦门大学,中国) ; Shopee, China(Shopee,中国) ; Tongji University, China(同济大学,中国)
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。
Comments Accepted By CVPR2026
MANSION: 多楼层语言到3D场景生成用于长周期任务
机构 * Tsinghua University(清华大学) ; AgiBot ; McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。
R2F:利用射线前沿进行无需大语言模型的对象导航
机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) ; Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) ; International University of Rome UNINT, Rome(罗马国际大学UNINT)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。
持续性具身导航学习
机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) ; Shenyang Institute of Automation(沈阳自动化研究所) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Uni-Walker通过分解导航知识为共享和特定组件,解决持续性具身导航学习中的灾难性遗忘问题,提升导航代理的持续学习能力。
Comments 24 pages, 7 figures
Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) ; School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)
专题命中 视觉空间推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。
Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD
放射科助手:一种协调专用工具的代理框架以实现可靠的放射学报告
机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; SenseTime Research, Shanghai, China(商汤研究) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 放射科助手通过协调专用工具实现全面的放射学报告流程,提升报告准确性和临床标准符合度。
SocialNav: 为社交感知具身导航训练的人类启发式基础模型
机构 * Amap, Alibaba Group, China(阿里集团阿地图,中国) ; Zhejiang University, China(浙江大学,中国)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 SocialNav通过分层架构和多阶段训练,实现了社交感知导航,显著提升了导航性能和社会合规率。
多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答
机构 * UCLA Computer Science(UCLA计算机科学系) ; UCSF Radiology(UCSF放射学) ; UCLA Medicine(UCLA医学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。
Comments 17 pages, 3 figures
从障碍到礼仪:基于VLM引导路径选择的机器人社交导航
机构 * School of Computing(计算机学院) ; Smart Systems Institute(智能系统研究所)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L)
UniMo: 基于推理链的统一运动生成与理解
专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。
AINav: 基于大语言模型的自适应交互导航
机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。
Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine
OpenNav: 基于多模态大语言模型的开放世界导航
机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) ; University of Toronto Robotics Institute(多伦多大学机器人研究所)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。
Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。
SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。
Comments 12 pages,6 figures
面向遥感的世界模型
机构 * University of Technology Sydney (UTS)(悉尼技术大学) ; University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Peking University(北京大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。
Comments 10 pages, 5 figures
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG
Comments Accepted by ACM Multimedia 2025
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; SSM Health, St. Louis, MO(SSM健康系统,圣路易斯,密苏里州) ; Saint Louis University School of Medicine(圣路易斯大学医学院) ; Icahn School of Medicine at Mount Sinai(西奈山医院伊坎医学院) ; National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究机构) ; Brigham and Women’s Hospital(布里金和妇女医院) ; Chest Radiology Division, Medical Imaging Department, King Abdullah Specialized Children’s Hospital(国王阿卜杜勒阿齐兹特殊儿童医院放射科,医学成像部门) ; King Abdulaziz Medical City, Ministry of National Guard Health Affairs(国王阿卜杜勒阿齐兹医疗城,国民卫队卫生事务部)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
机构 * DRAGON Lab at Department of Mechanical Engineering, The University of Tokyo(东京大学机械工程系DRAGON实验室)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 18 pages, 10 figures
Journal ref Advanced Intelligent Systems, Oct. 2025
专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI
Comments Accepted to NeurIPS 2025 (Spotlight)
机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) ; Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
Comments Human-aware Embodied AI Workshop @ IROS 2025
机构 * ETH Zürich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
Journal ref Computer Vision - ECCV 2024 Workshops, Lecture Notes in Computer Science (LNCS), vol. 15624, pp. 217-234, Springer, Cham, 2025
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG
Comments Accepted by EMNLP 2025 Findings
机构 * Michigan State University(密歇根州立大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Adelaide(阿德莱德大学)
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; ShanghaiTech University(上海科技大学) ; University of Sussex(Sussex大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
机构 * University of Connecticut(康涅狄格大学) ; Central University of Finance and Economics(中央财经大学) ; Baylor University(贝勒大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
Comments Accepted to EMNLP 2025 System Demonstration Track
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 19 pages, 12 figures, 6 tables