On the Explainability of Vision-Language Models in Art History
关于视觉-语言模型在艺术史中的可解释性
机构 * Marburg University(马尔堡大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
关于视觉-语言模型在艺术史中的可解释性
机构 * Marburg University(马尔堡大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。
DriveMamba: 以任务为中心的可扩展状态空间模型用于高效端到端自动驾驶
机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(计算机学院与人工智能学院,上海交通大学) ; SenseAuto
专题命中 视觉空间推理 :planning(abstract)
AI总结 DriveMamba通过动态任务关系建模、隐式视角对应学习和长期时间融合,提升端到端自动驾驶的效率与可扩展性。
Comments Accepted to ICLR2026
LocateAnything3D: 基于视觉-语言的3D检测与链式视觉推理
专题命中 视觉空间推理 :chain-of-thought(abstract)
AI总结 LocateAnything3D通过将3D检测转化为下一个token预测问题,实现了多目标3D检测,取得了Omni3D基准测试中的最佳成绩。
Comments Tech report. Project page: https://nvlabs.github.io/LocateAnything3D/
测试时计算用于指代多模态大语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) ; VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) ; Tsinghua University(清华大学) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。
Comments arXiv admin note: substantial text overlap with arXiv:2407.21534
具有方向感知的3D大多模态模型
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出方向感知的3D大多模态模型,通过补充自身姿态并改进点云数据对齐,提升3D多模态模型的性能和通用性。
Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
SAGE: 适用于具身人工智能的可扩展代理3D场景生成
机构 * NVIDIA ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 SAGE通过代理框架生成可扩展的3D环境,用于具身人工智能的策略训练和泛化能力提升。
Comments Project Page: https://research.nvidia.com/labs/dir/sage/
CapNav:基于能力条件的室内导航基准测试
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。
点语言模型:通过桥接大型3D语言模型实现任意对象分割
机构 * Department of Computer Science, Aberystwyth University(计算机科学系,阿伯里斯特维斯大学) ; School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) ; Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 点语言模型通过桥接大型3D语言模型与密集3D点云,解决表示不一致问题,提升3D对象分割的准确性和鲁棒性。
Comments Accepted by IEEE Transactions on Multimedia (TMM)
高保真行星探测的3D重建
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出了一种结合NeRF和高斯点绘的自动化3D重建管道,用于在极端环境下实现高保真的行星探测
Comments 7 pages, 3 figures, conference paper
Journal ref IEEE Conference on Artificial Intelligence (CAI) 2026, Special Session on AI for Space Exploration
GLIMPSE:面向可穿戴设备的实时文本识别与上下文理解的视频大语言模型
机构 * Meta Reality Labs(Meta现实实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 GLIMPSE通过混合架构在可穿戴设备上实现低功耗的实时文本识别与上下文理解,提升视频大语言模型在资源受限设备上的VQA性能。
基于场景图的LLM定位再规划集成探索与顺序操作
机构 * Beihang University(北航大学) ; State Key Laboratory of General Artificial Intelligence(一般人工智能国家重点实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
专题命中 视觉空间推理 :planning(abstract)
AI总结 EPoG通过结合基于图的全局规划器与LLM的定位局部规划器,实现探索与顺序操作规划的无缝结合,有效提升机器人在部分已知环境中的任务执行效率。
Comments 8 pages, 7 figures; accepted by ICRA 2026
BEVTraj: 无地图端到端鸟瞰图轨迹预测方法,采用可变形注意力和稀疏目标提案
机构 * Department of Automobile and IT Convergence, Kookmin University(汽车与IT融合系,韩国釜山大学) ; Department of Automotive Engineering, Kookmin University(汽车工程系,韩国釜山大学) ; Graduate School of Automobile and Mobility, Kookmin University(汽车与移动研究生院,韩国釜山大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 BEVTraj通过可变形注意力和稀疏目标提案实现无地图端到端鸟瞰图轨迹预测,提升自动驾驶的鲁棒性和灵活性。
Comments Submitted to IEEE Transactions on Intelligent Transportation Systems (under review)
隐式尺度多食物体积估计的单目图像三维重建
机构 * University of Waterloo(滑铁卢大学) ; Purdue University(普渡大学) ; Indiana University(印第安纳大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出隐式尺度三维重建方法,用于单目图像中多食物体积估计,通过基准数据集验证了基于几何的重建方法在准确性和鲁棒性上的优势。
Comments Paper accepted to 2026 IEEE Southwest Symposium on Image Analysis and Interpretation. The dataset can be downloaded at: https://www.kaggle.com/competitions/3d-reconstruction-from-monocular-multi-food-images/data
PA-MPPI:感知-aware的模型预测路径积分控制用于未知环境中的四旋翼导航
机构 * University of Zurich(苏黎世大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 PA-MPPI通过结合感知信息,提升了四旋翼在未知环境中的导航能力,能够有效探索未知区域并规划替代路径。
Journal ref IEEE Robotics and Automation Letters (RA-L), 2026
HoloBrain-0 技术报告
机构 * Horizon Robotics
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 HoloBrain-0 提出了一种融合视觉、语言和动作的框架,通过预训练和后训练范式,在模拟和现实任务中取得领先性能,并开源完整生态系统促进机器人研究。
Comments 32 pages
LAMP:机器人导航的隐式语言地图
机构 * Department of Intelligent Robotics, Sungkyunkwan University(智能机器人学系,全北国立大学) ; NAVER LABS ; Department of Robotics and Mechatronics Engineering, DGIST(机器人与机电工程系,韩国科学技术院)
专题命中 视觉空间推理 :planning(abstract)
AI总结 LAMP通过隐式语言地图实现高效机器人导航,结合隐式神经场与稀疏图进行粗到细路径优化,提升大环境下的内存效率和目标精度。
Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). Project page: https://lab-of-ai-and-robotics.github.io/LAMP/
Journal ref IEEE Robotics and Automation Letters (RA-L), 2025
像阅读文本一样理解图像:视觉-语言模型中的序列图像理解
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出通过序列化方法理解图像内容,揭示视觉-语言模型中对象识别与空间感知的机制,改进解码效率并增强空间推理能力。
ViT-5:2020年代中期的视觉变换器
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 ViT-5通过改进组件和架构,提升了视觉变换器的性能和泛化能力,成为2020年代中期更优的视觉骨干网络。
Comments Code is available at https://github.com/wangf3014/ViT-5
少即是多:从有限数据实现可扩展的视觉导航
机构 * ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利加州大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出Less is More方法,通过结合有限专家示范与规划器生成的监督,实现高效视觉导航。
Comments v2: Minor text edits, reference formatting fixes, and project page link added
PPE:用于多模态大语言模型中token压缩的位置保持嵌入
机构 * Huawei Technologies(华为技术有限公司)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能
Comments ICLR 2026
基于场景图的开放集合语义映射方法
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出基于场景图的开放集合语义映射方法,通过实时更新三维语义场景图,实现大规模环境中的稳定、可验证的映射结构,提升感知与高层推理的一致性与效率。
MultiMAE用于脑部MRI:通过多模态掩码自编码器提高对缺失输入的鲁棒性
机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(辐射肿瘤科,技术大学慕尼黑医院,慕尼黑,德国) ; Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(医疗与医学人工智能教研室,技术大学慕尼黑(TUM)) ; TUM University Hospital, Munich, Germany(技术大学慕尼黑医院,慕尼黑,德国) ; Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(图像引导诊断与治疗人工智能教研室,技术大学慕尼黑(TUM)) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) ; Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国) ; Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑合作伙伴站点,慕尼黑,德国) ; Institute of Radiation Medicine (IRM), Department of Radiation Sciences (DRS), Helmholtz Center Munich, Munich, Germany(辐射医学研究所(IRM),辐射科学部门(DRS),慕尼黑海德堡中心,慕尼黑,德国)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 MultiMAE通过多模态掩码自编码器提升脑部MRI在缺失输入下的鲁棒性,实现分割和分类任务的性能提升。
Comments Official implementation: https://github.com/chris-beischl/multimae-for-brain-mri
基于体素稀疏性的多分辨率对齐方法用于基于摄像头的3D语义场景补全
机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出多分辨率对齐方法,通过多分辨率特征对齐和关键分布一致性损失缓解基于摄像头的3D语义场景补全中的体素稀疏性问题。
Comments 15 pages, 6 figures, accepted by TIP 2026
USS-Nav: 一体化空间语义场景图用于轻量级无人机零样本物体导航
机构 * School of Aeronautic Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学航空科学与工程学院) ; State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou 310027, China(浙江大学工业控制技术状态重点实验室) ; Differential Robotics, Hangzhou 311121, China(杭州差分机器人)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 USS-Nav通过构建一体化空间语义场景图,实现轻量级无人机在未知环境中的高效零样本物体导航,提升计算效率和实时更新能力。
大语言模型赋能的可视化交互现状
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。
Comments Submitted to STARs of EuroVis'26
Distill3R: 一种在通用硬件上普及3D基础模型的流水线
机构 * Immersive and Creative Technologies Lab(沉浸与创意技术实验室) ; Concordia University(康科迪亚大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 Distill3R通过压缩蒸馏技术,在通用硬件上实现3D基础模型的高效训练,使实验室能以低成本进行3D视觉研究与部署。
Comments Submitted to the Canadian Conference on Robotics and Vision (CRV). 10 pages, 5 figures
一种用于高效3D医学图像分割的混合Mamba-SAM架构
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出一种混合Mamba-SAM架构,结合冻结SAM编码器与Mamba模型,提升3D医学图像分割的效率与精度。
PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成
机构 * East China University of Science and Technology(东华大学) ; Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。
Comments Accepted to ICASSP2026
FlexMap:从灵活的相机配置构建通用HD地图
机构 * School of Computing, Clemson University ; School of Engineering \& Technology, University of Washington
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 FlexMap通过几何感知基础模型和跨帧注意力机制,实现从灵活相机配置构建通用HD地图,提升了自动驾驶系统在传感器失效和配置变化时的鲁棒性。
动态拓扑感知:突破视觉语言导航中的粒度刚性
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
专题命中 视觉空间推理 :planning(abstract)
AI总结 DGNav通过动态拓扑导航框架,解决视觉语言导航中的粒度刚性问题,提升导航效率与安全性。