Φeat: Physically Grounded Material Feature Representation
Φeat: 物理基础的材料特征表示
机构 * Adobe Research, France(Adobe研究院(法国))
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出Φeat视觉骨干网络,通过对比同一材料在不同光照和几何下的观测,学习对材料身份敏感的表征,提升材料选择与分类等任务性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Φeat: 物理基础的材料特征表示
机构 * Adobe Research, France(Adobe研究院(法国))
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出Φeat视觉骨干网络,通过对比同一材料在不同光照和几何下的观测,学习对材料身份敏感的表征,提升材料选择与分类等任务性能。
开放词汇与指代分割:利用2D检测器实现3D高斯
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。
HUMEMBR:学习人类日常行为以进行预测性具身导航
机构 * Kiel University, Germany(德国基尔大学) ; George Mason University, USA(美国乔治·马歇尔大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出HUMEMBR系统,通过连续记忆构建与并行检索机制,实现基于人类日常行为的具身问答和导航,相比全上下文LLM基线在长时推理上更高效。
Comments Accepted to IROS 2026
壳监督高斯溅射用于城市真实到仿真重建
机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出壳监督高斯溅射框架,利用外部立面结构壳作为几何监督,通过掩码门控损失优化高斯重建,提升城市立面几何一致性。
Comments 10 pages main paper, 2 pages supplementary material
分析性概念中心记忆用于具身操作代理
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Westlake University(西湖大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出分析性概念中心记忆框架,通过结构化概念(语义部件、参数模板等)组织经验,支持粗到细检索,提升长时程具身操作中的物体重识别、状态推理和技能复用。
Mural: 通过混合Transformer将LLM知识迁移到图像生成
机构 * Amazon AGI(亚马逊人工智能研究院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。
长期对话的记忆快照
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出MemShot方法,通过将对话片段渲染为结构化视觉记忆单元,利用模型内部视觉推理能力关联关键情节,实现高效长期对话建模,在LoCoMo和LongMemEval上取得稳定性能并实现70倍加速。
GRAFT:用于人体场景重建的几何细化和拟合变换
机构 * Westlake University(西湖大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 GRAFT通过几何细化和拟合变换,提升单图像中人体与场景交互的重建质量,实现快速且精确的交互推理。
Comments ECCV 2026. Project Page: https://pradyumnaym.github.io/graft
ReSpace:基于文本的自回归3D室内场景合成与编辑
机构 * Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。
Comments 23 pages, 17 figures, 11 tables (incl. appendix)
UniPR-3D:迈向基于视觉几何基础的通用视觉位置识别
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Zaragoza(萨拉戈萨大学) ; University of Macau(澳门大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出UniPR-3D,首个融合多视角信息的视觉位置识别架构,通过3D tokens与2D tokens联合描述,提升跨视角推理与泛化能力,实验表明其优于单多视角基线。
Comments Accepted by ECCV 2026
Efficient-VLN: 一种高效且强大的视觉语言导航基线
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI
专题命中 视觉空间推理 :self-correction(abstract)
AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。
ReScene: 基于多视角图像的结构化室内场景重建
机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。
HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?
机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) ; Tesco, UK(乐购,英国)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。
理解多模态大语言模型如何通过Token激活图描述艺术品
机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) ; University of Zurich(苏黎世大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。
Comments Accepted at PRESTIGE workshop at ICPR 2026
LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航
机构 * Center for Project-Based Learning(项目学习中心) ; Integrated Systems Laboratory(集成系统实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。
SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。
Comments Accepted by ICML 2026. 16 pages, 9 figures
Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026
CascadeOcc: 用级联VQ表示重新思考3D占用世界模型
机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)
专题命中 视觉空间推理 :planning(abstract)
AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。
Comments Accepted to IEEE Signal Processing Letters (SPL), 2026
TruEye:图像中AI生成人物的细粒度检测
机构 * Vanderbilt University(范德堡大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出TruEye模型,通过掩码条件双流Transformer区分五种合成内容类别,实现AI生成或篡改人物与场景的细粒度检测和定位,无需大型语言模型,速度提升百倍。
Comments 18 Pages, 3 figures
GraphPilot: 基于场景图条件化的语言自主驾驶
机构 * Esslingen University of Applied Sciences(埃斯林根应用科学大学) ; University of Freiburg(弗赖堡大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出GraphPilot方法,通过交通场景图序列化与结构化提示模板,将关系上下文注入语言驾驶模型,显著提升驾驶分数。
RAE-NWM:密集视觉表示空间中的导航世界模型
机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) ; University of Rochester(罗切斯特大学) ; Beijing Information Science and Technology University(北京信息科技大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。
Comments Code is available at: https://github.com/20robo/raenwm
VLM引导的视觉地点识别用于行星级地理定位
机构 * Univ. of Southampton, UK(英国南安普顿大学) ; KAIST, South Korea(韩国科学技术院) ; QUT, Australia(昆士兰科技大学) ; Univ. of Essex, UK(英国埃塞克斯大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。
Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)
PhysiFormer: 在世界空间中学习模拟力学
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。
Comments Project page: https://yimingc9.github.io/physiformer
零样本3D理解的智能体协作认知
机构 * Sichuan University(四川大学) ; Adelaide University(阿德莱德大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 提出协作多智能体框架,通过规划智能体补充视角和感知智能体构建结构化认知地图,实现零样本3D理解,在6个基准上达到最优性能。
Comments Accepted by ECCV 2026. Project page: https://zhangbo135.github.io/agentic-collaborative-cognition/
几何感知超像素图变换器结合元数据用于皮肤病变分类
机构 * Edge Hill University(埃奇希尔大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种基于区域的图学习框架,将病变建模为超像素图,利用几何边属性和元数据上下文节点,通过边缘感知图变换器实现多模态融合,在四个公开数据集上取得优于现有方法的分类性能。
Comments Accepted at MICCAI 2026
RoDyn: 驯服交互式机器人动态2.5D世界模型用于机器人操作
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出RoDyn,一种几何感知的2.5D世界模型,通过机器人动态分词器和掩码引导自回归架构,在高效潜在空间中建模环境动态,提升生成保真度并显著改善下游强化学习和模仿学习性能。
SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。
ArtiTwinSplat:基于RGB-D视频的高斯泼溅实现可交互数字孪生重建
机构 * ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软) ; University of Bonn(波恩大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 提出ArtiTwinSplat框架,利用3D高斯泼溅从RGB-D视频自动构建可交互的铰接物体数字孪生,无需CAD模型或人工标注,支持实时渲染与交互操作。
Comments Presented at the ICRA 2026 Workshop on Advances and Challenges in AI-Driven Automation and Robotic System Integration with Digital Twins, Vienna, June 2026
使用取证知识图谱的可信图像认证
机构 * Drexel University(德雷塞尔大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。
Comments Accepted and Published at ECCV 2026
HANCLIP:双曲角否定视觉语言模型系列
机构 * ADAPT Centre Dublin City University, Ireland(爱尔兰都柏林城市大学ADAPT中心) ; University of East Anglia Norwich, UK(英国东英吉利大学) ; Queen’s University Belfast Belfast, UK(英国贝尔法斯特女王大学) ; University of Science Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学理科大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 针对视觉语言模型对否定语义脆弱的问题,提出HANCLIP系列,通过双曲空间和角度三元组目标重构嵌入空间,在20K数据上训练,增强否定敏感性同时保持预训练表示,在NegBench等基准上取得一致提升。
WorldOlympiad:你的世界模型能经受铁人三项考验吗?
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Monash University(莫纳什大学) ; TRE, Alibaba Group(阿里巴巴TRE)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。
Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad