Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
机构 * USTC Shanghai AI Lab(USTC上海人工智能实验室) ; SII SJTU(SJTU信息研究所) ; ZJU FDU(浙江大学福州大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
Comments Project Page: https://aether-world.github.io/
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Science and Technology of China(中国科学技术大学) ; TeleAI, China Telecom Corp Ltd(中国电信TeleAI)
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
Comments 8 pages; CVPR 2024
Journal ref CVPR (2024), 28306-28316
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Project website: whiteboard.cs.columbia.edu/
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
Comments 9 pages, 3 figures, 3 tables (21 pages, 4 figures, 15 tables including references and appendices)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Project page: https://vis-www.cs.umass.edu/3dvla/
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
Comments Accepted to ICLR 2024. Website: https://sites.google.com/view/mm-webnav/
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments ICCV 2023, project page: https://github.com/MarSaKi/VLN-BEVBert
DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑
机构 * University of Michigan(密歇根大学) ; University of Notre Dame(圣母大学) ; Yale University(耶鲁大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。
AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现
专题命中 视觉空间推理 :reasoning(title)
AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。
Comments The code and dataset are publicly available. Code: https://github.com/lzlfwow/AffordAny. Dataset: https://modelscope.cn/datasets/lzlfwow/AffordAny
GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Independent Researcher(独立研究员) ; National Center for Research (NCR)(国家研究中心)
专题命中 视觉空间推理 :reasoning(title)
AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。
Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026
利用年际一致的历史预测作为免费输入模态的多年地理空间推理
机构 * VITO Remote Sensing(VITO遥感公司)
专题命中 视觉空间推理 :reasoning(title)
AI总结 该研究将过往预测和BVL掩码纳入模型,提出CTY嵌入编码器,在540万像素的泛欧数据集上使作物F1提升,纠正召回偏差,为地理空间模型提供低成本方案。
Comments 17 pages, 7 figures Updated abstract to match with arxiv submission
基于参考的操作:多模态空间推理的框架与流程
专题命中 视觉空间推理 :reasoning(title)
AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。
Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)
StyleForge:基于超图场中反事实推理的室内家具风格生成
专题命中 视觉空间推理 :reasoning(title)
AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。
零样本长时程灵巧操作:基于多视图3D接地VLM推理
机构 * Seoul National University(首尔国立大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。
PoseGAM: 通过几何感知多视图推理实现鲁棒的未见物体姿态估计
机构 * KAUST(卡塔尔科技大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 提出PoseGAM,一种基于多视图基础模型的几何感知框架,直接预测未见物体的6D姿态,无需显式匹配,通过点云几何和特征网络整合几何信息,在多个基准上平均AR提升5.1%。
Comments Accepted by CVPR 2026 (Oral). Project page: https://windvchen.github.io/PoseGAM/
ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理
机构 * Simon Fraser University(西蒙弗雷泽大学) ; University of Waterloo(滑铁卢大学) ; Hong Kong University of Science(香港科学大学) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))
专题命中 视觉空间推理 :reasoning(title)
AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。
Comments Project Page: https://3dlg-hcvc.github.io/revsi/
通过多轮基于定位的强化学习实现高分辨率视觉推理
机构 * Fudan University(复旦大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室)
专题命中 视觉空间推理 :reasoning(title)
AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。
Comments Accepted by ACL(Findings) 2026
POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM
机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) ; WeChat AI, Tencent(腾讯微信人工智能)
专题命中 视觉空间推理 :reasoning(title)
AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。
基于渲染的视频生成与基于代理的推理
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
专题命中 视觉空间推理 :reasoning(title)
AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。
Comments Accepted to CVPR 2026
FunFact:通过因子图推理构建概率性功能3D场景图
机构 * ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软) ; University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)
专题命中 视觉空间推理 :reasoning(title)
AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。
DecoVLN:解耦观察、推理与修正以实现视觉-语言导航
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Shandong University(山东大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 DecoVLN通过优化长期记忆构建和修正策略,提升长周期导航的鲁棒性与稳定性,实验证明其在真实环境中的有效性。
Comments 16 pages, 8 figures, CVPR2026