arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 387 篇

2608.06938 2026-08-10 cs.CV cs.AI 新提交 79%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22355 2026-07-27 cs.CV cs.AI 新提交 79%

SiPhy: Single-Image Physical Property Reasoning

SiPhy:单图像物理属性推理

Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究从单图像推断物理属性,核心方法是引入SiPhy框架,将视觉线索与材料知识对齐,通过采样、提取特征等操作及对比聚合器、重量感知细化来实现。在多个数据集上取得领先性能,还验证了其在真实交互数据集上作为数据标注引擎的潜力。

Comments Accepted to ECCV 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 79%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13558 2026-07-16 cs.AI 新提交 79%

Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling

基于工具增强证据的多智能体协作推理用于城市区域剖析

Xixuan Hao, Yutian Jiang, Jiabo Liu, Yihang Yang, Guangyin Jin, Song Gao, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Washington(华盛顿大学) Chang’an University(长安大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对城市区域剖析问题,提出UrbanAgent框架,通过多智能体协作推理解决跨模态不一致,将指标预测扩展为闭环过程,经实验验证其性能优于现有基线,在未见城市设置中有强泛化性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12177 2026-07-15 cs.AI cs.CV 新提交 79%

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

地理空间基础模型的新兴范式:从预训练到智能推理

Shelley Cazares

机构 * Google Public Sector(谷歌公共部门)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。

Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 79%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09740 2026-07-14 cs.AI cs.CV 新提交 79%

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles

用于多交互车辆场景级变道意图和轨迹预测的动态场景交互推理框架

Joshua Kofi Asamoah, Blessing Agyei Kyem, Eugene Denteh, Armstrong Aboah

机构 * North Dakota State University(北达科他州立大学)

专题命中 视觉空间推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 研究针对多交互车辆场景级变道意图及轨迹预测问题,提出动态场景图注意力框架,将场景表示为时变交互图,通过时态图注意力消息传递等捕捉车辆关系与线索,实验表明该框架能提升预测准确率,降低碰撞率和误差,验证了组件贡献和公式有效性。

Comments 28 pages, 9 Figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07601 2026-07-09 cs.RO cs.AI 新提交 79%

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis

CARLA-GS:用于自动驾驶极端情况合成的解耦表示、推理和物理模拟

Kaicong Huang, Meng Ma, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究自动驾驶极端情况合成问题,提出CARLA-GS模块化管道,解耦视觉表示、语义推理和物理执行并保持跨模块耦合,能从实际驾驶数据生成可编辑场景,经多智能体大语言模型推理等步骤,实现可控生成及逼真、时空一致的视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 79%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05798 2026-07-08 cs.CV cs.AI 新提交 79%

Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

回答前分割:用于多模态大语言模型视觉推理的像素定位

Yake Wei, Yuan Wang, Fengyun Rao, Jing Lyu, Di Hu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型视觉推理,提出SegAnswer方法,将放大单元从边界框转为像素级分割掩码,能精准定位感兴趣区域,过滤冗余信息,与视觉令牌构建方式更契合,经多基准测试验证了其在像素定位及分割任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02921 2026-07-07 cs.CV cs.AI 新提交 79%

R3D: Quantitative 3D Spatial Reasoning for Egocentric Wearables

R3D:用于以自我为中心的可穿戴设备的定量3D空间推理

Maxwell Horton, Wei Lu, Quan Tran, Yury Astashonok, Kirmani Ahmed, Babak Damavandi, Anuj Kumar, Xiao Zhang, Seungwhan Moon

机构 * Meta Reality Labs(元现实实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对以自我为中心的可穿戴设备定量3D空间推理,介绍R3D-Bench基准及R3D工具调用框架,用分割和深度提升对象表示构建3D场景,通过工具提供信息给语言模型,在基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31285 2026-07-03 cs.AI 新提交 79%

Spatial Reasoning via Modality Switching Between Language and Symbolic Representation

通过语言与符号表示之间的模态切换进行空间推理

Shreya Rajpal, Tanawan Premsri, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究多跳文本空间故事中,将语言推理切换到几何感知模态(如布局或网格)能否提升推理性能,并提出基于可信度和复杂度的切换指标,实现原则性模态选择,使LLM性能提升高达42%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交 79%

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.AI

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26041 2026-06-25 cs.CV cs.CL 新提交 79%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22409 2026-06-23 cs.CV cs.AI 新提交 79%

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解

Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang

机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22171 2026-06-23 cs.LG 新提交 79%

Beyond Time Series: Spatial Reasoning for Epidemic Forecasting via Multimodal Learning

超越时间序列:基于多模态学习的空间推理用于流行病预测

Diana Guadalupe Gomez, Chenwei Wu, Zhiyi Wang, Liyue Shen, Alexander Rodríguez

机构 * University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出M-SPICE框架,通过注意力机制融合区域级时序数据与空间辅助信号,在COVID-19、流感和ILI预测任务上超越现有基线。

Comments To appear in the Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11918 2026-06-18 cs.AI 新提交 79%

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

提问的艺术:一致性增强空间推理中的事实性

Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas

机构 * The University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出自监督强化学习框架,通过几何与语义一致性验证器(如图像翻转、文本对象顺序交换)对齐预训练模型的内在空间推理能力,无需标注数据即可达到接近监督方法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15749 2026-06-16 cs.CV cs.AI cs.SY eess.SY 新提交 79%

OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning

OmniTraffic:面向时空交通推理的可控生成流水线与基准

Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Lab(上海人工智能实验室) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。

Comments 34 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13673 2026-06-12 cs.CV cs.AI 新提交 79%

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

SpatialClaw:重新思考智能体空间推理的动作接口

Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出SpatialClaw框架,以代码作为动作接口,通过状态化Python内核和感知几何原语,使VLM智能体逐步执行并灵活组合中间结果,在20个3D/4D空间推理基准上平均准确率59.9%,比现有方法高11.2个百分点。

Comments Project page: https://spatialclaw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12830 2026-06-12 cs.CV cs.AI 新提交 79%

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

感知、交互、推理:构建工具增强的视觉智能体用于空间推理

Changye Li, Meng Lu, Yi Wu, Ligeng Zhu

机构 * Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出PERIA智能体,通过视觉感知和交互工具增强VLM的空间推理能力,在13个基准上优于同类模型7.0%-14.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12065 2026-06-11 cs.AI cs.MA 新提交 79%

Automating Geometry-Intensive Compliance Checking in BIM: Graph-Based Semantic Reasoning Framework

BIM中几何密集型合规检查自动化:基于图的语义推理框架

Zixuan Xiao, Pei Troh Koh, Jun Ma, Jack C. P. Cheng

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对BIM中几何密集型法规自动检查的语义鸿沟问题,提出SGR-BIM图驱动推理框架,通过跨模态知识图谱实现可解释推理,在679个消防规范查询上达到84.3%准确率,较基线提升8.6%。

Journal ref Automation in Construction 189 (2026) 107038

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12047 2026-06-11 cs.CV cs.AI stat.ML 新提交 79%

Metadata-Aware Multi-Prompt Reasoning for Zero-Shot Accident Understanding

元数据感知的多提示推理用于零样本事故理解

Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran

机构 * Netradyne

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出三阶段流水线,通过视觉-语言相似性、元数据驱动的多提示推理和开放词汇检测,实现零样本事故视频的时序定位、语义分类和空间定位,显著提升性能。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 15

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11770 2026-06-11 cs.AI 新提交 79%

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT: 基于强化学习的空间推理状态感知思维可视化

Chao Lei, Yanbei Jiang, Markus Hiller, Zhijian Zhou, Xunye Tian, Krista A. Ehinger, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出SVoT框架,通过强化学习生成可验证的中间状态和可视化,结合文本与视觉推理链,提升多模态大模型在多跳空间推理中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11683 2026-06-11 cs.CV cs.AI 新提交 79%

Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

推理,再推理:跨视角重访提升空间推理

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou, Xiaofeng Cao, Jiangchao Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08952 2026-06-09 cs.AI 新提交 79%

AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models

AlloSpatial:基础模型中空间推理的智能体框架

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Jingzhi Li, Yubin Wang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出AlloSpatial框架,通过World2Mind认知映射沙箱将自我中心观察转化为异中心空间先验,并利用空间推理工具实现几何语义仲裁,在VSI-Bench和MindCube上提升模型5%-18%的空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13095 2026-08-14 cs.RO cs.CV 新提交 79%

Semantic Radiance Fields as Simulators for Spatial Reasoning in Real-World Scenes

语义辐射场作为真实场景空间推理的模拟器

Nico Heider, Michał Jan Włodarczyk, Katarzyna Wasielewska-Michniewska, Przemysław Hołda, Martin Schieck, Marcin Paprzycki, Maria Ganzha, Bogdan Franczyk

机构 * Leipzig University(莱比锡大学) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Wrocław University of Economics(弗罗茨瓦夫经济大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出用语义辐射场(SRF)构建兼具几何真实性与语义可查询性的真实场景模拟器,用于训练评估具身智能体的空间推理能力,还将其应用于果园苹果采摘任务。

Comments Accepted at the IJCAI 2026 Workshop on Spatio-Temporal Reasoning and Learning (STRL), oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交 78%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14991 2026-08-18 cs.CV 新提交 78%

Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving

面向通信高效自动驾驶的风险自适应边云视觉推理

Meng Ma, Shuyang Li, Naigang Wang, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。

Comments 7 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10886 2026-08-12 cs.CV cs.RO 新提交 78%

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

GESTO:面向动态场景推理的以人为中心的时空记忆

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) Google Research(谷歌研究院) TU Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 78%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏