arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 13 篇

2602.02456 2026-02-03 cs.RO 78%

Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning

关系感知的层次3D场景图用于任务推理

Albert Gassol Puigjaner, Angelos Zacharia, Kostas Alexis

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02341 2026-02-03 cs.CV 78%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV 78%

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01541 2026-02-03 cs.CV cs.AI 77%

Toward Cognitive Supersensing in Multimodal Large Language Model

迈向多模态大语言模型的认知超感知

Boyi Li, Yifan Shen, Yuanzhe Liu, Yifan Xu, Jiateng Liu, Xinzhuo Li, Zhengyuan Li, Jingyuan Zhu, Yunhan Zhong, Fangzhou Lan, Jianguo Cao, James M. Rehg, Heng Ji, Ismini Lourentzou, Xu Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01644 2026-02-03 cs.LG cs.AI cs.CV cs.MA cs.RO 73%

From Perception to Action: Spatial AI Agents and World Models

从感知到行动:空间AI代理与世界模型

Gloria Felicia, Nolan Bryant, Handi Putra, Ayaan Gazali, Eliel Lobo, Esteban Rojas

机构 * AtlasPro AI

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的三轴分类法,将代理能力与空间任务联系起来,强调空间定位与符号定位的区别,并指出世界模型对跨尺度安全部署的重要性。

Comments 61 pages, 742 citations, 1 figure, 3 tables. Survey paper on spatial AI agents, embodied AI, graph neural networks, and world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01536 2026-02-03 cs.RO cs.CV 67%

UniDWM: Towards a Unified Driving World Model via Multifaceted Representation Learning

UniDWM: 通过多维表征学习实现统一的驾驶世界模型

Shuai Liu, Siheng Ren, Xiaoyao Zhu, Quanmin Liang, Zefeng Li, Qiang Li, Xin Hu, Kai Huang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Xpeng Motors Technology Co Ltd(小鹏汽车科技有限公司)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 UniDWM通过多维表征学习实现统一驾驶世界模型,提升自动驾驶中的轨迹规划和4D重建能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 62%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01527 2026-02-03 cs.HC cs.AI cs.CV 57%

Toward a Machine Bertin: Why Visualization Needs Design Principles for Machine Cognition

迈向机器伯林:为什么可视化需要为机器认知设计原则

Brian Keith-Norambuena

机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。

Comments Preprint submitted to IEEE TVCG on February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 57%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18343 2026-02-03 cs.CL 57%

Model Editing with Graph-Based External Memory

基于图的外部记忆模型编辑

Yash Kumar Atri, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) UC Berkeley(伯克利大学) UCSF(旧金山加州大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 HYPE通过双曲几何和图神经网络实现稳定的模型编辑,提升编辑稳定性、事实准确性和多跳推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00865 2026-02-03 cs.CV 50%

Distill3R: A Pipeline for Democratizing 3D Foundation Models on Commodity Hardware

Distill3R: 一种在通用硬件上普及3D基础模型的流水线

Brandon Leblanc, Charalambos Poullis

机构 * Immersive and Creative Technologies Lab(沉浸与创意技术实验室) Concordia University(康科迪亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Distill3R通过压缩蒸馏技术,在通用硬件上实现3D基础模型的高效训练,使实验室能以低成本进行3D视觉研究与部署。

Comments Submitted to the Canadian Conference on Robotics and Vision (CRV). 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00650 2026-02-03 cs.CV 50%

A Hybrid Mamba-SAM Architecture for Efficient 3D Medical Image Segmentation

一种用于高效3D医学图像分割的混合Mamba-SAM架构

Mohammadreza Gholipour Shahraki, Mehdi Rezaeian, Mohammad Ghasemzadeh

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种混合Mamba-SAM架构,结合冻结SAM编码器与Mamba模型,提升3D医学图像分割的效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 50%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏