arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3396 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3396 篇

1904.04776 2019-07-30 cs.CV cs.LG 57%

Multi-Agent Tensor Fusion for Contextual Trajectory Prediction

Tianyang Zhao, Yifei Xu, Mathew Monfort, Wongun Choi, Chris Baker, Yibiao Zhao, Yizhou Wang, Ying Nian Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Presented in CVPR 19: http://openaccess.thecvf.com/content_CVPR_2019/html/Zhao_Multi-Agent_Tensor_Fusion_for_Contextual_Trajectory_Prediction_CVPR_2019_paper.html ; Architecture details available: https://github.com/programmingLearner/MATF-architecture-details

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.00932 2019-06-05 cs.CV cs.LG stat.ML 57%

Y-GAN: A Generative Adversarial Network for Depthmap Estimation from Multi-camera Stereo Images

Miguel Alonso

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments Accepted for Presentation at the ICML 2019 LatinX in AI Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.05757 2019-03-15 cs.HC cs.AI cs.CV 57%

VRKitchen: an Interactive 3D Virtual Environment for Task-oriented Learning

Xiaofeng Gao, Ran Gong, Tianmin Shu, Xu Xie, Shu Wang, Song-Chun Zhu

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.02805 2019-01-04 cs.NE cs.AI cs.RO 57%

DeepTraffic: Crowdsourced Hyperparameter Tuning of Deep Reinforcement Learning Systems for Multi-Agent Dense Traffic Navigation

Lex Fridman, Jack Terwilliger, Benedikt Jenik

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments Neural Information Processing Systems (NIPS 2018) Deep Reinforcement Learning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.07488 2018-11-22 cs.CV cs.AI 57%

Quantifying Human Behavior on the Block Design Test Through Automated Multi-Level Analysis of Overhead Video

Seunghwan Cha, James Ainooson, Maithilee Kunda

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.07528 2018-10-18 cs.AI 57%

Machine Common Sense Concept Paper

David Gunning

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.08481 2017-02-08 cs.AI cs.CV 57%

GuessWhat?! Visual object discovery through multi-modal dialogue

Harm de Vries, Florian Strub, Sarath Chandar, Olivier Pietquin, Hugo Larochelle, Aaron Courville

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 23 pages; CVPR 2017 submission; see https://guesswhat.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00380 2016-12-02 cs.AI cs.CV stat.ML 57%

Playing Doom with SLAM-Augmented Deep Reinforcement Learning

Shehroze Bhatti, Alban Desmaison, Ondrej Miksik, Nantas Nardelli, N. Siddharth, Philip H. S. Torr

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.02261 2016-05-23 cs.AI 57%

End-to-End Goal-Driven Web Navigation

Rodrigo Nogueira, Kyunghyun Cho

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05336 2026-01-12 cs.RO 56%

Intent at a Glance: Gaze-Guided Robotic Manipulation via Foundation Models

意图一目了然:通过基础模型实现的注视引导的机器人操作

Tracey Yee Hsin Tay, Xu Yan, Jonathan Ouyang, Daniel Wu, William Jiang, Jonathan Kao, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(comments)

AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。

Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03540 2024-11-07 cs.RO 56%

VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation

Haochen Zhang, Nader Zantout, Pujith Kachana, Zongyuan Wu, Ji Zhang, Wenshan Wang

专题命中 视觉空间推理 :reasoning(abstract,comments)

Comments Accepted and presented at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics (SemRob), Robotics Science and Systems Conference (RSS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14257 2023-10-31 cs.CL cs.AI cs.LG 56%

Hierarchical Prompting Assists Large Language Model on Web Navigation

Abishek Sridhar, Robert Lo, Frank F. Xu, Hao Zhu, Shuyan Zhou

专题命中 视觉空间推理 :分类 cs.CL、cs.AI、cs.LG;reasoning(comments)

Comments EMNLP 2023 Findings; Natural Language Reasoning and Structured Explanations Workshop at ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.06150 2018-09-20 cs.RO cs.AI cs.CL cs.LG 56%

FollowNet: Robot Navigation by Following Natural Language Directions with Deep Reinforcement Learning

Pararth Shah, Marek Fiser, Aleksandra Faust, J. Chase Kew, Dilek Hakkani-Tur

专题命中 视觉空间推理 :分类 cs.CL、cs.AI、cs.LG;planning(journal_ref)

Comments 7 pages, 8 figures

Journal ref Third Workshop in Machine Learning in the Planning and Control of Robot Motion at ICRA, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03947 2017-09-13 cs.RO 56%

Constant Space Complexity Environment Representation for Vision-based Navigation

Jeffrey Kane Johnson

专题命中 视觉空间推理 :planning(abstract,comments)

Comments IROS 2017: 9th Workshop on Planning, Perception and Navigation for Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26947 2026-08-28 cs.RO cs.CV 新提交 50%

4DSynth: Controllable Procedural World Synthesis for Dynamic Embodied Simulation

4DSynth:面向动态具身模拟的可控程序式世界合成

Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyang Sun

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26744 2026-08-28 cs.CV 新提交 50%

G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification

G2D:用于零样本图像分类的生成式到判别式协同推理框架

Zehua Hao, Fang Liu, Qinliang Wang, Yaoyang Du, Xinyan Huang, Puhua Chen

机构 * Xidian University(西安电子科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 G2D是一种无需训练的零样本图像分类框架,通过生成式VLM验证CLIP检索的候选,在8个基准上平均准确率达68.85%,优于CLIP及独立生成式模型,还可迁移至其他模型。

Comments Accepted at ACM MM 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25845 2026-08-27 cs.CV 新提交 50%

THA-Flow Generative Model: Prosthesis Geometry Prediction from Preoperative CT

THA-Flow生成模型:基于术前CT的假体几何预测

Yiping Wang, Jie Li, Jingyu Shen, Liao Wang

机构 * Changzhou Jinse Medical Information Technology Co., Ltd.(常州金色医疗信息技术有限公司) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本研究提出THA-Flow生成模型,通过AutoencoderKL和三维UNet从术前CT生成三维假体几何,在1355个髋关节数据上验证,实现了THA三维手术规划的生成式AI首次应用。

Comments 17 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 50%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23869 2026-08-26 cs.CV 新提交 50%

Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

Gen2Physics:通过多视图材料分解将生成的三维网格与物理特性关联

Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis, Philipp Henzler, Manuel Sanchez

机构 * University of Bristol(布里斯托大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Gen2Physics是一个将生成的三维网格与物理特性关联的自动化框架,通过多视图材料分解实现,其材料分割精度较现有方法提升超一倍,还能输出水密性各材料子网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 50%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30972 2026-08-26 cs.CV 版本更新 50%

BiSegMamba: Efficient Bidirectional Tri-Oriented Mamba for 3D Medical Image Segmentation

BiSegMamba: 用于3D医学图像分割的高效双向三向Mamba

Bakht Zada, Chao Tong, Qile Su, Shuai Zhang

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出BiSegMamba,一种基于双向三向Mamba的高效3D医学图像分割网络,通过渐进压缩主干、多尺度空间混合器、双向正交Mamba块和自适应方向融合,在降低计算成本的同时提升分割精度。

Comments Code is available at: https://github.com/bakhtzadaabshare/BiSegMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22093 2026-08-25 cs.RO 新提交 50%

EndoNav: Semantic-to-Geometric Grounding for Language-Guided Robotic Endoscopic Examination

EndoNav:面向语言引导的机器人内窥镜检查的语义到几何的 grounding(语义几何关联)

Jecia Z. Y. Mao, Hisashi Ishida, Kathryn Jung, Masaru Ishii, Russell H. Taylor, Manish Sahu

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究人员提出 EndoNav 框架,可将外科医生高级命令转换为患者特异性鼻窦解剖内的自主内窥镜可视化行为,其可视化效果接近住院外科医生水平,验证了该方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21628 2026-08-25 cs.SE cs.RO 新提交 50%

ExploreAI: Agentic Exploration Knowledge Bases for Reproducible Observable-Regression Testing of Black-Box VR and 3D Applications

ExploreAI:用于黑盒VR与3D应用可复现可观测回归测试的智能探索知识库

Jiajie Wang, Kebin Peng, Wei Wang, Xiaoyin Wang, Sen He, Xue Qin

专题命中 视觉空间推理 :planning(abstract)

AI总结 ExploreAI是LLM驱动的智能体框架,通过构建探索知识库(EKB),实现黑盒VR与3D应用的可复现可观测回归测试,在多场景中验证了其有效性。

Comments 11 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21447 2026-08-25 cs.CV 新提交 50%

BIMScript: Material-Aware Structured Scene Programs for BIM Ingestion

BIMScript:用于BIM导入的材料感知结构化场景程序

Prakash Kondibhau Naikade, Thomas B. Moeslund, Andreas Møgelmose

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出BIMScript,通过扩展布局语言属性、优化解码方案、改进粒度处理,实现合成扫描数据到BIM工具的端到端自动导入,且支持大语言模型驱动的可持续性推理。

Comments Project Page: see https://bimscriptworld.github.io/BIMScript/ ; to be published in ECCV 2026 TwinWorld Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-25 cs.CV cs.RO 版本更新 50%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20691 2026-08-24 cs.CV 新提交 50%

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

连接语言与球面空间:面向全景生成的以对象为中心的控制方法

Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19298 2026-08-21 cs.CV 新提交 50%

SceneGTMM: A Conformal Mapping-based Scene-Aware Transferable GNN-Transformer Dual-Graph Interaction Framework for Map Matching

SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架

Yongliang Zhang, Feng Song, Ji Chen, Lishuai Guo, Yong Deng, Yue Zheng, Tianyi Liu, Zhixiong Chen, Qixin Zhang

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-08-21 cs.CV 版本更新 50%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-08-21 cs.CV cs.RO 版本更新 50%

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02846 2026-08-21 cs.CV 50%

Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?

瞬间动作预见:多模态线索能替代视频到何种程度?

Manuel Benavent-Lledo, Konstantinos Bacharidis, Victoria Manousaki, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Universidad de Alicante(阿利坎特大学) Foundation for Research and Technology-Hellas(希腊基础研究与技术基金会) University of Crete(克里特大学) Hellenic Mediterranean University(希腊地中海大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AAG通过结合单帧RGB特征与深度线索及先前动作信息,实现了多模态单帧动作预见,能与视频聚合基线和先进方法在教学活动数据集上竞争。

Comments Accepted in WACV 2026 - Applications Track

Journal ref 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏