arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-21 至 2025-11-21 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3 篇

2511.14210 2025-11-21 cs.CV cs.AI cs.LG 81%

Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution

Orion:一个多模态感知、高级视觉推理与执行的统一视觉代理

N Dinesh Reddy, Dylan Snyder, Lona Kiragu, Mirajul Mohin, Shahrear Bin Amin, Sudeep Pillai

机构 * VLM Run Research(VLM Run研究)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Orion通过整合视觉推理与工具增强执行,实现了多模态感知、高级视觉推理与执行的统一,提升多步骤视觉智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 79%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16430 2025-11-21 cs.CV cs.LG 57%

Graph Neural Networks for Surgical Scene Segmentation

用于手术场景分割的图神经网络

Yihan Li, Nikhil Churamani, Maria Robu, Imanol Luengo, Danail Stoyanov

机构 * Medtronic Digital Technologies(梅奥医疗数字技术公司) UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于图神经网络的手术场景分割方法,结合视觉Transformer和图结构建模,提升分割精度与解剖一致性。

Comments 12 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏