arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-29 至 2025-12-29 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2505.05622 2025-12-29 cs.RO cs.AI 83%

CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory

CityNavAgent:基于层次语义规划和全局记忆的空中视觉-语言导航

Weichen Zhang, Chen Gao, Shiquan Yu, Ruiying Peng, Baining Zhao, Qian Zhang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 CityNavAgent通过层次语义规划和全局记忆模块,提升空中视觉-语言导航在复杂城市环境中的导航性能。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18190 2025-12-29 cs.AI cs.CL cs.LG 82%

External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning

外部海马体:用于引导大语言模型推理的拓扑认知图

Jian Yan

机构 * School of Computer Science, Zunyi Normal University(计算机科学学院,遵义师范学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出External Hippocampus框架,通过拓扑认知图引导大语言模型推理,解决多步推理中的认知死锁问题,提升推理效率和准确性。

Comments 12 pages, 7 figures. v3: replaces v2 (uploaded in error); updated to two-column format; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 79%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21722 2025-12-29 cs.RO 78%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18033 2025-12-29 cs.RO cs.AI 70%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06157 2025-12-29 cs.CV cs.AI 57%

UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces

UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能

Baining Zhao, Jianjie Fang, Zichao Dai, Ziyou Wang, Jirong Zha, Weichen Zhang, Chen Gao, Yue Wang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。

Comments 22 pages

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏