arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-30 至 2025-09-30 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2506.06856 2025-09-30 cs.CV 82%

Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning

Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

机构 * Sangfor Technologies The Australian National University(澳大利亚国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24640 2025-09-30 cs.CV cs.AI 79%

Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs

Mohamad Ballout, Okajevo Wilfred, Seyedalireza Yaghoubi, Nohayr Muhammad Abdelmoneim, Julius Mayer, Elia Bruni

机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23757 2025-09-30 cs.AI cs.CV 79%

Transparent Visual Reasoning via Object-Centric Agent Collaboration

Benjamin Teoh, Ben Glocker, Francesca Toni, Avinash Kori

机构 * Imperial College London, UK(伦敦帝国学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25185 2025-09-30 cs.CV 78%

PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images

Shuoshuo Zhang, Zijian Li, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Jun Zhang, Yujiu Yang, Rui Wang

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25151 2025-09-30 cs.CV 78%

VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning

Zhaozhi Wang, Tong Zhang, Mingyue Guo, Yaowei Wang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Lab(鹏城实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24321 2025-09-30 cs.RO 78%

SONAR: Semantic-Object Navigation with Aggregated Reasoning through a Cross-Modal Inference Paradigm

Yao Wang, Zhirui Sun, Wenzheng Chi, Baozhi Jia, Wenjun Xu, Jiankun Wang

机构 * Shenzhen Key Laboratory of Robotics Perception and Intelligence(机器人感知与智能深圳重点实验室) Department of Electronic and Electrical Engineering(电子与电气工程系) Southern University of Science and Technology(南方科技大学) Research Institute of Multiple Agents and Embodied Intelligence(多智能体与具身智能研究院) Peng Cheng Laboratory(鹏城实验室) Robotics and Microsystems Center(机器人与微系统中心) School of Mechanical and Electric Engineering(机械与电子工程学院) Soochow University(苏州大学) Xiamen Key Laboratory of Visual Perception Technology and Application(视觉感知技术与应用厦门重点实验室) Reconova Information Technology Co., Ltd.(Reconova信息技术有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13888 2025-09-30 cs.RO 78%

InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning

Ji Zhang, Shihan Wu, Xu Luo, Hao Wu, Lianli Gao, Heng Tao Shen, Jingkuan Song

机构 * Southwest Jiaotong University(西南交通大学) University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25139 2025-09-30 cs.AI cs.CV cs.MM 70%

Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs

Yue Zhang, Tianyi Ma, Zun Wang, Yanyuan Qiao, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Adelaide(阿德莱德大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23563 2025-09-30 cs.RO cs.AI cs.CV cs.LG 62%

RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation

Seungchan Kim, Omar Alama, Dmytro Kurdydyk, John Keller, Nikhil Keetha, Wenshan Wang, Yonatan Bisk, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Davidson College(戴维森学院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22698 2025-09-30 cs.RO cs.AI 57%

Advancing Audio-Visual Navigation Through Multi-Agent Collaboration in 3D Environments

Hailong Zhang, Yinfeng Yu, Liejun Wang, Fuchun Sun, Wendong Zheng

机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25190 2025-09-30 cs.CV 50%

Visual Jigsaw Post-Training Improves MLLMs

Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Linköping University(_linköping大学) SenseTime Research(商汤科技研究院)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23641 2025-09-30 cs.CV cs.RO 50%

From Static to Dynamic: a Survey of Topology-Aware Perception in Autonomous Driving

Yixiao Chen, Ruining Yang, Xin Chen, Jia He, Dongliang Xu, Yue Yao

机构 * Sems Shandong University(山东大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏