arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-11 至 2025-11-11 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2412.10566 2025-11-11 cs.CV 85%

EVLM: Self-Reflective Multimodal Reasoning for Cross-Dimensional Visual Editing

Umar Khalid, Kashif Munir, Hasan Iqbal, Azib Farooq, Jing Hua, Nazanin Rahnavard, Chen Chen, Victor Zhu, Zhengping Ji

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22146 2025-11-11 cs.CV cs.AI cs.LG 84%

Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs

Amirmohammad Izadi, Mohammad Ali Banayeeanzade, Fatemeh Askari, Ali Rahimiakbar, Mohammad Mahdi Vahedi, Hosein Hasani, Mahdieh Soleymani Baghshah

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2025 (Thirty-ninth Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05894 2025-11-11 cs.CV 82%

Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning

Fei Yu, Quan Deng, Shengeng Tang, Yuehua Li, Lechao Cheng

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06770 2025-11-11 cs.AR eess.IV 78%

ASTER: Attention-based Spiking Transformer Engine for Event-driven Reasoning

Tamoghno Das, Khanh Phan Vu, Hanning Chen, Hyunwoo Oh, Mohsen Imani

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Submitted for review at conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18135 2025-11-11 cs.CV 78%

MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation

Jiaxin Huang, Runnan Chen, Ziwen Li, Zhengqing Gao, Xiao He, Yandong Guo, Mingming Gong, Tongliang Liu

机构 * MBZUAI The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学) AI2Robotic

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06337 2025-11-11 cs.CV 67%

BuildingWorld: A Structured 3D Building Dataset for Urban Foundation Models

Shangfeng Huang, Ruisheng Wang, Xin Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07171 2025-11-11 cs.CV cs.AI cs.LG 62%

Federated Learning for Video Violence Detection: Complementary Roles of Lightweight CNNs and Vision-Language Models for Energy-Efficient Use

Sébastien Thuau, Siba Haidar, Rachid Chelouah

机构 * esieaLab, ETIS Laboratory(esiea实验室,ETIS实验室) ESIEA, University of CY Cergy(ESIEA,CY塞克大学) ETIS Laboratory, CNR1S, UMR8051(ETIS实验室,CNR1S,UMR8051)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 3 figures, ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06146 2025-11-11 cs.CL cs.AI cs.CV 62%

Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models

Akshar Tumu, Varad Shinde, Parisa Kordjamshidi

机构 * UC San Diego(加州大学圣地亚哥分校) IIT Kanpur(印度理工学院坎pur) Michigan State University(密歇根州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06087 2025-11-11 cs.CV cs.AI 57%

Hybrid CNN-ViT Framework for Motion-Blurred Scene Text Restoration

Umar Rashid, Muhammad Arslan Arshad, Ghulam Ahmad, Muhammad Zeeshan Anjum, Rizwan Khan, Muhammad Akmal

机构 * Department of Electrical Engineering, University of Engineering & Technology, New Campus, Lahore, Pakistan(电子工程系,工程科技大学,新校区,拉合尔,巴基斯坦) Department of Electrical, Electronic, and Future Technologies, Sheffield Hallam University, Sheffield S1 1WB, UK(电子、电气与未来技术系,谢菲尔德哈姆大学,谢菲尔德 S1 1WB,英国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17047 2025-11-11 cs.CV cs.AI 57%

Controllable Hybrid Captioner for Improved Long-form Video Understanding

Kuleen Sasse, Efsun Sarioglu Kayi, Arun Reddy

机构 * Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24838 2025-11-11 cs.CV cs.AI 57%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06840 2025-11-11 cs.CV cs.RO 50%

PanoNav: Mapless Zero-Shot Object Navigation with Panoramic Scene Parsing and Dynamic Memory

Qunchao Jin, Yilin Wu, Changhao Chen

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted as a poster in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06201 2025-11-11 cs.CV cs.HC 50%

Scene-Aware Urban Design: A Human-AI Recommendation Framework Using Co-Occurrence Embeddings and Vision-Language Models

Rodrigo Gallardo, Oz Fishman, Alexander Htet Kyaw

机构 * Department of Architecture(建筑系) Department of EECS(电子工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted to NEURIPS 2025 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01322 2025-11-11 cs.CV 50%

FreeInsert: Disentangled Text-Guided Object Insertion in 3D Gaussian Scene without Spatial Priors

Chenxi Li, Weijie Wang, Qiang Li, Bruno Lepri, Nicu Sebe, Weizhi Nie

机构 * Tianjin University(天津大学) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by ACMMM2025, Our project webpage: https://tjulcx.github.io/FreeInsert/

详情

展开后加载摘要…

URL PDF HTML 收藏