arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2101.01169 2022-01-20 cs.CV cs.AI cs.LG 62%

Transformers in Vision: A Survey

Salman Khan, Muzammal Naseer, Munawar Hayat, Syed Waqas Zamir, Fahad Shahbaz Khan, Mubarak Shah

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 30 pages (Accepted in ACM Computing Surveys December 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07385 2021-12-21 cond-mat.mtrl-sci cs.AI cs.LG cs.MA physics.comp-ph 62%

Autonomous synthesis of metastable materials

Sebastian Ament, Maximilian Amsler, Duncan R. Sutherland, Ming-Chiang Chang, Dan Guevarra, Aine B. Connolly, John M. Gregoire, Michael O. Thompson, Carla P. Gomes, R. Bruce van Dover

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Journal ref Autonomous materials synthesis via hierarchical active learning of nonequilibrium phase diagrams, Science Advances, Vol 7, Issue 5, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.14039 2021-12-09 cs.LG cs.AI cs.NE 62%

Towards mental time travel: a hierarchical memory for reinforcement learning agents

Andrew Kyle Lampinen, Stephanie C. Y. Chan, Andrea Banino, Felix Hill

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2021; 10 pages main text; 29 pages total

Journal ref Advances in Neural Information Processing Systems, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.08960 2021-11-18 cs.CV cs.AI cs.LG 62%

Compositional Transformers for Scene Generation

Drew A. Hudson, C. Lawrence Zitnick

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at NeurIPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.08434 2021-10-07 cs.LG cs.AI stat.ML 62%

Graph Neural Networks: A Review of Methods and Applications

Jie Zhou, Ganqu Cui, Shengding Hu, Zhengyan Zhang, Cheng Yang, Zhiyuan Liu, Lifeng Wang, Changcheng Li, Maosong Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Published at AI Open 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08634 2021-09-20 cs.CL cs.AI 62%

Grounding Natural Language Instructions: Can Large Language Models Capture Spatial Information?

Julia Rozanova, Deborah Ferreira, Krishna Dubba, Weiwei Cheng, Dell Zhang, Andre Freitas

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments *Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.09240 2021-07-21 cs.LG cs.CL cs.CV 62%

Generative Video Transformer: Can Objects be the Words?

Yi-Fu Wu, Jaesik Yoon, Sungjin Ahn

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Published in ICML 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04132 2021-07-12 cs.CL cs.AI 62%

A Systematic Survey of Text Worlds as Embodied Natural Language Environments

Peter A Jansen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03427 2021-06-08 cs.AI cs.CL 62%

Hierarchical Task Learning from Language Instructions with Unified Transformers and Self-Monitoring

Yichi Zhang, Joyce Chai

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2021 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11213 2021-04-23 cs.CV cs.AI cs.LG cs.RO 62%

ManipulaTHOR: A Framework for Visual Object Manipulation

Kiana Ehsani, Winson Han, Alvaro Herrasti, Eli VanderBilt, Luca Weihs, Eric Kolve, Aniruddha Kembhavi, Roozbeh Mottaghi

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments CVPR 2021 -- (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.09224 2021-04-20 cs.CV cs.AI cs.LG cs.RO 62%

Multi-Modal Fusion Transformer for End-to-End Autonomous Driving

Aditya Prakash, Kashyap Chitta, Andreas Geiger

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08492 2021-04-20 cs.AI cs.LG 62%

A Self-Supervised Auxiliary Loss for Deep RL in Partially Observable Settings

Eltayeb Ahmed, Luisa Zintgraf, Christian A. Schroeder de Witt, Nicolas Usunier

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.07764 2021-02-18 cs.RO cs.AI cs.CV cs.LG cs.NE 62%

End-to-End Egospheric Spatial Memory

Daniel Lenton, Stephen James, Ronald Clark, Andrew J. Davison

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Conference paper at ICLR 2021. Implementation: https://github.com/ivy-dl/memory Project page: https://djl11.github.io/ESM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.00229 2021-02-05 cs.CL cs.AI cs.CV 62%

Multimodal Text Style Transfer for Outdoor Vision-and-Language Navigation

Wanrong Zhu, Xin Eric Wang, Tsu-Jui Fu, An Yan, Pradyumna Narayana, Kazoo Sone, Sugato Basu, William Yang Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.14359 2020-12-29 cs.AI cs.CV cs.LG cs.RO 62%

Commonsense Visual Sensemaking for Autonomous Driving: On Generalised Neurosymbolic Online Abduction Integrating Vision and Semantics

Jakob Suchan, Mehul Bhatt, Srikrishna Varadarajan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments This is a preprint / review version of an accepted contribution to be published as part of the Artificial Intelligence Journal (AIJ).? The article is an extended version of an IJCAI 2019 publication [74, arXiv:1906.00107]

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03912 2020-12-08 cs.CV cs.AI cs.LG cs.RO 62%

MultiON: Benchmarking Semantic Map Memory using Multi-Object Navigation

Saim Wani, Shivansh Patel, Unnat Jain, Angel X. Chang, Manolis Savva

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Project page: https://shivanshpatel35.github.io/multi-ON/ ; the first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01928 2020-11-04 cs.LG cs.AI cs.RO stat.ML 62%

Generalization to New Actions in Reinforcement Learning

Ayush Jain, Andrew Szot, Joseph J. Lim

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments ICML 2020. Videos and code: https://sites.google.com/view/action-generalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01298 2020-10-06 cs.LG cs.AI cs.RO stat.ML 62%

Beyond Tabula-Rasa: a Modular Reinforcement Learning Approach for Physically Embedded 3D Sokoban

Peter Karkus, Mehdi Mirza, Arthur Guez, Andrew Jaegle, Timothy Lillicrap, Lars Buesing, Nicolas Heess, Theophane Weber

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00562 2020-10-02 cs.CL cs.AI cs.CV 62%

ISAAQ -- Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention

Jose Manuel Gomez-Perez, Raul Ortega

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication as a long paper in EMNLP2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.13165 2020-08-05 cs.RO cs.AI cs.LG 62%

Relational Graph Learning for Crowd Navigation

Changan Chen, Sha Hu, Payam Nikdel, Greg Mori, Manolis Savva

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Accepted to IROS 2020. Added links to codes and video demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.00849 2020-06-23 cs.CV cs.CL cs.LG cs.MM 62%

Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers

Zhicheng Huang, Zhaoyang Zeng, Bei Liu, Dongmei Fu, Jianlong Fu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.04109 2020-02-12 cs.RO cs.AI cs.LG 62%

On Reward Shaping for Mobile Robot Navigation: A Reinforcement Learning and SLAM Based Approach

Nicolò Botteghi, Beril Sirmacek, Khaled A. A. Mustafa, Mannes Poel, Stefano Stramigioli

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12612 2019-10-16 cs.RO cs.AI cs.CV cs.LG 62%

Learning Navigation Subroutines from Egocentric Videos

Ashish Kumar, Saurabh Gupta, Jitendra Malik

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08792 2019-09-20 cs.RO cs.AI cs.LG 62%

Agent Prioritization for Autonomous Navigation

Khaled S. Refaat, Kai Ding, Natalia Ponomareva, Stéphane Ross

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments 8 pages, accepted to IEEE/RSJ International Conference on Robots and Systems (IROS) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10092 2019-04-09 cs.CV cs.AI cs.CL cs.RO 62%

Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation

Xin Wang, Qiuyuan Huang, Asli Celikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, Lei Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments CVPR 2019 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.04325 2018-06-12 cs.LG cs.AI stat.ML 62%

Efficient Model-Based Deep Reinforcement Learning with Variational State Tabulation

Dane Corneil, Wulfram Gerstner, Johanni Brea

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICML 2018; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.01203 2018-06-05 cs.LG cs.AI stat.ML 62%

Relational inductive bias for physical construction in humans and machines

Jessica B. Hamrick, Kelsey R. Allen, Victor Bapst, Tina Zhu, Kevin R. McKee, Joshua B. Tenenbaum, Peter W. Battaglia

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments In Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci 2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.00653 2018-03-05 cs.LG cs.AI cs.CV cs.RO 62%

Semi-parametric Topological Memory for Navigation

Nikolay Savinov, Alexey Dosovitskiy, Vladlen Koltun

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Published at International Conference on Learning Representations (ICLR) 2018. Project website at https://sites.google.com/view/SPTM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01904 2025-02-06 cs.CV cs.AI 61%

Virgo: A Preliminary Exploration on Reproducing o1-like MLLM

Yifan Du, Zikang Liu, Yifan Li, Wayne Xin Zhao, Yuqi Huo, Bingning Wang, Weipeng Chen, Zheng Liu, Zhongyuan Wang, Ji-Rong Wen

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI

Comments Technical Report on Slow Thinking with LLMs: Visual Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24103 2026-08-26 cs.AI 新提交 57%

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

ACE:用于多幻灯片演示自动化的自修正智能体画布编辑器

JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

机构 * Seoul National University(首尔大学) Miridih(米里迪)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI

AI总结 针对LLM智能体编辑演示文档的布局破坏与有效输出被误判问题,提出带CARE路由器和自修正循环的ACE,其性能优于对比方法,获盲评者偏好。

Comments 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏