arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2410.23242 2025-01-06 cs.AI 57%

A little less conversation, a little more action, please: Investigating the physical common-sense of LLMs in a 3D embodied environment

Matteo G. Mecattaf, Ben Slater, Marko Tešić, Jonathan Prunty, Konstantinos Voudouris, Lucy G. Cheke

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 25 pages, 4 figures; v2: Added AFMR Acknowledgment

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05840 2025-01-03 cs.CL 57%

MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct

Run Luo, Haonan Zhang, Longze Chen, Ting-En Lin, Xiong Liu, Yuchuan Wu, Min Yang, Minzheng Wang, Pengpeng Zeng, Lianli Gao, Heng Tao Shen, Yunshui Li, Xiaobo Xia, Fei Huang, Jingkuan Song, Yongbin Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19595 2024-12-30 cs.RO cs.AI 57%

SocRATES: Towards Automated Scenario-based Testing of Social Navigation Algorithms

Shashank Rao Marpally, Pranav Goyal, Harold Soh

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02989 2024-12-30 cs.RO cs.AI 57%

Learning Semantic Traversability with Egocentric Video and Automated Annotation Strategy

Yunho Kim, Jeong Hyun Lee, Choongin Lee, Juhyeok Mun, Donghoon Youm, Jeongsoo Park, Jemin Hwangbo

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2024, First two authors contributed equally

Journal ref IEEE Robotics and Automation Letters (Volume: 9, Issue: 11, November 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11061 2024-12-30 cs.CV cs.AI cs.RO 57%

PhotoBot: Reference-Guided Interactive Photography via Natural Language

Oliver Limoyo, Jimmy Li, Dmitriy Rivkin, Jonathan Kelly, Gregory Dudek

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments In Proceedings of the IEEE/RSJ International Conference on Intelligent Robotics and Systems (IROS'24), Abu Dhabi, UAE, Oct. 14-18, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16270 2024-12-24 cs.AI cs.HC 57%

MetaScientist: A Human-AI Synergistic Framework for Automated Mechanical Metamaterial Design

Jingyuan Qi, Zian Jia, Minqian Liu, Wangzhi Zhan, Junkai Zhang, Xiaofei Wen, Jingru Gan, Jianpeng Chen, Qin Liu, Mingyu Derek Ma, Bangzheng Li, Haohui Wang, Adithya Kulkarni, Muhao Chen, Dawei Zhou, Ling Li, Wei Wang, Lifu Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13187 2024-12-19 cs.CV cs.LG 57%

HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction

Chen Bao, Jiarui Xu, Xiaolong Wang, Abhinav Gupta, Homanga Bharadhwaj

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11258 2024-12-17 cs.RO cs.AI cs.CV 57%

GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMs

Xinli Xu, Wenhang Ge, Dicong Qiu, ZhiFei Chen, Dongyu Yan, Zhuoyun Liu, Haoyu Zhao, Hanfeng Zhao, Shunsi Zhang, Junwei Liang, Ying-Cong Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10605 2024-12-17 cs.CV cs.AI 57%

MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration

Yanbo Ding, Shaobin Zhuang, Kunchang Li, Zhengrong Yue, Yu Qiao, Yali Wang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10455 2024-12-17 cs.CV cs.AI cs.CG 57%

Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning

Shihao Xu, Yiyang Luo, Wei Shi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10402 2024-12-17 cs.AI cs.RO 57%

TANGO: Training-free Embodied AI Agents for Open-world Tasks

Filippo Ziliotto, Tommaso Campari, Luciano Serafini, Lamberto Ballan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10348 2024-12-16 cs.CV cs.AI 57%

A dual contrastive framework

Yuan Sun, Zhao Zhang, Jorge Ortiz

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12498 2024-12-16 cs.CV cs.LG cs.RO 57%

Feudal Networks for Visual Navigation

Faith Johnson, Bryan Bo Cao, Ashwin Ashok, Shubham Jain, Kristin Dana

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18938 2024-12-04 cs.CV cs.AI 57%

From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding

Heqing Zou, Tianze Luo, Guiyang Xie, Victor, Zhang, Fengmao Lv, Guangcong Wang, Junyang Chen, Zhuochen Wang, Hansheng Zhang, Huaijian Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19589 2024-12-02 cs.CL 57%

Can Large Language Models Reason about the Region Connection Calculus?

Anthony G Cohn, Robert E Blackwell

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments 13 pages. arXiv admin note: text overlap with arXiv:2309.15577

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15027 2024-11-25 cs.RO cs.AI cs.HC 57%

Time is on my sight: scene graph filtering for dynamic environment perception in an LLM-driven robot

Simone Colombani, Luca Brini, Dimitri Ognibene, Giuseppe Boccignone

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02423 2024-11-06 cs.HC cs.AI 57%

Development of CODO: A Comprehensive Tool for COVID-19 Data Representation, Analysis, and Visualization

Biswanath Dutta, Debanjali Bain

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 15 pages, 4 figures, journal

Journal ref Journal of Information and Knowledge, Vol. 61, no. 5, pp. 245-253 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07433 2024-11-05 cs.CV cs.AI 57%

Controllable Navigation Instruction Generation with Chain of Thought Prompting

Xianghao Kong, Jinyu Chen, Wenguan Wang, Hang Su, Xiaolin Hu, Yi Yang, Si Liu

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.AI

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13510 2024-10-18 cs.CL cs.CV 57%

GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models

Aditya Sharma, Aman Dalmia, Mehran Kazemi, Amal Zouaq, Christopher J. Pal

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11068 2024-10-16 cs.CV cs.LG cs.SD eess.AS 57%

Character-aware audio-visual subtitling in context

Jaesung Huh, Andrew Zisserman

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments ACCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10745 2024-10-15 cs.CV cs.AI 57%

FlexGen: Flexible Multi-View Generation from Text and Image Inputs

Xinli Xu, Wenhang Ge, Jiantao Lin, Jiawei Feng, Lie Xu, HanFeng Zhao, Shunsi Zhang, Ying-Cong Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05465 2024-10-15 cs.CV cs.LG 57%

HAMMR: HierArchical MultiModal React agents for generic VQA

Lluis Castrejon, Thomas Mensink, Howard Zhou, Vittorio Ferrari, Andre Araujo, Jasper Uijlings

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09206 2024-10-08 cs.RO cs.LG 57%

Context-Conditional Navigation with a Learning-Based Terrain- and Robot-Aware Dynamics Model

Suresh Guttikonda, Jan Achterhold, Haolong Li, Joschka Boedecker, Joerg Stueckler

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments ©2023 IEEE. Accepted for publication in European Conference on Mobile Robots (ECMR), 2023. Version including corrections (see p. 8)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03551 2024-10-07 cs.CV cs.AI cs.HC 57%

Constructive Apraxia: An Unexpected Limit of Instructible Vision-Language Models and Analog for Human Cognitive Disorders

David Noever, Samantha E. Miller Noever

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04102 2024-10-03 cs.CV cs.AI 57%

ArtVLM: Attribute Recognition Through Vision-Based Prefix Language Modeling

William Yicheng Zhu, Keren Ye, Junjie Ke, Jiahui Yu, Leonidas Guibas, Peyman Milanfar, Feng Yang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted at ECCV 2024. Contact: zhuwilliam[at]google[dot]com. GitHub: https://github.com/google-research/google-research/tree/master/attribute_with_prefixlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17922 2024-09-27 cs.AI 57%

Navigation in a simplified Urban Flow through Deep Reinforcement Learning

Federica Tonti, Jean Rabault, Ricardo Vinuesa

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02522 2024-09-24 cs.AI cs.RO 57%

Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments

Zhiyuan Li, Yanfeng Lu, Yao Mu, Hong Qiao

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05865 2024-09-10 cs.RO cs.LG 57%

Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments

Haritheja Etukuru, Norihito Naka, Zijin Hu, Seungjae Lee, Julian Mehu, Aaron Edsinger, Chris Paxton, Soumith Chintala, Lerrel Pinto, Nur Muhammad Mahi Shafiullah

专题命中 视觉空间推理 :verifier(abstract);分类 cs.LG

Comments Project website https://robotutilitymodels.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04576 2024-09-10 cs.RO cs.AI 57%

ActionFlow: Equivariant, Accurate, and Efficient Policies with Spatially Symmetric Flow Matching

Niklas Funk, Julen Urain, Joao Carvalho, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01630 2024-09-04 cs.RO cs.AI cs.ET 57%

SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems

Wenxiao Zhang, Xiangrui Kong, Thomas Braunl, Jin B. Hong

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏