arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2506.21976 2025-06-30 cs.LG cs.AI cs.CV cs.MA cs.RO 62%

SceneDiffuser++: City-Scale Traffic Simulation via a Generative World Model

Shuhan Tan, John Lambert, Hong Jeon, Sakshum Kulshrestha, Yijing Bai, Jing Luo, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Waymo LLC(Waymo公司) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20917 2025-06-27 cs.CL cs.AI 62%

Optimising Language Models for Downstream Tasks: A Post-Training Perspective

Zhengyan Shi

机构 * Faculty of Engineering(工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21909 2025-06-27 cs.CL cs.LG cs.SE 62%

SceneGenAgent: Precise Industrial Scene Generation with Coding Agent

Xiao Xia, Dan Zhang, Zibo Liao, Zhenyu Hou, Tianrui Sun, Jing Li, Ling Fu, Yuxiao Dong

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05414 2025-06-09 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 62%

SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing

Mingfei Chen, Zijun Cui, Xiulong Liu, Jinlin Xiang, Caleb Zheng, Jingyuan Li, Eli Shlizerman

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Project website with demo videos: https://zijuncui02.github.io/SAVVY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00958 2025-05-14 cs.CV cs.CL cs.LG 62%

2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining

Wenqi Zhang, Hang Zhang, Xin Li, Jiashuo Sun, Yongliang Shen, Weiming Lu, Deli Zhao, Yueting Zhuang, Lidong Bing

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06507 2025-05-13 cs.AI cs.CV cs.LG 62%

Text-to-CadQuery: A New Paradigm for CAD Generation with Scalable Large Model Capabilities

Haoyang Xie, Feng Ju

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04972 2025-05-09 cs.RO cs.AI cs.CV cs.LG cs.NI 62%

AI and Vision based Autonomous Navigation of Nano-Drones in Partially-Known Environments

Mattia Sartori, Chetna Singhal, Neelabhro Roy, Davide Brunelli, James Gross

机构 * KTH Royal Institute of Technology(皇家理工学院) Inria France(法国国家信息与自动化研究所) University of Trento(特伦托大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments in DCOSS-IoT 2025, Wi-DroIT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10146 2025-05-09 cs.LG cs.AI 62%

GeoUni: A Unified Model for Generating Geometry Diagrams, Problems and Problem Solutions

Jo-Ku Cheng, Zeren Zhang, Ran Chen, Jingyang Deng, Ziran Qin, Jinwen Ma

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Electronic, Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15388 2025-04-23 cs.AI cs.LG cs.MA 62%

Investigating Relational State Abstraction in Collaborative MARL

Sharlin Utke, Jeremie Houssineau, Giovanni Montana

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 39 No. 20 (2025), 20947-20955

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03312 2025-04-22 cs.CV cs.AI cs.LG 62%

Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters

Kevin Y. Li, Sachin Goyal, Joao D. Semedo, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10786 2025-04-17 cs.CV cs.AI cs.LG 62%

Visual Language Models show widespread visual deficits on neuropsychological tests

Gene Tangtartharakul, Katherine R. Storrs

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 31 pages, 3 figures, 1 supplementary document with 1 figure and 51 sample images; corrected typo in Fig 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03572 2025-04-15 cs.CV cs.AI cs.LG cs.RO 62%

Navigation World Models

Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments CVPR 2025. Project page: https://www.amirbar.net/nwm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04752 2025-04-11 cs.LG cs.CL cs.NE 62%

SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking

Xingrun Xing, Boyan Gao, Zheng Zhang, David A. Clifton, Shitao Xiao, Li Du, Guoqi Li, Jiajun Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06269 2025-04-10 cs.IR cs.AI cs.CL 62%

EXCLAIM: An Explainable Cross-Modal Agentic System for Misinformation Detection with Hierarchical Retrieval

Yin Wu, Zhengxuan Zhang, Fuling Wang, Yuyu Luo, Hui Xiong, Nan Tang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04550 2025-04-08 cs.CV cs.AI cs.LG cs.RO 62%

Advancing Egocentric Video Question Answering with Multimodal Large Language Models

Alkesh Patel, Vibhav Chitalia, Yinfei Yang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01095 2025-04-02 cs.AI cs.CV cs.LG 62%

VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models

Muchao Ye, Weiyang Liu, Pan He

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19794 2025-03-26 cs.CV cs.AI cs.LG 62%

PAVE: Patching and Adapting Video Large Language Models

Zhuoming Liu, Yiquan Li, Khoi Duc Nguyen, Yiwu Zhong, Yin Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments CVPR2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19921 2025-03-18 cs.CV cs.AI cs.CL cs.GR 62%

SIMS: Simulating Stylized Human-Scene Interactions with Retrieval-Augmented Script Generation

Wenjia Wang, Liang Pan, Zhiyang Dou, Jidong Mei, Zhouyingcheng Liao, Yuke Lou, Yifan Wu, Lei Yang, Jingbo Wang, Taku Komura

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07927 2025-03-18 cs.AI cs.CL cs.HC 62%

A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications

Pranab Sahoo, Ayush Kumar Singh, Sriparna Saha, Vinija Jain, Samrat Mondal, Aman Chadha

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07871 2025-03-12 cs.CL cs.AI cs.IR 62%

MapQA: Open-domain Geospatial Question Answering on Map Data

Zekun Li, Malcolm Grossman, Eric, Qasemi, Mihir Kulkarni, Muhao Chen, Yao-Yi Chiang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06978 2025-03-11 cs.CV cs.AI cs.LG cs.RO 62%

Lightweight Multimodal Artificial Intelligence Framework for Maritime Multi-Scene Recognition

Xinyu Xi, Hua Yang, Shentai Zhang, Yijie Liu, Sijin Sun, Xiuju Fu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 4 figures, submitted to Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06820 2025-03-11 cs.CV cs.AI cs.LG 62%

Towards Fine-Grained Video Question Answering

Wei Dai, Alan Luo, Zane Durante, Debadutta Dash, Arnold Milstein, Kevin Schulman, Ehsan Adeli, Li Fei-Fei

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06014 2025-03-11 cs.CV cs.AI cs.LG cs.RO 62%

Towards Ambiguity-Free Spatial Foundation Model: Rethinking and Decoupling Depth Ambiguity

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 32 pages, 31 figures, github repo: https://github.com/Xiaohao-Xu/Ambiguity-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04982 2025-03-10 cs.CV cs.AI cs.CL 62%

LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression

Souvik Kundu, Anahita Bhiwandiwalla, Sungduk Yu, Phillip Howard, Tiep Le, Sharath Nittur Sridhar, David Cobbley, Hao Kang, Vasudev Lal

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments This work has been accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11142 2025-03-10 cs.AI cs.CL cs.CV 62%

NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM

Zihan Wang, Yaohui Zhu, Gim Hee Lee, Yachun Fan

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05218 2025-03-05 cs.LG cs.CL stat.ML 62%

Density estimation with LLMs: a geometric investigation of in-context learning trajectories

Toni J. B. Liu, Nicolas Boullé, Raphaël Sarfati, Christopher J. Earls

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15392 2025-02-24 cs.AI cs.CL cs.CV 62%

Chitrarth: Bridging Vision and Language for a Billion People

Shaharukh Khan, Ayush Tarun, Abhinav Ravi, Ali Faraz, Akshat Patidar, Praveen Kumar Pokala, Anagha Bhangare, Raja Kolla, Chandra Khatri, Shubham Agarwal

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11149 2025-02-20 cs.LG cs.AI 62%

Large Language-Geometry Model: When LLM meets Equivariance

Zongzhao Li, Jiacheng Cen, Bing Su, Wenbing Huang, Tingyang Xu, Yu Rong, Deli Zhao

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04359 2025-02-10 cs.CL cs.AI cs.CV 62%

Exploring Spatial Language Grounding Through Referring Expressions

Akshar Tumu, Parisa Kordjamshidi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06234 2025-01-28 cs.CV cs.AI cs.LG 62%

TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data

Jeremy Andrew Irvin, Emily Ruoyu Liu, Joyce Chuyi Chen, Ines Dormoy, Jinyoung Kim, Samar Khanna, Zhuo Zheng, Stefano Ermon

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏