arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2603.23676 2026-03-26 cs.AI cs.RO 70%

Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement

将视觉与语言接地于3D遮罩以实现长周期箱子整理

Ashish Malik, Caleb Lowe, Aayam Shrestha, Stefan Lee, Fuxin Li, Alan Fern

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23447 2026-03-25 cs.CV cs.AI 70%

3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding

3DCity-LLM:赋能多模态大语言模型进行3D城市级感知与理解

Yiping Chen, Jinpeng Li, Wenyu Ke, Yang Luo, Jie Ouyang, Zhongjie He, Li Liu, Hongchao Fan, Hao Wu

机构 * School of Geospatial Engineering and Science(测绘工程与科学学院) Sun Yat-sen University(中山大学) College of Electronic Science(电子科学学院) National University of Defense Technology(国防科技大学) Department of Civil and Environmental Engineering(土木与环境工程系) Norwegian University of Science and Technology(挪威科技大学) National Geomatics Center of China(中国国家测绘地理信息中心)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出3DCity-LLM框架,通过粗到细的特征编码策略和120万高质量数据集,提升城市级多模态感知与理解能力,实验表明其在空间推理和城市智能方面优于现有方法。

Comments 24 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI 70%

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI 70%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 70%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11554 2026-03-13 cs.CV cs.AI cs.RO 70%

MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

MANSION: 多楼层语言到3D场景生成用于长周期任务

Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su

机构 * Tsinghua University(清华大学) AgiBot McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 70%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06073 2026-03-09 cs.RO cs.AI 70%

Lifelong Embodied Navigation Learning

持续性具身导航学习

Xudong Wang, Jiahua Dong, Baichen Liu, Qi Lyu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) Shenyang Institute of Automation(沈阳自动化研究所) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Uni-Walker通过分解导航知识为共享和特定组件,解决持续性具身导航学习中的灾难性遗忘问题,提升导航代理的持续学习能力。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17702 2026-03-03 cs.CV cs.AI 70%

Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计

Xueyang Li, Jiahao Li, Yu Song, Yunzhong Lou, Xiangdong Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 视觉空间推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。

Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02814 2026-03-02 cs.AI 70%

Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting

放射科助手:一种协调专用工具的代理框架以实现可靠的放射学报告

Yongrui Yu, Zhongzhen Huang, Linjie Mu, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, Shanghai, China(商汤研究) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 放射科助手通过协调专用工具实现全面的放射学报告流程,提升报告准确性和临床标准符合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21135 2026-03-02 cs.RO cs.AI cs.CV 70%

SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

SocialNav: 为社交感知具身导航训练的人类启发式基础模型

Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang, Ning Guo

机构 * Amap, Alibaba Group, China(阿里集团阿地图,中国) Zhejiang University, China(浙江大学,中国)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 SocialNav通过分层架构和多阶段训练,实现了社交感知导航,显著提升了导航性能和社会合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 70%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09002 2026-02-10 cs.RO cs.AI 70%

From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection

从障碍到礼仪:基于VLM引导路径选择的机器人社交导航

Zilin Fang, Anxing Xiao, David Hsu, Gim Hee Lee

机构 * School of Computing(计算机学院) Smart Systems Institute(智能系统研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12126 2026-01-21 cs.AI 70%

UniMo: Unified Motion Generation and Understanding with Chain of Thought

UniMo: 基于推理链的统一运动生成与理解

Guocun Wang, Kenkun Liu, Jing Lin, Guorui Song, Jian Li, Xiaoguang Han

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22942 2026-01-01 cs.RO cs.AI 70%

AINav: Large Language Model-Based Adaptive Interactive Navigation

AINav: 基于大语言模型的自适应交互导航

Kangjie Zhou, Yao Mu, Haoyang Song, Yi Zeng, Pengying Wu, Han Gao, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。

Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18033 2025-12-29 cs.RO cs.AI 70%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 70%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02631 2025-12-03 cs.LG 70%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG 70%

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05227 2025-11-04 cs.RO cs.CV cs.LG cs.MM cs.SY eess.SY 70%

NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving

Qucheng Peng, Chen Bai, Guoxiang Zhang, Bo Xu, Xiaotong Liu, Xiaoyin Zheng, Chen Chen, Cheng Lu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22030 2025-10-28 eess.IV cs.AI cs.CV 70%

ReXGroundingCT: A 3D Chest CT Dataset for Segmentation of Findings from Free-Text Reports

Mohammed Baharoon, Luyang Luo, Michael Moritz, Abhinav Kumar, Sung Eun Kim, Xiaoman Zhang, Miao Zhu, Mahmoud Hussain Alabbad, Maha Sbayel Alhazmi, Neel P. Mistry, Lucas Bijnens, Kent Ryan Kleinschmidt, Brady Chrisler, Sathvik Suryadevara, Sri Sai Dinesh Jaliparthi, Noah Michael Prudlo, Mark David Marino, Jeremy Palacio, Rithvik Akula, Di Zhou, Hong-Yu Zhou, Ibrahim Ethem Hamamci, Scott J. Adams, Hassan Rayhan AlOmaish, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) SSM Health, St. Louis, MO(SSM健康系统,圣路易斯,密苏里州) Saint Louis University School of Medicine(圣路易斯大学医学院) Icahn School of Medicine at Mount Sinai(西奈山医院伊坎医学院) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究机构) Brigham and Women’s Hospital(布里金和妇女医院) Chest Radiology Division, Medical Imaging Department, King Abdullah Specialized Children’s Hospital(国王阿卜杜勒阿齐兹特殊儿童医院放射科,医学成像部门) King Abdulaziz Medical City, Ministry of National Guard Health Affairs(国王阿卜杜勒阿齐兹医疗城,国民卫队卫生事务部)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05020 2025-10-28 cs.RO cs.AI 70%

Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System

Haokun Liu, Zhaoqi Ma, Yunong Li, Junichiro Sugihara, Yicheng Chen, Jinjie Li, Moju Zhao

机构 * DRAGON Lab at Department of Mechanical Engineering, The University of Tokyo(东京大学机械工程系DRAGON实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 18 pages, 10 figures

Journal ref Advanced Intelligent Systems, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21955 2025-10-27 cs.CV cs.AI 70%

Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs

Insu Lee, Wooje Park, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25528 2025-10-22 cs.CV cs.AI cs.RO 70%

LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models

Pranav Saxena, Avigyan Bhattacharya, Ji Zhang, Wenshan Wang

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Human-aware Embodied AI Workshop @ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02838 2025-10-22 cs.AI 70%

I-Design: Personalized LLM Interior Designer

Ata Çelen, Guo Han, Konrad Schindler, Luc Van Gool, Iro Armeni, Anton Obukhov, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Journal ref Computer Vision - ECCV 2024 Workshops, Lecture Notes in Computer Science (LNCS), vol. 15624, pp. 217-234, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15065 2025-10-15 cs.LG cs.RO 70%

HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models

Trishna Chakraborty, Udita Ghosh, Xiaopan Zhang, Fahim Faisal Niloy, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25139 2025-09-30 cs.AI cs.CV cs.MM 70%

Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs

Yue Zhang, Tianyi Ma, Zun Wang, Yanyuan Qiao, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Adelaide(阿德莱德大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21928 2025-09-29 cs.RO cs.AI 70%

SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks

Jialiang Li, Wenzheng Wu, Gaojing Zhang, Yifan Han, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ShanghaiTech University(上海科技大学) University of Sussex(Sussex大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12446 2025-09-25 cs.MA cs.AI 70%

PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization

Dawei Xiang, Wenyan Xu, Kexin Chu, Tianqi Ding, Zixu Shen, Yiming Zeng, Jianchang Su, Wei Zhang

机构 * University of Connecticut(康涅狄格大学) Central University of Finance and Economics(中央财经大学) Baylor University(贝勒大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16721 2025-09-23 cs.CV cs.AI cs.RO 70%

Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 19 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏