SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Under Review
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Under Review
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
Comments In Proceedings of the IEEE/RSJ International Conference on Intelligent Robotics and Systems (IROS'24), Abu Dhabi, UAE, Oct. 14-18, 2024
专题命中 视觉推理 :visual language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments COLM 2024. https://github.com/apple/ml-rpm-bench
专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.AI、cs.LG
Comments Project page: https://hy-motion.github.io/
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Accepted at ECCV2024
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Project website: whiteboard.cs.columbia.edu/
专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 6 figures, 4 tables
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 62 pages; work in progress
专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Total 120 pages. See our project at https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments FMDM@NeurIPS2023, Code and data: https://github.com/pkunlp-icler/PCA-EVAL/
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ICCV 2023
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted to NeurIPS 2019. Project page: https://deanplayerljx.github.io/tabvcr
Cambrian-P: 基于姿态的视频理解
机构 * New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; Meta FAIR
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。
Comments Project Page: https://cambrian-mllm.github.io/
MindClaw: 用于精确干预的闭环具身心理状态推理
机构 * Jilin University(吉林大学) ; Microsoft Asia(微软亚洲) ; National Taiwan University(国立台湾大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。
Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress
视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型
机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) ; University of Texas Health(德克萨斯大学健康科学中心) ; Virginia Hospital Center(弗吉尼亚医院中心) ; Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) ; Stanford University(斯坦福大学) ; Cedars-Sinai Medical Center(西达赛奈医疗中心) ; Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) ; University of California–Los Angeles(加州大学洛杉矶分校) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Columbia University(哥伦比亚大学)
专题命中 视觉推理 :VLM(abstract,comments);vision language model(abstract);分类 cs.AI
AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。
Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results
Journal ref npj Digital Medicine 8, 797 (2025)
NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理
专题命中 视觉推理 :multimodal large language model(title)
AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。
在变压器推理中为潜在算法路由建立基础
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉推理 :grounding(title)
AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。
Comments Accepted by COLM 2026
在思考之前,先学会决策:面向高效视觉推理的主动路由
机构 * Xi’an Jiaotong University(西安交通大学) ; ARC Lab, Tencent IEG(腾讯IEG ARC实验室) ; City University of Hong Kong(香港城市大学) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Harvard University(哈佛大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :visual reasoning(title)
AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。
Comments 36 pages, 20 figures
结构化可视化设计知识:用于基础生成推理和情境反馈
专题命中 视觉推理 :grounding(title)
AI总结 提出一种结构化方案,将可视化设计知识编码为带语义元数据的自然语言指南,支持专家编写、机器查询,并嵌入向量空间以分析冲突和跨领域原则,弥补符号系统与生成模型之间的鸿沟。
评估和引导多模态大语言模型中的模态偏好
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)
专题命中 视觉推理 :multimodal large language model(title)
AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。
Comments Modality Preference
FinCoT:在专家金融推理中 grounding 思维链
机构 * SCB 10X, SCBX Group(SCB 10X集团)
专题命中 视觉推理 :grounding(title)
AI总结 FinCoT通过整合专家金融推理蓝图,提升金融领域模型性能并减少推理成本,实现更可解释的推理过程。
Comments Accepted at FinNLP-2025, EMNLP (Oral Presentation)
通过上下文归一化增强长上下文推理用于检索增强生成
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc.(百度公司)
专题命中 视觉推理 :grounding(title)
AI总结 通过上下文归一化策略提升RAG在长上下文推理中的鲁棒性和稳定性