LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航
Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
MBZUAI(穆罕默德·本·扎耶德人工智能大学)
;
Stanford University(斯坦福大学)
;
Amap, Alibaba Group(阿里巴巴集团高德地图)
;
Shanghai AI Laboratory(上海人工智能实验室)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率
Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Chinese Academy of Sciences(中国科学院)
;
Tsinghua University(清华大学)
COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization
COGITAO:一个用于研究组合性与泛化能力的视觉推理框架
Yassine Taoudi-Benchekroun, Klim Troyan, Pascal Sager, Stefan Gerber, Lukas Tuggener, Benjamin Grewe
机构
*
Institute of Neuroinformatics, University of Zurich(神经信息研究所,苏黎世大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Centre for Artificial Intelligence, Zurich University of Applied Sciences(人工智能中心,应用科学大学)
机构
*
The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学)
;
The University of Sydney, Sydney, New South Wales, Australia(悉尼大学)
;
School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院)
;
Shandong University of Technology, Beijing, China(山东理工大学)
机构
*
College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学)
;
State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室)
;
BNRist, Tsinghua University(清华大学北京研究院)
;
Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)
GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model
GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理
Lalit Maurya, Saurabh Kaushik, Beth Tellman
机构
*
Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院)
;
Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)
专题命中
视觉推理
:multimodal large language model(title);分类 cs.CV、cs.AI
CommentsWon the 'Best Paper Runner-up Award' at the 2024 IEEE International Automated Vehicle Validation Conference (IAVVC 2024). Also accepted at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics, at the Robotics Science and Systems Conference (RSS SemRob 2024)
Giacomo Camposampiero, Loic Houmard, Benjamin Estermann, Joël Mathys, Roger Wattenhofer
专题命中
视觉推理
:visual reasoning(title);分类 cs.AI、cs.LG
CommentsThe first two authors have contributed equally to this work. Accepted as regular paper at CVPR 2023 Workshop and Challenges for New Frontiers in Visual Language Reasoning: Compositionality, Prompts and Causality (NFVLR)
Abstract Visual Reasoning: An Algebraic Approach for Solving Raven's Progressive Matrices
Jingyi Xu, Tushar Vaidya, Yufei Wu, Saket Chandra, Zhangsheng Lai, Kai Fong Ernest Chong
专题命中
视觉推理
:visual reasoning(title);分类 cs.CV、cs.AI
CommentsAccepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2023. 30 pages, 7 figures (including supplementary material). First three authors contributed equally. Code is available at: https://github.com/Xu-Jingyi/AlgebraicMR