Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)
专题命中
视觉推理
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Advanced Interdisciplinary Sciences(先进交叉科学学院)
;
School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院)
;
Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中
视觉推理
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
DGSeg:用于推理分割的语义-空间引导预测的动态门控
Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)
专题命中
视觉推理
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
Comments7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea
ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks
ReSiReg:面向语言条件机器人任务的空间一致语义
Simon Schwaiger, David Seyser, Alessandro Scherl, Wilfried Wöber, Gerald Steinbauer-Wagner
机构
*
Graz University of Technology, Institute of Software Engineering and Artificial Intelligence(格拉茨技术大学,软件工程与人工智能研究所)
;
University of Applied Sciences Technikum Wien, Department of Industrial Engineering(维也纳应用科技大学,工业工程系)
;
University of Alicante, Department of Computer Technology(阿利坎特大学,计算机技术系)
;
University of Natural Resources and Life Sciences, Institute for Integrative Nature Conservation Research(自然资源与生命科学大学,整合自然保护研究 institute)
机构
*
College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)
;
School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan
机构
*
New York University(纽约大学)
;
Sensetime Research(商汤科技研究院)
;
Tsinghua University(清华大学)
;
New York University Shanghai(上海纽约大学)
;
University of Georgia(佐治亚大学)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV