机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Baidu Inc.(百度公司)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
基于动态视觉搜索和缩放的自适应聚焦推理方法用于高效VLMs
Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li
机构
*
organization= School of Computer Science \& Technology, Beijing Institute of Technology , city= Beijing , country= China
;
organization= State Key Laboratory of General Artificial Intelligence, BIGAI , city= Beijing , country= China
;
organization= School of Intelligence Science
;
Technology, Peking University , city= Beijing , country= China
;
organization= Guangdong Laboratory of Machine Perception
;
Intelligent Computing, Shenzhen MSU--BIT University , city= Shenzhen , country= China
;
organization= Department of Automation, Tsinghua University , city= Beijing , country= China
专题命中
视觉推理
:vision language model(abstract);visual reasoning(abstract);分类 cs.CV
机构
*
MILA – Quebec AI Institute(魁北克人工智能研究所)
;
Polytechnique Montréal(蒙特利尔理工学院)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
;
Institute for Machine Learning, Johannes Kepler University Linz(林茨约瑟夫·夫兰克大学机器学习研究所)
;
Nankai University(南开大学)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
SAT:多模态语言模型的动态空间能力训练
Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko
机构
*
Boston University(波士顿大学)
;
University of Washington(华盛顿大学)
;
Allen Institute for AI(人工智能研究院)
;
Microsoft Research(微软研究院)
;
New York University(纽约大学)