AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
AtomThink: 多模态慢思考与原子步骤推理
Kun Xiang, Zhili Liu, Terry Jingchen Zhang, Yinya Huang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Hanhui Li, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang
机构
*
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
ETH Zurich(苏黎世联邦理工学院)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Hong Kong(香港大学)
;
Noah’s Ark Lab(诺亚实验室)
;
Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科)
;
Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所)
;
Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科)
;
Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科)
;
Institute of Pathology, Fudan University(复旦大学病理研究所)
;
Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)
Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making
为何文本占上风:视觉可能损害多模态医疗决策制定
Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan
机构
*
University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学)
;
University of Pittsburgh(匹兹堡大学)
;
NC State University(北卡罗来纳州立大学)
;
University of Washington(华盛顿大学)
;
University of Maryland(马里兰大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning
无需训练的双双曲适配器用于更高效的跨模态推理
Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)
;
Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系)
;
Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
大规模多模态数据集与基准用于人类活动场景理解和推理
Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing
机构
*
The Chinese University of Hong Kong, Hong Kong(香港中文大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Columbia University(哥伦比亚大学)
;
University of Pittsburgh(匹兹堡大学)
专题命中
视觉推理
:vision language model(abstract);分类 cs.CV、cs.AI
机构
*
MILA – Quebec AI Institute(魁北克人工智能研究所)
;
Polytechnique Montréal(蒙特利尔理工学院)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
;
Institute for Machine Learning, Johannes Kepler University Linz(林茨约瑟夫·夫兰克大学机器学习研究所)
;
Nankai University(南开大学)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
SAT:多模态语言模型的动态空间能力训练
Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko
机构
*
Boston University(波士顿大学)
;
University of Washington(华盛顿大学)
;
Allen Institute for AI(人工智能研究院)
;
Microsoft Research(微软研究院)
;
New York University(纽约大学)