MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
MonoSR: 从单目图像进行开放词汇空间推理
Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li
机构
*
Technical University of Munich(慕尼黑工业大学)
;
A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Nanyang Technological University(南洋理工大学)
Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An
机构
*
Nanyang Technological University(南洋理工大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
East China University of Science and Technology(华东理工大学)
;
Singapore Management University(新加坡管理大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
Rheos: Modelling Continuous Motion Dynamics in Hierarchical 3D Scene Graphs
Rheos: 分层3D场景图中的连续运动动态建模
Iacopo Catalano, Francesco Verdoja, Javier Civera, Jorge Peña-Queralta, Julio A. Placed
机构
*
University of Turku(图尔库大学)
;
Centre for Artificial Intelligence, Zürich University of Applied Sciences(应用科学大学人工智能中心)
;
Instituto Tecnológico de Aragón (ITA) and the University of Zaragoza(阿拉贡理工大学和萨拉戈萨大学)
;
University of Zaragoza(萨拉戈萨大学)
;
School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)
机构
*
Central South University(中南大学)
;
Tsinghua University(清华大学)
;
South China Normal University(华南师范大学)
;
ByteDance Inc(字节跳动公司)
;
University of Zaragoza(阿拉维达大学)
;
CosmosMind
;
Wuhan University(武汉大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Southeast University(东南大学)
;
Tencent(腾讯公司)
;
Nankai University(南开大学)
;
Supermicro Computer Inc(Supermicro计算机公司)
;
Huazhong University of Science and Technology(华中科技大学)
Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning
位置重绑定缓存复用:交错多模态推理中无重放的视觉重访
Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu
机构
*
Sun Yat-sen University(中山大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Harbin Institute of Technology (HIT)(哈尔滨工业大学)
;
Fudan University(复旦大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning
Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏
Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu
机构
*
Xi’an Jiaotong University(西安交通大学)
;
MOE KLINNS Lab(MOE KLINNS实验室)
;
Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室)
;
Sun Yat-sen University(中山大学)
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Xiamen University(厦门大学)
;
Kling Team, Kuaishou Technology(快手科技Kling团队)
;
National University of Singapore(新加坡国立大学)
;
Southern University of Science and Technology(南方科技大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
The Hong Kong Polytechnic University(香港理工大学)
;
University of Michigan(密歇根大学)
;
Nanyang Technological University(南洋理工大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Tübingen(图宾根大学)
3D Scene Graphs: Open Challenges and Future Directions
3D场景图:开放挑战与未来方向
Dennis Rotondi, Francesco Argenziano, Sebastian Koch, Nathan Hughes, Martin Buechner, Johanna Wald, Lukas Rosenberger Schmid, Daniele Nardi, Abhinav Valada, Liam Paull, Federico Tombari, Luca Carlone, Kai O. Arras
机构
*
University of Stuttgart(斯图加特大学)
;
IMPRS-IS(马克斯·普朗克研究所-智能系统)
;
Sapienza University of Rome(罗马萨皮恩扎大学)
;
Google(谷歌)
;
MIT(麻省理工学院)
;
University of Freiburg(弗赖堡大学)
;
UTN University of Montreal(蒙特利尔大学UTN分校)
;
Mila TU Munich(慕尼黑技术大学Mila)
MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning
MathVis-Fine:通过渐进式依赖引导训练将视觉监督与必要性对齐的多模态数学推理
Wanshi Xu, Haokun Zhao, Haidong Yuan, Songjun Cao, Long Ma
机构
*
School of ECE, Peking University(北京大学电子与计算机工程学院)
;
College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院)
;
School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
;
Tencent Youtu Lab(腾讯优图实验室)
Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design
通过奖励设计解耦多模态大语言模型中的感知与推理
Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng
机构
*
Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系)
;
Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)
;
Independent Researcher(独立研究者)
机构
*
Tsinghua University(清华大学)
;
Chongqing University(重庆大学)
;
Peking University(北京大学)
;
ZenoMind AI
;
Xi’an Jiaotong University(西安交通大学)
;
Beijing Institute of Technology(北京理工大学)
;
Southeast University(东南大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Joy Future Academy(京东探索研究院)
;
The University of Hong Kong(香港大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao
机构
*
Xidian University(西安电子科技大学)
;
National University of Singapore(新加坡国立大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV