Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
Ground-R1: 通过强化学习激励基于地面的视觉推理
Meng Cao, Haoze Zhao, Can Zhang, Xiaojun Chang, Ian Reid, Xiaodan Liang
机构
*
Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
;
Peking University(北京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Sun Yat-sen University(中山大学)
MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment
MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理
Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim
机构
*
Seoul National University(首尔国立大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Florida(佛罗里达大学)
;
Epic Games
机构
*
Department of Robotics
;
Mechatronics Engineering, University of Dhaka, Bangladesh
;
Center for Computational \& Data Sciences, Independent University, Bangladesh
专题命中
视觉推理
:vision language model(abstract);VLM(abstract)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
SurgVidLM:迈向多粒度外科视频理解的大型语言模型
Guankun Wang, Junyi Wang, Wenjin Mo, Long Bai, Kun Yuan, Ming Hu, Jinlin Wu, Junjun He, Yiming Huang, Nicolas Padoy, Zhen Lei, Hongbin Liu, Nassir Navab, Hongliang Ren
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Sun Yat-sen University(中山大学)
;
University of Strasbourg(斯特拉斯堡大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Monash University(墨尔本大学)
;
Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS)
;
Shanghai AI Laboratory(上海人工智能实验室)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Data Science and Engineering, East China Normal University, Shanghai, China(数据科学与工程学院,东华大学,上海,中国)
;
Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国)
机构
*
Macquarie University(麦考瑞大学)
;
The University of Western Australia(西澳大学)
;
Stanford University(斯坦福大学)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Tsinghua University(清华大学)
;
Palmer Research Laboratories(帕勒尔研究实验室)
机构
*
Department of Computer Science, Tsinghua University(清华大学计算机科学系)
;
Quancheng Laboratory(清华云城实验室)
;
University of Waterloo, Canada(加拿大滑铁卢大学)
;
China University of Political Science and Law(中国政法大学)
;
MegaTech.AI Inc(MegaTech.AI公司)
Comments12 pages, 6 figures. Derives Transformer as a signal-noise decomposition operator via Maximizing Coding Rate Reduction. Identifies 'Attention Sink' as spectral resonance (Arnold Tongues) and proposes $π$-RoPE for dynamical stability
机构
*
School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(电子科技大学机械与电子工程学院)
;
Shanghai AI laboratory(上海人工智能实验室)