机构
*
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
State Key Laboratory of Multimedia Information Processing(国家多媒体信息处理重点实验室)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
Hong Kong University of Science and Technology(香港科技大学)
DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes
Sungjune Park, Hyunjun Kim, Junho Kim, Seongho Kim, Yong Man Ro
机构
*
Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST))
MSEarth: A Multimodal Scientific Dataset and Benchmark for Phenomena Uncovering in Earth Science
Xiangyu Zhao, Wanghan Xu, Bo Liu, Yuhao Zhou, Fenghua Ling, Ben Fei, Xiaoyu Yue, Lei Bai, Wenlong Zhang, Xiao-Ming Wu
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
Jingli Lin, Chenming Zhu, Runsen Xu, Xiaohan Mao, Xihui Liu, Tai Wang, Jiangmiao Pang
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The University of Hong Kong(香港大学)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Comments30 pages, a benchmark designed to evaluate Online Spatio-Temporal understanding from the perspective of an agent actively exploring a scene. Project Page: https://rbler1234.github.io/OSTBench.github.io/
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
Yifan Li, Zhenghao Chen, Ziheng Wu, Kun Zhou, Ruipu Luo, Can Zhang, Zhentao He, Yufei Zhan, Wayne Xin Zhao, Minghui Qiu
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
;
Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室)
;
ByteDance(字节跳动)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
机构
*
Shanghai Jiaotong University(上海交通大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
East China Normal University(华东师范大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
Kun Xiang, Heng Li, Terry Jingchen Zhang, Yinya Huang, Zirong Liu, Peixin Qu, Jixi He, Jiaqi Chen, Yu-Jie Yuan, Jianhua Han, Hang Xu, Hanhui Li, Mrinmaya Sachan, Xiaodan Liang
机构
*
Sun Yat-sen University(中山大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
The University of Hong Kong(香港大学)
;
ETH AI Center(苏黎世人工智能中心)
OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding
Jiancong Xie, Wenjin Wang, Zhuomeng Zhang, Zihan Liu, Qi Liu, Ke Feng, Zixun Sun, Yuedong Yang
机构
*
School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院)
;
Interactive Entertainment Group, Tencent Inc, China(腾讯互动娱乐集团)
;
Key Laboratory of Machine Intelligence and Advanced Computing (MOE), China(机器智能与先进计算重点实验室)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanjing University(南京大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Peking University(北京大学)
EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM
Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begüm Demir, Nicu Sebe, Paolo Rota
机构
*
University of Trento(特伦托大学)
;
BIFOLD and Technische Universität Berlin(BIFOLD和柏林技术大学)
;
Technical University of Munich(慕尼黑技术大学)
;
University of Pisa(比萨大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Training-Free Multimodal Deepfake Detection via Graph Reasoning
Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Yanyan Wei, Zhangling Duan, Zhaohong Jia
机构
*
School of Internet, Anhui University, Hefei, China(安徽大学互联网学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Hefei, China(合肥综合国家科学中心人工智能研究院)
;
Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(香港 Baptist 大学计算机科学系)