LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
LAION-BVD:用于多模态预训练的千万小时级开源视频数据集
Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge
VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference
VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法
Lyuke Wang, Zhuo Li, Guangxu Zhu
机构
*
Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心)
;
Shenzhen Research Institute of Big Data(深圳大数据研究院)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shenzhen Loop Area Institute(深圳河套学院)
Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
超越视频:统一视频推理与深度研究的开放世界视频智能体
Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song
机构
*
Shandong University(山东大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beihang University(北京航空航天大学)
;
City University of Hong Kong(香港城市大学)
;
Nanyang Technological University(南洋理工大学)
;
Kuaishou Technology(快手科技)
;
Southern University of Science and Technology(南方科技大学)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见
Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding
机构
*
Zhejiang University(浙江大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
CommentsWe are currently building Gaming World Model and data engine that transfers game dynamics to robotics. Feel free to contact Dongping Chen (dongpingchen0612@gmail.com) if you are interested in research collaboration or financial support
PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos
PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验
Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)