MINERVA: Evaluating Complex Video Reasoning
机构 * Google DeepMind(谷歌DeepMind) ; Columbia University(哥伦比亚大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Google DeepMind(谷歌DeepMind) ; Columbia University(哥伦比亚大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * The University of Hong Kong, Pok Fu Lam, Hong Kong(香港大学) ; Kuaishou Technology, Shenzhen, China(快手科技) ; The Hong Kong University of Science and Technology (HKUST), Hong Kong(香港科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Panasonic Connect Co., Ltd.(松下电器(中国)有限公司) ; Stanford University(斯坦福大学) ; Panasonic R&D Company of America(松下美国研发公司) ; Panasonic Holdings Corporation(松下控股公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * University of Stuttgart Germany(斯图加特大学) ; University of Tuebingen Germany(图宾根大学) ; The Center for Bionic Intelligence Tuebingen Stuttgart Germany(图宾根-斯图加特生物智能中心)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted at SIGGRAPH 2025, link: https://zhiminghu.net/hu25_hoigaze.html
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; University of Trento(特伦多大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Clinical Hospital of Chengdu Brain Science Institute(成都脑科学研究院临床医院) ; MOE Key Lab for NeuroInformation(教育部神经信息关键实验室) ; China-Cuba Belt and Road Joint Laboratory on Neurotechnology and Brain-Apparatus Communication(中 cuba 带路神经技术与脑-装置通信联合实验室) ; School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) ; School of Artificial Intelligence, Chongqing University of Education(重庆教育学院人工智能学院) ; Sichuan Academy of Medical Sciences and Sichuan Provincial People’s Hospital(四川省医学科学院和四川省人民医院) ; Research Unit of NeuroInformation (2019RU035), Chinese Academy of Medical Sciences(神经信息研究单位(2019RU035),中国医学科学院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
Comments 13 pages, 6 figures, 6 tables; This work has been submitted to Neural Networks for possible publication
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
Comments 12 pages (including references), 5 figures, 5 tables, and a paper/ethics checklist. Camera-Ready Copy for ICWSM 2025. This version uses the same results as the previously posted revise-and-resubmit version. Changes are mostly formatting adjustments
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) ; Microsoft Research(微软研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted in CVPR 2025
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
机构 * Meta Reality Labs(Meta现实实验室) ; FAIR, Meta(Meta人工智能研究机构) ; National University of Singapore(新加坡国立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments 13 pages, 5 figures; https://dibschat.github.io/ProVideLLM
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments CVPR 2025 Camera Ready Version. Project Page: https://videochat-online.github.io
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
Comments 16 pages, 6 figures, Accepted in ECCV 2022
Journal ref In European Conference on Computer Vision (pp. 185-200). Springer, Cham (2022)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted to IEEE TPAMI 2025
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
Comments AAAI 2025
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
Comments 22 pages, 15 figures; references added, typos corrected, new keyword "guided" added, new experimental data and related results updated; new keyword "Generative AI" added for clarity
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments ICME 2025
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV