A Matter of Time: Revealing the Structure of Time in Vision-Language Models
机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
机构 * Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心、剑桥大学) ; Department of Engineering, University of Cambridge(工程系、剑桥大学) ; Department of Psychology, University of Cambridge(心理学系、剑桥大学) ; Department of Computer Science, University of Cambridge(计算机科学系、剑桥大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom, P. R. China(人工智能研究所(TeleAI),中国电信,中华人民共和国) ; College of Computer Science, Wuhan University(计算机科学学院,武汉大学) ; School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院,光学与电子学(iOPEN),西北工业大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments Submitted to LREC 2026. 11 pages, 5 figures
机构 * Microsoft Azure Research(微软Azure研究) ; Microsoft Research India(微软印度研究) ; University of Virginia(弗吉尼亚大学) ; Microsoft M365 Research(微软M365研究)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments Published at ACM SoCC 2025; 14 pages, 20 figures
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments 5 pages, 2 figures, 2 tables
机构 * Nlpie Research University of Zurich(Nlpie研究所 瑞士苏黎世大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Southern Methodist University(南方 Methodist 大学) ; The City University of Hong Kong(香港城市大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Connecticut(康涅狄格大学) ; Tsinghua University(清华大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tibet University(西藏大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * Mission San Jose High School(Mission San Jose 高中) ; Missouri University of Science and Technology(密苏里科学与技术大学) ; Michigan State University(密歇根州立大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
机构 * Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科学教育创新园) ; Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通运输物联网重点实验室,计算机科学与人工智能学院,武汉理工大学) ; State Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
机构 * CUHK MMLab(香港中文大学多模态实验室) ; CUHK (SZ)(香港中文大学(深圳)) ; Tsinghua University(清华大学) ; UCAS(中国科学院大学) ; CUHK HCCL(香港中文大学高性能计算实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1
机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) ; Saarland Informatics Campus(萨尔兰信息技术校区) ; Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
Journal ref published at WMT2025
专题命中 多模态生成 :multi-modal(title);multimodal(abstract)
Comments 8 pages, 6 figures, accepted in IEEE International Workshop on Computer-Aided Modeling and Design of Communication Links and Networks (CAMAD)
机构 * Apple(苹果公司)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
机构 * Lanzhou University(兰州大学) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Technical Report; Project Page: https://github.com/Shopee-MUG/MUG-V
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Human Language Technology Center of Excellence(人机语言技术卓越中心) ; University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Repo can be found here: https://github.com/alexmartin1722/wikivideo
机构 * organization= School of Chemical \& Biomolecular Engineering, Georgia Institute of Technology , addressline= 311 Ferst Drive NW , city= Atlanta , postcode= 30332 , state= GA , country= USA ; organization= Department of Chemical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Street , city= Pittsburgh , postcode= 15213 , state= PA , country= USA
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
Comments Submitted to "Current Opinion in Chemical Engineering" for peer review
机构 * Tulane University(路易斯安那州立大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Horizon Robotics ; University of Hong Kong(香港大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Nanjing University(南京大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
Comments IROS 2025
机构 * UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Anyscale
专题命中 多模态生成 :multimodal(abstract)
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * The University of Melbourne(墨尔本大学) ; China University of Petroleum (East China)(中国石油大学(华东))
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM
Comments Accepted by ACM Multimedia 2025
机构 * School of Software, Tsinghua University(清华大学软件学院) ; Ant Group(蚂蚁集团) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
机构 * MIT Media Lab(MIT媒体实验室) ; MIT EECS(MIT电子工程与计算机科学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Accepted as Oral at NeurIPS 2025. Revision after camera ready
机构 * Pervasive Systems, University of Twente(普罗威斯系统,埃因霍温大学) ; CYENS Center of Excellence(CYENS卓越中心) ; Cyprus University of Tecnhology(塞浦路斯技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV