机构
*
School of Control Science and Engineering, Shandong University, Jinan, 250061, China(控制科学与工程学院,山东大学,济南,250061,中国)
;
Engineering Research Center of Intelligent Unmanned System, Ministry of Education, China(智能无人系统工程研究中心,教育部,中国)
;
Department of Geriatric Neurology, Qilu Hospital of Shandong University, Jinan, 250061, China(老年神经内科,山东大学齐鲁医院,济南,250061,中国)
;
Shandong Inspur Science Research Institute Co., Ltd.(山东浪潮科学研究院有限公司)
Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models
令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩
Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu
机构
*
College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学)
;
Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学)
;
College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
TAViS: 基于文本的音频视觉分割与基础模型
Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han
机构
*
Northwestern Polytechnical University(西北工业大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)
专题命中
音频语音多模态
:audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)
机构
*
School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院)
;
School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院)
;
School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
Peng Cheng Laboratory, Shenzhen(鹏城实验室)
Understanding World or Predicting Future? A Comprehensive Survey of World Models
理解世界还是预测未来?世界模型的全面综述
Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li
机构
*
Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)
专题命中
多模态生成
:multimodal(abstract);分类 cs.CL、cs.AI
AI总结
本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。
CommentsExtended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables