MM-ACT: Learn from Multimodal Parallel Generation to Act
MM-ACT: 从多模态并行生成中学习以行动
Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The University of Hong Kong(香港大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
UniDiff: A Unified Diffusion Framework for Multimodal Time Series Forecasting
UniDiff: 一种用于多模态时间序列预测的统一扩散框架
Da Zhang, Bingyu Li, Zhuyuan Zhao, Junyu Gao, Feiping Nie, Xuelong Li
机构
*
School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安710072,中国)
;
Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)
机构
*
Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院)
;
Department of Biomedical Informatics, Stony Brook University(生物医学信息学系,石溪大学)
JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model
JambaTalk: 基于混合Transformer-Mamba模型的语音驱动3D说话人脸生成
Farzaneh Jafari, Stefano Berretti, Anup Basu
机构
*
University of Alberta, Multimedia Research Center (MRC)(阿尔伯塔大学多媒体研究中心)
;
University of Florence, Media Integration and Communication Center (MICC)(佛罗伦萨大学媒体整合与通信中心)
NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification
NeuroABench: 一种多模态评估基准,用于神经外科解剖识别
Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei
机构
*
Hong Kong Institute of Science and Innovation(香港科学与创新研究院)
;
The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院)
;
Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
CommentsThe article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
大规模多模态数据集与基准用于人类活动场景理解和推理
Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing
机构
*
The Chinese University of Hong Kong, Hong Kong(香港中文大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Columbia University(哥伦比亚大学)
;
University of Pittsburgh(匹兹堡大学)
机构
*
Zhejiang University(浙江大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of Manchester(曼彻斯特大学)
;
Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)
How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline
现代追踪器距离无人机-反无人机还有多远?一个百万级基准和新基线
Chunhui Zhang, Li Liu, Zhipeng Zhang, Yong Wang, Hao Wen, Xi Zhou, Shiming Ge, Yanfeng Wang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
CloudWalk Technology Co., Ltd(云walk科技有限公司)
;
School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空宇航学院)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)