PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models
PCA:用于快速视频大语言模型的持久性感知压缩与聚合
Zihan Song, Shuo Ye, Bo Zhao, Ruixin Zhang, Jiayu Zhang, Shouhong Ding, Zitong Yu
机构
*
Institute for Artificial Intelligence, Great Bay University(大湾区大学人工智能研究院)
;
Sun Yat-sen University(中山大学)
;
Youtu Lab, Tencent(腾讯优图实验室)
;
Shenzhen University(深圳大学)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?
Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang
机构
*
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
Zhongguancun Academy(中关村科学城)
;
School of Engineering, Westlake University(西湖大学工学院)
;
School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Hong Kong Polytechnic University(香港理工大学)
;
The University of Southern Queensland(南昆士兰大学)
Anthony Cioppa, Silvio Giancola, Håkan Ardö, Mohamad Dalal, Jan Held, Jérémie Ochin, Jiayuan Rao, Karen Sanchez, Renaud Vandeghen, Artur Xarles, Olivier Barnich, Albert Clapés, Mathieu Delvaux, Sergio Escalera, Bernard Ghanem, Cédric Hons, Antoine Houet, Sotiris Manitsaris, Tom Michel, Pierre Miralles, Thomas B. Moeslund, Mikael Nilsson, Bogdan Stanciulescu, Marc Van Droogenbroeck, Yanfeng Wang, Weidi Xie, Faisal Altawijri, Mohamed Atef, Semen Budennyy, Vasiliy Chelpanov, Puhua Chen, Yixin Chen, Lechao Cheng, Jianling Chu, Ju-Seong Do, Oleg Durygin, Omar Fetouh, Mirco Fuchs, Youssef Ghallab, Falguni Ghosh, Wonjun Heo, Yufeng Hu, Weixuan Huang, Phuong-Linh Huynh-Ha, Matvey Isupov, Yangguang Ji, Siyuan Jiang, Zhenxiang Jiang, Wonyong Jo, Ho-Young Jung, SeongHeon Kang, MinJae Kim, Youngseon Kim, Jakub Komosa, Artem Konshin, Trung-Hoang Le, Jongmin Lee, Lingling Li, Litao Li, Vadim Linkov, Fang Liu, Haoxuan Ma, Shun Makino, Ismail Mathkour, Konstantin Mitin, Mikhail Moiseev, Takumi Nagaya, Yuki Nakamura, Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Trong-Thuan Nguyen, Christian Orduz, Kwanyong Park, Fabian Perez, Parthsarthi Rawat, SuHyun Rim, Hoover Rueda-Chacón, Atom Scott, Minori Sugimura, Yuyang Sun, Shengeng Tang, Minh-Triet Tran, Ikuma Uchida, Juan Vanegas, Thanh-Nhan Vo, Jiangtao Wang, Yaxiong Wang, Xiaogang Wang, Ruifeng Wang, Rio Watanabe, Jiali Wen, Yongliang Wu, Di Yang, Xu Yang, Zhuo Yang, Xinyu Ye, Yibo Yu, Zihan Zhai, Yu Zhang, Zhenyu Zhao, Zhun Zhong, Yixi Zhou, Xingyu Zhu, Wenbo Zhu, Julian Ziegler
机构
*
University of Liège(列日大学)
;
King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)
;
Spiideo(斯皮迪奥公司)
;
Aalborg University(奥尔堡大学)
;
SpAItial(斯帕蒂亚尔公司)
;
Center for Robotics, Mines Paris, PSL(巴黎矿业学院机器人中心(巴黎文理研究大学))
;
Footovision(Footovision公司)
;
Shanghai Jiao Tong University(上海交通大学)
;
Universitat de Barcelona(巴塞罗那大学)
;
Computer Vision Center(计算机视觉中心)
;
EVS Broadcast Equipment(EVS广播设备公司)
;
Pioneer Center for Artificial Intelligence(先锋人工智能中心)
;
Lund University(隆德大学)
;
TAHAKOM(TAHAKOM公司)
;
Mohamed Bin Zayed University for Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
;
Sber AI(Sber人工智能公司)
;
Salute For Business(Salute For Business公司)
;
Intelligent Perception and Image Understanding Lab, Xidian University(西安电子科技大学智能感知与图像理解实验室)
;
South China University of Technology(华南理工大学)
;
Hefei University of Technology(合肥工业大学)
;
Kyungpook National University(庆北国立大学)
;
Leipzig University of Applied Sciences(莱比锡应用科学大学)
;
Friedrich-Alexander University Erlangen-Nuremberg(埃尔朗根-纽伦堡大学)
;
University of Seoul(首尔大学)
;
Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)
;
Nanjing University(南京大学)
;
University of Science, Ho Chi Minh City(胡志明市科技大学)
;
Nanyang Technological University(南洋理工大学)
;
National University of Singapore(新加坡国立大学)
机构
*
Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院)
;
Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心)
;
Amazon(亚马逊)
GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video
GuideMe:流视频中的多域任务指导与干预
Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau
机构
*
City University of Hong Kong(香港城市大学)
;
Huawei Research(华为研究院)
;
University of Science and Technology of China(中国科学技术大学)
;
Chinese University of Hong Kong(香港中文大学)
;
City University of Hong Kong (Dongguan)(香港城市大学(东莞))
Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization
学习观察:通过交错策略优化的主动视频异常理解
Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao
机构
*
School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院)
;
School of Computer Science(计算机科学学院)
;
Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)
Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition
重新思考特征工程与学习策略在少样本隐藏情感识别中的作用
Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo
机构
*
Hefei University of Technology(合肥工业大学)
;
University College London(伦敦大学学院)
;
The University of Sydney(悉尼大学)
;
Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
Beihang University(北京航空航天大学)
;
The University of New South Wales(新南威尔士大学)
;
United Arab Emirates University(阿拉伯联合酋长国大学)
TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning
TRUST:通过图像到超声视频迁移学习实现高效腹部创伤识别
Enguang Wang, Hao Zhou, Shuo Gao, Tuo Liu, Guangquan Zhou
机构
*
School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院)
;
Nanjing Medical University First Affiliated Hospital(南京医科大学第一附属医院)
;
Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室,东南大学)
;
State Key Laboratory of Digital Medical Engineering, Southeast University(数字医学工程国家重点实验室,东南大学)
机构
*
School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)
;
School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)
;
SIGS, Tsinghua University(清华大学深圳国际研究生院)
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)