GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
GIFT:全局不可替代性帧目标用于高效视频理解
Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu
机构
*
Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院)
;
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
Zhejiang University(浙江大学)
;
Alibaba Group Holding Limited(阿里巴巴集团控股有限公司)
;
Future Living Lab of Alibaba(阿里巴巴未来生活实验室)
FedCVU: Federated Learning for Cross-View Video Understanding
FedCVU: 联邦学习用于跨视图视频理解
Shenghan Zhang, Run Ling, Ke Cao, Ao Ma, Zhanjie Zhang
机构
*
Software College, Northeastern University, Shenyang, China(东北大学软件学院)
;
University of Science and Technology of China, Hefei, China(中国科学技术大学)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
Zhejiang University, Hangzhou, China(浙江大学)
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
Symphony:一种受认知启发的多智能体系统用于长视频理解
Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Kuaishou Technology(快手科技)
;
School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
先关注再注意:通过自回归注视实现高效的可扩展视频理解
Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Boyi Li, Jan Kautz, Song Han, David M. Chan, Pavlo Molchanov, Trevor Darrell, Hongxu Yin
SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding
SurgFed: 基于语言引导的多任务联邦学习用于手术视频理解
Zheng Fang, Ziwei Niu, Ziyue Wang, Zhu Zhuo, Haofeng Liu, Shuyang Qian, Jun Xia, Yueming Jin
机构
*
National University of Singapore(国立新加坡大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Zhejiang University(浙江大学)
;
Nanyang Technological University(南洋理工大学)
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划
Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang
机构
*
Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
VIVO AI Lab(VIVO人工智能实验室)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
;
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)
Event-Anchored Frame Selection for Effective Long-Video Understanding
基于事件的帧选择用于有效长视频理解
Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)
;
College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
;
Tongji University(同济大学)
;
MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用
Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu
机构
*
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学)
;
Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)
;
Paradigm Inc.(4Paradigm公司)