HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training
Xuecheng Wu, Danlei Huang, Heli Sun, Xinyi Yin, Yifan Wang, Hao Wang, Jia Zhang, Fei Wang, Peihao Guo, Suyu Xing, Junxiao Xue, Liang He
机构
*
Xi'an Jiaotong University(西安交通大学)
;
Zhengzhou University(郑州大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Dalian University of Technology(大连理工大学)
;
Zhejiang Lab(浙江实验室)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
Ammarah Hashmi, Sahibzada Adil Shahzad, Chia-Wen Lin, Yu Tsao, Hsin-Min Wang
机构
*
Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Academia Sinica(社会网络与以人为本计算计划、台湾国际研究生计划、中国科学院)
;
Institute of Information Systems and Applications, National Tsing Hua University(信息系统与应用研究所、国立清华大学)
;
Department of Computer Science, National Chengchi University(计算机科学系、国立成功大学)
;
Research Center for Information Technology Innovation, Academia Sinica(信息技术创新研究中心、中国科学院)
;
Institute of Information Science, Academia Sinica(信息科学研究所、中国科学院)
机构
*
School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院)
;
School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院)
;
School of Artifical Intelligence, Xidian University(西安电子科技大学人工智能学院)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
Li Yu, Xuanzhe Sun, Wei Zhou, Moncef Gabbouj
机构
*
School of Computer Science, Nanjing University of Information Science and Technology(信息科学与技术南京大学计算机科学学院)
;
Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology, Nanjing University of Information Science and Technology(大气环境与设备技术江苏省协同创新中心)
;
School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院卡斯尔大学)
;
Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通讯科学学院坦佩雷大学)
CommentsP. Liu is with the Department of Computer Science and Engineering, University of Nevada, Reno, NV, 89512. Q. Tao and J. Zhou are with Centre for Frontier AI Research (CFAR), and Institute of High Performance Computing (IHPC), A*STAR, Singapore. J. Zhou is also with Centre for Advanced Technologies in Online Safety (CATOS), A*STAR, Singapore. J. Zhou is the corresponding author
AVLnet: Learning Audio-Visual Language Representations from Instructional Videos
Andrew Rouditchenko, Angie Boggust, David Harwath, Brian Chen, Dhiraj Joshi, Samuel Thomas, Kartik Audhkhasi, Hilde Kuehne, Rameswar Panda, Rogerio Feris, Brian Kingsbury, Michael Picheny, Antonio Torralba, James Glass