Hierarchical Sub-action Tree for Continuous Sign Language Recognition
Dejie Yang, Zhu Xu, Xinjie Gao, Yang Liu
机构
*
Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)
;
State Key Laboratory of General Artificial Intelligence, Peking Universitys, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)
专题命中
预训练与数据
:large language model(abstract);language model(abstract)
Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval
Zhichuan Wang, Yang Zhou, Zhe Liu, Rui Yu, Song Bai, Yulong Wang, Xinwei He, Xiang Bai
机构
*
Huazhong Agricultural University(华中农业大学)
;
Shenzhen University(深圳大学)
;
The University of Hong Kong(香港大学)
;
University of Louisville(路易斯安那大学)
;
ByteDance(字节跳动)
;
Huazhong University of Science and Technology(华中科技大学)
专题命中
预训练与数据
:large language model(abstract);language model(abstract)
A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation
TRI LBM Team, Jose Barreiros, Andrew Beaulieu, Aditya Bhat, Rick Cory, Eric Cousineau, Hongkai Dai, Ching-Hsin Fang, Kunimatsu Hashimoto, Muhammad Zubair Irshad, Masha Itkina, Naveen Kuppuswamy, Kuan-Hui Lee, Katherine Liu, Dale McConachie, Ian McMahon, Haruki Nishimura, Calder Phillips-Grafflin, Charles Richter, Paarth Shah, Krishnan Srinivasan, Blake Wulfe, Chen Xu, Mengchao Zhang, Alex Alspach, Maya Angeles, Kushal Arora, Vitor Campagnolo Guizilini, Alejandro Castro, Dian Chen, Ting-Sheng Chu, Sam Creasey, Sean Curtis, Richard Denitto, Emma Dixon, Eric Dusel, Matthew Ferreira, Aimee Goncalves, Grant Gould, Damrong Guoy, Swati Gupta, Xuchen Han, Kyle Hatch, Brendan Hathaway, Allison Henry, Hillel Hochsztein, Phoebe Horgan, Shun Iwase, Donovon Jackson, Siddharth Karamcheti, Sedrick Keh, Joseph Masterjohn, Jean Mercat, Patrick Miller, Paul Mitiguy, Tony Nguyen, Jeremy Nimmer, Yuki Noguchi, Reko Ong, Aykut Onol, Owen Pfannenstiehl, Richard Poyner, Leticia Priebe Mendes Rocha, Gordon Richardson, Christopher Rodriguez, Derick Seale, Michael Sherman, Mariah Smith-Jones, David Tago, Pavel Tokmakov, Matthew Tran, Basile Van Hoorick, Igor Vasiljevic, Sergey Zakharov, Mark Zolotas, Rares Ambrus, Kerri Fetzer-Borelli, Benjamin Burchfiel, Hadas Kress-Gazit, Siyuan Feng, Stacie Ford, Russ Tedrake
Admitting Ignorance Helps the Video Question Answering Models to Answer
Haopeng Li, Tom Drummond, Mingming Gong, Mohammed Bennamoun, Qiuhong Ke
机构
*
School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院)
;
School of Mathematics and Statistics, University of Melbourne(墨尔本大学数学与统计学学院)
;
school of Physics, Maths and Computing, The University of Western Australia(西澳大学物理、数学与计算学学院)
;
Department of Data Science & AI, Monash University(墨尔本大学数据科学与人工智能系)
PSELDNets: Pre-trained Neural Networks on a Large-scale Synthetic Dataset for Sound Event Localization and Detection
Jinbo Hu, Yin Cao, Ming Wu, Fang Kang, Feiran Yang, Wenwu Wang, Mark D. Plumbley, Jun Yang
机构
*
Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院噪声与振动研究所噪声与振动实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Department of Intelligent Science, Xi’an Jiaotong Liverpool University(西安交通大学利物浦大学智能科学系)
;
Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(奥卢大学机器视觉与信号分析中心)
;
State Key Laboratory of Acoustics, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声学国家重点实验室)
;
Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音与信号处理中心)
Comments16 pages, 9 figures, accepted by IEEE Transactions on Audio, Speech, and Language Processing. The code is available at https://github.com/Jinbo-Hu/PSELDNets
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
Michael S. Ryoo, Honglu Zhou, Shrikant Kendre, Can Qin, Le Xue, Manli Shu, Jongwoo Park, Kanchana Ranasinghe, Silvio Savarese, Ran Xu, Caiming Xiong, Juan Carlos Niebles
机构
*
Salesforce AI Research(Salesforce AI研究院)
;
Stony Brook University(石溪大学)