机构
*
DeepWisdom
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Renmin University of China(中国人民大学)
;
Zhejiang University(浙江大学)
;
Université de Montréal & Mila(蒙特利尔大学及Mila)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Linear Script Representations in Speech Foundation Models Enable Zero-Shot Transliteration
语音基础模型中的线性脚本表示可实现零样本转写
Ryan Soh-Eun Shim, Kwanghee Choi, Kalvin Chang, Ming-Hao Hsu, Florian Eichin, Zhizheng Wu, Alane Suhr, Michael A. Hedderich, David Harwath, David R. Mortensen, Barbara Plank
机构
*
LMU Munich(慕尼黑大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
The University of Hong Kong(香港大学)
;
National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
LTX-2: Efficient Joint Audio-Visual Foundation Model
LTX-2:高效的音频-视觉联合基础模型
Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman
Enhancing Safety in Automated Ports: A Virtual Reality Study of Pedestrian-Autonomous Vehicle Interactions under Time Pressure, Visual Constraints, and Varying Vehicle Size