Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders
用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器
Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez
机构
*
i Intelligent Insights(4i智能洞察公司)
;
Universidad de Sevilla(塞维利亚大学)
;
Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学)
;
Honda Research Institute Japan(本田日本研究所)
CommentsAccepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending
Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs
注意力谱正则化:无回放的连续多模态大语言模型
Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Sun Yat-sen University(中山大学)
;
Nanyang Technological University(南洋理工大学)
;
Renmin University of China(中国人民大学)
;
Tsinghua University(清华大学)
VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别
Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang
机构
*
Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)
;
Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)
;
State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)
机构
*
National Innovation Center for Digital Fishery(国家数字渔业创新中心)
;
Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室)
;
State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室)
;
Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心)
;
Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室)
;
College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)
Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation
可靠性感知的几何融合用于鲁棒的音频视觉导航
Teng Liu, Yinfeng Yu
机构
*
Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
音频空间引导融合用于音频视觉导航
Xinyu Zhou, Yinfeng Yu
机构
*
Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
机构
*
Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
机构
*
Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰)
;
Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化
Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li
机构
*
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院)
;
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院)
;
AI Center, OPPO, China(OPPO人工智能中心)
;
Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)
机构
*
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
;
School of Information Science and Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学)
;
Institute of Information Science, Beijing Jiao Tong University(信息科学研究院,北京交通大学)
;
YouTube Media Algorithms team, Google Inc.(YouTube媒体算法团队,谷歌公司)
机构
*
University of Bari Aldo Moro(巴里大学阿尔多·莫罗大学)
;
Catalonia's Telecommunications Technology Centre(加泰罗尼亚电信技术中心)
;
University of Picardie Jules Verne(皮卡第大学朱利·瓦内大学)