LiDAR-based Object Detection with Real-time Voice Specifications
机构 * Shivaji University(希瓦吉大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments 10 pages, 4 figures, submitted as part of MSc research
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Shivaji University(希瓦吉大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments 10 pages, 4 figures, submitted as part of MSc research
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 12 pages, 6 figures
机构 * Ethikon Institute(Ethikon研究所)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments 20 pages, 1 figure
机构 * Idiap Research Institute(Idiap研究所) ; École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments submitted to EUSIPCO 2025
机构 * Stony Brook University(石溪大学) ; Institute for Advanced Computational Science(高级计算科学研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments Submitted to COLM 2025. Preprint
机构 * Northeastern University(东北大学) ; Khoury College of Computer Sciences(科里计算机学院) ; Mercury Speech & Language(水星言语与语言机构)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) ; Google LLC(谷歌公司) ; Klein Tools(克莱因工具公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
机构 * University of Cambridge(剑桥大学) ; Politecnico di Milano(米兰理工大学) ; Indian Institute of Technology Madras(马德拉斯印度理工学院) ; Bogazici University(博阿齐奇大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM
机构 * ByteDance(字节跳动) ; Beijing Jiaotong University(北京交通大学) ; Monash University(莫纳什大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
机构 * Hedra Inc.(Hedra公司) ; Peking University(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; HKU(香港大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments MagicInfinite is publicly accessible at https://www.hedra.com/. More examples are at https://magicinfinite.github.io/
机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI)) ; Linköping University(林雪平大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
机构 * School of ECE, NTUA(希腊国立雅典理工大学电气与计算机工程学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
机构 * 1 Lisa Lepp: 2 Dimitar Shterionov: 3 Mirella De Sisto: 4 Grzegorz Chrupa a
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL
Comments Submitted to the MDPI special issue "Human and Machine Translation: Recent Trends and Foundations"
机构 * Infinigence-AI(智源人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2403.02274
Journal ref 2025 20th ACM/IEEE International Conference on Human-Robot Interaction (HRI)
机构 * Tokushima University(德岛大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments 4 pages, 5 figures, 1 table, The 1st InterAI: Interactive AI for Human-Centered Robotics workshop in conjunction with IEEE Ro-MAN 2024, Pasadona, LA, USA, Aug. 2024
Journal ref The 1st InterAI Workshop: Interactive AI for Human-centered Robotics, 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments Published at IEEE Transactions on Audio, Speech and Language Processing
Journal ref IEEE Transactions on Audio, Speech and Language Processing (2025)
机构 * School of Marine Science and Technology, Northwestern Polytechnical University(西北工业大学海洋科学与技术学院) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) ; Research and Development Institute of Northwestern Polytechnical University in Shenzhen(西北工业大学深圳研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments ICLR 2025
Journal ref ICLR 2025
机构 * CMU(卡内基梅隆大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; UCLA(加利福尼亚大学洛杉矶分校) ; MIT(麻省理工学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
机构 * Technische Hochschule Nuernberg(纽伦堡应用技术大学)
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments Accepted at ICASSP 2025
机构 * PRHLT Research Center, Universitat Politècnica de València(瓦伦西亚理工大学PRHLT研究中心) ; ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚ValgrAI人工智能研究生学院及研究网络) ; School of Communication, Universidad de Navarra(纳瓦拉大学传播学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Journal ref Proceedings of the 17th International Conference on Agents and Artificial Intelligence (ICAART 2025), Porto, Portugal, February 23-25, 2025
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments Technical Report
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
机构 * Zhejiang Lab(之江实验室) ; Li Auto(理想汽车) ; Harbin Institute of Technology(哈尔滨工业大学) ; Zhejiang University(浙江大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
机构 * East China Normal University(华东师范大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
机构 * School of Artificial Intelligence and Advanced Computing, Xi’an Jiaotong-Liverpool University(西交利物浦大学人工智能与先进计算学院) ; Monash University(莫纳什大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 7pages
机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院)
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
Comments Accepted at UIC 2024 proceedings. Accepted version