OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 9 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 9 figures
机构 * LY Corporation(LY公司) ; Keio University(庆应大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments under review
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
机构 * KAIST, South Korea(韩国釜山国立大学) ; NWPU, China(中国西北工业大学) ; UNIST, South Korea(韩国全南国立大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS
Comments accepted by NeurIPS 2025
机构 * ALMAnaCH, INRIA Paris(ALMAnaCH,INRIA巴黎) ; Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS(Télécom巴黎,SES,巴黎高等理工学院,I3-CNRS) ; Télécom Paris, LTCI, Institut Polytechnique de Paris(Télécom巴黎,LTCI,巴黎高等理工学院) ; CNRS, ISIR, Sorbonne University(CNRS,ISIR,索邦大学) ; ISIR, Sorbonne University(ISIR,索邦大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 9 pages
机构 * University of Western Brittany(西部布列塔尼大学) ; Psychiatry Department, CHU Brest(布列塔尼大学精神科部门)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments Preprint version of a manuscript submitted to the Journal of Affective Disorders
专题命中 音频语音多模态 :multimodal(abstract)
机构 * LTIMindTree
专题命中 音频语音多模态 :audio-visual(abstract)