Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments Submitted to Interspeech
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments Submitted to Interspeech
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CL
Comments ACL 2024 Main Conference. Project website: https://jack-zc8.github.io/M3AV-dataset-page
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
Comments CVPRw 2024 (L3D-IVU)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments 5 pages, 4 figures
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments ICASSP AMHAT 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);multi-modal(abstract);分类 cs.MM
Comments 5 pages, 4 figures, to be published in ICASSP2023
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments submitted to ICASSP 2023
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
Comments Accepted in AAAI 2023
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV
Comments Accepted by AAAI2022
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments Accepted by INTERSPEECH 2021
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
Comments In CVPR 2021. Project page: http://vision.cs.utexas.edu/projects/VisualVoice/
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS
Comments Accepted to ICASSP 2021
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);multi-modal(abstract);分类 eess.AS
Comments 5 pages
Journal ref Published in Proceedings of the 28th European Signal Processing Conference (EUSIPCO), 2020
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
Journal ref Multimedia Tools and Applications (2020)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM
Comments 8 pages, 9 figures. Accepted by ISM 2018
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.MM
Comments To appear in IEEE Transactions on Emerging Topics in Computational Intelligence. Some audio samples can be reached in this link: https://sites.google.com/view/avse2017
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CL
Comments ICASSP 2015
基于深度引导协同建模的视听分割
机构 * School of Intelligent Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对现有视听分割方法未建模几何线索的问题,提出三模态框架DGCM-AVS,通过深度感知动态调制器与深度引导渐进融合模块优化,在AVSS数据集上实现M_J、M_F指标的显著提升。
Journal ref IEEE Transactions on Multimedia, 2026
LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; Nanjing University(南京大学) ; SJTU(上海交通大学) ; HKUST(GZ)(香港科技大学(广州)) ; Shanghai AI Lab(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; CASIA(中国科学院自动化所) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 针对现有评估协议局限于短片段的问题,提出LongAV-Compass基准,通过284个测试用例和统一评估框架,系统评估分钟级音视频生成在文本、图像、视频条件下的质量、一致性和对齐。
超越笛卡尔错觉:在感知瓶颈下测试双阶段多模态理论 of Mind
机构 * College of Computer Science, Beijing Information Science and Technology University(北京信息科技大学计算机学院)
专题命中 音频语音多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了多模态大语言模型在感知瓶颈下的双阶段空间推理能力,提出了一种基于锚点的具身体验空间分解链式推理方法,以解决空间对称性和视角模糊性问题,从而提升多模态理论 of Mind 的表现。
Comments 17 pages, 3 figures