On Adversarial Robustness of Large-scale Audio Visual Learning
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
Journal ref 2022 International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2022)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
Journal ref 2022 International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2022)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
Comments 17 pages, 11 figures, 8 tables
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 5 pages, 1 figure. arXiv admin note: substantial text overlap with arXiv:2107.01175
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
Comments ACL 2022 main conference
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted by TPAMI. arXiv admin note: substantial text overlap with arXiv:2003.04210
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
Comments Accepted at DSTC10 Workshop at AAAI 2022
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、eess.AS
Comments Accepted to ICASSP 2022
专题命中 音频语音多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Project page: https://google.github.io/aichoreographer/; Dataset page: https://google.github.io/aistplusplus_dataset/
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS
Comments 12 pages, 5 figures, 2 tables
Journal ref CSMT2020
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted at ECCV 2020
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments 18 pages, 12 figures, Published as a conference paper at International Conference on Learning Representations (ICLR) 2020. (camera-ready version)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments To appear at ICCV 2019. Project page: http://sound-track.csail.mit.edu
专题命中 音频语音多模态 :audio-visual(abstract,comments);multi-modal(abstract);分类 cs.CV
Comments The audio-visual dataset can be downloaded from http://www.robots.ox.ac.uk/~vgg/data/lip_reading/
面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴
机构 * National Cheng Kung University (NCKU)(成功大学)
专题命中 音频语音多模态 :multimodal(title)
AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。
Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)
omni-macos:在Apple Silicon上运行的端侧全模态搜索系统
专题命中 音频语音多模态 :omni-modal(title)
AI总结 omni-macos是一款在Apple Silicon端侧运行的全模态搜索系统,可在用户Mac设备上处理多模态数据搜索,数据不离开设备,适配不同硬件规格的Mac并优化内存使用。
Comments 18 pages, 5 figures, 10 tables
PI -- 多模态行星防御
专题命中 音频语音多模态 :multimodal(title)
AI总结 本文提出了一种高效的行星防御方法,通过高速动能穿甲弹粉碎小行星,可在不同预警时间内有效防御直径20-1000米的天体。
Comments 195 pages, 148 figures. Published in Advances in Space Research (ASR) 10-22; https://www.sciencedirect.com/science/article/pii/S0273117722009395
SocialPulse: 使用智能手表多模态感知在自然环境中检测社交互动
专题命中 音频语音多模态 :multimodal(title)
AI总结 本文提出了一种在设备上检测自然环境中社交互动的方法,通过智能手表的多模态感知技术,实现了对多种社交互动的准确识别,并在真实场景中验证了其有效性。
赋予传感器声音:用于语义时间序列嵌入的多模态JEPA
机构 * C3 AI
专题命中 音频语音多模态 :multimodal(title)
AI总结 提出CHARM模型,通过通道级文本描述与Transformer编码器结合,利用联合嵌入预测架构(JEPA)学习语义时间序列嵌入,在异常检测、分类和预测任务中仅用线性探针即取得强性能。
Comments 9 pages, 5 figures, accepted at ICML 2026. arXiv admin note: substantial text overlap with arXiv:2505.14543
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), PMLR 306, 2026
GuardReasoner-Omni:一种基于推理的多模态护栏,适用于文本、图像、视频和音频
专题命中 音频语音多模态 :multi-modal(title)
AI总结 提出GuardReasoner-Omni,一种基于推理的多模态护栏模型,通过两阶段训练(SFT和RL)在3B和7B参数规模上实现对文本、图像、视频和音频数据的有效审核,性能优于现有基线。
先手势,LLM辅助语音补充:通过增强现实中的虚拟对应物探索多模态机器人'提线人'遥控
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 音频语音多模态 :multimodal(title)
AI总结 本文探讨了通过增强现实中的虚拟对应物实现多模态机器人遥控的方法,比较了仅手势和结合语音与手势的交互方式在性能和用户体验上的差异,提出设计指南以平衡效率、鲁棒性和用户专业性。
Comments This work is under peer review
感受,而非感受:手部追踪XR中的情感音频视觉伪触觉
专题命中 音频语音多模态 :audio-visual(title)
AI总结 该研究探讨了在无控制器的XR环境中,通过伪触觉线索(音频、视觉)影响用户情感体验的机制,发现其更应视为情感反馈而非直接触觉替代。
Comments 5 pages, 2 figures, 1 table, CHI EA Posters
Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), April 13--17, 2026, Barcelona, Spain
Dynamite:通过AI增强的多模态交互实现实时复盘幻灯片创作
专题命中 音频语音多模态 :multimodal(title)
AI总结 Dynamite通过AI增强的多模态交互实现实时复盘幻灯片创作,提升课堂讨论后复盘的准确性和效率。
Comments Accepted to VL/HCC 2025
生成式多模态反馈用于歌唱语音合成评估
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Columbia University(哥伦比亚大学) ; Dalian University of Technology(大连理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 音频语音多模态 :multi-modal(title)
AI总结 本文提出生成式多模态反馈框架,通过音频-语言模型生成多维语言和音频反馈,提升歌唱语音合成评估的准确性和可解释性。
Comments 16 pages, 5 figures
Colin:一种多模态人机协同创故事叙述系统,以支持儿童的多层级叙述技能
专题命中 音频语音多模态 :multimodal(title)
AI总结 Colin通过语音和视觉模态支持儿童多层级叙述技能发展,通过生成、理解和构建阶段提升儿童的叙事能力。
GazePointAR: 一种基于情境的多模态语音助手,用于可穿戴增强现实中的代词消歧
专题命中 音频语音多模态 :multimodal(title)
AI总结 GazePointAR是一种基于情境的多模态语音助手,通过结合眼动、指向手势和对话历史来提升可穿戴增强现实中的代词消歧能力。
Journal ref Proceedings of the CHI Conference on Human Factors in Computing Systems (CHI 2024), Article 408, ACM
机构 * IIT Kanpur(印度坎pur理工学院) ; Dept. of EE, IIT Kanpur(电子工程系,印度坎pur理工学院)
专题命中 音频语音多模态 :multi-modal(title)
Comments 4 pages
专题命中 音频语音多模态 :multimodal(title)
Comments To appear in the Proceedings of Interspeech 2025