arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-15 至 2025-10-15 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2510.11760 2025-10-15 cs.SD cs.AI cs.CV cs.MM 85%

Audio-Guided Visual Perception for Audio-Visual Navigation

Yi Wang, Yinfeng Yu, Fuchun Sun, Liejun Wang, Wendong Zheng

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语种认知计算国际联合实验室) Tsinghua University(清华大学) Tianjin University of Technology(天津工业大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Main paper (6 pages). Accepted for publication by International Conference on Virtual Reality and Visualization 2025 (ICVRV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12133 2025-10-15 cs.CL cs.AI 81%

SafeMT: Multi-turn Safety for Multimodal Language Models

Han Zhu, Juntao Dai, Jiaming Ji, Haoran Li, Chengkun Cai, Pengcheng Wen, Chi-Min Chan, Boyuan Chen, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Peking University(北京大学) University of Edinburgh(爱丁堡大学)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06689 2025-10-15 cs.SD eess.AS 79%

A Fast and Lightweight Model for Causal Audio-Visual Speech Separation

Wendi Sang, Kai Li, Runxuan Yang, Jianqiang Huang, Xiaolin Hu

机构 * School of Computer Technology and Application(计算机技术与应用学院) Intelligent Computing and Application Laboratory of Qinghai Province(青海省智能计算与应用实验室) Department of Computer Science and Technology(计算机科学与技术系) Institute for AI(人工智能研究院) Tsinghua Laboratory of Brain and Intelligence (THBI)(清华大学脑与智能实验室) IDG/McGovern Institute for Brain Research(IDG/麦克戈维脑研究学院) Tsinghua University(清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted by ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11738 2025-10-15 cs.SD cs.AI cs.CV cs.MM 75%

SeeingSounds: Learning Audio-to-Visual Alignment via Text

Simone Carnemolla, Matteo Pennisi, Chiara Russo, Simone Palazzo, Daniela Giordano, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

Comments accepted to ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11732 2025-10-15 cs.SD cs.AI eess.AS 62%

Serial-Parallel Dual-Path Architecture for Speaking Style Recognition

Guojian Li, Qijie Shao, Zhixian Zhao, Shuiyuan Wang, Zhonghua Fu, Lei Xie

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

Comments Accepted by NCMMSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11837 2025-10-15 cs.CR cs.AI 61%

Countermind: A Multi-Layered Security Architecture for Large Language Models

Dominik Schwarz

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI

Comments 33 pages, 3 figures, 6 tables. Keywords: LLM security; defense-in-depth; prompt injection; activation steering; multimodal sandbox; threat modeling

详情

展开后加载摘要…

URL PDF HTML 收藏