arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-24 至 2025-10-24 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2510.20223 2025-10-24 cs.CR cs.MM 83%

Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations

Divyanshu Kumar, Shreyas Jena, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23155 2025-10-24 cs.CV 83%

PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling

Xiao Yu, Yan Fang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19671 2025-10-24 cs.SD cs.AI eess.AS 62%

Automated evaluation of children's speech fluency for low-resource languages

Bowen Zhang, Nur Afiqah Abdul Latiff, Justin Kan, Rong Tong, Donny Soh, Xiaoxiao Miao, Ian McLoughlin

机构 * College of Computing \& Data Science

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 5 pages, 2 figures, conference

Journal ref Proc. Interspeech 2025, pp. 1948-1952, 17-21 Aug. 2025, Rotterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23203 2025-10-24 cs.RO 50%

CE-Nav: Flow-Guided Reinforcement Refinement for Cross-Embodiment Local Navigation

Kai Yang, Tianlin Zhang, Zhengbo Wang, Zedong Chu, Xiaolong Wu, Yang Cai, Mu Xu

机构 * AMAP, Alibaba Group(阿里集团AMAP)

专题命中 音频语音多模态 :multi-modal(abstract)

Comments Project Page: https://ce-nav.github.io/. Code is available at https://github.com/amap-cvlab/CE-Nav

详情

展开后加载摘要…

URL PDF HTML 收藏