arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-07 至 2025-08-07 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2508.04566 2025-08-07 cs.CV cs.AI cs.MM 90%

CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization

Jinxing Zhou, Ziheng Zhou, Yanghao Zhou, Yuxin Mao, Zhangling Duan, Dan Guo

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06362 2025-08-07 cs.CV cs.MM cs.SD eess.AS 89%

Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs

Umberto Cappellazzo, Minsu Kim, Stavros Petridis

机构 * Imperial College London(伦敦帝国学院)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to IEEE ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04418 2025-08-07 cs.MM cs.CV cs.MA cs.SD eess.AS 85%

Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation

Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project page: https://github.com/jasongief/TGS-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04129 2025-08-07 cs.CV 83%

SVC 2025: the First Multimodal Deception Detection Challenge

Xun Lin, Xiaobao Guo, Taorui Wang, Yingjie Ma, Jiajian Huang, Jiayu Zhang, Junzhe Cao, Zitong Yu

机构 * Great Bay University(大亚湾大学) Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

Comments Accepted by Workshop SVC of ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03724 2025-08-07 cs.CV 83%

From Waveforms to Pixels: A Survey on Audio-Visual Segmentation

Jia Li, Yapeng Tian

机构 * Department of Computer Science, The University of Texas at Dallas(计算机科学系,德克萨斯大学达拉斯分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04353 2025-08-07 cs.MM cs.AI 81%

LUST: A Multi-Modal Framework with Hierarchical LLM-based Scoring for Learned Thematic Significance Tracking in Multimedia Content

Anderson de Lima Luiz

机构 * AImotion Bavaria Technische Hochschule Ingolstadt(巴伐利亚AImotion技术大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

Comments 5 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15641 2025-08-07 cs.CL cs.AI 81%

Leveraging Context for Multimodal Fallacy Classification in Political Debates

Alessio Pittiglio

机构 * DISI, University of Bologna(DISI,博洛尼亚大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 12th Workshop on Argument Mining (ArgMining 2025) @ ACL 2025

Journal ref In Proceedings of the 12th Argument mining Workshop (ArgMining 2025), pages 388-397, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02786 2025-08-07 cs.SD cs.CV eess.AS 81%

CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation

Yuanhong Chen, Kazuki Shimada, Christian Simon, Yukara Ikemiya, Takashi Shibuya, Yuki Mitsufuji

机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Sony Group Corporation(索尼集团) Sony AI, Sony Group Corporation(索尼人工智能,索尼集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07384 2025-08-07 cs.SD eess.AS 79%

AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment

Yu Chen, Hongxu Zhu, Jiadong Wang, Kainan Chen, Xinyuan Qian

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10416 2025-08-07 cs.MM cs.SD eess.AS 73%

Can Sound Replace Vision in LLaVA With Token Substitution?

Ali Vosoughi, Jing Bi, Pinxin Liu, Yunlong Tang, Chenliang Xu

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

Comments Project page: https://ali-vosoughi.github.io/SoundCLIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02929 2025-08-07 cs.HC cs.SD eess.AS 70%

AudioMiXR: Spatial Audio Object Manipulation with 6DoF for Sound Design in Augmented Reality

Brandon Woodard, Margarita Geleta, Joseph J. LaViola, Andrea Fanelli, Rhonda Wilson

机构 * Brown University(布朗大学) University of California at Berkeley(加州大学伯克利分校) University of Central Florida(中央佛罗里达大学) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

Comments Updated abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04481 2025-08-07 cs.LG cs.HC cs.NE cs.SD eess.AS 57%

Emotion Detection Using Conditional Generative Adversarial Networks (cGAN): A Deep Learning Approach

Anushka Srivastava

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments 3 pages, 2 tables, submitted for arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏