arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4587 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4587 篇

2605.18221 2026-05-19 cs.SD cs.CL cs.CV cs.LG physics.med-ph 73%

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

SIREM: 语音引导的MRI重建与学习采样

Md Hasan, Nyvenn Castro, Daiqi Liu, Lukas Mulzer, Jana Hutter, Jonghye Woo, Moritz Zaiss, Andreas Maier, Paula A. Perez-Toro

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃森哲-埃尔朗根-纽伦堡大学模式识别实验室) Institute of Radiology, University Hospital Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根大学医院放射学研究所) Institut für Informationsverarbeitung, Leibniz Universität Hannover(汉诺威莱比锡大学信息处理研究所) Department of Radiology, Harvard Medical School and Massachusetts General Hospital(哈佛医学院放射科和麻省总医院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种语音引导的MRI重建框架SIREM,通过同步语音作为跨模态先验,利用语音与声音学之间的相关性预测图像内容,从而在更高的吞吐量下实现更合理的解剖结构重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 73%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 73%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 73%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI 73%

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 73%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12650 2026-04-15 cs.CV cs.MM 73%

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

监听深度伪造检测:一种超越以说话为中心的伪造分析的新视角

Miao Liu, Fangda Wei, Jing Wang, Xinyuan Qian

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology Beijing(北京科技大学) University of Science(科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出监听深度伪造检测任务,引入首个专门为此任务设计的ListenForge数据集,并提出MANet网络以捕捉监听伪造中的细微运动不一致,实验表明现有说话深度伪造检测模型在监听场景中表现不佳。

Comments Submitted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26113 2026-03-30 cs.MM cs.SD eess.AS 73%

Cinematic Audio Source Separation Using Visual Cues

电影音频源分离使用视觉线索

Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。

Comments CVPR 2026. Project page: https://cass-flowmatching.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24332 2026-02-25 cs.SD cs.CV eess.AS eess.IV 73%

Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes

动态场景中手术动作空间映射的声源定位

Jonas Hein, Lazaros Vlachopoulos, Maurits Geert Laurent Olthof, Bastian Sigrist, Philipp Fürnstahl, Matthias Seibold

机构 * ROCS(罗克辛研究所) Balgrist University Hospital(巴尔格里斯大学医院) University of Zurich(苏黎世大学) Dept. of Orthopedics(骨科部门) Computer Vision and Geometry Group(计算机视觉与几何组) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种动态手术场景中声源定位的方法,通过整合3D音频与视觉数据,提升手术场景的多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17769 2026-02-23 cs.MM cs.SD eess.AS 73%

MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions

MusicSem: 一种语义丰富的语言-音频数据集,用于自然音乐描述

Rebecca Salganik, Teng Tu, Fei-Yueh Chen, Xiaohao Liu, Keifeng Lu, Ethan Luvisia, Zhiyao Duan, Guillaume Salha-Galvan, Anson Kahng, Yunshan Ma, Jian Kang

机构 * University of Rochester(罗切斯特大学) National University of Singapore(新加坡国立大学) SJTU Paris Elite Institute of Technology(上海科技技术巴黎精英学院) Singapore Management University(新加坡管理学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 MusicSem是一个基于Reddit讨论的语义丰富的音乐描述数据集,旨在提升多模态音乐表示学习中对细粒度语义的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14655 2026-02-17 cs.CL cs.AI 73%

Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech

突破数据效率困境:一种联邦学习与增强学习框架用于通过语音检测阿尔茨海默病

Xiao Wei, Bin Wen, Yuqin Lin, Kai Li, Mingyang gu, Xiaobao Wang, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(认知计算与应用天津重点实验室) College of Intelligence and Computing, Tianjin University(智能计算学院,天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) College of Computer and Data Science, Fuzhou University(计算机与数据科学学院,福州大学) Huiyan Technology (Tianjin) Co., Ltd(慧研科技(天津)有限公司)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 FAL-AD通过联邦学习与数据增强框架,实现阿尔茨海默病语音检测中的数据效率提升,达到91.52%的多模态准确率。

Comments 5 pages, 1 figures, accepted by ICASSP 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14891 2026-01-29 cs.CL cs.AI 73%

LLMBind: A Unified Modality-Task Integration Framework

LLMBind:一种统一的模态-任务整合框架

Bin Zhu, Munan Ning, Peng Jin, Bin Lin, Jinfa Huang, Qi Song, Junwu Zhang, Zhenyu Tang, Mingjun Pan, Li Yuan

机构 * pku(北京大学) pcl(鹏城实验室) hkbu(香港 Baptist大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 LLMBind通过双路径机制和MoE架构,实现多模态任务的统一整合,提升任务扩展性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 73%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05126 2025-12-08 eess.AS cs.AI cs.CL cs.CV cs.MM cs.SD 73%

SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model

SyncVoice:面向视频配音的视觉增强预训练TTS模型

Kaidi Wang, Yi He, Wenhao Guan, Weijie Wu, Hongwu Ding, Xiong Zhang, Di Wu, Meng Meng, Jian Luan, Lin Li, Qingyang Hong

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) MiLM Plus, Xiaomi Inc., China(小米公司) School of Electronic Science and Engineering, Xiamen University, China(厦门大学电子科学与技术学院)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SyncVoice通过视觉增强预训练TTS模型,提升视频配音的语音自然度和音视频同步性能,适用于多语言视频翻译场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL 73%

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12452 2025-11-18 cs.CV cs.CL 73%

DenseAnnotate: Enabling Scalable Dense Caption Collection for Images and 3D Scenes via Spoken Descriptions

Xiaoyu Lin, Aniket Ghorpade, Hansheng Zhu, Justin Qiu, Dea Rrozhani, Monica Lama, Mick Yang, Zixuan Bian, Ruohan Ren, Alan B. Hong, Jiatao Gu, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11106 2025-11-17 cs.MM cs.CV cs.SD 73%

AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization

Zhonghua Jiang, Kui Chen, Kunxi Li, Keting Yin, Yiyun Zhou, Zhaode Wang, Chengfei Lv, Shengyu Zhang

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09915 2025-11-17 cs.CL cs.MM cs.SD 73%

HI-TransPA: Hearing Impairments Translation Personal Assistant

Zhiming Ma, Shiyu Gan, Junhao Zhao, Xianming Li, Qingyun Pan, Peidong Wang, Mingjun Pan, Yuhao Mo, Jiajie Cheng, Chengxin Chen, Zhonglun Cao, Chonghan Liu, Shi Cheng

机构 * SmartFlowAI Research(SmartFlowAI研究院) Tongji University(同济大学) CMIC Guangzhou(广州CMIC) BUPT Beijing(北京邮电大学) Northeastern University Shenyang(沈阳东北大学) Peking University(北京大学) Qiyuan Tech Beijing(北京启元科技)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18213 2025-10-03 cs.SD cs.CV eess.AS 73%

NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields

Amandine Brunetto, Sascha Hornauer, Fabien Moutarde

机构 * Center for Robotics, Mines Paris - PSL University Paris, France(机器人中心,巴黎 Mines Paris - PSL 大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments ICLR 2025 (Poster). Camera ready version. Project Page: https://amandinebtto.github.io/NeRAF; 24 pages, 13 figures

Journal ref The Thirteenth International Conference on Learning Representations, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19951 2025-09-30 cs.CV cs.AI 73%

Audio-centric Video Understanding Benchmark without Text Shortcut

Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21761 2025-09-01 cs.CV cs.MM 73%

Learning from Silence and Noise for Visual Sound Source Localization

Xavier Juanola, Giovana Morais, Magdalena Fuentes, Gloria Haro

机构 * Intelligent Multimodal Vision Analysis Universitat Pompeu Fabra Barcelona, Spain(智能多模态视觉分析Universitat Pompeu Fabra Barcelona) MARL-IDM New York University, New York, USA(MARL-IDM纽约大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

Comments 10 pages, 2 figures, 4 tables + Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15407 2025-08-22 cs.CL cs.AI 73%

When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models

Cheng Wang, Gelei Deng, Xianglin Yang, Han Qiu, Tianwei Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04723 2025-08-08 cs.SD cs.AI eess.AS 73%

Wearable Music2Emotion : Assessing Emotions Induced by AI-Generated Music through Portable EEG-fNIRS Fusion

Sha Zhao, Song Yi, Yangxuan Zhou, Jiadong Pan, Jiquan Wang, Jie Xia, Shijian Li, Shurong Dong, Gang Pan

机构 * Zhejiang University(浙江大学) Hangzhou RongNao Technology Co., Ltd(杭州融脑科技有限公司)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI、eess.AS

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10416 2025-08-07 cs.MM cs.SD eess.AS 73%

Can Sound Replace Vision in LLaVA With Token Substitution?

Ali Vosoughi, Jing Bi, Pinxin Liu, Yunlong Tang, Chenliang Xu

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

Comments Project page: https://ali-vosoughi.github.io/SoundCLIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11274 2025-07-30 cs.CL cs.AI 73%

Task Arithmetic for Language Expansion in Speech Translation

Yao-Fei Cheng, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Wen Shen Teo, Siddhant Arora, Shinji Watanabe

机构 * University of Washington(华盛顿大学) Sony Group Corporation(索尼集团) University of Electro-Communications(电通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10109 2025-07-15 cs.MM cs.SD eess.AS 73%

DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis

Wenjie Tian, Xinfa Zhu, Haohe Liu, Zhixian Zhao, Zihao Chen, Chaofan Ding, Xinhan Di, Junjie Zheng, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Centre for Vision Speech and Signal Processing, University of Surrey(视觉语音与信号处理中心,萨里大学) AI Lab, Giant Network(巨人网络人工智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05361 2025-06-10 cs.CL eess.AS 73%

Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks

Chien-yu Huang, Wei-Chih Chen, Shu-wen Yang, Andy T. Liu, Chen-An Li, Yu-Xiang Lin, Wei-Cheng Tseng, Anuj Diwan, Yi-Jen Shih, Jiatong Shi, William Chen, Chih-Kai Yang, Wenze Ren, Xuanjun Chen, Chi-Yuan Hsiao, Puyuan Peng, Shih-Heng Wang, Chun-Yi Kuan, Ke-Han Lu, Kai-Wei Chang, Fabian Ritter-Gutierrez, Kuan-Po Huang, Siddhant Arora, You-Kuan Lin, Ming To Chuang, Eunjung Yeo, Kalvin Chang, Chung-Ming Chien, Kwanghee Choi, Jun-You Wang, Cheng-Hsiu Hsieh, Yi-Cheng Lin, Chee-En Yu, I-Hsiang Chiu, Heitor R. Guimarães, Jionghao Han, Tzu-Quan Lin, Tzu-Yuan Lin, Homu Chang, Ting-Wu Chang, Chun Wei Chen, Shou-Jen Chen, Yu-Hua Chen, Hsi-Chun Cheng, Kunal Dhawan, Jia-Lin Fang, Shi-Xin Fang, Kuan-Yu Fang Chiang, Chi An Fu, Hsien-Fu Hsiao, Ching Yu Hsu, Shao-Syuan Huang, Lee Chen Wei, Hsi-Che Lin, Hsuan-Hao Lin, Hsuan-Ting Lin, Jian-Ren Lin, Ting-Chun Liu, Li-Chun Lu, Tsung-Min Pai, Ankita Pasad, Shih-Yun Shan Kuan, Suwon Shon, Yuxun Tang, Yun-Shao Tsai, Jui-Chiang Wei, Tzu-Chieh Wei, Chengxi Wu, Dien-Ruei Wu, Chao-Han Huck Yang, Chieh-Chi Yang, Jia Qi Yip, Shao-Xiang Yuan, Vahid Noroozi, Zhehuai Chen, Haibin Wu, Karen Livescu, David Harwath, Shinji Watanabe, Hung-yi Lee

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、eess.AS

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22581 2025-05-29 cs.CV cs.AI 73%

Tell me Habibi, is it Real or Fake?

Kartik Kuckreja, Parul Gupta, Injy Hamed, Thamar Solorio, Muhammad Haris Khan, Abhinav Dhall

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12154 2025-05-20 cs.CV cs.SD eess.AS 73%

Learning to Highlight Audio by Watching Movies

Chao Huang, Ruohan Gao, J. M. F. Tsang, Jan Kurcius, Cagdas Bilen, Chenliang Xu, Anurag Kumar, Sanjeel Parekh

机构 * University of Rochester(罗切斯特大学) University of Maryland, College Park(马里兰大学学院公园分校) Meta Reality Labs Research(Meta现实实验室)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments CVPR 2025. Project page: https://wikichao.github.io/VisAH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04394 2025-05-09 cs.CV cs.SD eess.AS 73%

SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer

Young-Hu Park, Rae-Hong Park, Hyung-Min Park

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Journal ref Neurocomputing, Volume 639, 28 July 2025, 130289

详情

展开后加载摘要…

URL PDF HTML 收藏