arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2312.12309 2023-12-20 cs.HC 73%

TeamCAD -- A Multimodal Interface for Remote Computer Aided Design

Demircan Tas, Dimitrios Chatzinikolis

专题命中 音频语音多模态 :multimodal(title,comments)

Comments Created for 6.835, Intelligent Multimodal User Interfaces at MIT, Spring 2022. Submitted to CHI 2024. 10 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09765 2026-08-11 cs.CL cs.CV 新提交 73%

REFRAMED: Towards Realistic Audio Description Generation for Movies

REFRAMED:面向电影的真实音频描述生成

Igor Sterner, Mirella Lapata, Alex Lascarides, Frank Keller

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30256 2026-07-30 cs.CV cs.CL cs.HC 版本更新 73%

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

VideoFDB: 评估对话代理中的全双工视觉-语音能力

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello

机构 * NVIDIA David AI

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。

Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25543 2026-07-29 cs.CV cs.AI 新提交 73%

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

少即是多:通用AIGC音频-视频检测的模态解耦

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Agder(阿格德大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。

Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08729 2026-06-30 cs.CV cs.GR cs.MM cs.SD 73%

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成

Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

机构 * DeepMind OpenAI

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05121 2026-06-30 cs.CL cs.SD eess.AS 73%

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU系统在S&I挑战2025 SLA开放赛道中的表现

Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、eess.AS

AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 73%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21478 2026-06-23 cs.CL cs.LG eess.AS 版本更新 73%

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-Fu Liao, Shrikanth Narayanan, James Glass, Hung-yi Lee

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University, Taipei, Taiwan(国立台湾大学) National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) Academia Sinica, Taiwan(台湾“中央”研究院) National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07608 2026-06-09 cs.CL cs.AI cs.LG cs.SD 新提交 73%

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线

Felix Akeret

机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ETH Zürich(苏黎世联邦理工学院) University of Bern(伯尔尼大学) FHNW(西北应用科学与艺术大学) CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。

Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31432 2026-06-01 cs.CL cs.AI cs.SD 73%

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略

Sara Papi, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL 73%

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18221 2026-05-19 cs.SD cs.CL cs.CV cs.LG physics.med-ph 73%

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

SIREM: 语音引导的MRI重建与学习采样

Md Hasan, Nyvenn Castro, Daiqi Liu, Lukas Mulzer, Jana Hutter, Jonghye Woo, Moritz Zaiss, Andreas Maier, Paula A. Perez-Toro

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃森哲-埃尔朗根-纽伦堡大学模式识别实验室) Institute of Radiology, University Hospital Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根大学医院放射学研究所) Institut für Informationsverarbeitung, Leibniz Universität Hannover(汉诺威莱比锡大学信息处理研究所) Department of Radiology, Harvard Medical School and Massachusetts General Hospital(哈佛医学院放射科和麻省总医院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种语音引导的MRI重建框架SIREM,通过同步语音作为跨模态先验,利用语音与声音学之间的相关性预测图像内容,从而在更高的吞吐量下实现更合理的解剖结构重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 73%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 73%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 73%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI 73%

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 73%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12650 2026-04-15 cs.CV cs.MM 73%

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

监听深度伪造检测:一种超越以说话为中心的伪造分析的新视角

Miao Liu, Fangda Wei, Jing Wang, Xinyuan Qian

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology Beijing(北京科技大学) University of Science(科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出监听深度伪造检测任务,引入首个专门为此任务设计的ListenForge数据集,并提出MANet网络以捕捉监听伪造中的细微运动不一致,实验表明现有说话深度伪造检测模型在监听场景中表现不佳。

Comments Submitted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26113 2026-03-30 cs.MM cs.SD eess.AS 73%

Cinematic Audio Source Separation Using Visual Cues

电影音频源分离使用视觉线索

Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。

Comments CVPR 2026. Project page: https://cass-flowmatching.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24332 2026-02-25 cs.SD cs.CV eess.AS eess.IV 73%

Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes

动态场景中手术动作空间映射的声源定位

Jonas Hein, Lazaros Vlachopoulos, Maurits Geert Laurent Olthof, Bastian Sigrist, Philipp Fürnstahl, Matthias Seibold

机构 * ROCS(罗克辛研究所) Balgrist University Hospital(巴尔格里斯大学医院) University of Zurich(苏黎世大学) Dept. of Orthopedics(骨科部门) Computer Vision and Geometry Group(计算机视觉与几何组) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种动态手术场景中声源定位的方法,通过整合3D音频与视觉数据,提升手术场景的多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17769 2026-02-23 cs.MM cs.SD eess.AS 73%

MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions

MusicSem: 一种语义丰富的语言-音频数据集,用于自然音乐描述

Rebecca Salganik, Teng Tu, Fei-Yueh Chen, Xiaohao Liu, Keifeng Lu, Ethan Luvisia, Zhiyao Duan, Guillaume Salha-Galvan, Anson Kahng, Yunshan Ma, Jian Kang

机构 * University of Rochester(罗切斯特大学) National University of Singapore(新加坡国立大学) SJTU Paris Elite Institute of Technology(上海科技技术巴黎精英学院) Singapore Management University(新加坡管理学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 MusicSem是一个基于Reddit讨论的语义丰富的音乐描述数据集,旨在提升多模态音乐表示学习中对细粒度语义的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14655 2026-02-17 cs.CL cs.AI 73%

Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech

突破数据效率困境:一种联邦学习与增强学习框架用于通过语音检测阿尔茨海默病

Xiao Wei, Bin Wen, Yuqin Lin, Kai Li, Mingyang gu, Xiaobao Wang, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(认知计算与应用天津重点实验室) College of Intelligence and Computing, Tianjin University(智能计算学院,天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) College of Computer and Data Science, Fuzhou University(计算机与数据科学学院,福州大学) Huiyan Technology (Tianjin) Co., Ltd(慧研科技(天津)有限公司)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 FAL-AD通过联邦学习与数据增强框架,实现阿尔茨海默病语音检测中的数据效率提升,达到91.52%的多模态准确率。

Comments 5 pages, 1 figures, accepted by ICASSP 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14891 2026-01-29 cs.CL cs.AI 73%

LLMBind: A Unified Modality-Task Integration Framework

LLMBind:一种统一的模态-任务整合框架

Bin Zhu, Munan Ning, Peng Jin, Bin Lin, Jinfa Huang, Qi Song, Junwu Zhang, Zhenyu Tang, Mingjun Pan, Li Yuan

机构 * pku(北京大学) pcl(鹏城实验室) hkbu(香港 Baptist大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 LLMBind通过双路径机制和MoE架构,实现多模态任务的统一整合,提升任务扩展性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 73%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05126 2025-12-08 eess.AS cs.AI cs.CL cs.CV cs.MM cs.SD 73%

SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model

SyncVoice:面向视频配音的视觉增强预训练TTS模型

Kaidi Wang, Yi He, Wenhao Guan, Weijie Wu, Hongwu Ding, Xiong Zhang, Di Wu, Meng Meng, Jian Luan, Lin Li, Qingyang Hong

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) MiLM Plus, Xiaomi Inc., China(小米公司) School of Electronic Science and Engineering, Xiamen University, China(厦门大学电子科学与技术学院)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SyncVoice通过视觉增强预训练TTS模型,提升视频配音的语音自然度和音视频同步性能,适用于多语言视频翻译场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL 73%

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12452 2025-11-18 cs.CV cs.CL 73%

DenseAnnotate: Enabling Scalable Dense Caption Collection for Images and 3D Scenes via Spoken Descriptions

Xiaoyu Lin, Aniket Ghorpade, Hansheng Zhu, Justin Qiu, Dea Rrozhani, Monica Lama, Mick Yang, Zixuan Bian, Ruohan Ren, Alan B. Hong, Jiatao Gu, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11106 2025-11-17 cs.MM cs.CV cs.SD 73%

AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization

Zhonghua Jiang, Kui Chen, Kunxi Li, Keting Yin, Yiyun Zhou, Zhaode Wang, Chengfei Lv, Shengyu Zhang

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09915 2025-11-17 cs.CL cs.MM cs.SD 73%

HI-TransPA: Hearing Impairments Translation Personal Assistant

Zhiming Ma, Shiyu Gan, Junhao Zhao, Xianming Li, Qingyun Pan, Peidong Wang, Mingjun Pan, Yuhao Mo, Jiajie Cheng, Chengxin Chen, Zhonglun Cao, Chonghan Liu, Shi Cheng

机构 * SmartFlowAI Research(SmartFlowAI研究院) Tongji University(同济大学) CMIC Guangzhou(广州CMIC) BUPT Beijing(北京邮电大学) Northeastern University Shenyang(沈阳东北大学) Peking University(北京大学) Qiyuan Tech Beijing(北京启元科技)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18213 2025-10-03 cs.SD cs.CV eess.AS 73%

NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields

Amandine Brunetto, Sascha Hornauer, Fabien Moutarde

机构 * Center for Robotics, Mines Paris - PSL University Paris, France(机器人中心,巴黎 Mines Paris - PSL 大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments ICLR 2025 (Poster). Camera ready version. Project Page: https://amandinebtto.github.io/NeRAF; 24 pages, 13 figures

Journal ref The Thirteenth International Conference on Learning Representations, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏