arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 14 篇

2511.19080 2025-11-25 cs.MM cs.CV 86%

Towards Generalizable Deepfake Detection via Forgery-aware Audio-Visual Adaptation: A Variational Bayesian Approach

面向可泛化的深度伪造检测的伪造感知音频视觉适应:一种变分贝叶斯方法

Fan Nie, Jiangqun Ni, Jian Zhang, Bin Zhang, Weizhe Zhang, Bin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of New Networks, Pengcheng Laboratory(鹏城实验室网络部) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院) School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院) School of Cyberspace Science, Harbin Institute of Technology(哈尔滨工业大学网络空间科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于变分贝叶斯的伪造感知音频视觉适应方法,通过估计音频视觉相关性来提升深度伪造检测的泛化能力。

Comments TIFS AQE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18698 2025-11-25 cs.SD cs.AI cs.CV cs.LG cs.MM 85%

Multimodal Real-Time Anomaly Detection and Industrial Applications

多模态实时异常检测与工业应用

Aman Verma, Keshav Samdani, Mohd. Samiuddin Shafi

机构 * Department of Electrical Engineering IIT Bombay Mumbai, India(电气工程系 印度理工学院Bombay 墨尔本)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出了一种多模态实时异常检测系统,结合视频和音频处理,通过多模型音频集合、混合物体检测和双向跨模态注意力机制,提升了准确性与工业适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10016 2025-11-25 cs.MM cs.AI cs.CL 85%

A Survey of Generative Categories and Techniques in Multimodal Generative Models

多模态生成模型中生成类别的综述

Longzhen Han, Awes Mubarak, Almas Baimagambetov, Nikolaos Polatidis, Thar Baker

机构 * School of Architecture, Technology and Engineering, University of Brighton, Lewes Road, BN2 4GJ(建筑、科技与工程学院,布里顿大学,勒斯路,BN2 4GJ) University of Khorfakkan, Sharjah(柯法克坎大学,沙迦)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文综述多模态生成模型中生成类别的发展,分析了跨模态能力的基础技术,并探讨了评估框架与治理机制以提升系统通用性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17890 2025-11-25 cs.CV cs.AI cs.MM 85%

Decoupled Audio-Visual Dataset Distillation

解耦音频-视觉数据集蒸馏

Wenyuan Li, Guang Li, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Hokkaido University(北海道大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 DAVDD通过解耦音频-视觉表示提升数据集蒸馏效果,利用预训练库和轻量解耦器实现稳定特征提取与模态隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18993 2025-11-25 cs.CV 83%

AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal Localization

AuViRe:用于深度伪造时间定位的音频视觉语音表示重建

Christos Koutlis, Symeon Papadopoulos

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AuViRe 通过音频视觉语音表示重建技术,提升深度伪造时间定位的准确性,实验结果显示在多个数据集上均优于现有方法。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18718 2025-11-25 cs.RO cs.AI 79%

AIRHILT: A Human-in-the-Loop Testbed for Multimodal Conflict Detection in Aviation

AIRHILT:航空多模态冲突检测的人机交互测试平台

Omar Garib, Jayaprakash D. Kambhampaty, Olivia J. Pinon Fischer, Dimitri N. Mavris

机构 * Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology(丹尼尔·古根海姆航空航天工程学院,佐治亚理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 AIRHILT是一款用于航空多模态冲突检测的人机交互测试平台,通过集成ASR、视觉检测和决策模型,实现冲突检测的高效评估与研究。

Comments 9 pages, 4 figures, 1 table, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 79%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17955 2025-11-25 cs.CL 79%

MTikGuard System: A Transformer-Based Multimodal System for Child-Safe Content Moderation on TikTok

MTikGuard系统:一种基于Transformer的多模态系统,用于TikTok上的儿童安全内容审核

Dat Thanh Nguyen, Nguyen Hung Lam, Anh Hoang-Thi Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Faculty of Software Engineering, University of Information Technology(软件工程学院,信息科技大学) Faculty of Computer Science, University of Information Technology(计算机科学学院,信息科技大学) University of Information Technology, Ho Chi Minh City(信息科技大学,胡志明市) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 MTikGuard系统通过多模态分类框架和扩展数据集,实现TikTok儿童安全内容审核的高准确率和实时部署。

Comments Accepted at PACLIC39

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17776 2025-11-25 cs.LG cs.MM 79%

PrismSSL: One Interface, Many Modalities; A Single-Interface Library for Multimodal Self-Supervised Learning

PrismSSL: 一个接口,多种模态;一个多模态自监督学习的单一接口库

Melika Shirian, Kianoosh Vadaei, Kian Majlessi, Audrina Ebrahimi, Arshia Hemmat, Peyman Adibi, Hossein Karshenas

机构 * dept. Computer Engineering University of Isfahan(计算机工程系 哈尔拉克大学) dept. Computer Engineering University of Texas at Dallas(计算机工程系 德克萨斯大学达拉斯分校) dept. Computer Science University of Oxford(计算机科学系 奥克兰大学) dept. Artificial Intelligence University of Isfahan(人工智能系 哈尔拉克大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.MM

AI总结 PrismSSL是一个统一多模态自监督学习的单一接口库,提供模块化代码、分布式训练和图形化仪表盘,支持多种模态和方法的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08213 2025-11-25 cs.HC 71%

GazePointAR: A Context-Aware Multimodal Voice Assistant for Pronoun Disambiguation in Wearable Augmented Reality

GazePointAR: 一种基于情境的多模态语音助手,用于可穿戴增强现实中的代词消歧

Jaewook Lee, Jun Wang, Elizabeth Brown, Liam Chu, Sebastian S. Rodriguez, Jon E. Froehlich

专题命中 音频语音多模态 :multimodal(title)

AI总结 GazePointAR是一种基于情境的多模态语音助手,通过结合眼动、指向手势和对话历史来提升可穿戴增强现实中的代词消歧能力。

Journal ref Proceedings of the CHI Conference on Human Factors in Computing Systems (CHI 2024), Article 408, ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18487 2025-11-25 eess.AS cs.AI cs.CL cs.SD 67%

InstructAudio: Unified speech and music generation with natural language instruction

InstructAudio: 通过自然语言指令统一语音和音乐生成

Chunyu Qiang, Kang Yin, Xiaopeng Wang, Yuzhe Liang, Jiahui Zhao, Ruibo Fu, Tianrui Wang, Cheng Gong, Chen Zhang, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 InstructAudio通过自然语言指令统一语音和音乐生成,实现多任务学习和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13219 2025-11-25 cs.SD cs.AI eess.AS 62%

FoleyBench: A Benchmark For Video-to-Audio Models

FoleyBench:视频到音频模型的基准测试

Satvik Dixit, Koichi Saito, Zhi Zhong, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS

AI总结 FoleyBench 是首个针对 Foley 风格视频到音频生成的基准测试,包含5000个三元组,用于评估模型在音频质量、对齐和同步方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17553 2025-11-25 cs.LG cs.AI cs.CL 62%

Practical Machine Learning for Aphasic Discourse Analysis

实用语言学在失语症话语分析中的应用

Jason M. Pittman, Anton Phillips, Yesenia Medina-Santos, Brielle C. Stark

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了五个机器学习模型在失语症患者描述图片任务中识别正确信息单位(CIUs)的性能,发现虽然模型能有效区分词与非词,但识别CIUs仍面临挑战。

Comments 14 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02792 2025-11-25 cs.HC 50%

Where Do Passengers Gaze? Impact of Passengers' Personality Traits on Their Gaze Pattern Toward Pedestrians During APMV-Pedestrian Interactions with Diverse eHMIs

乘客注视方向在哪里?乘客个性特征对其在APMV-行人互动中对行人注视模式的影响

Hailong Liu, Zhe Zeng, Takahiro Wada

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究探讨了乘客个性特征如何影响其在APMV与行人互动中的注视模式,发现不同eHMI设计对乘客注视行为有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏