arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2310.04628 2023-10-10 cs.CY 50%

(Re)framing Built Heritage through the Machinic Gaze

Vanicka Arora, Liam Magee, Luke Munn

专题命中 图文多模态 :image-text(abstract)

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17609 2023-05-30 cs.GR cs.HC 50%

EvIcon: Designing High-Usability Icon with Human-in-the-loop Exploration and IconCLIP

I-Chao Shen, Fu-Yin Cherng, Takeo Igarashi, Wen-Chieh Lin, Bing-Yu Chen

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13172 2023-04-27 cs.GR 50%

Generating Procedural Materials from Text or Image Prompts

Yiwei Hu, Paul Guerrero, Miloš Hašan, Holly Rushmeier, Valentin Deschaintre

专题命中 图文多模态 :multi-modal(abstract)

Journal ref SIGGRAPH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05830 2023-03-13 cs.CR 50%

ICStega: Image Captioning-based Semantically Controllable Linguistic Steganography

Xilong Wang, Yaofei Wang, Kejiang Chen, Jinyang Ding, Weiming Zhang, Nenghai Yu

专题命中 图文多模态 :image-text(abstract)

Comments 5 pages, 5 tables, 3 figures. Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06671 2023-02-24 cs.RO 50%

GenAug: Retargeting behaviors to unseen situations via Generative Augmentation

Zoey Chen, Sho Kiami, Abhishek Gupta, Vikash Kumar

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05195 2022-12-13 cs.LG 50%

Uniform Masking Prevails in Vision-Language Pretraining

Siddharth Verma, Yuchen Lu, Rui Hou, Hanchao Yu, Nicolas Ballas, Madian Khabsa, Amjad Almahairi

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.00130 2015-07-02 cs.GT 50%

Randomized Revenue Monotone Mechanisms for Online Advertising

Gagan Goel, MohammadTaghi Hajiaghayi, Mohammad Reza Khani

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4567 篇

2607.03657 2026-07-07 cs.CV cs.AI 新提交 93%

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07531 2026-06-09 cs.CL cs.AI 新提交 93%

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台

Jakub Muszyński, Paweł Pozorski, Maria Ganzha

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。

Comments Submitted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17666 2025-02-21 cs.CL 92%

How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations

Hyunji Lee, Danni Liu, Supriti Sinhamahapatra, Jan Niehues

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17102 2026-08-19 cs.CL eess.AS eess.IV 新提交 91%

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

跨语音与面部的情感:多模态基础模型中的共享情感机制

Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 91%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21990 2026-02-24 cs.CV cs.SD 91%

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13836 2026-06-18 cs.CL cs.CV cs.MM 版本更新 91%

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

FutureOmni:从全模态上下文中评估多模态大语言模型的未来预测能力

Qian Chen, Jinlan Fu, Changsong Li, Min Zhang, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 提出FutureOmni基准,评估多模态大模型从音视频线索预测未来的能力,发现现有模型在语音密集场景下表现差,并设计OFF训练策略提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02611 2024-12-04 cs.CV cs.AI cs.CL cs.MM cs.SD eess.AS 91%

AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?

Kaixiong Gong, Kaituo Feng, Bohao Li, Yibing Wang, Mofan Cheng, Shijia Yang, Jiaming Han, Benyou Wang, Yutong Bai, Zhuoran Yang, Xiangyu Yue

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project page: https://av-odyssey.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10412 2026-08-12 cs.HC cs.CY 新提交 90%

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任

He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract)

AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。

Comments Accepted to ACM HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12820 2026-07-15 cs.CV 新提交 90%

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13747 2025-12-04 cs.CV 90%

InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue

InteractiveOmni: 一种用于音频-视觉多轮对话的统一多模态模型

Wenwen Tong, Hewei Guo, Dongchuan Ran, Jiangnan Chen, Jiefan Lu, Kaibin Wang, Keqiang Li, Xiaoxu Zhu, Jiakui Li, Kehan Li, Xueheng Li, Lumin Li, Chenxu Guo, Jiasheng Zhou, Jiandong Chen, Xianye Wu, Jiahao Wang, Silei Wu, Lei Chen, Hanming Deng, Yuxuan Song, Dinghao Zhou, Guiping Zhong, Ken Zheng, Shiyin Kang, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 InteractiveOmni是一种统一的多模态模型,通过多阶段训练策略提升多轮对话能力,提供高效的音频-视觉交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07490 2026-05-11 cs.CR 90%

Cross-Modal Backdoors in Multimodal Large Language Models

多模态模型中的跨模态后门

Runhe Wang, Li Bai, Haibo Hu, Songze Li

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04566 2025-08-07 cs.CV cs.AI cs.MM 90%

CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization

Jinxing Zhou, Ziheng Zhou, Yanghao Zhou, Yuxin Mao, Zhangling Duan, Dan Guo

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05152 2023-12-22 cs.LG cs.AI cs.CV cs.MM 90%

Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks

Haoyi Duan, Yan Xia, Mingze Zhou, Li Tang, Jieming Zhu, Zhou Zhao

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05863 2023-10-11 eess.AS cs.AI cs.CV cs.SD 90%

Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models

Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09212 2023-05-17 eess.AS cs.CV cs.MM cs.SD 90%

Cross-Modal Global Interaction and Local Alignment for Audio-Visual Speech Recognition

Yuchen Hu, Ruizhe Li, Chen Chen, Heqing Zou, Qiushi Zhu, Eng Siong Chng

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 12 pages, 5 figures, Accepted by IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.03598 2022-04-05 cs.CV cs.CL eess.AS 90%

Audio-visual Generalised Zero-shot Learning with Cross-modal Attention and Language

Otniel-Bogdan Mercea, Lukas Riesch, A. Sophia Koepke, Zeynep Akata

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03314 2026-08-14 cs.CV cs.CL 版本更新 90%

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

CoLA: 跨模态低秩适配用于多模态下游任务

Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Atito

机构 * Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心) University of Surrey(塞维利亚大学) Surrey Institute for People-Centred AI(以人为本的人工智能研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出CoLA框架,通过引入跨模态适配路径扩展LoRA,实现双流架构中单模态基础模型的高效多模态适配,在视觉-语言和音频-视觉任务上分别提升约3%和2%的相对性能。

Comments Accepted by ICML 2026, 17 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14143 2026-06-09 cs.CV cs.AI 版本更新 90%

SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM

SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索

An Yu, Weiheng Lu, Jian Li, Zhenfei Zhang, Yunhang Shen, Felix X. -F. Ye, Ming-Ching Chang

机构 * Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) Nanjing University(南京大学) Xiamen University(厦门大学) Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 提出SMART框架,融合音频与视觉特征,利用镜头感知令牌压缩技术,在多模态大模型基础上实现视频时刻检索,在Charades-STA和QVHighlights上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05931 2026-06-05 cs.CL cs.AI cs.CV cs.IR cs.LG cs.MM eess.AS 90%

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

多模态还是非多模态:通过主动模态检测的查询自适应音视频人物检索

Erfan Loweimi, Mengjie Qian, Kate Knill, Guanfeng Wu, Chi-Ho Chan, Abbas Haider, Muhammad Awan, Josef Kittler, Hui Wang, Mark Gales

机构 * University of Cambridge(剑桥大学) Queen's University Belfast(贝尔法斯特女王大学) University of Surrey(萨里大学) Cisco(思科) Southwest Jiaotong University(西南交通大学) Teesside University(泰赛德大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出一种查询自适应框架,通过跨模态分数一致性检测主动模态,在BBC Rewind语料库上达到94.2%的P@1,优于单模态和固定融合方法。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22012 2026-05-22 cs.CL cs.CV 90%

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解

Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, Junbo Niu, Tianyu Guo, Yang Shi, Yue Ding, Yiyan Ji, Bingyin Mei, Yushuo Guan, Yuanxing Zhang, Pengfei Wan, Fangcheng Fu, Wentao Zhang

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) HKUST(香港科技大学) CASIA(中国科学院自动化研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01219 2026-05-05 cs.MM cs.CV cs.SD eess.IV 90%

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音频视频质量评估中的多模态置信度建模

Mayesha Maliha R. Mithila, Mylene C. Q. Farias

机构 * Texas State University Department of Computer Science(德克萨斯州立大学计算机科学系)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出MCM-AVQA框架,通过多模态置信度感知方法提升音频视频质量评估的准确性与可解释性,特别在处理不对称退化时表现更优。

Comments Accepted at ICIP 2026, 6 pages, 4 figures, no supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00701 2026-02-03 cs.MM cs.CV cs.LG cs.SD 90%

Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning

跨模态二进制注意力:面向音频视觉学习的高效融合框架

Mohamed Saleh, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所) Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学方法中心)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出CMQKA和SNNergy,通过高效二进制操作实现线性复杂度的跨模态融合,显著提升音频视觉任务的能耗效率和性能

详情

展开后加载摘要…

URL PDF HTML 收藏