arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-10 至 2026-02-10 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2602.08309 2026-02-10 cs.CV 88%

CAE-AV: Improving Audio-Visual Learning via Cross-modal Interactive Enrichment

CAE-AV:通过跨模态交互增强改进音频-视觉学习

Yunzuo Hu, Wen Li, Jing Zhang

机构 * School of Information Science and Engineering, East China University of Science and Technology (ECUST)(信息科学与工程学院,东华大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV

AI总结 CAE-AV通过跨模态交互增强框架,解决音频-视觉学习中的模态不对齐问题,提升表示质量和任务性能。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08293 2026-02-10 eess.AS 88%

Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition

跨模态瓶颈融合用于噪声鲁棒的音频视觉语音识别

Seaone Ok, Min Jun Choi, Eungbeom Kim, Seungu Han, Kyogu Lee

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS

AI总结 CoBRA通过跨模态瓶颈融合机制,在噪声环境下提升音频视觉语音识别的鲁棒性和效率。

Comments 5 pages, 3 figures, ICASSP 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08914 2026-02-10 cs.HC cs.AI 83%

Gesturing Toward Abstraction: Multimodal Convention Formation in Collaborative Physical Tasks

指向抽象:协作物理任务中的多模态惯例形成

Kiyosu Maeda, William P. McCarthy, Ching-Yi Tsai, Jeffrey Mu, Haoliang Wang, Robert D. Hawkins, Judith E. Fan, Parastoo Abtahi

机构 * Princeton University(普林斯顿大学) Brown University(布朗大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究通过多模态协作任务探讨了如何通过建立语言和手势抽象来提高协作效率,并扩展了惯例形成的概率模型。

Comments Accepted at the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026). 15 pages

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), ACM, 2026

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 79%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07434 2026-02-10 cs.RO cs.AI 79%

Bridging Speech, Emotion, and Motion: a VLM-based Multimodal Edge-deployable Framework for Humanoid Robots

弥合语音、情感与运动:一种基于视觉语言模型的多模态边缘可部署框架用于人形机器人

Songhua Yang, Xuetao Li, Xuanye Fei, Mengde Li, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SeM$^2$框架,通过多模态感知、思维链推理和语义序列对齐机制,实现情感一致的多模态交互,提升人形机器人在现实环境中的社交表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11261 2026-02-10 cs.CL 79%

Kahaani: A Multimodal Co-Creative Storytelling System

Kahaani:一种多模态协同创作叙事系统

Samee Arif, Muhammad Saad Haroon, Aamina Jamal Khan, Taimoor Arif, Agha Ali Raza, Awais Athar

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) University of Michigan(密歇根大学) Strategize Labs(战略实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18268 2026-02-10 cs.LG 78%

Reducing Aleatoric and Epistemic Uncertainty through Multi-modal Data Acquisition

通过多模态数据采集减少偶然性和epistemic不确定性

Arthur Hoarau, Benjamin Quost, Sébastien Destercke, Willem Waegeman

机构 * Université de Lorraine, CentraleSupélec CNRS, LORIA, Metz, France(洛林大学、中央超导电子学学院 CNRS、LORIA、法国梅茨) Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) CNRS, Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(CNRS、图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) University of Ghent Ghent, Belgium(根特大学、比利时根特)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出一种多模态数据采集框架,通过增加模态数量和收集更多观测来减少偶然性和epistemic不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19611 2026-02-10 cs.HC 78%

Scene2Hap: Generating Scene-Wide Haptics for VR from Scene Context with Multimodal LLMs

Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈

Arata Jingu, Easa AliAbbasi, Sara Safaee, Paul Strohmeier, Jürgen Steimle

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07179 2026-02-10 cs.HC cs.AI cs.CL cs.CY cs.IT math.IT 62%

An Information-Theoretic Framework for Comparing Voice and Text Explainability

一种信息论框架用于比较语音和文本的可解释性

Mona Rajhans, Vishal Khawarey

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种信息论框架,用于比较语音和文本在AI系统可解释性中的效果,发现类比基于的交付在理解效率与信任校准之间取得最佳平衡。

Comments Accepted for publication at the 10th ACM International Conference on Intelligent Systems, Metaheuristics & Swarm Intelligence (ISMSI 2026), April 24-26, Cebu City, Phillipines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07143 2026-02-10 cs.SD cs.CL 57%

Massive Sound Embedding Benchmark (MSEB)

大规模声音嵌入基准(MSEB)

Georg Heigold, Ehsan Variani, Tom Bagby, Cyril Allauzen, Ji Ma, Shankar Kumar, Michael Riley

机构 * Google Research(谷歌研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MSEB是一个用于评估多模态系统听觉组件的可扩展框架,提供八个核心任务和大规模数据集,旨在推动稳健的机器听觉智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07266 2026-02-10 cs.HC 50%

ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators

ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具

Franklin Mingzhe Li, Michael Xieyang Liu, Cynthia L. Bennett, Shaun K. Kane

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。

Comments 21 pages, 4 figures, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏