arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2511.11811 2025-11-26 cs.HC cs.SY eess.AS eess.IV eess.SY 79%

Lessons Learned from Developing a Privacy-Preserving Multimodal Wearable for Local Voice-and-Vision Inference

从开发一个隐私保护的多模态可穿戴设备以实现本地语音和视觉推断中获得的启示

Yonatan Tussa, Andy Heredia, Nirupam Roy

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文介绍了开发隐私保护多模态可穿戴设备的经验,展示了如何在本地进行语音和视觉推断,并探讨了在日常环境中平衡隐私、响应性和可用性的设计挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20474 2025-11-26 cs.CV cs.LG 57%

Modular Deep Learning Framework for Assistive Perception: Gaze, Affect, and Speaker Identification

模块化深度学习框架用于辅助感知:注视、情绪和说话人识别

Akshit Pramod Anchan, Jewelith Thomas, Sritama Roy

机构 * School of Computer Science and Engineering (SCOPE)(计算机科学与工程学院) Vellore Institute of Technology (VIT)(韦洛雷理工学院) School of Electronics Engineering (SENSE)(电子工程学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出模块化深度学习框架,用于实现注视、情绪和说话人识别的高精度辅助感知技术。

Comments 10 pages, 9 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19947 2025-11-26 cs.IT eess.SP math.IT 50%

Towards Edge General Intelligence: Knowledge Distillation for Mobile Agentic AI

迈向边缘泛智能:面向移动代理AI的知识蒸馏

Yuxuan Wu, Linghan Ma, Ruichen Zhang, Yinqiu Liu, Dusit Niyato, Shunpu Tang, Zehui Xiong, Zhu Han, Zhaohui Yang, Kaibin Huang, Zhaoyang Zhang, Kai-Kit Wong

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了将知识蒸馏整合到边缘泛智能中的方法,旨在提升移动边缘计算中智能代理的效率与可扩展性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏