arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-29 至 2025-12-29 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2512.21706 2025-12-29 cs.CL cs.AI 62%

Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech

实现全双工语音中对话行为推理能力

Shuchang Pan, Siddharth Banerjee, Dhruv Hebbar, Siddhant Patel, Akshaj Gupta, Kan Jen Cheng, Hanjo Kim, Zeyi Austin Li, Martin Q. Ma, Tingle Li, Gopala Anumanchipalli, Jiachen Lian

机构 * Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的思维框架,通过建模对话行为的因果推断,实现全双工语音交互中的行为推理与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21566 2025-12-29 physics.optics 50%

Broadband tunable microwave photonic radar for simultaneous detection of human respiration, heartbeat, and speech with deep learning-based speech recognition

宽带可调微波光子雷达用于同时检测人体呼吸、心跳和语音的系统,结合深度学习语音识别

Lei Gao, Dingding Liang, Jiawei Gao, Chulun Lin, Zhiqiang Huang, Taixia Shi, Yang Chen

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究提出一种宽带可调微波光子雷达系统,结合深度学习实现对呼吸、心跳和语音的同步检测,实验验证其高精度语音识别和多模态生命体征监测能力。

Comments 40 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏