arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-22 至 2025-12-22 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2512.17241 2025-12-22 cs.RO cs.HC 50%

A Service Robot's Guide to Interacting with Busy Customers

服务机器人与忙碌顾客互动指南

Suraj Nukala, Meera Sushma, Leimin Tian, Akansel Cosgun, Dana Kulic

机构 * Faculty of Engineering, Monash University(蒙纳什大学工程学院) CSIRO Robotics(CSIRO机器人研究中心) School of Information Technology, Deakin University(德金大学信息技术学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究探讨了服务机器人在模拟餐厅场景中通过不同沟通方式与忙碌顾客互动的效果,发现视觉显示在传达意图上效果最佳,而语音在捕捉注意力方面表现突出。

Comments Presented at ACRA 2025. 10 pages, 4 figures. Includes a user study (N=24) using the Temi robot evaluating speech, visual, and micromotion modalities

Journal ref Proceedings of the 2025 Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17228 2025-12-22 cs.HC 50%

LUMIA: A Handheld Vision-to-Music System for Real-Time, Embodied Composition

LUMIA: 一种用于实时具身创作的手持视觉到音乐系统

Chung-Ta Huang, Connie Cheng, Vealy Lai

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LUMIA通过视觉到音乐的实时具身创作系统,将环境互动与生成式AI结合,实现基于感知的即兴音乐创作。

Comments 6 pages, 15 pages with appendix, NeurIPS 2025 Creative AI track

详情

展开后加载摘要…

URL PDF HTML 收藏