arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-02-20 至 2026-02-20 共收录 1
2602.17097 2026-02-20 cs.SD

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

AudioChat: 通过Transfusion Forcing实现统一的音频讲故事、编辑与理解

William Chen, Prem Seetharaman, Rithesh Kumar, Oriol Nieto, Shinji Watanabe, Justin Salamon, Zeyu Jin

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Adobe Research(Adobe研究) OpenAI. Work performed while at Adobe(OpenAI)

AI总结 AudioChat通过Transfusion Forcing实现音频故事的生成、编辑与理解,结合LLM工具调用和结构化推理提升多轮交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏