2510.13747
2025-12-04
cs.CV
57%
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
InteractiveOmni: 一种用于音频-视觉多轮对话的统一多模态模型
Wenwen Tong, Hewei Guo, Dongchuan Ran, Jiangnan Chen, Jiefan Lu, Kaibin Wang, Keqiang Li, Xiaoxu Zhu, Jiakui Li, Kehan Li, Xueheng Li, Lumin Li, Chenxu Guo, Jiasheng Zhou, Jiandong Chen, Xianye Wu, Jiahao Wang, Silei Wu, Lei Chen, Hanming Deng, Yuxuan Song, Dinghao Zhou, Guiping Zhong, Ken Zheng, Shiyin Kang, Lewei Lu
机构
*
SenseTime Research(商汤科技研究院)
专题命中
视频问答
:video understanding(abstract);分类 cs.CV
AI总结
InteractiveOmni是一种统一的多模态模型,通过多阶段训练策略提升多轮对话能力,提供高效的音频-视觉交互体验。