论文导读
香港大学、香港科技大学(广州)、萨塞克斯大学和LIGHTSPEED提出Omni-Streaming Thinking,让实时音视频模型把早期判断先标成待验证,而不是立刻当事实。冻结Qwen3-Omni骨干并加轻量适配后,它在五项基准上相对最强开放基线平均提高超过10%,结论不覆盖所有闭源模型。
画面给出线索,声音却来得更晚
流式模型不能一次看完整段视频,只能边接收边判断。画面可能先出现机场登机口或正在弹吉他的人,模型便推测答案;几秒后广播或声音给出相反信息。如果早期推测已经写入记忆,后续回答会继续沿着错误前提走。论文把这类问题称为“过早跨模态承诺”。
论文图:视觉先支持Gate 6,后续音频说出Gate 12,模型需要撤回原判断。
普通做法往往只把所有模态压进同一段上下文,难以知道某条结论由哪种证据支持,也不清楚应在什么时候复查。OST因此把“现在看到什么”和“未来还要等什么”明确分开。
给每条判断设置验证期限
OST生成结构化状态:已有证据、对未来证据的预测,以及由证据支持的主张。每条主张先标为待定,同时记录应由音频还是视觉验证,以及未来哪个时间区间会出现关键线索。音频与画面证据分别保存,避免一方的强提示直接覆盖另一方。
论文图:带时间戳的事实监督预测、验证、回答门控与策略适配。
验证区间结束后,如果新证据冲突,系统会降低旧主张及其依赖状态的影响,再用新证据更新判断。答案门控还会检查关键主张是否完成验证;该等就等,该改就改,而非对所有问题统一延迟。
专门用“同画面换声音”做诊断
除五个流式和音视频基准外,团队建立OST-DiagBench:固定视频,只编辑音频,构造一致、缺失、矛盾、共存和字幕—语音冲突。这样能区分模型是真的听取声音,还是只被画面先入为主。
论文图:OST与开放基线在多项流式音视频任务上的结果对比。
论文报告,OST的d-prime达到2.95,开放基线最高为1.38,并减少视觉引发的听觉幻觉。五项常规基准上,其平均相对性能也超过最强开放基线10%。不过实验基于冻结的Qwen3-Omni-30B-A3B-Instruct和轻量适配,机制在其他架构上的收益仍需单独验证。
诊断集固定画面再替换声音,减少了场景变化带来的干扰,因此更能检验模型是否真的按时听取音频,而不是凭视觉常识猜答案。
下一步用于直播和实时助手
直播问答、会议助手、车载交互都可能遇到“证据尚未到齐”的情况。OST提供了一种可审计的等待机制:开发者能看到模型在等哪种证据、何时复查、为什么撤回。后续若能降低结构化状态的计算成本,并覆盖更长视频和多人声音,它会比单纯要求模型“谨慎回答”更接近可部署方案。