arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

京东&港科大等提出EchoWM:边走边生成720p画面、环境声和语音

作者:arXivDaily编辑部 arXiv 2608.23189 cs · cs.CV

在生成场景里向前走、转弯或绕着角色移动时,画面、环境声、音乐和对白同时延续。京东探索研究院、香港科技大学、北京大学、斯坦福大学等机构提出EchoWM,用连续导航信号控制720p视频,并联合生成与场景同步的音频。

团队把它称为“可进入的全模态世界模型”。这里的“进入”是生成媒体中的交互:用户控制相机意图,模型继续合成视听内容;论文没有证明它能像传统引擎一样返回精确物体坐标或执行固定物理规则。

第一人称控制相机,第三人称同时学角色

EchoWM用相机意图统一两类交互。第一人称场景中,轨迹直接描述观察者的六自由度运动;第三人称场景中,相机与角色的相对运动从数据中学习,不需要为跟拍、环绕和远近变化分别编写控制器。

论文主视觉:多个生成世界围绕EchoWM标识排列,展示模型覆盖的场景类型。

离散按键和连续位姿都会被转换成统一的相对六自由度轨迹。数据级尺度校准约束不同来源中的移动幅度,减少同一个“向前”指令在某段素材里只动一点、在另一段里突然跨越很远的问题。

论文相机意图图:第一、第三人称控制被映射到统一轨迹表示,并用于不同视角的连续生成。

视频和声音在同一段世界里继续

训练数据同时覆盖带环境声、音乐、语音的视频以及可提取相机轨迹的视觉素材。模型先做渐进式训练,再进行自回归后训练,让下一段生成读取前一段的视听状态和控制轨迹。

论文方法总览:视听数据、轨迹控制、渐进训练和自回归后训练共同构成EchoWM。

项目页给出的案例包括画外语音、场景内人物发声、环境机械声、风雪和音乐。声音不是后期从标签库拼接,而是与视频共同生成。定性演示能看到声音事件与画面动作大致同步,但不能据此推断口型、空间声场和长对话在所有案例中都准确。

论文定性结果:多组视频帧配合对应的环境声、语音或音乐生成案例。

三条评测线分别看控制、画质和声音

控制评测检查生成轨迹是否跟随输入;视频质量使用公开世界模型基准和感知指标;音频部分考察环境声、语音与视频内容的一致性。论文还比较第一人称、第三人称和多轮续写,避免只用一类漂亮样例代表全部能力。

论文控制结果:三种方法在简单与困难轨迹划分上的多项指标对比。

模型支持720p输出,但论文没有把分辨率等同于细节完全可靠。长序列中,人物身份、物体结构和音频语义仍可能漂移;公开评测也主要衡量生成质量和轨迹跟随,不是物理模拟正确率。

多轮续写还要面对边界衔接:上一段末尾的相机速度、角色姿态和正在播放的声音,都要成为下一段起点。论文通过自回归后训练暴露这类输入,但展示案例的长度和场景范围仍有限,不能替代长时间人工巡检。

下一步是开放权重与状态接口

EchoWM适合交互式短片、虚拟场景漫游、游戏概念预演和视听数据合成。代码页已经出现JoyAI-Echo项目,但论文对应的完整训练资源、权重和推理门槛仍要按仓库实际发布内容核对。

若后续加入结构化状态查询、可复现的多轮场景变化和更低延迟,用户才可能把它从演示页面带进连续创作工具。现阶段最可靠的结论,是同一个生成模型已经能接收导航控制,并让视频与多类声音在一段轨迹中共同延续。

音频产品化还需要单独验证语音内容安全、说话人一致性、响度和多声源空间关系。视频侧常用的画质指标无法覆盖这些问题,未来评测应把视听同步、语义正确和主观听感分开报告。

参考资料

https://arxiv.org/abs/2608.23189

https://arxiv.org/html/2608.23189

https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm

https://github.com/jd-opensource/JoyAI-Echo