arXivDaily arXiv每日学术速递 周一至周五更新
紧急更新!大量爬虫把网站搞的很不稳定,部分功能限制为登录后才能使用,如高级检索等

PAPERDAILY REPORTS

腾讯把视频模型变成交互世界,只训练0.199%参数

作者:arXivDaily编辑部 arXiv 2609.01560 cs · cs.AI · cs.CV

腾讯、新加坡国立大学、香港理工大学联合提出H3-World,把330亿参数的MiniMax-H3视频生成器改造成可交互世界模型。团队使用8000个游戏样本、10000步LoRA优化,只训练0.199%的参数,就获得角色动作和镜头运动的分段控制。

视频模型原本已经会听动作描述

MiniMax-H3在没有专门动作模块时,已经能根据自然语言生成角色走、跑、转向以及镜头移动的视频。H3-World利用这一现成语义接口,把每个控制动作写成角色指令与镜头指令的结构化组合,而不是重新设计一套离散手柄编码。

问题在于普通文本提示只适合描述整段视频,连续动作容易互相泄漏。前一条“向左走”的影响可能延续到后一段,镜头和角色也会混在同一个时间范围内,难以形成可重复的交互。

图:论文主视觉展示多种可交互生成世界。

时间路由把指令钉在对应片段

H3-World把动作指令与对应的视频潜变量时间段对齐,并用时间注意力路由限制每条指令的作用区间。角色动作与相机动作可以组合,例如人物前进时镜头平移,随后角色停止而镜头继续旋转。

这种设计复用视频预训练中已经形成的语义表示,LoRA只调整少量参数。论文因此把重点放在轻量适配,而不是声称从8000个样本重新训练了世界模型;0.199%指的是可训练参数比例,不是整个模型规模。

图:论文动作控制图展示分段角色和镜头指令。

控制能力仍是生成式研究原型

论文展示了已见和未见视觉场景中的动作控制,并比较指令遵循、时间对齐与画面质量。真实结果是模型能在生成视频里持续表现角色和镜头变化,但它没有物理引擎的确定性状态,也没有证明长时间交互中位置、碰撞和物体关系始终一致。

生成世界每次采样仍可能出现外观漂移、动作边界模糊或场景细节变化。研究所说的“世界控制”应理解为对生成视频动态的控制,不应直接等同于可运行游戏、机器人仿真器或稳定数字孪生。

图:论文对比图展示动作指令与生成结果。

下一步:轻量适配可以先服务内容原型

H3-World更直接的应用是交互式分镜、游戏概念验证和可控镜头预演。创作者可以先用文本动作快速测试角色走位与镜头方案,再把确定的镜头交给传统引擎或视频制作流程。

下一步需要增加更长时间的状态记忆、动作反馈和物理一致性测试,并把控制延迟、重复执行偏差和失败率公开。只有同一指令在多次采样中保持足够稳定,生成式世界模型才可能承担实时交互环境,而不只是可观看的演示。

交互系统还需要明确动作粒度。自然语言适合高层意图,却很难精确表达持续时间、速度和连续反馈;可以让文本负责选择动作,再由结构化参数约束时间和幅度,减少同一句话在不同场景中的歧义。

评测应把画面质量与控制准确率分开。一个视频可能看起来漂亮但没有按时转向,也可能严格执行动作却出现明显纹理漂移;分别统计动作命中、边界误差、身份一致性和视觉质量,才能看清轻量适配的真实收益。

项目页已经提供模型和代码入口,后续复现可重点检查8000个样本的构成、未见场景划分和采样随机性。若多次运行的控制结果波动很大,实时产品仍需外部状态机或传统引擎兜底。

对于创作者,理想接口还应保存指令时间线和随机种子,使一次满意结果可以重放、局部修改和版本比较。若每次修改镜头都会改变角色外观,工作流仍然不可控;项目应提供编辑前后的一致性指标,并允许只重新生成指定时间段。

参考资料

https://arxiv.org/abs/2609.01560

https://danzer1xxxxchan.github.io/H3-World