World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry
World Action Verifier: 通过前向-反向不对称性自我改进世界模型
机构 * Stanford University(斯坦福大学) ; UC San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Google DeepMind(谷歌DeepMind) ; Harvard University(哈佛大学)
AI总结 提出World Action Verifier (WAV)框架,利用状态合理性和动作可达性的独立验证以及前向-反向不对称性,通过视频语料库的多样子目标生成器和稀疏逆模型实现循环一致性,从而在欠探索区域自我改进世界模型,在多个任务中样本效率提升2倍且下游策略性能提升22%以上。
Comments Project Website: https://world-action-verifier.github.io