LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models
LD4WAM:从人类视频学习世界动作模型的潜在动力学
专题命中 动作与事件理解 :video generation(abstract)
AI总结 LD4WAM通过运动对齐的潜在动力学,结合语义重建与真实运动对齐训练的潜在动力学模型和MoT架构的世界动力学动作模型,在RoboTwin仿真及真实机器人上表现良好,可泛化到未见物体与背景。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
LD4WAM:从人类视频学习世界动作模型的潜在动力学
专题命中 动作与事件理解 :video generation(abstract)
AI总结 LD4WAM通过运动对齐的潜在动力学,结合语义重建与真实运动对齐训练的潜在动力学模型和MoT架构的世界动力学动作模型,在RoboTwin仿真及真实机器人上表现良好,可泛化到未见物体与背景。
$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; AGIBOT Finch
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。
Comments Our project homepge: this https URL (https://tau0-wm.github.io)
SlotMem:用于叙事长视频生成的字符可寻址内部存储器
机构 * The University of Hong Kong(香港大学) ; Tsinghua University(清华大学)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。
面向持续故事与交互世界的长时序视听生成
机构 * Joy Future Academy, JD(京东探索研究院)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。
Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)
AcoustiTrace:看似合理的声音为何违背物理规律
专题命中 视频数据与评测 :video generation(abstract);分类 cs.MM
AI总结 该研究提出AcoustiTrace诊断基准,从八个声学维度评估T2AV和I2AV生成,构建相关数据集与评估器,发现领先模型仍难符合基础声学规律,其诊断可指导模型优化与新方向探索。