arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-31 至 2026-08-31 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 1 篇

2608.28491 2026-08-31 cs.AI cs.RO 新提交 62%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏