Transformers and Slot Encoding for Sample Efficient Physical World Modelling
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG、cs.CV
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG、cs.CV
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG、cs.CV
Comments Code is available at: https://github.com/wzzheng/OccWorld
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV、cs.RO
Comments Technical Report
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG、cs.RO
Comments ICML 2022 Long Presentation. Website: http://lfzhao.com/oowm/
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG、cs.RO
CIVA:面向视觉世界模型智能体的评论者诱导价值子空间攻击
专题命中 通用世界模型 :world-model(title,abstract);world-model(title,abstract);分类 cs.AI、cs.CV
AI总结 该研究针对视觉世界模型智能体提出CIVA攻击方法,通过提取价值子空间优化扰动,在多个基准任务上优于现有方法,实现了低时间变化下的显著奖励下降。
Comments Includes supplementary material
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
机构 * Electronic Arts(美国艺电公司) ; Simon Fraser University(西蒙菲莎大学)
专题命中 通用世界模型 :world-model(title);world-model(title);world model(abstract);world model(abstract)
AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。
Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/
MASim:面向社会科学的多语言代理模拟
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.MA
AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。
Comments Accepted at COLM 2026
智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模
机构 * University of British Columbia(英属哥伦比亚大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; National University of Singapore(新加坡国立大学) ; Columbia University(哥伦比亚大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Style3D(无合适对应中文名)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO
AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。
Comments Authorship change
FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Alibaba Group(阿里巴巴集团)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV
AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。
Comments Project Page: https://filmworld-ai.github.io
受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估
机构 * Macquarie University(麦考瑞大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO
AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。
Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277
Nous:一种用于长期智能体记忆的预测世界模型
机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。
Comments Preprint. 10 pages, 1 figure, 6 tables
面向机器人控制的上下文世界建模
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Tongji University(同济大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV、cs.RO
AI总结 提出上下文世界建模(ICWM)框架,通过任务无关的交互历史推断系统变量,使机器人策略无需参数更新即可适应新配置,在仿真和真实实验中显著优于标准VLA基线。
DeWorldSG: 基于世界模型先验的深度感知3D语义场景图生成
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; La Trobe University(拉筹伯大学)
专题命中 通用世界模型 :world-model(title);world-model(title);world model(abstract);world model(abstract)
AI总结 提出DeWorldSG框架,通过深度引导滤波估计实例级3D高斯分布,并利用世界模型先验聚合时空证据,生成时空鲁棒的3D语义场景图,在对象和谓词预测上达到最先进性能。
Comments 19 pages, 6 figures, ECCV 2026
EO-WM: 一种用于概率性地球观测预测的物理信息世界模型
机构 * The University of Hong Kong(香港大学) ; Wuhan University(武汉大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。
Comments 28 pages, 5 figures, 11 tables
风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模
机构 * Hubei University(湖北大学) ; Nanyang Technological University(南洋理工大学) ; Osaka University(大阪大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO
AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。
DynaWM: 基于世界模型和动量目标的动力学感知蒸馏实现连续楼梯上的平滑运动
机构 * School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO
AI总结 提出DynaWM框架,通过世界模型正则化增强地形编码,并利用动量目标编码器稳定知识蒸馏,使双足轮式机器人在连续楼梯上实现高适应性和平滑运动。
Comments Comments: 8 pages, 7 figures, accepted by IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS),2026
Policy4OOD:一种知识引导的世界模型,用于针对阿片类药物过量危机的政策干预模拟
机构 * University of Notre Dame, South Bend, USA(南达科他大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Policy4OOD,一种知识引导的时空世界模型,通过联合编码政策知识图谱、空间依赖和时间序列,实现政策干预的预测、反事实推理和优化,并在2019-2024年美国州级数据上验证了其有效性。
从离散规划到真实世界执行:一种面向执行感知的多智能体路径规划的世界模型驱动框架
机构 * IEEE Publication Technology Group(IEEE出版技术组)
专题命中 通用世界模型 :world-model(title);world-model(title);world model(abstract);world model(abstract)
AI总结 提出ExecTimeNet世界模型预测离散MAPF方案在物理机器人上的执行状态,并基于此构建REMAP框架和ESADG优化方法,在仿真和实物实验中分别减少高达21%和15.3%的执行延迟。
Curiosity-Critic:累积预测误差改进作为世界模型训练的可处理内在奖励
机构 * Department of Computer Science, University of Toronto, Toronto, Canada(多伦多大学计算机科学系)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Curiosity-Critic方法,通过可处理的每步替代项(当前预测误差与渐近误差基线的差值)作为内在奖励,利用共训练的评论家在线估计误差基线,有效分离可约与不可约预测误差,在随机网格世界实验中优于现有方法。
Comments Accepted to ICML 2026 Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026). Code: https://github.com/vinbhaskara/Curiosity-Critic
通过世界建模的潜在动作预训练
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; Alexandria University(亚历山大大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV、cs.RO
AI总结 提出LAWM框架,通过世界建模从无标签视频中学习潜在动作表征,实现跨任务、环境和本体的迁移学习,在LIBERO基准和真实场景中优于使用真实动作预训练的方法。
图像模型能想象时间吗?ImageTime:通过时空一致性探究视觉世界建模的新基准
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出ImageTime基准,通过四关键帧协议(初始状态、动作开始、过渡状态、最终状态)评估图像生成模型在时空一致性上的表现,揭示模型在维持连贯视觉世界状态方面的能力与不足。
世界-语言-动作模型:统一世界建模、语言推理与动作合成
机构 * SJTU(上海交通大学) ; SII(上海研究院) ; HUST(华中科技大学) ; SCUT(华南理工大学) ; ECUST(东华大学) ; SHU(上海大学) ; NJUPT(南京工业大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.RO
AI总结 提出世界-语言-动作(WLA)模型,通过自回归Transformer联合预测文本子任务、子目标图像和机器人动作,融合世界建模与语言推理能力,实现多任务和长时域任务的最优性能。
Comments 19 pages, 10 figures
ShareVerse:面向共享世界建模的多智能体一致视频生成
机构 * Shanghai Jiao Tong University China(上海交通大学中国) ; Fudan University China(复旦大学中国) ; StepFun China(StepFun中国)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。
监督微调的大语言模型规划器中世界模型恢复的深入探究
机构 * National Laboratory of the Rockies(落基山国家实验室)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG
AI总结 通过可解释性实验,研究监督微调如何影响大语言模型在经典规划任务中恢复世界模型的能力,发现微调使模型线性编码动作有效性和状态谓词,且更广泛的状态空间覆盖有助于更准确的世界模型恢复。
Comments 17 pages. Under review at TMLR
语言智能体的策略与世界模型协同训练
机构 * Southern University of Science and Technology(南方科技大学) ; Hong Kong University of Science and Technology(香港科学大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学大学(广州)) ; Hong Kong Polytechnic University(香港理工大学) ; LIGHTSPEED
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出PaW框架,通过在强化学习过程中添加辅助世界模型监督,无需改变推理范式,提升语言智能体在多个任务上的性能。
Comments 9 pages, 6 figures
放射科医生阅读的世界模型用于医学图像表示学习
机构 * University of Georgia(佐治亚大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出GazeWorld,一种将图像视为世界、放射科医生注视序列视为轨迹的医学成像世界模型,通过自回归预测注视补丁表示和空间补全未访问区域,在多个基准上实现最先进的诊断准确率和零样本性能。
结论为何从相同观察中分歧:通过推理正式化世界模型非识别性
机构 * Human Informatics and Systems Laboratory, Doshisha University, Kyoto, Japan(大阪大学人文学与系统实验室,京都,日本) ; Linked Open Data Initiative, NPO, Tokyo, Japan(开放数据倡议,东京,日本) ; Keio Research Institute at SFC, Fujisawa, Japan(庆应义塾大学SFC研究所, Fujisawa,日本) ; Stroly Inc., Kyoto, Japan(Stroly公司,京都,日本)
专题命中 通用世界模型 :world-model(title);world-model(title);world model(abstract);world model(abstract)
AI总结 本文探讨了在相同观察下推理结论分歧的本质,提出非识别性是推理学习的固有属性,而非对方认知缺陷。通过θ-级和W-级非识别性分析,揭示了推理框架对数据暴露和模型学习的影响,并关联深度表示学习与监管辩论案例。
Comments 12 pages, 2 figures, 1 table. Extended English version of a paper accepted for presentation at JSAI 2026
DreamPolicy: 一种统一的世界模型策略用于可扩展的人形机器人运动
机构 * ShanghaiTech University(上海科技大学) ; InstAdapt
专题命中 通用世界模型 :world-model(title);world-model(title);world model(abstract);world model(abstract)
AI总结 DreamPolicy通过整合离线数据与扩散式世界模型,实现单一策略掌握已知和未知地形。其地形感知世界模型能生成物理合理的未来轨迹,作为动态目标指导策略,避免手动奖励工程。实验表明,DreamPolicy在未知和复合地形上性能优于基线38%。
层级神经选项与抽象世界模型的联合学习
机构 * Cornell University(康奈尔大学) ; Google Deepmind(谷歌DeepMind)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出AgentOWL方法,通过高效样本学习抽象世界模型和层级神经选项,使智能体在Object-Centric Ataris游戏中以更少数据学习更多技能。