Contrastive Learning of Structured World Models
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
Comments ICLR 2020
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
Comments ICLR 2020
EchoWM:开放且可进入的全模态世界模型
机构 * HKUST(香港科技大学) ; PKU(北京大学) ; Joy Future Academy, JD(京东探索研究院) ; HKU(香港大学) ; THU(清华大学) ; USTC(中国科学技术大学) ; FDU(复旦大学) ; Beihang University(北京航空航天大学) ; Stanford University(斯坦福大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)
AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。
Comments 42 pages, 24 figures
MOSH-WM:面向以对象为中心的世界模型的基于掩码的软哈密顿动力学
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 该研究提出MOSH-WM模型,通过掩码支撑构建软哈密顿动力学,在OBJ3D、CLEVRER数据集的视频预测任务中,相比基线显著降低误差,且误差积累更慢。
AudioWorldSim:用于世界模型的真实双耳音频数据集
机构 * VISGRAF ; IMPA(巴西纯数学与应用数学国家研究所)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。
Comments 7 pages, 3 figures
正交JEPA:用于潜在世界模型的分解预测状态
机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 该研究提出正交JEPA框架,通过正交预测分解改进潜在世界模型,在多类任务实验中评估了其表示质量、预测、规划及长时程稳定性。
面向人体状态转换的生理世界模型
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(title);world models(title)
AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。
用动作条件预测一致性诊断JEPA世界模型
机构 * Huawei(华为) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本研究针对JEPAs世界模型易受视觉扰动影响的问题,提出动作条件预测一致性(ACPC)诊断方法,定义IR与SR指标,经四视觉控制任务实验验证其可预测扰动带来的预测及代价变化。
模型发现智能体:用于数据高效发现机制世界模型的大语言模型辅助贝叶斯实验设计
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 该研究提出模型发现智能体(MDA),结合LLM与贝叶斯机制,在少量干预下发现机制世界模型,在三类基准上实现数据高效模型学习与可靠干预预测的SOTA性能。
Comments v3: further improve app A (algorithm pseudocode), add new app G (further related work) - (main text unchanged)
通过可执行模型理解人类行为
机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。
Comments Accepted in ECCV2026 Workshop
将物理先验知识蒸馏为流式世界模型
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本文提出PhyS三阶段框架,构建120K物理交互数据集,经微调、蒸馏及在线强化学习结合TCR方法,提升流式世界模型的物理一致性,在PhysicsIQ等基准上取得显著性能提升。
Comments 9 pages, 7 figures. Project page: https://lyongo.github.io/PhyS/
社交世界模型
机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学语言技术研究所) ; NVIDIA, Santa Clara, CA, USA(英伟达)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本文提出社交世界模型(SWMs)及结构化社交世界表示形式(S3AP),通过显式建模隐藏心理状态提升AI在社交推理任务中的性能。
PhyLatent:为JEPA世界模型学习与动力学相关的表征
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院) ; School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) ; The University of Sheffield(谢菲尔德大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 PhyLatent为JEPA世界模型设计训练目标,解决其三类失效模式,在OGBench-Cube等数据集上显著降低失效率、提升MPC成功率,证明全局非坍塌不足以学习可靠的JEPA状态空间。
Comments 16 pages, 5 figures
LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。
HERA:用于潜在世界模型中物理预测的历史证据路由适配器
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本研究提出 HERA 框架,通过 RRPM 适配器为冻结潜在预测器路由历史证据,在 IntPhys2 数据集上显著提升 V-JEPA 2-G 的物理预测准确率,验证了该策略的有效性。
TRW: TRACE-RealWorld——作为物化视图的世界模型的可审计一致性契约
机构 * Stanford University(斯坦福大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 TRACE-RealWorld解决在变化物理世界中维护物化视图的问题,提出承诺级有效性抽象等数据管理方法,通过端到端评估测量多方面指标,贡献是为部署世界表示提供一致性、恢复和问责契约。
Comments v2 propagates declared point and extended hazards through the composition theorem and separates point-event from interval-risk budgets. It aligns Flood-SAR adjudication with each hazard class, sharpens calibration-slack and drift claims, adds bootstrap Monte Carlo error and joint-coverage requirements, revises terminology, and expands related-work context
VISA: VLM引导的实例语义审计用于3D占据世界模型
机构 * University of Maryland College Park(马里兰大学帕克分校) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; Stanford University(斯坦福大学) ; Motional AD Inc.(Motional AD公司)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。
视听世界模型:为具身智能体奠定多感官想象的基础
机构 * Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。
WorldExam:从表观外观到内在反应性对世界模型进行基准测试
机构 * CASIA(中国科学院自动化研究所) ; SLAI(智能科学与技术实验室) ; CUHK(香港中文大学) ; AMAP(中国农业科学院) ; THU(清华大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 该研究推出WorldExam基准,评估20个模型在视觉质量等四层级的表现,发现不同驱动模型能力有明显分化,无模型兼具广泛任务覆盖与稳定性能,高视觉质量不代表内在反应性强。
Comments Project Website: https://WorldExam.github.io
ProWorld:用于长程视觉目标到达的感知进展双曲世界模型
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本文针对长程视觉目标到达任务中视觉世界模型的进展感知与轨迹区分难题,提出双曲视觉世界模型ProWorld,经实验相较LeWM实现9.67的平均绝对成功率提升。
Comments 24 pages, 14 figures, 15 tables
MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构
机构 * City University of Hong Kong, China(香港城市大学) ; Tencent, China(腾讯)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。
量子影院:通过生成世界模型对量子计算硬件进行交互式电影探索
机构 * Amazon Web Services(亚马逊网络服务) ; Duke Kunshan University(杜克昆山大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本文提出量子影院,一个基于生成世界模型的开源交互式应用,通过四幕叙事将不可见的量子硬件转化为可探索的电影体验,旨在弥合量子计算与公众之间的想象鸿沟。
StatePlay:用于机制一致性生成的状态感知游戏世界模型
机构 * Tencent(腾讯)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。
Comments Project Page: https://jimntu.github.io/stateplay_page/
CalTwin:基于Fisher信息正则化的校准、分布偏移鲁棒医学世界模型研究
机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院) ; Gachon University(嘉泉大学) ; St. John’s University(圣约翰大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 本研究提出CalTwin方法,结合Fisher信息偏移惩罚与置信度失配惩罚,应用于GRU医学世界模型,在PhysioNet脓毒症挑战赛上显著降低了分布外隐状态预测误差,同时改善了置信度校准。
穿越绘画:来自互联网先验的自我中心世界模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Toyota Research Institute(丰田研究机构)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。
INTACT:用于无搜索世界模型的同构意图到动作学习
机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; InSpatio
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。
Comments 28 pages, 11 figures, including appendices
视觉补丁世界:作为规划潜在结构化表示的代码世界模型
机构 * Hong Kong Baptist University(香港浸会大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。
虚假预言:论智能体系统中世界模型的安全性
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。
关于受控世界模型的可识别性
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。
DWM:在潜在世界模型中分离世界效应与动作
机构 * Peking University(北京大学)
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 研究在潜在世界模型中分离世界效应与动作的问题,提出DWM框架,通过辅助世界头和正交性约束实现预测转换的显式加法分解,在构建的W变体基准测试中取得更好效果。
为灵巧操作扩展跨实体世界模型
机构 * UC San Diego(UC圣迭戈大学) ; Harvard University(哈佛大学) ; Shanghai Jiao Tong University(上海交通大学) ; Hillbot
专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)
AI总结 研究跨实体学习中不同形态机器人数据共享和控制转移问题,提出将人类和机器人手表示为3D粒子集,在随机交互数据上训练基于图的世界模型并与模型预测控制集成,实验表明该方法能提高泛化能力、有效结合数据并实现不同机器人手的控制。
Comments Accepted to IROS 2026, Project Page: https://alan-heoooh.github.io/dexwm.html