Hybrid Neural World Models
混合神经世界模型
机构 * Lossfunk
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出混合神经世界模型,通过单网络连续视界条件训练直接预测未来状态,并利用误差图隐式捕捉不连续性,实现高效且可靠的物理动力学模拟。
Comments Preprint. Under review
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
混合神经世界模型
机构 * Lossfunk
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出混合神经世界模型,通过单网络连续视界条件训练直接预测未来状态,并利用误差图隐式捕捉不连续性,实现高效且可靠的物理动力学模拟。
Comments Preprint. Under review
放射科医生阅读的世界模型用于医学图像表示学习
机构 * University of Georgia(佐治亚大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出GazeWorld,一种将图像视为世界、放射科医生注视序列视为轨迹的医学成像世界模型,通过自回归预测注视补丁表示和空间补全未访问区域,在多个基准上实现最先进的诊断准确率和零样本性能。
ChronoMedicalWorld:一个用于从纵向护理数据中学习患者轨迹的医学世界模型
机构 * Beijing KidneyTec Medical Technology Co., Ltd.(北京肾科医疗技术有限公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种名为ChronoMedicalWorld的模型,旨在通过纵向护理数据学习患者轨迹,该模型结合了联合嵌入状态编码器和宽动作编码器,并在六个术语目标下训练了循环潜在转移模块,以提高慢性病护理中长期预测的准确性。
Comments 14 pages, 2 figures, 6 tables
DeformMaster: 一个用于从视频中生成变形物体交互物理-神经世界模型
机构 * Nankai University(南开大学) ; Zhejiang University(浙江大学) ; Southern University of Science and Technology(南方科技大学) ; Rightly Robotics, A4X(Rightly Robotics,A4X) ; University of Science and Technology of China(中国科学技术大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本研究提出DeformMaster,一种基于视频的交互物理-神经世界模型,能够从真实交互视频中生成变形物体的统一动态-外观框架,通过保留结构化的物理推演并利用神经残差补偿未建模效应,实现高保真4D外观生成,实验表明其在动态预测和外观渲染方面优于现有方法。
Comments Project page: https://can-lee.github.io/deformmaster-web/
HEAT: 基于轨迹引导的世界模型实现异构端到端自动驾驶
机构 * KAIST(韩国科学技术院)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出一种基于轨迹引导的学习方法,通过规划轨迹组织训练,使模型能够捕捉驾驶意图的领域不变表示,并结合预测未来潜在特征的世界模型,提高特征一致性并缓解领域偏见,从而在多个异构数据集上实现强性能。
Transformer 通过线性方式表示高度结构化的世界模型
机构 * LaBRI, CNRS University of Bordeaux(LaBRI、CNRS 波尔多大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了Transformer在训练过程中是否能构建任务的内部模型,并发现其内部表示结构与领域结构相匹配,通过Sudoku求解轨迹训练的Transformer展示了其内部计算机制和稀疏可解释的决策电路。
不完美的世界模型是可利用的
机构 * University of Edinburgh(爱丁堡大学) ; Stanford University(斯坦福大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种新的强化学习中模型利用的定义,指出世界模型如果暗示某种策略应严格优于另一种策略,而真实环境转移模型却暗示相反,那么该模型就是可利用的。研究通过发展奖励黑客和模型利用的一般理论,证明在大规模策略集上利用本质上是不可避免的,并揭示了安全规划在世界模型中的局限性。
Comments 17 pages, 3 figures, 2 tables; modified (fixed metadata)
GeoWorld:几何世界模型
机构 * ANU(澳大利亚国立大学) ; MBZUAI(穆斯林人工智能研究所)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 GeoWorld通过超几何JEPA和几何强化学习解决传统能量预测模型在几何结构和长周期预测中的不足,实验显示在3-4步规划中性能提升3%-2%。
Comments Accepted to CVPR 2026
确定性事件-图子结构作为世界模型用于反事实推理
机构 * Tesseract Academy(Tesseract学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出事件图子结构作为世界模型,通过结构化干预词汇fork日志来回答反事实查询,证明了解释性与反事实性查询的对偶性,并在CLEVRER验证规模上评估了基于领域无关子结构运行时的C++解释器。
Comments 10 pages, 3 figures, 2 tables
潜在视频预测学习更好的世界模型
机构 * The University of Melbourne(墨尔本大学) ; Monash University(莫纳什大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文系统研究了潜在预测模型在世界模型中的鲁棒性,发现其在特征可区分性、抗污损性、细粒度辨别、遮挡鲁棒性和时间方向敏感性等方面表现优异,优于其他视频基础模型。
PriorZero:连接语言先验与世界模型以实现决策制定
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; The Chinese University of Hong Kong MMLab(香港中文大学MMLab)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 PriorZero通过解耦的rollout训练设计,将LLM生成的语义先验整合到基于世界模型的规划中,提升探索效率和长期性能,适用于文本冒险游戏和指令遵循任务。
Comments 30 pages, 12 figures
企业系统需要学习的世界模型吗?上下文对推断动态的重要性
机构 * ServiceNow ; Mila
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了在可配置的企业环境中,代理是否仍需学习动态规则,通过实验表明运行时发现动态比离线训练更鲁棒。
层级神经选项与抽象世界模型的联合学习
机构 * Cornell University(康奈尔大学) ; Google Deepmind(谷歌DeepMind)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出AgentOWL方法,通过高效样本学习抽象世界模型和层级神经选项,使智能体在Object-Centric Ataris游戏中以更少数据学习更多技能。
你的驾驶世界模型是全能选手吗?
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。
Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens
DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶
机构 * Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团Amap) ; Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。
Comments ICML 2026
Simulus:结合高效样本世界模型代理的改进
机构 * Technion(技术ion大学) ; Microsoft Research(微软研究院) ; ByteDance Seed(字节跳动种子实验室)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。
Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature
Sub-JEPA:子空间高斯正则化用于稳定的端到端世界模型
机构 * Shanghai University(上海大学) ; The University of Manchester(曼彻斯特大学) ; Nankai University(南开大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 Sub-JEPA通过在多个随机子空间中应用高斯约束,缓解了JEPA训练中的偏差-方差权衡问题,提升了训练稳定性与表示灵活性,实验显示其在连续控制环境中优于LeWM。
Comments https://github.com/intcomp/Sub-JEPA
MolWorld: 用于可操作分子优化的分子世界模型
机构 * Emory University(埃默里大学) ; Merck & Co., Inc.(默克公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 MolWorld通过分子转移图的序列扩展实现可操作分子优化,通过学习世界模型增强分子结构连接性,提升分子设计的可行性和连续性。
探测数据高效、通用型Transformer世界模型在Atari上的尺度影响
机构 * Graduate School of Artificial Intelligence(人工智能研究生院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过最小化Transformer世界模型分析Atari 100k基准的缩放行为,发现环境存在不同的缩放区域,联合训练可稳定缩放动态并提升下游控制性能。
AGWM:基于 affordance 的世界模型用于具有组合前提条件的环境
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; University of Hong Kong(香港大学) ; Columbia University(哥伦比亚大学) ; Amazon(亚马逊) ; City University of Hong Kong(香港城市大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出 AGWM 模型,通过学习抽象 affordance 结构来跟踪动作的动态可执行性,以解决传统世界模型在多步预测中的误差累积问题。
Comments 16 pages, 3 figures, 4 tables. Appendix on pages 11-16 (main text is self-contained)
渲染,而非解码:具有潜在结构解耦的权重空间世界模型
机构 * Department of Computer Science(计算机科学系) ; University of Manchester(曼彻斯特大学) ; University of Bristol(布里斯托大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出NOVA框架,通过权重和偏置构建隐式神经表示,实现高效且可解释的世界模型,支持结构场景组件的解耦与编辑。
Comments 35 pages, 30 figures, 8 tables
在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆
机构 * University of Macau(澳门大学) ; UESTC(电子科技大学) ; Purdue University(普渡大学) ; McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。
基于轻量预测世界模型的情感条件短周期人体姿态预测
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文研究了情感嵌入对短周期姿态预测的辅助作用,提出轻量级自回归预测世界模型,结合姿态关键点与情感嵌入,提升情感驱动动作序列的预测性能。
迈向一致的世界模型:多令牌预测与潜在语义增强
机构 * Shenzhen University(深圳大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过多令牌预测和潜在语义增强方法,解决大语言模型内部世界模型一致性问题,提升表示对齐性和鲁棒性。
Comments Accepted by ACL 2026 Main Conference. 21 pages, 3 figures, 7 tables
以基础设施为中心的世界模型:弥合时间深度与空间广度以实现道路感知
机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(土木与环境工程系,马萨诸塞大学阿默斯特分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出以基础设施为中心的世界模型,通过时空互补性提升道路感知能力,提出三阶段框架和双层架构,结合多模态数据引擎和开放源代码基础,推动基础设施理解交通。
Comments 18 pages, 7 tables, 1 figure, vision paper
全局神经世界模型:用于动作条件规划的空间接地离散拓扑
机构 * Western Digital Corporation(西部数据公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出全局神经世界模型,通过平衡的连续熵约束实现拓扑量化,采用连续动作条件联合嵌入预测架构,将环境映射到离散2D网格,防止流形漂移,通过最大熵探索学习通用过渡动态。
Comments 12 pages, 8 figures
基于空间、时间与具身推理的统一框架的空域视觉-语言导航
机构 * Key Laboratory for Information Science of Electromagnetic Waves (Ministry of Education)(电磁波信息科学重点实验室(教育部)) ; School of Information Science and Technology(信息科学与技术学院) ; Fudan University(复旦大学)
专题命中 具身推理 :navigation(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出一种统一框架,利用单目RGB视角和自然语言指令实现空域视觉-语言导航,通过多任务学习优化空间感知、轨迹推理和动作预测,提升轻量化无人机在复杂环境中的导航能力。
Comments Under Review, 16 pages, 12 figures. Our code is publicly available at https://github.com/return-sleep/AeroAct
潜在链式思维世界建模用于端到端驾驶
机构 * UT Austin(得克萨斯大学奥斯汀分校) ; NVIDIA(英伟达) ; Stanford University(斯坦福大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出Latent-CoT-Drive模型,通过潜在语言整合链式思维推理与决策,提升驾驶性能与安全性,实现更快推理和更优轨迹质量。
Comments Accepted to CVPR 2026
基于语义泛化的世界模型用于规划
机构 * Independent(独立) ; EPFL(瑞士联邦理工学院洛桑) ; Beihang University(北京航空航天大学) ; University of Toronto(多伦多大学) ; NUS(新加坡国立大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。
零 shot 世界模型是发展性高效学习者
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出零 shot 视觉世界模型(ZWM),基于稀疏时间因子预测器、零 shot 估计和推理组合,展示了其在单个儿童第一人称经验中快速生成多物理理解基准能力,复现儿童发展行为特征,为高效灵活学习提供蓝图。