arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-02-17 至 2026-02-17 共收录 12 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 12 篇

2602.07672 2026-02-17 cs.SE cs.AI cs.LG cs.PL cs.SC 94%

Debugging code world models

调试代码世界模型

Babak Rahmani

机构 * Tübingen AI Center, University of Tübingen, Microsoft Research(图宾根人工智能中心、图宾根大学、微软研究院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 代码世界模型通过模拟程序执行来预测运行时状态,研究发现其在长周期状态跟踪中存在token预算耗尽和字符串状态处理的局限性,提出改进监督和状态表示的方向。

Comments 8 pages, 4 figures, under review in conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15012 2026-02-17 cs.CL cs.AI cs.LG 93%

Cold-Start Personalization via Training-Free Priors from Structured World Models

冷启动个性化通过从结构化世界模型中训练无关先验进行个性化

Avinandan Bose, Shuyue Stella Li, Faeze Brahman, Pang Wei Koh, Simon Shaolei Du, Yulia Tsvetkov, Maryam Fazel, Lin Xiao, Asli Celikyilmaz

机构 * Meta University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 Pep通过结构化世界模型和贝叶斯推断实现冷启动个性化,相比强化学习更高效且能更准确预测用户偏好。

Comments 24 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12063 2026-02-17 cs.RO 90%

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model

VLAW: 视觉-语言-动作策略与世界模型的迭代共改进

Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。

Comments Project Page: https://sites.google.com/view/vlaw-arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06130 2026-02-17 cs.LG cs.AI cs.CL 89%

Self-Improving World Modelling with Latent Actions

具有潜在动作的自我改进世界建模

Yifu Qiu, Zheng Zhao, Waylon Li, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * University of Edinburgh(爱丁堡大学) Nvidia Research(Nvidia研究) University of Groningen(格罗宁根大学) University of Cambridge(剑桥大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.LG;dynamics model(abstract)

AI总结 SWIRL通过将动作视为潜在变量,结合前向世界建模和逆动态建模,实现了对LLM和VLM的自我改进世界建模,在多个基准测试中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13347 2026-02-17 cs.CV cs.AI cs.RO 89%

Visual Foresight for Robotic Stow: A Diffusion-Based World Model from Sparse Snapshots

机器人存取的视觉预见:一种基于稀疏快照的扩散世界模型

Lijun Zhang, Nikhil Chacko, Petter Nilsson, Ruinian Xu, Shantanu Thakar, Bai Lou, Harpreet Sawhney, Zhebin Zhang, Mudit Agrawal, Bhavana Chandrashekhar, Aaron Parness

机构 * Amazon, Seattle, US(亚马逊(美国西雅图))

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 FOREST通过基于稀疏快照的扩散模型,提升仓库存取操作的预测精度,为仓储规划提供有效预见信号。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14721 2026-02-17 cs.AI 88%

WebWorld: A Large-Scale World Model for Web Agent Training

WebWorld: 一个大规模的世界模型用于网络代理训练

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, Zuozhu Liu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 WebWorld是一个大规模开放网络模拟器,通过大规模训练实现网络代理的有效训练,展示了在多个领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV 85%

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

专题命中 通用世界模型 :world model(title);world model(title);分类 cs.CV、cs.RO

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04641 2026-02-17 cs.CV cs.AI cs.LG 83%

Simulating the Real World: A Unified Survey of Multimodal Generative Models

模拟现实世界:多模态生成模型的统一综述

Yuqi Hu, Longguang Wang, Xian Liu, Ling-Hao Chen, Yuwei Guo, Yukai Shi, Ce Liu, Anyi Rao, Zeyu Wang, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能前沿技术研究所,香港科学与技术大学(广州)) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR(计算机科学与工程系,香港科学与技术大学香港特别行政区) MMLab, The Hong Kong University of Science and Technology(多模态实验室,香港科学与技术大学) School of Electronics and Communication Engineering, Shenzhen Campus of Sun Yat-sen University(电子与通信工程学院,中山大学深圳校区) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国) Tsinghua University, Guangdong, China(清华大学,广东,中国) Bosch (China) Investment Co., Ltd., Shanghai, China(博世(中国)投资有限公司,上海,中国)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文首次系统性地统一研究了2D、视频、3D和4D生成,为多模态生成模型和现实世界模拟提供了统一框架的综述。

Comments Repository for the related papers at https://github.com/ALEEEHU/World-Simulator

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11079 2026-02-17 cs.AI 81%

ARCTraj: A Dataset and Benchmark of Human Reasoning Trajectories for Abstract Problem Solving

ARCTraj:抽象问题解决中人类推理轨迹的数据集和基准

Sejin Kim, Hayan Choi, Seokki Lee, Sundong Kim

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 ARCTraj通过记录人类推理轨迹,提供了一种结构化且可解释的框架,用于研究抽象问题解决中的推理过程,推动可解释性和可推广智能的发展。

Comments KDD 2026 (Datasets and Benchmarks) accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13230 2026-02-17 cs.AI cs.LG 56%

Intelligence as Trajectory-Dominant Pareto Optimization

智能作为轨迹主导的帕累托优化

Truong Xuan Khanh, Truong Quynh Hoa

机构 * H&K Research Studio, Clevix LLC(H&K研究室,Clevix LLC)

专题命中 通用世界模型 :environment model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出轨迹主导的帕累托优化,通过轨迹层面的多目标权衡解决智能优化中的长周期发展约束问题。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13321 2026-02-17 cs.AI cs.LG 50%

Detecting Jailbreak Attempts in Clinical Training LLMs Through Automated Linguistic Feature Extraction

通过自动化语言特征提取检测临床训练LLM中的劫持尝试

Tri Nguyen, Huy Hoang Bao Le, Lohith Srikanth Pentapalli, Laurah Turner, Kelly Cohen

机构 * University of Cincinnati(克利夫兰大学)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本研究通过自动化语言特征提取,利用BERT模型预测四个核心语言特征,以检测临床训练LLM中的劫持尝试,验证了该方法的有效性及可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13231 2026-02-17 cs.NI cs.AI cs.LG 50%

An Explainable Failure Prediction Framework for Neural Networks in Radio Access Networks

用于无线接入网络神经网络的可解释性故障预测框架

Khaleda Papry, Francesco Spinnato, Marco Fiore, Mirco Nanni, Israat Haque

机构 * Department of Computer Science, Dalhousie University, Canada(达尔豪斯大学计算机科学系) Department of Computer Science, University of Pisa, Italy(比萨大学计算机科学系) IMDEA Networks Institute, Madrid, Spain(IMDEA网络研究所)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文提出一种结合可解释性与模型优化的框架,用于提升无线接入网络中神经网络的故障预测能力,通过减少参数和提升F1分数实现更高效的模型设计。

详情

展开后加载摘要…

URL PDF HTML 收藏