arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-06-04 至 2026-06-04 共收录 19 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 19 篇

2606.04534 2026-06-04 cs.RO 94%

MAD: Mapping-Aware World Models for Agile Quadrotor Flight

MAD: 面向敏捷四旋翼飞行的地图感知世界模型

Xinhong Zhang, Runqing Wang, Yunfan Ren, Ding Yu, Boyu Zhou, Jian Sun, Fang Deng, Jie Chen, Gang Wang

机构 * State Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology, Beijing 100081, China(自主智能无人系统国家重点实验室,北京理工大学,北京100081,中国) Zhongguancun Academy, Beijing 100094, China(中关村学院,北京100094,中国) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出地图感知世界模型MAD,通过重构机器人中心占用和可见性网格地图学习几何感知的潜在动力学,在视觉导航和竞速任务中实现更高成功率、更快飞行速度和更好跨任务迁移。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03482 2026-06-04 cs.CV cs.AI cs.LG 94%

Beyond Pixel Histories: World Models with Persistent 3D State

超越像素历史:具有持久3D状态的世界模型

Samuel Garcin, Thomas Walker, Steven McDonagh, Tim Pearce, Hakan Bilen, Tianyu He, Kaixin Wang, Jiang Bian

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 提出PERSIST范式,通过模拟潜在3D场景(环境、相机、渲染器)的演化,实现具有持久空间记忆和一致几何的世界模型,显著提升3D一致性、空间记忆和长期稳定性。

Comments Accepted to the International Conference on Machine Learning (ICML) 2026. To appear in the Proceedings of Machine Learning Research (PMLR). 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05015 2026-06-04 cs.RO 93%

Generalization of World Models under Environmental Variability for Vision-based Quadrotor Navigation

环境变异性下基于视觉的四旋翼导航的世界模型泛化

Luca Zanatta, Grzegorz Malczyk, Kostas Alexis

机构 * Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 通过基于视觉的四旋翼导航测试,研究世界模型在不同环境随机性下的鲁棒性,发现自监督预训练阶段的泛化能力是模拟到现实迁移的强预测因子,并识别出离散潜在大小和训练序列长度是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04130 2026-06-04 cs.RO 92%

CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization

CLAW: 通过对抗潜在正则化学习连续潜在动作世界模型

Tewodros Ayalew, Matthew Jeung, Samuel Wheeler, Xiao Zhang, Andre de la Cruz Arce, Kaylene Stocking, Michael Maire, Matthew R. Walter

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Argonne National Laboratory(阿贡国家实验室)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 提出CLAW框架,利用对抗潜在正则化和扩散视频生成,从无动作视频中端到端学习世界模型与连续潜在动作表示,支持观察模仿学习和目标导向规划。

Comments 8 pages, 15 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 91%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02697 2026-06-04 cs.CV cs.AI 88%

ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling

ShareVerse:面向共享世界建模的多智能体一致视频生成

Jiayi Zhu, Jianing Zhang, Yiying Yang, Wei Cheng, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University China(上海交通大学中国) Fudan University China(复旦大学中国) StepFun China(StepFun中国)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 82%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 81%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17262 2026-06-04 hep-th gr-qc 80%

Kalb-Ramond Topological Term in Majorana Superspace and Kaluza-Klein Spectrum Deformation in Five Dimensions

Majorana超空间中的Kalb-Ramond拓扑项与五维Kaluza-Klein谱变形

L. A. S. Nunes, C. A. S. Almeida

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 在五维N=1超空间中构造Kalb-Ramond拓扑项的超对称完备,揭示伪超对称构造的缺失项,并证明新玻色子项导致KK谱变形,影响Randall-Sundrum膜世界模型中的挠率现象。

Comments 21 pages. v2: added appendix; minor clarifications and corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.01141 2026-06-04 eess.SY cs.SY math.OC 72%

Retrofit Control with Approximate Environment Modeling

基于近似环境建模的改造控制

Takayuki Ishizaki, Takahiro Kawaguchi, Hampei Sasahara, Jun-ichi Imura

专题命中 通用世界模型 :environment model(title,abstract)

AI总结 本文提出了一种基于近似环境建模的改造控制方法,该方法通过调整近似环境建模的精度来调节控制性能,确保系统稳定性在原有系统稳定的情况下鲁棒性。

Journal ref Automatica, 107, pp.442-453, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04634 2026-06-04 cs.LG 69%

Explainably Safe Reinforcement Learning

可解释的安全强化学习

Sabine Rieder, Stefan Pranger, Debraj Chakraborty, Jan Křetínský, Bettina Könighofer

机构 * Masaryk University(马萨里克大学) Graz University of Technology(格拉茨技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 提出一种基于分层决策树的可解释安全强化学习方法,通过世界模型分析状态风险并构建屏蔽策略,生成可理解的解释,同时保持安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04291 2026-06-04 cs.CV 69%

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

3D视觉食谱:数据、学习范式与应用

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

机构 * Brown University(布朗大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) New York University(纽约大学) The University of Sydney(悉尼大学) Stability AI

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出一种以数据为中心的3D视觉分类法,通过分析点云、网格、体素和3D高斯等几何表示及其获取流程,以及数据集设计、基准构建和监督机制,统一了表示、学习范式与下游任务(重建、生成、视频建模)之间的关系。

Comments Accepted to the CVPR 2026 OpenSUN3D Workshop. Official version available at CVF Open Access. https://openaccess.thecvf.com/content/CVPR2026W/OpenSUN3D/html/Du_A_Cookbook_of_3D_Vision_Data_Learning_Paradigms_and_Application_CVPRW_2026_paper.html

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23420 2026-06-04 cs.AI 69%

Bilevel Autoresearch: Meta-Autoresearching Itself

双层自动研究:元自动研究自身

Yaonan Qu, Meng Lu

机构 * Independent Researcher(独立研究者)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI

AI总结 提出双层自动研究框架,外层循环通过读取内层循环代码和轨迹、识别瓶颈并注入可执行Python搜索机制来改进内层循环,在GPT预训练基准上实现5倍改进。

Comments 16 pages, 5 figures, 3 tables. v2 expands the framing as mechanism-level agentic self-improvement and updates related work and limitations; core method and experiments unchanged. This paper was primarily drafted by AI agents with human oversight and direction

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.08280 2026-06-04 cs.RO cs.SY eess.SY 69%

Extrinisic Calibration of a Camera-Arm System Through Rotation Identification

通过旋转识别进行相机-机械臂系统的外校准

Steve McGuire, Christoffer Heckman, Daniel Szafir, Simon Julier, Nisar Ahmed

机构 * Department of Aerospace Engineering Sciences, University of Colorado at Boulder(科罗拉多大学波尔德分校航空航天工程科学系)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出了一种基于观察臂的结构运动来恢复外校准参数的方法,结合已知的机械臂运动学和图像平面中的二次曲线观测,通过最大似然估计计算校准外参数,该方法在仿真中得到验证并在现实模型中测试,结果与尺子估计一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02251 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 60%

From Pixels to Torques: Policy Learning with Deep Dynamical Models

从像素到扭矩:基于深度动态模型的策略学习

Niklas Wahlström, Thomas B. Schön, Marc Peter Deisenroth

专题命中 通用世界模型 :model-based reinforcement learning(abstract);分类 cs.LG、cs.RO;predictive model(abstract)

AI总结 本文提出一种高效的数据驱动强化学习算法,通过深度动态模型直接从像素信息学习闭环控制策略,解决高维观测下的连续状态-动作空间数据高效学习问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04453 2026-06-04 cs.CV cs.LG 50%

Radiomic Feature Selection Using Gradient Loss of Deep Neural Network for Lung Cancer Stage Detection

基于深度神经网络梯度损失的放射组学特征选择用于肺癌分期检测

Hina Shakir, Mohammad Mohatram, Javeed Hussain, Syed Rizwan Ali, Muhammad Irfan Memon

机构 * Department of Software Engineering, Bahria University(巴尔ia大学软件工程系) Global College of Engineering and Technology(全球工程与技术学院) Software Engineering & Business Incubation Center, Bahria University(软件工程与企业孵化中心,巴尔ia大学)

专题命中 通用世界模型 :分类 cs.LG、cs.CV;predictive model(abstract);predictive models(abstract)

AI总结 提出GL-RFE框架,利用深度神经网络梯度敏感性分析递归消除低贡献特征,从106个放射组学特征中选出前15个用于肺癌早晚期分类,准确率达90.22%。

Journal ref J. Vis. Exp. (230), e70181, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03351 2026-06-04 cs.LG cs.AI q-bio.QM 50%

epiGPTope: A machine learning-based epitope generator and classifier

epiGPTope: 一种基于机器学习的表位生成器和分类器

Natalia Flechas Manrique, Alberto Martínez, Elena López-Martínez, Luc Andrea, Román Orus, Aitor Manteca, Aitziber L. Cortajarena, Llorenç Espinosa-Portalés

机构 * Multiverse Computing(多维计算公司) Centre for Cooperative Research in Biomaterials (CIC biomaGUNE)(生物材料联合研究中心) Basque Research and Technology Alliance (BRTA)(巴斯克研究与技术联盟) Donostia International Physics Center(多斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊kerbasque科学基金会) IKERBASQUE(伊kerbasque)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 提出基于大型语言模型epiGPTope,通过预训练和微调直接生成新型表位序列,并结合统计分类器预测表位来源(细菌或病毒),以加速合成表位库的构建和筛选。

Comments 11 pages, 4 figures. Supplementary Information with 5 pages, 4 figures

Journal ref ACS Synthetic Biology 2026 15 (2), 631-642

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.03435 2026-06-04 eess.SY cs.MA cs.SY 50%

Mean-field Games for Bio-inspired Collective Decision-making in Dynamical Networks

基于生物启发的动态网络中集体决策的均场博弈

Leonardo Stella, Dario Bauso

专题命中 通用世界模型 :environment model(abstract);分类 cs.MA

AI总结 本文研究了动态网络中集体决策问题,提出均场博弈模型结合宏观与微观动态,分析了蜂群、病毒传播和智能电网故障的均场模型,并通过数值分析探讨了网络攻击对频率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05291 2026-06-04 physics.comp-ph cs.NA math.NA physics.plasm-ph 50%

A Unified Gas Kinetic Scheme for Multi-scale and Multi-component Plasma Transport

多尺度多组分等离子体输运的统一气体动力学方案

Chang Liu, Kun Xu

专题命中 通用世界模型 :environment model(abstract);simulation model(abstract)

AI总结 本文提出一种统一气体动力学方案,用于多尺度多组分等离子体输运模拟,通过直接建模方法结合Vlasov-BGK方程和Maxwell方程,实现不同尺度下的等离子体模拟,并验证了其在多种物理现象中的有效性。

Journal ref Communications in Computational Physics 22.5 (2017): 1175-1223

详情

展开后加载摘要…

URL PDF HTML 收藏