arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-04-16 至 2026-04-16 共收录 9 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 5 篇

2604.13824 2026-04-16 cs.LG 94%

Beyond State Consistency: Behavior Consistency in Text-Based World Models

超越状态一致性:文本基础世界模型中的行为一致性

Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, ChenZhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Dalian University of Technology(大连理工大学) MBZUAI Peking University(北京大学) Microsoft(微软)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出行为一致性训练方法,通过改进世界模型与真实环境的功能一致性,提升长期对齐效果,实验显示在WebShop和TextWorld中表现优异,同时保持单步预测质量。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06168 2026-04-16 cs.CV cs.RO 82%

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08230 2026-04-16 cs.AI 76%

Empowerment Gain and Causal Model Construction: Children and adults are sensitive to controllability and variability in their causal interventions

赋能增益与因果模型构建:儿童和成人对干预可控性和变异性敏感

Eunice Yiu, Kelsey Allen, Shiry Ginosar, Alison Gopnik

机构 * Department of Psychology, University of California, Berkeley(加州大学伯克利分校心理学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 通用世界模型 :world model(abstract,comments);world model(abstract,comments);world models(comments);分类 cs.AI

AI总结 研究探讨了赋能增益在因果学习中的作用,通过实验验证儿童和成人如何利用赋能信号推断因果关系并设计干预措施。

Comments Accepted to Philosophical Transactions A, Special issue: World models, AGI, and the hard problems of life-mind continuity. Expected publication in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 71%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13462 2026-04-16 cs.SE cs.AI cs.CE cs.LG 64%

Learning from Change: Predictive Models for Incident Prevention in a Regulated IT Environment

从变更中学习:受监管IT环境中的事故预防预测模型

Eileen Kapel, Jan Lennartz, Luis Cruz, Diomidis Spinellis, Arie van Deursen

机构 * ING Bank(ING银行) Delft University of Technology(代尔夫特理工大学)

专题命中 通用世界模型 :predictive model(title);predictive models(title);分类 cs.AI、cs.LG

AI总结 本文提出一种预测事故风险评分方法,通过机器学习模型在IT变更部署阶段预测潜在事故风险,利用SHAP值提高决策透明度,证明数据驱动模型在合规性与风险预防上的优势。

Comments 12 pages, 6 figures, 2026 IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 1 篇

2511.17792 2026-04-16 cs.CV cs.RO 96%

Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?

Target-Bench: 视频世界模型能否在语义目标下实现无地图路径规划?

Dingrui Wang, Zhihao Liang, Hongyuan Ye, Zhexiao Sun, Zhaowei Lu, Yuchen Zhang, Yuyu Zhao, Yuan Gao, Marvin Seegert, Finn Schäfer, Haotong Qin, Wei Li, Luigi Palmieri, Felix Jahncke, Mattia Piccinini, Johannes Betz

机构 * TUM(慕尼黑技术大学) Bosch AI Center(博世人工智能中心) ETH(苏黎世联邦理工学院) NJU(南京大学)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 Target-Bench首次评估视频世界模型的语义推理、空间估计和规划能力,通过450个机器人采集场景和5个互补指标揭示当前模型在语义推理与视觉生成间的显著差距。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 1 篇

2604.13654 2026-04-16 cs.RO 81%

Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap

面向无人机的视觉与语言导航:进展、挑战与研究路线图

Hanxuan Chen, Jie Zheng, Siqi Yang, Tianle Zeng, Siwei Feng, Songsheng Cheng, Ruilong Ren, Hanzhong Guo, Shuai Yuan, Xiangyue Wang, Kangli Wang, Ji Pei

机构 * Autel Robotics, Shenzhen, China(大疆创新,深圳,中国) School of Intelligent Software and Engineering, Nanjing University, Nanjing, China(南京大学智能软件与工程学院,南京,中国) School of Computer, Data & Information Sciences, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机、数据与信息科学学院,麦迪逊,WI,美国) Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) The University of Hong Kong, Hong Kong SAR, China(香港大学,香港特别行政区,中国) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院,北京,中国)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文综述了无人机视觉与语言导航领域,分析了从早期模块化方法到基于大模型的智能系统的发展,探讨了现实部署中的挑战,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 2 篇

2604.11929 2026-04-16 cs.LG math.DS physics.comp-ph 50%

Fast and principled equation discovery from chaos to climate

从混沌到气候的快速且原理性的方程发现

Yuzheng Zhang, Weizhen Li, Rui Carvalho

机构 * Department of Engineering(工程系) Institute for Data Science(数据科学研究所) College of Control Science and Engineering(控制科学与工程学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出Bayesian-ARGOS框架,结合频繁ist筛查与贝叶斯推断,实现高效且原理性的方程发现,在计算成本显著降低的同时,优于现有方法在数据效率和噪声容忍度上的表现。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09207 2026-04-16 cs.LG cs.NA math.NA 50%

mLaSDI: Multi-stage latent space dynamics identification

mLaSDI:多阶段潜在空间动态识别

William Anderson, Seung Whan Chung, Robert Stephany, Youngsoo Choi

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出mLaSDI,通过分阶段训练改进传统LaSDI,有效解决高频率现象的建模问题,提升重建和预测精度,减少训练时间和超参数调优。

详情

展开后加载摘要…

URL PDF HTML 收藏