arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 6450 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4308 篇

1612.07896 2016-12-26 cs.AI cs.LG 71%

A Base Camp for Scaling AI

C. J. C. Burges, T. Hart, Z. Yang, S. Cucerzan, R. W. White, A. Pastusiak, J. Lewis

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16216 2024-04-26 cs.CV cs.RO cs.SD eess.AS 70%

ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling

Arjun Somayazulu, Sagnik Majumder, Changan Chen, Kristen Grauman

专题命中 通用世界模型 :environment model(title);分类 cs.CV、cs.RO

Comments Project page: https://vision.cs.utexas.edu/projects/active_rir/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08494 2023-04-19 cs.MA cs.AI cs.CY cs.SE 70%

Smart Home Environment Modelled with a Multi-Agent System

Mohammad Rasras, Iuliana Marin, Serban Radu

专题命中 通用世界模型 :environment model(title);分类 cs.AI、cs.MA

Comments 12 pages, 8 figures, journal article

Journal ref U.P.B. Sci. Bull., Series C, Vol. 85, Iss. 1, 2023, ISSN 2286-3540

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09237 2019-06-25 cs.LG cs.AI stat.ML 70%

Shaping Belief States with Generative Environment Models for RL

Karol Gregor, Danilo Jimenez Rezende, Frederic Besse, Yan Wu, Hamza Merzic, Aaron van den Oord

专题命中 通用世界模型 :environment model(title);分类 cs.AI、cs.LG

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18079 2026-08-20 cs.AI 新提交 69%

Position: Profiling Game Worlds by Transition Complexity

Position:通过转移复杂度分析游戏世界

Lele Cao

机构 * Microsoft Research(微软研究院) DeepMind(深度思考(DeepMind))

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 该研究针对GWM与RL常被混淆的问题,提出转移复杂度剖面(TCP)指标,用于量化游戏环境的转移预测难度,呼吁其成为相关论文的标准基准元数据。

Comments Accepted by ICML 2026 Position Paper Track. https://icml.cc/virtual/2026/poster/67074

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20182 2026-08-19 cs.CL cs.AI 版本更新 69%

Beyond BFI: The CSI for Enhanced Reliability and Validity in Evaluating LLM Personality Traits

超越BFI:用于增强评估LLM人格特质可靠性与有效性的CSI

Huanhuan Ma, Haisong Gong, Xiaoyuan Yi, Xing Xie, Philip S. Yu, Dongkuan Xu

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 针对现有LLM人格特质评估工具BFI的可靠性与有效性局限,提出适配LLM的CSI,经实验验证其可靠性更高、与模型真实输出相关性超0.85,能有效评估LLM人格特质。

Comments Code available via https://github.com/dependentsign/CSI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12476 2026-08-14 cs.AI 新提交 69%

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。

Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 69%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 69%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08725 2026-08-11 cs.RO 新提交 69%

WA-SpecDec: World-Aware Speculative Decoding for Vision-Language-Action Models

WA-SpecDec:面向视觉-语言-动作模型的世界感知投机解码

Zikang Wen, Yuning Zhang, Dong Yuan

机构 * The University of Sydney(悉尼大学)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 本文提出WA-SpecDec框架,在VLA预填充阶段注入世界模型的物理场景感知,在不改变放宽接受规则的前提下,提升了任务成功率、实现1.5倍匹配成功率加速并降低近接触失败率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21109 2026-08-11 cs.RO 版本更新 69%

Anomaly-Informed Confidence Calibration for Vision-Based Safety Prediction

基于异常的置信度校准用于基于视觉的安全预测

Zhenjiang Mao, Jiawen Wu, Gabriel Wagner, Zhongzheng Zhang, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出了一种基于异常的在线校准方法,通过融合感知和动态异常分数来改进基于视觉的安全预测中的置信度估计,从而在面对分布偏移时减少过自信,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14382 2026-08-11 cs.CV cs.GR cs.MM 版本更新 69%

Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation

Delta Forcing:交互式自回归视频生成中的信任区域引导

Yuheng Wu, Xiangbo Gao, Tianhao Chen, Xinghao Chen, Qing Yin, Zhengzhong Tu, Dongman Lee

机构 * Texas A\&M University(德克萨斯A&M大学) University of Washington(华盛顿大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 69%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 69%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04996 2026-08-06 cs.RO 新提交 69%

DreamWAM: Beyond RGB Future Prediction for World Action Models

DreamWAM:超越RGB未来预测的世界动作模型

Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27865 2026-07-31 cs.CV 新提交 69%

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

通过鲁棒3D化身放置学习理解肢体语言

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) NORCE Norwegian Research Centre AS(挪威NORCE研究中心)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03701 2026-07-30 cs.CV 版本更新 69%

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

VidNum-1.4K:一个全面的视频基于数值推理基准

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24425 2026-07-28 cs.LG 新提交 69%

Context Is King: How In-Context Specification Shapes the Geometry of Concepts

上下文为王:上下文规范如何塑造概念的几何结构

Elad David, Max Fomin

机构 * Zenity

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.LG

AI总结 研究大型语言模型中上下文规范对概念几何结构的塑造,发现上下文决定模型实际使用的结构,声明性规则可确定几何编码关系及拓扑类型,不同规模模型表现不同,同一模型家族中较大模型存在的机制在较小模型中可能不存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 69%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18703 2026-07-22 cs.CV 新提交 69%

Generative World Renderer at the Speed of Play

以游戏速度运行的生成式世界渲染器

Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang

机构 * Alaya Lab(阿莱雅实验室) University of California, Merced(加州大学默塞德分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 研究如何提升生成式世界渲染器AlayaRenderer的速度,核心方法是将其重构为自回归流模型并引入轻量级编解码器,主要贡献是大幅降低推理成本,实现30 FPS可玩的生成式世界,保留核心渲染能力。

Comments Project page: https://alaya-renderer-flash.alayalab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18565 2026-07-22 eess.SY cs.RO cs.SY 新提交 69%

Integrity-Gated Eco-CACC: Epistemic Admissibility for Cooperative Driving at Signalized Intersections

完整性门控生态协同自适应巡航控制:信号交叉口协同驾驶的认知可容许性

Lyes Saad Saoud, Moussa Ayyash

机构 * Chicago State University(芝加哥州立大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 研究信号交叉口Eco-CACC系统,提出完整性门控框架,结合多种因素构建统一完整性度量调节控制权,仿真表明其在模型一致时保持效率,完整性下降时能早期保守响应,解决现有方法在传感等问题下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18482 2026-07-22 physics.app-ph 新提交 69%

Evaluation-Recording Contamination in Learned Nano-Quadrotor Dynamics: A Fresh-Seed Audit

学习的纳米四旋翼动力学中的评估记录污染:新种子审计

David Shulman

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);dynamics model(abstract)

AI总结 研究学习的纳米四旋翼动力学中评估记录污染问题,通过固定NanoBench Crazyflie 2.1数据集快照进行实验,比较不同模型,发现污染虽降误差但置信区间过零,可靠评估需记录级分割等多方面操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17669 2026-07-21 cs.CV 新提交 69%

Attention from Above: A Multimodal Model for Drone-Based Object Localization

自上而下的注意力:一种基于无人机的目标定位多模态模型

Hyun-Ki Jung

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 针对无人机目标检测,本文基于YOLO-World框架,用A2C2f层替换C2f层,引入注意力机制和并行处理结构,提升小目标检测性能,在VisDrone数据集实验中各项指标显著优于原模型,提供了高精度检测方案。

Comments Preprint. Accepted for publication in the International Journal of Interactive Mobile Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15660 2026-07-20 cs.AI 新提交 69%

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

ToolVerse:为智能强化学习解锁大规模环境和长时任务

Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) Peking University(北京大学) Fudan University(复旦大学) Wuhan University(武汉大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 69%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.MA

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 69%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 69%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 69%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12963 2026-07-15 cs.AI 版本更新 69%

Calculating Mutual Information between a Reward Maximizer and its Environment

信息论视角下最优奖励最大化世界模型的分析

Alfred Harwood, Jose Faustino, Alex Altair

机构 * Dovetail Research(Dovetail研究公司) University of Sao Paulo(圣保罗大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文从信息论角度分析了最优奖励最大化中世界模型的信息量,证明最优策略对环境的信息量为n log m比特,并适用于多种奖励最大化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01898 2026-07-15 cs.LG cs.AI stat.ML 版本更新 69%

Propheticus: Machine Learning Framework for the Development of Predictive Models for Reliable and Secure Software

Propheticus:用于开发可靠安全软件预测模型的机器学习框架

João R. Campos, Marco Vieira, Ernesto Costa

机构 * DEI/CISUC, University of Coimbra,\ Portugal

专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);分类 cs.AI、cs.LG

AI总结 针对软件可靠性与安全性需求,介绍Propheticus机器学习框架,抽象其复杂性以便用户使用,通过漏洞预测和在线故障预测两个案例研究,展示该框架能简化并加速机器学习工作流程。

Comments Accepted for publication in the 30th IEEE International Symposium on Software Reliability Engineering (ISSRE) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏