arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 6450 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4308 篇

2603.14087 2026-03-17 cs.LG cs.CL 69%

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

理解下一token预测器中看似无用特征的出现

Mark Rofin, Jalal Naghiyev, Michael Hahn

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR 69%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09285 2026-03-11 cs.CV 69%

Learning Convex Decomposition via Feature Fields

通过特征场学习凸分解

Yuezhi Yang, Qixing Huang, Mikaela Angelina Uy, Nicholas Sharp

机构 * NVIDIA The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出通过特征场学习实现高质量的开放世界凸分解,解决了长期存在的凸分解问题,并实现了首个自监督学习的开放世界模型。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23488 2026-03-10 cs.AI cs.CL 69%

Mapping Overlaps in Benchmarks through Perplexity in the Wild

通过在野 perplexity 映射重叠关系

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 69%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03276 2026-03-04 cs.CV 69%

Beyond Language Modeling: An Exploration of Multimodal Pretraining

超越语言模型:多模态预训练的探索

Shengbang Tong, David Fan, John Nguyen, Ellis Brown, Gaoyue Zhou, Shengyi Qian, Boyang Zheng, Théophane Vallaeys, Junlin Han, Rob Fergus, Naila Murray, Marjan Ghazvininejad, Mike Lewis, Nicolas Ballas, Amir Bar, Michael Rabbat, Jakob Verbeek, Luke Zettlemoyer, Koustuv Sinha, Yann LeCun, Saining Xie

机构 * FAIR, Meta(FAIR、Meta) New York University(纽约大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文通过多模态预训练探索,揭示了视觉与语言数据的互补性及统一预训练对世界建模的促进作用,并提出MoE架构解决多模态扩展的不对称性问题。

Comments Project website at https://beyond-llms.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20071 2026-03-04 cs.LG 69%

Distributional value gradients for stochastic environments

分布价值梯度用于随机环境

Baptiste Debes, Tinne Tuytelaars

机构 * PSI KU Leuven(KU莱顿心理学研究所)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 本文提出分布式Sobolev训练方法,通过建模价值函数及其梯度的分布,提升在随机环境中的样本效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV 69%

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22643 2026-03-03 cs.RO 69%

VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search

VLA-Reasoner: 通过在线蒙特卡洛树搜索增强视觉-语言-动作模型的推理能力

Wenkai Guo, Guanxing Lu, Haoyuan Deng, Zhenyu Wu, Yansong Tang, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 VLA-Reasoner通过在线蒙特卡洛树搜索增强视觉-语言-动作模型,提升长时间轨迹任务的推理能力与执行效率。

Comments 8 pages, 6 figures, Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20659 2026-02-26 cs.AI 69%

Recursive Belief Vision Language Action Models

递归信念视觉语言动作模型

Vaidehi Bagaria, Bijo Sebastian, Nirav Kumar Patel

机构 * Department of Engineering Design, Indian Institute of Technology, Madras, Chennai, India(工程设计系,印度理工学院,马德拉斯,钦奈,印度)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI

AI总结 RB-VLA通过信念与意图联合条件化扩散策略,实现长周期任务的高效执行,显著提升成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20550 2026-02-25 cs.CV 69%

The Finite Primitive Basis Theorem for Computational Imaging: Formal Foundations of the OperatorGraph Representation

计算成像的有限原始基定理:操作图表示法的正式基础

Chengshuai Yang

机构 * NextGen PlatformAI C Corp, USA(NextGen平台AI公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 该研究提出有限原始基定理,证明所有成像前向模型可表示为由11个标准原语构成的DAG,并通过实验验证其在多种成像模态中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19503 2026-02-24 cs.CV 69%

A Text-Guided Vision Model for Enhanced Recognition of Small Instances

一种基于文本引导的视觉模型,用于提升小实例的识别

Hyun-Ki Jung

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出了一种基于文本引导的改进YOLO-World模型,通过优化主干网络结构提升小物体检测精度和模型轻量化性能。

Comments Accepted for publication in Applied Computer Science (2026)

Journal ref Applied Computer Science, Vol. 22, No. 1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 69%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 69%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07593 2026-02-12 stat.ML cs.LG stat.ME 69%

Diffusion posterior sampling for simulation-based inference in tall data settings

扩散后验采样用于高数据设置下的基于模拟的推断

Julia Linhart, Gabriel Victorino Cardoso, Alexandre Gramfort, Sylvain Le Corff, Pedro L. C. Rodrigues

机构 * Université Paris-Saclay(巴黎-萨克雷大学) Inria(法国国家信息与自动化技术研究院) CEA(法国原子能委员会) CMAP, École Polytechnique(高等理工学院CMAP部门) Institut Polytechnique de Paris(巴黎理工 institute) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) LJK(格勒诺布尔联合实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 本文提出了一种无需兰格-动态步骤的扩散后验采样方法,提高了高数据设置下基于模拟的推断效率和稳定性。

Comments 49 pages, 24 figures, 3 tables, 2 algorithms, 12 appendices, TMLR acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21872 2026-02-11 eess.IV cs.LG 69%

Targeted Unlearning Using Perturbed Sign Gradient Methods With Applications On Medical Images

利用扰动符号梯度方法的目标遗忘与医疗图像应用

George R. Nahass, Zhu Wang, Homa Rashidisabet, Won Hwa Kim, Sasha Hubschman, Jeffrey C. Peterson, Chad A. Purnell, Pete Setabutr, Ann Q. Tran, Darvin Yi, Sathya N. Ravi

机构 * Department of Biomedical Engineering(生物医学工程系) Department of Ophthalmology(眼科学系) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Department of Computer Science(计算机科学系) Computer Science and Engineering(计算机科学与工程) Pohang University of Science and Technology, South Korea(韩国釜山科学技术大学) Department of Plastic and Reconstructive Surgery(整形外科与重建外科系)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于扰动符号梯度的方法,用于医疗图像中的目标遗忘,通过可调损失设计和模型组合策略,在遗忘与保留之间取得平衡,优于现有基线方法。

Comments 39 pages, 12 figures, 11 tables, 3 algorithms

Journal ref Transactions on Machine Learning Research 2025, https://openreview.net/forum?id=XE0bJg6sQN

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02283 2026-02-03 cs.LG stat.ML 69%

Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management

基于选择模型的Q学习用于延迟反馈收益管理

Owen Shen, Patrick Jaillet

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 本文提出基于选择模型的Q学习方法,用于解决延迟反馈下的收益管理问题,通过部分世界模型提升决策鲁棒性并减少偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03762 2026-01-30 cs.CL cs.AI 69%

Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models

虚拟大脑:迈向大型语言模型中人工通用智能的缺失部件

Yuxi Ma, Chi Zhang, Song-Chun Zhu

机构 * Beijing Insitute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型中人工通用智能的缺失部件,提出智能代理应具备无限任务执行、任务生成、价值系统和现实世界模型等特征,并强调知与行的统一对智能发展的重要性。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 47 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19752 2026-01-28 cs.AI 69%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-01-22 cs.CV 69%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

Comments 17 pages, 21 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV 69%

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12538 2026-01-21 cs.AI cs.CL 69%

Agentic Reasoning for Large Language Models

大语言模型的代理推理

Tianxin Wei, Ting-Wei Li, Zhining Liu, Xuying Ning, Ze Yang, Jiaru Zou, Zhichen Zeng, Ruizhong Qiu, Xiao Lin, Dongqi Fu, Zihao Li, Mengting Ai, Duo Zhou, Wenxuan Bao, Yunzhe Li, Gaotang Li, Cheng Qian, Yu Wang, Xiangru Tang, Yin Xiao, Liri Fang, Hui Liu, Xianfeng Tang, Yuji Zhang, Chi Wang, Jiaxuan You, Heng Ji, Hanghang Tong, Jingrui He

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在开放和动态环境中的代理推理方法,通过三个层次的框架提升单体、自我进化和集体多代理推理能力,并提出了未来研究方向。

Comments Project: https://github.com/weitianxin/Awesome-Agentic-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15946 2026-01-19 cs.LG cs.AR hep-ex 69%

AIE4ML: An End-to-End Framework for Compiling Neural Networks for the Next Generation of AMD AI Engines

AIE4ML:一个端到端框架,用于为下一代AMD AI引擎编译神经网络

Dimitrios Danopoulos, Enrico Lupi, Chang Sun, Sebastian Dittmeier, Michael Kagan, Vladimir Loncar, Maurizio Pierini

机构 * Institute of Physics Belgrade, Serbia(塞尔维亚贝尔格莱物理研究所) Physikalisches Institut, Heidelberg University, Germany(德国海德堡大学物理研究所) SLAC National Accelerator Laboratory, Menlo Park, CA, USA(美国Menlo Park加州SLAC国家加速器实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 AIE4ML是一个端到端框架,用于将AI模型自动转换为优化的固件,以在AMD AIE-ML设备上实现高效神经网络执行,同时支持向前兼容新架构,提供高效率和低延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10592 2026-01-16 cs.CV 69%

Action100M: A Large-scale Video Action Dataset

Action100M:一个大规模视频动作数据集

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade Yu, Allen Bolourchi, Theo Moutakanni, Pascale Fung

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 Action100M通过自动化流程生成大规模视频动作数据集,用于提升视频理解和世界建模的可扩展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07313 2026-01-13 cs.LG cs.AI 69%

Explaining Machine Learning Predictive Models through Conditional Expectation Methods

通过条件期望方法解释机器学习预测模型

Silvia Ruiz-España, Laura Arnal, François Signol, Juan-Carlos Perez-Cortes, Joaquim Arlandis

机构 * ITI, Universitat Politècnica de València(ITI,瓦伦西亚理工大学)

专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MUCE方法,通过多变量条件期望捕捉预测变化,结合稳定性与不确定性指标,提升模型局部可解释性与可信度。

Comments 24 pages, 15 figures. Silvia Ruiz-España and Laura Arnal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 69%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22973 2026-01-05 cs.CV 69%

YOLO-IOD: Towards Real Time Incremental Object Detection

YOLO-IOD:朝向实时增量物体检测

Shizhou Zhang, Xueqiang Lv, Yinghui Xing, Qirui Wu, Di Xu, Chen Zhao, Yanning Zhang

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 YOLO-IOD通过解决增量学习中的知识冲突问题,提出了一种基于预训练YOLO-World模型的实时增量物体检测框架,有效减少遗忘并提升检测性能。

Comments AAAI 2026 accepted. Code & models are available at: https://github.com/qiangzai-lv/YOLO-IOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 69%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 69%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15621 2025-12-18 cs.CV 69%

OccSTeP: Benchmarking 4D Occupancy Spatio-Temporal Persistence

OccSTeP:4D占用率时空持续性基准测试

Yu Zheng, Jie Hu, Kailun Yang, Jiaming Zhang

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 OccSTeP提出了一种4D占用率时空持续性基准,通过OccSTeP-WM模型实现对自动驾驶中未来行为的反应和前瞻性预测,实验结果显示其在语义和占用率指标上均有显著提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏