arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3110 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3110 篇

2208.03936 2023-07-04 cs.LG cs.RO 82%

Sparse Representation Learning with Modified q-VAE towards Minimal Realization of World Model

Taisuke Kobayashi, Ryoma Watanuki

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG;robotics(journal_ref)

Comments 28 pages, 17 figures

Journal ref Advanced Robotics, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17110 2023-12-29 cs.RO 81%

Toward Semantic Scene Understanding for Fine-Grained 3D Modeling of Plants

Mohamad Qadri, Harry Freeman, Eric Schneider, George Kantor

专题命中 具身推理 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19779 2026-08-21 quant-ph cs.AI cs.LG 新提交 81%

An Irreducible Quantum Advantage in Aligning World Models with Reality

世界模型与现实对齐的不可约量子优势

Josep Lumbreras, Hailan Ma, Jayne Thompson, Mile Gu

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究证明经典世界模型无法通过增加记忆实现与真实世界的完美策略对齐,而量子世界模型仅用单个qutrit即可做到,揭示了世界模型对齐现实的不可约量子优势。

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19085 2026-08-21 cs.RO cs.AI 版本更新 81%

DA-WAM: Decision-Aligned Future Latents for Driving World Models

DA-WAM:面向驾驶世界模型的决策对齐未来潜变量

Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng, Yaonong Wang, Pei Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Leapmotor(零跑汽车) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 DA-WAM 是统一预测表示学习等模块的驾驶世界模型框架,通过动作条件未来潜变量实现决策对齐,在 NAVSIM 数据集上达到最优性能,验证了关键组件的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18746 2026-08-20 cs.LG cs.CV 新提交 81%

Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning

潜在世界模型中的决策度量对齐:MPC规划的诊断与动作条件目标

Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 该研究针对潜在世界模型中MPC规划的决策度量对齐问题,提出两种秩一致性诊断指标,开发DA-LeWM模型,验证其可加快收敛并提升在线成功率,改善潜在MPC的几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15156 2026-08-20 cs.RO cs.AI 版本更新 81%

Low-Rank Dynamics-Effective Latent Carriers for Counterfactual Rollout in Learned World Models

用于学习世界模型中反事实滚动的低秩动力学有效潜在载体

Yang Liu, Yuming Chen

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文针对学习世界模型的反事实滚动问题,提出基于低秩动力学有效潜在载体的方法,在两物体碰撞环境中验证秩4修补块可实现稳定的12步自主反事实滚动,且效果可复现。

Comments Revised version: removed an inconclusive development-only event-relative phase analysis; the main rank-4 carrier, fresh-checkpoint replication, B1/B2 temporal reuse, position-edit, and joint-edit conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-20 cs.RO cs.CV 版本更新 81%

Multi-Agent Embodied Autonomous Driving (MAEAD): From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17959 2026-08-19 cs.AI cs.LG 新提交 81%

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

面向基于神经符号世界模型的零样本任务迁移

Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种神经符号世界模型,通过解耦观测重构与奖励预测,实现无需额外环境交互的零样本任务迁移,其泛化能力优于纯神经方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17956 2026-08-19 cs.LG cs.AI cs.SY eess.SY 新提交 81%

An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models

被遗漏的模式即罕见规则:连续代码世界模型中的采样-验证危险定律

Javier Aguilar Martín

机构 * AGILabs

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示连续代码世界模型中采样-验证机制的危险,通过理论分析与实验发现,LLM合成的模式盲模型易被利用,接受仅能证明样本一致性,无法保证连续控制任务的性能。

Comments 92 pages, 5 figures. Code, data and result artifacts: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17542 2026-08-19 cs.LG cs.AI 新提交 81%

No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models

无需高斯:用于JEPA世界模型的对比逆动力学

Jack Boylan, Chris Hokamp

机构 * Quantexa(昆泰克萨公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出AC-MTM,用对比逆动力学替代JEPA世界模型的高斯型抗坍塌机制,在多目标视觉任务上性能优于SIGReg,且训练稳定无额外复杂组件

Comments 17 pages, 5 figures. Code: https://github.com/jackboyla/action-contrastive-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16829 2026-08-18 cs.LG cs.AI 新提交 81%

CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?

CaliBench:视频世界模型的随机动力学是否经过物理校准?

Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke

机构 * Odyssey(奥德赛公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 CaliBench用于测试视频世界模型的物理校准,将性能分解为可评分性与校准度,发现多数场景-模型组合显著未校准,发布了mnTV指标用于模型对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14952 2026-08-18 cs.RO cs.CV eess.SP 新提交 81%

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。

Comments 7 pages, 3 figures. Working draft prepared for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14022 2026-08-17 cs.CV cs.AI 新提交 81%

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM:面向少步骤动作条件视频世界模型的渐进式因果训练

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

机构 * CUHK(香港中文大学) Tencent PCG(腾讯平台与内容事业群) FDU(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 ForgeWM 是一种渐进式框架,通过多阶段技术将双向动作条件视频生成器转化为少步骤世界模型,在 Minecraft 和 FPS 游戏任务中实现了更优的可控少步骤视频生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 81%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 81%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10386 2026-08-12 cs.LG cs.RO 新提交 81%

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 81%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15142 2026-08-11 cs.AI cs.LG 版本更新 81%

Concept-Guided Spatial Regularization for World Models in Atari Pong

《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》

Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。

Comments Revised manuscript with updated presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07408 2026-08-10 cs.CV cs.LG 新提交 81%

Addressable Memory for Video World Models

视频世界模型的可寻址内存

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of Toronto(多伦多大学) Vector Institute(矢量研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对交互式视频世界模型超出训练时序后内存寻址失效及压缩缓存破坏内存的问题,提出无训练框架 WorldTrace,含两种压缩方法,在新基准 LoopBench 上分别提升时序一致性 15.5%、情景回忆 19.5%。

Comments Project page: https://research.nvidia.com/labs/sil/projects/WorldTrace/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 81%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06799 2026-08-10 cs.RO cs.CV 新提交 81%

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

前向预测足够吗?面向JEPA世界模型的物理状态 grounding

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 81%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06706 2026-08-10 cs.LG cs.AI 新提交 81%

Dueling World Models: Advantage-Style Action Channels for Common-Mode Distractor Rejection

对决世界模型:用于共模干扰项抑制的优势式动作通道

Jiazhuo Li, Yiming Fei, Zhiruo Zhou, Heikichi Hayashi

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出对决世界模型,通过在潜在动态中减去动作预测的平均效应来抑制共模干扰项,无需额外机制,在多个任务中可恢复智能体自身效应,适用于各类动作条件世界模型。

Comments 17 pages, 6 figures, 11 tables. Includes supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08991 2026-08-07 cs.CV cs.LG 版本更新 81%

Deterministic World Models for Closed-loop Reachability Analysis of End-to-End Vision-based Control

确定性世界模型用于闭环视觉系统验证

Yuang Geng, Zhongzheng Zhang, Chengzhen Jiang, Yanru Li, Xinyang Wang, Zhuoyang Zhou, Hoang-Dung Tran, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出确定性世界模型,通过直接映射系统状态到生成图像,消除不可解释的潜在变量,提升闭环视觉系统验证的精度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新 81%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 具身推理 :manipulation(title);robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 81%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03211 2026-08-05 cs.CV cs.RO 新提交 81%

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

CrossScope:用于联合双视野手术视频预测的角色非对称世界模型

Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对母子ERCP中双柔性镜无校准立体关系的手术视频预测问题,提出角色非对称的CrossScope双流模型,经配对双视野基准评估,其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01845 2026-08-04 cs.LG cs.CV 新提交 81%

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27017 2026-08-03 cs.LG cs.RO 版本更新 81%

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 81%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏