Sparse Representation Learning with Modified q-VAE towards Minimal Realization of World Model
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG;robotics(journal_ref)
Comments 28 pages, 17 figures
Journal ref Advanced Robotics, 2023
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG;robotics(journal_ref)
Comments 28 pages, 17 figures
Journal ref Advanced Robotics, 2023
专题命中 具身推理 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)
Comments 7 pages, 8 figures
世界模型与现实对齐的不可约量子优势
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究证明经典世界模型无法通过增加记忆实现与真实世界的完美策略对齐,而量子世界模型仅用单个qutrit即可做到,揭示了世界模型对齐现实的不可约量子优势。
Comments 31 pages, 4 figures
DA-WAM:面向驾驶世界模型的决策对齐未来潜变量
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Leapmotor(零跑汽车) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 DA-WAM 是统一预测表示学习等模块的驾驶世界模型框架,通过动作条件未来潜变量实现决策对齐,在 NAVSIM 数据集上达到最优性能,验证了关键组件的有效性。
潜在世界模型中的决策度量对齐:MPC规划的诊断与动作条件目标
专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG
AI总结 该研究针对潜在世界模型中MPC规划的决策度量对齐问题,提出两种秩一致性诊断指标,开发DA-LeWM模型,验证其可加快收敛并提升在线成功率,改善潜在MPC的几何结构。
用于学习世界模型中反事实滚动的低秩动力学有效潜在载体
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 本文针对学习世界模型的反事实滚动问题,提出基于低秩动力学有效潜在载体的方法,在两物体碰撞环境中验证秩4修补块可实现稳定的12步自主反事实滚动,且效果可复现。
Comments Revised version: removed an inconclusive development-only event-relative phase analysis; the main rank-4 carrier, fresh-checkpoint replication, B1/B2 temporal reuse, position-edit, and joint-edit conclusions are unchanged
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
机构 * Lingnan University, Hong Kong(岭南大学(香港))
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。
面向基于神经符号世界模型的零样本任务迁移
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出一种神经符号世界模型,通过解耦观测重构与奖励预测,实现无需额外环境交互的零样本任务迁移,其泛化能力优于纯神经方法。
被遗漏的模式即罕见规则:连续代码世界模型中的采样-验证危险定律
机构 * AGILabs
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究揭示连续代码世界模型中采样-验证机制的危险,通过理论分析与实验发现,LLM合成的模式盲模型易被利用,接受仅能证明样本一致性,无法保证连续控制任务的性能。
Comments 92 pages, 5 figures. Code, data and result artifacts: https://github.com/JaviMaligno/code-world-models
无需高斯:用于JEPA世界模型的对比逆动力学
机构 * Quantexa(昆泰克萨公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出AC-MTM,用对比逆动力学替代JEPA世界模型的高斯型抗坍塌机制,在多目标视觉任务上性能优于SIGReg,且训练稳定无额外复杂组件
Comments 17 pages, 5 figures. Code: https://github.com/jackboyla/action-contrastive-jepa
CaliBench:视频世界模型的随机动力学是否经过物理校准?
机构 * Odyssey(奥德赛公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 CaliBench用于测试视频世界模型的物理校准,将性能分解为可评分性与校准度,发现多数场景-模型组合显著未校准,发布了mnTV指标用于模型对比。
不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知
机构 * University of South Florida(南佛罗里达大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。
Comments 7 pages, 3 figures. Working draft prepared for journal submission
ForgeWM:面向少步骤动作条件视频世界模型的渐进式因果训练
机构 * CUHK(香港中文大学) ; Tencent PCG(腾讯平台与内容事业群) ; FDU(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; HKUST(香港科技大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 ForgeWM 是一种渐进式框架,通过多阶段技术将双向动作条件视频生成器转化为少步骤世界模型,在 Minecraft 和 FPS 游戏任务中实现了更优的可控少步骤视频生成性能。
目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。
Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab
世界令牌:通过训练时世界建模增强具身策略
机构 * JIUTIAN Research(九天研究院) ; Zhongguancun Academy(中关村学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。
Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习
机构 * Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG
AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。
Comments 13 pages, 6 figures
MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模
专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG
AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。
Comments 14 pages, 6 figures
《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》
机构 * UC Davis(加州大学戴维斯分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。
Comments Revised manuscript with updated presentation
视频世界模型的可寻址内存
机构 * NVIDIA(英伟达) ; Princeton University(普林斯顿大学) ; University of Toronto(多伦多大学) ; Vector Institute(矢量研究院)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG
AI总结 针对交互式视频世界模型超出训练时序后内存寻址失效及压缩缓存破坏内存的问题,提出无训练框架 WorldTrace,含两种压缩方法,在新基准 LoopBench 上分别提升时序一致性 15.5%、情景回忆 19.5%。
Comments Project page: https://research.nvidia.com/labs/sil/projects/WorldTrace/
Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。
前向预测足够吗?面向JEPA世界模型的物理状态 grounding
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; COCO Matrix
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。
Surg-UniWorld:具有多模态控制专家的统一外科世界模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; the University of Sydney(悉尼大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。
对决世界模型:用于共模干扰项抑制的优势式动作通道
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出对决世界模型,通过在潜在动态中减去动作预测的平均效应来抑制共模干扰项,无需额外机制,在多个任务中可恢复智能体自身效应,适用于各类动作条件世界模型。
Comments 17 pages, 6 figures, 11 tables. Includes supplementary appendix
确定性世界模型用于闭环视觉系统验证
机构 * University of Florida(佛罗里达大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出确定性世界模型,通过直接映射系统状态到生成图像,消除不可解释的潜在变量,提升闭环视觉系统验证的精度与性能。
Afford-X:面向任务型操作的通用且轻量化的可供性推理模型
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Department of Computer Science, Tsinghua University(清华大学计算机科学系)
专题命中 具身推理 :manipulation(title);robotics(abstract);分类 cs.RO、cs.CV
AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。
克服动作可控世界模型中的统计偏差
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。
CrossScope:用于联合双视野手术视频预测的角色非对称世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 针对母子ERCP中双柔性镜无校准立体关系的手术视频预测问题,提出角色非对称的CrossScope双流模型,经配对双视野基准评估,其性能优于现有基线。
WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似
专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。
隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG
AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。
世界动作规划器:基于动作条件世界模型的通用决策方法
机构 * Harvard University(哈佛大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。
Comments Project page at worldactionplanner.github.io