Stochastic Control Problems Motivated by Sailboat Trajectory Optimization
由帆船轨迹优化启发的随机控制问题
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出两个随机控制问题,旨在快速到达圆形迎风目标,通过分析帆船在随机风场中的运动模型,探讨了冲击控制与奇异控制的数学特性及解的存在性。
Comments 45 pages, 10 figures
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
由帆船轨迹优化启发的随机控制问题
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出两个随机控制问题,旨在快速到达圆形迎风目标,通过分析帆船在随机风场中的运动模型,探讨了冲击控制与奇异控制的数学特性及解的存在性。
Comments 45 pages, 10 figures
专题命中 具身导航 :navigation(abstract)
Comments 15 pages, 5 figures, presented in Ibero-American Conference on Human-Computer Interaction 2025
基于景观与搜索行为分析的粒子群优化可解释信息处理
机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) ; Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) ; School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) ; Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) ; Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)
专题命中 具身导航 :navigation(abstract)
AI总结 本研究针对粒子群优化(PSO),提出结合探索性景观分析与搜索轨迹网络的多维度可解释性框架,经24个基准函数实验确立拓扑与参数配置指南,提升了PSO的透明度与可解释性。
Comments 40 pages
Journal ref Computer Science Review, Volume 63, Part A, 2027
AffordTrajDP:用于机器人操纵的动态 affordance 引导视觉运动策略学习
机构 * Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO
AI总结 针对静态 affordance 导致的机器人操纵轨迹漂移问题,提出 AffordTrajDP 动态框架,以物体为中心传播锚点 affordance 生成轨迹,在 ManiSkill3 上成功率达70.0%,现实实验验证其鲁棒性与组件有效性。
AnyWorld:用于跨 embodiments 泛化的分解式第一人称世界模型
机构 * Nanyang Technological University(南洋理工大学) ; Institute of Advanced Intelligence and Computing, A*STAR(新加坡科技研究局高级智能与计算研究院) ; XPENG Robotics(小鹏机器人) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 具身推理 :world model(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO
AI总结 AnyWorld 框架通过分解交互为动作、相机、embodiment 因子,将人类交互重组为机器人原生经验,生成数据可提升机器人操作性能,验证了动作校准与视觉重组的必要性。
Comments Project page: https://xpeng-robotics.github.io/anyworld/
Matrix-Game 3.5:利用补丁内存增强实时流式交互式世界模型
机构 * Riemann Dynamics(黎曼动力学)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);embodied agent(abstract);分类 cs.CV
AI总结 Matrix-Game 3.5通过三项关键改进优化交互式世界模型,实现稳定长时序实时交互式生成,在多类任务上表现出色。
Comments https://matrix-game-v3-5.github.io/
连续容量增长:面向JEPA世界模型的视觉Transformer编码器的任务复杂度驱动的宽度与深度扩展
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV
AI总结 本文提出SCG方法,使JEPA世界模型的视觉Transformer编码器可按需连续扩展宽度或深度,在多任务上提升性能并实现更高参数效率,且零误扩展。
Comments 12 pages, 2 figures, 6 tables
超越欧几里得距离:通过地平线匹配轨迹可达性度量修复潜在世界模型
机构 * Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.LG
AI总结 本文提出轨迹可达性度量(TRM)作为固定潜在世界模型的后处理终端排名方法,通过训练小的成对头部来改进终端排名,从而提高连续操控任务的性能。
Comments 24 pages, including appendix
潜在规划在点云场景中是否可行?面向几何观测的动作条件JEPA世界模型
机构 * AIT Austrian Institute of Technology(奥地利技术研究所) ; Assistive & Autonomous Systems(辅助与自主系统)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 该研究将JEPA模型扩展至点云场景,验证了三种JEPA设计可在点云规划中有效工作,其中动作敏感型模型表现最优,还实现了无需目标观测的3D目标接口构建。
物理空间中相邻集的动作优于世界模型中的最佳预测
机构 * Tongji University(同济大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。
Comments 23 pages, 7 figures. Includes supplementary material
世界模型与策略如何在大语言模型智能体中结合?一种联合谱分析与行为学解释
机构 * Dartmouth College(达特茅斯学院) ; Columbia University(哥伦比亚大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究通过受控实验探究LLM智能体中世界模型与策略的结合机制,从几何与行为角度揭示二者的互补特性,并提出提升策略训练保留世界知识能力的方法。
Comments Accepted to EMNLP 2026
Flow-JEPA:用于JEPA世界模型中鲁棒潜在动力学的流匹配方法
机构 * Nanyang Technological University(南洋理工大学) ; The University of Queensland(昆士兰大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对JEPA世界模型确定性自回归预测器易累积误差且对扰动敏感的问题,提出Flow-JEPA,采用条件流匹配实现随机轨迹级预测,显著提升了干净及含噪观测下的平均成功率。
闭合模式是一种规范选择:认证代码世界模型中相对于可达性的拓扑结构
机构 * AGILabs
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究探讨认证代码世界模型中相对于可达性的拓扑,通过LLM合成实验得出三条原则,揭示危险与可达性的关联、修复的限制及缓解措施需匹配错误维度方向的结论。
Comments 33 pages, 2 figures. Paper 3 of a series (companion papers: arXiv:2607.14169, arXiv:2608.17956). Code, data, and Lean formalization: https://github.com/JaviMaligno/code-world-models
用于学习世界模型中反事实滚动的低秩动力学有效潜在载体
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 本文针对学习世界模型的反事实滚动问题,提出基于低秩动力学有效潜在载体的方法,在两物体碰撞环境中验证秩4修补块可实现稳定的12步自主反事实滚动,且效果可复现。
Comments Revised manuscript with expanded Joint-intervention, carrier-relative, and recurrent-dynamics analyses. 54 pages, 7 figures. Code and data are available at https://github.com/lysea8282/dynamic-effective-latent-carriers
J-LAW:通过耦合潜在因子图实现联合定位与可操作世界建模
机构 * Geely Technology Europe(吉利技术欧洲公司) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘与遥感国家重点实验室(LIESMARS)) ; Wuhan University(武汉大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG
AI总结 提出J-LAW,通过耦合因子图联合优化度量物体位姿、潜在世界状态和潜在地标嵌入,实现定位与可操作世界建模的协同提升,实验证明能显著降低潜在预测误差和端点漂移。
Comments Under review
更好的世界模型可以导致更好的训练后性能
机构 * University of Michigan(密歇根大学) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究通过比较不同世界建模策略,发现显式建模能提升Transformer的状态表示质量,从而增强强化学习后训练的效果。
CAER:面向世界模型训练的因果动作效应重加权
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 针对现有动作条件世界模型训练中交互动态未充分优化的问题,提出CAER范式,通过在线定位动作因果影响的令牌并重加权,提升了生成视频的物理一致性、可控性与视觉质量。
Comments 14 pages, 8 figures. Project page: https://manifoldai-research.github.io/CAER/
视频世界模型能否追踪未被观测的世界状态?
机构 * Seoul National University(首尔大学) ; Roblox(罗布乐思公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 该研究通过动作条件视频“贝壳游戏”实验,发现多数视频世界模型无法追踪未观测的世界状态,仅线性注意力(转移特征值为负)和TTT(带非线性快速权重)可实现外推,为构建有状态视频世界模型提供了方向。
Comments Project webpage:https://joonghyuk.com/stateful-vwm-web/
潜在世界模型中的干预差距
机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; University of Montreal(蒙特利尔大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 该研究发现潜在世界模型存在干预差距,即模型开环转移与环境干预对任务变量的影响存在偏差,需以捕获优先的方式在模型原生接口直接审计干预保真度。
Comments 21 pages, 10 figures
流形外细化:用冻结世界模型引导视频生成器
机构 * Fulbright University Vietnam(富布赖特越南大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 该研究提出流形外细化(OMR)方法,用冻结的V-JEPA 2.1世界模型引导视频生成器,在低额外成本下提升了视频的物理一致性与语义 adherence指标。
Comments Accepted at BMVC 2026. Project page: https://itruonghai.github.io/omr
通过世界模型扩展自动研究智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。
世界模型遇见语言模型:论具体推理与抽象推理的互补性
机构 * Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。
Comments EMNLP 2026
MobileDreamer: 用于GUI代理的生成式草图世界模型
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Meituan(美团)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 MobileDreamer通过生成式草图世界模型和rollout想象策略,提升GUI代理在长周期任务中的决策能力,任务成功率提升5.25%。
WebWorld:将浏览器作为自改进网页代码的世界模型
机构 * Beihang University(北京航空航天大学) ; Shanghai Jiao Tong University(上海交通大学) ; IQuest Research(IQuest研究院) ; Langboat
专题命中 具身推理 :world model(title,abstract)
AI总结 本研究提出WebWorld,将浏览器作为VLM无法欺骗的网页代码世界模型,通过浏览器签发合格证书的机制实现VLM自主交互与监督,使WebWorld-27B在两个基准任务上实现显著性能提升,达到强前沿系统水平。
Comments EMNLP Main Conference
一种在膜世界模型中局部共形凯勒流形上的新自对偶引力瞬子解
专题命中 具身推理 :world model(title)
AI总结 本文在共形膨胀子引力中找到了一种真空类克尔扭曲时空上的精确引力瞬子解,该解由一阶偏微分方程导出,与自对偶性相关,其奇点由五次多项式决定,拓扑为S^3×R/Z_2,并利用克莱因瓶上的对径边界条件描述了霍金粒子蒸发过程,最后揭示了与Janis-Newman-Winicour模型之间的联系。
Comments Version V4 : final. pictures improved --- spelling improved --- comments welcome---73 pages---70 pictures. 1 picture improved Aug 30
Mol-JEPA:用于分子的多模态联合嵌入预测架构
机构 * University of Tübingen(蒂宾根大学) ; Boehringer Ingelheim(勃林格殷格翰) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Brown University(布朗大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。
Social-JEPA:涌现的几何同构
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV
AI总结 Social-JEPA通过让不同视角的独立代理学习环境模型,发现其潜在空间近似线性同构,从而实现跨代理的透明转换与高效迁移学习。
Comments Due to an unresolved dispute among the authors regarding the correctness of the experimental results and the validity of the conclusions, the team has decided to withdraw this paper until these issues can be fully resolved
AcrossWAM1.0:用于紧凑机器人策略的模块化潜在世界-动作栈
机构 * Across Physical AI(跨物理人工智能机构) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 该研究针对LaWAM的耦合问题推出AcrossWAM1.0模块化潜在世界-动作栈,在LIBERO实验中实现高成功率,参数规模显著缩小,提供可审计的部署边界。
StableWorld: 向稳定和一致的长交互视频生成迈进
机构 * PRLab, NJU(南京大学PRLab) ; HKU(香港大学) ; UCAS(中国科学技术大学) ; WeChat, Tencent Inc.(腾讯公司) ; NTU(国立清华大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。
LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标
机构 * Soongsil University(崇实大学) ; Chung-Ang University(中央大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.LG
AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。
Comments Accepted to EMNLP 2026 (Main Conference). Code and benchmark: https://github.com/cau-hai-lab/LIBERO-Para