A Base Camp for Scaling AI
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG
专题命中 通用世界模型 :environment model(title);分类 cs.CV、cs.RO
Comments Project page: https://vision.cs.utexas.edu/projects/active_rir/
专题命中 通用世界模型 :environment model(title);分类 cs.AI、cs.MA
Comments 12 pages, 8 figures, journal article
Journal ref U.P.B. Sci. Bull., Series C, Vol. 85, Iss. 1, 2023, ISSN 2286-3540
专题命中 通用世界模型 :environment model(title);分类 cs.AI、cs.LG
Comments pre-print
Position:通过转移复杂度分析游戏世界
机构 * Microsoft Research(微软研究院) ; DeepMind(深度思考(DeepMind))
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 该研究针对GWM与RL常被混淆的问题,提出转移复杂度剖面(TCP)指标,用于量化游戏环境的转移预测难度,呼吁其成为相关论文的标准基准元数据。
Comments Accepted by ICML 2026 Position Paper Track. https://icml.cc/virtual/2026/poster/67074
超越BFI:用于增强评估LLM人格特质可靠性与有效性的CSI
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 针对现有LLM人格特质评估工具BFI的可靠性与有效性局限,提出适配LLM的CSI,经实验验证其可靠性更高、与模型真实输出相关性超0.85,能有效评估LLM人格特质。
Comments Code available via https://github.com/dependentsign/CSI
受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放
机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。
Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison
流强制:构建用于鲁棒流视频生成的统一训练轨迹
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics(地平线机器人) ; Anyverse Dynamics
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。
Comments 15 pages,6 figures
评估协议决定结果:在TwoRoom上独立复现LeWorldModel
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG
AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。
Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab
WA-SpecDec:面向视觉-语言-动作模型的世界感知投机解码
机构 * The University of Sydney(悉尼大学)
专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.RO
AI总结 本文提出WA-SpecDec框架,在VLA预填充阶段注入世界模型的物理场景感知,在不改变放宽接受规则的前提下,提升了任务成功率、实现1.5倍匹配成功率加速并降低近接触失败率。
Comments Preprint
基于异常的置信度校准用于基于视觉的安全预测
机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 本文提出了一种基于异常的在线校准方法,通过融合感知和动态异常分数来改进基于视觉的安全预测中的置信度估计,从而在面对分布偏移时减少过自信,提升预测性能。
Delta Forcing:交互式自回归视频生成中的信任区域引导
机构 * Texas A\&M University(德克萨斯A&M大学) ; University of Washington(华盛顿大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。
Comments preprint
EnvACE:通过世界预演内化环境动态以实现智能体强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; Central South University(中南大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent Inc.(腾讯公司)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
DreamWAM:超越RGB未来预测的世界动作模型
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。
通过鲁棒3D化身放置学习理解肢体语言
机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) ; “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) ; NORCE Norwegian Research Centre AS(挪威NORCE研究中心)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。
VidNum-1.4K:一个全面的视频基于数值推理基准
机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。
Comments 7 pages, 5 figures
上下文为王:上下文规范如何塑造概念的几何结构
机构 * Zenity
专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.LG
AI总结 研究大型语言模型中上下文规范对概念几何结构的塑造,发现上下文决定模型实际使用的结构,声明性规则可确定几何编码关系及拓扑类型,不同规模模型表现不同,同一模型家族中较大模型存在的机制在较小模型中可能不存在。
通过视觉状态转换扩展 GUI 智能体
机构 * NUS(新加坡国立大学) ; Sea AI Lab(Sea人工智能实验室) ; UTS(悉尼科技大学) ; University of Liverpool(利物浦大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。
以游戏速度运行的生成式世界渲染器
机构 * Alaya Lab(阿莱雅实验室) ; University of California, Merced(加州大学默塞德分校)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 研究如何提升生成式世界渲染器AlayaRenderer的速度,核心方法是将其重构为自回归流模型并引入轻量级编解码器,主要贡献是大幅降低推理成本,实现30 FPS可玩的生成式世界,保留核心渲染能力。
Comments Project page: https://alaya-renderer-flash.alayalab.ai/
完整性门控生态协同自适应巡航控制:信号交叉口协同驾驶的认知可容许性
机构 * Chicago State University(芝加哥州立大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO
AI总结 研究信号交叉口Eco-CACC系统,提出完整性门控框架,结合多种因素构建统一完整性度量调节控制权,仿真表明其在模型一致时保持效率,完整性下降时能早期保守响应,解决现有方法在传感等问题下的不足。
学习的纳米四旋翼动力学中的评估记录污染:新种子审计
专题命中 通用世界模型 :world-model(abstract);world-model(abstract);dynamics model(abstract)
AI总结 研究学习的纳米四旋翼动力学中评估记录污染问题,通过固定NanoBench Crazyflie 2.1数据集快照进行实验,比较不同模型,发现污染虽降误差但置信区间过零,可靠评估需记录级分割等多方面操作。
自上而下的注意力:一种基于无人机的目标定位多模态模型
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 针对无人机目标检测,本文基于YOLO-World框架,用A2C2f层替换C2f层,引入注意力机制和并行处理结构,提升小目标检测性能,在VisDrone数据集实验中各项指标显著优于原模型,提供了高精度检测方案。
Comments Preprint. Accepted for publication in the International Journal of Interactive Mobile Technologies
ToolVerse:为智能强化学习解锁大规模环境和长时任务
机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。
语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性
机构 * Constructor University(康斯坦丁大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.MA
AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。
迈向野外空间超感知
机构 * Tsinghua University(清华大学) ; NVIDIA(英伟达) ; Stanford University(斯坦福大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。
Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/
TRACE:可审计的智能体承诺的操作推理模式
机构 * Stanford University(斯坦福大学) ; Quadrivium AI(四元数人工智能)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。
Comments 46 pages, 18 tables, 4 figures
GEST引擎:从事件图到合成视频。完整技术报告
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) ; Büchi Labortechnik AG(布赫实验室技术公司)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV
AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。
信息论视角下最优奖励最大化世界模型的分析
机构 * Dovetail Research(Dovetail研究公司) ; University of Sao Paulo(圣保罗大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI
AI总结 本文从信息论角度分析了最优奖励最大化中世界模型的信息量,证明最优策略对环境的信息量为n log m比特,并适用于多种奖励最大化目标。
Propheticus:用于开发可靠安全软件预测模型的机器学习框架
机构 * DEI/CISUC, University of Coimbra,\ Portugal
专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);分类 cs.AI、cs.LG
AI总结 针对软件可靠性与安全性需求,介绍Propheticus机器学习框架,抽象其复杂性以便用户使用,通过漏洞预测和在线故障预测两个案例研究,展示该框架能简化并加速机器学习工作流程。
Comments Accepted for publication in the 30th IEEE International Symposium on Software Reliability Engineering (ISSRE) 2019