arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-28 至 2026-08-28 共收录 82 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 11 篇

2608.17512 2026-08-28 cs.RO 版本更新 79%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27152 2026-08-28 cs.LG 新提交 70%

Ultra Low-Power, Lightweight, Probabilistic RSS-Based Path Reconstruction: A System for Landscape-Scale Bee Tracking

超轻量、超低功耗、基于概率RSS的路径重建:用于景观尺度蜜蜂追踪的系统

Christopher J. Noroozi, Joseph L. Woodgate, Michael Mangan, Michael T. Smith

机构 * University of Sheffield(谢菲尔德大学) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.LG

AI总结 本研究提出一种基于RSS的概率路径重建方法,实现了对38毫克低功耗设备的景观尺度追踪,精度达10-15米,可用于欧洲熊蜂归巢飞行的追踪研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26669 2026-08-28 cs.RO cs.CV 新提交 62%

Beyond the Proving Ground: Independent Public-Road Testing of Assisted Lane Change Systems using LiDAR

超越试验场:基于激光雷达的辅助变道系统独立公开道路测试

Marcello Cellina, Akos Kriston, Antonio Migneco, Davide Maggi, Stefano Favelli, Fabrizio Re, Fabrizio Minarini, Andrea Nuovo, Riccardo Dona, Biagio Ciuffo

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出公共道路独立测试辅助变道系统的方法,在法国A31高速开展测试,发现部分系统操作未达UNECE第79号法规安全距离要求,验证了LiDAR传感的适用性,可支持市场监管与法规修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-08-28 cs.RO cs.CV 版本更新 62%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: this https URL (https://dpt2026.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27456 2026-08-28 cs.CV 新提交 57%

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26002 2026-08-28 cs.RO 版本更新 57%

DESCENT: Directed Edge Scene Encoding for Airport Surface Movement Prediction

DESCENT:面向机场地面运动预测的有向边场景编码

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Graz University of Technology(格拉茨工业大学) Institute of Visual Computing(视觉计算研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究针对机场地面运动预测领域,提出基于Transformer的DESCENT架构,结合PRS上下文采样与检测Transformer解码器,在Amelia-10基准上较现有最优基线实现显著性能提升,尤其在安全关键场景表现突出。

Comments IROS 2026. Project page at this https URL (https://a-pru.github.io/descent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26551 2026-08-28 eess.SY 新提交 50%

Nonlinear Model Predictive Control for Guidance Law with Target Input Estimation

结合目标输入估计的制导律非线性模型预测控制

Minho Jang, Minjeong Kim, Sungsu Park

专题命中 具身导航 :navigation(abstract)

AI总结 本文针对捷联导引头导弹,提出结合目标输入估计的MPCG制导律,通过LGRPM离散化OCP并处理约束,仿真显示其拦截性能优于PPNG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26525 2026-08-28 eess.SY 新提交 50%

Fusion Based Dynamic Platform Magnetic Compensation Beyond the Tolles Lawson Approach

基于融合的超越Tolles-Lawson方法的动态平台磁补偿

Rong Yang, Yaakov Bar-Shalom

专题命中 具身导航 :navigation(abstract)

AI总结 本文针对经典Tolles-Lawson框架的不足,提出两阶段磁补偿框架,利用增广线性化模型和无地图KFF算法,在公开数据集上将平均补偿误差降至12.3nT,提升了航空磁补偿性能。

Comments 16 pages, 10 figures, submitted to Journal of Advances in Information Fusion (JAIF) on 3rd Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26211 2026-08-28 cs.SE 新提交 50%

Characterizing the Landscape of Open-Source Satellite Software

开源卫星软件的全景特征分析

Jinfeng Wen, Qi Liang, Yuehan Sun, Federica Sarro, Ao Zhou, Xuanzhe Liu, Shangguang Wang

专题命中 具身导航 :navigation(abstract)

AI总结 本文对22286个GitHub开源卫星软件项目开展特征研究,构建软件目标分类体系,揭示其流行度提升、异构专业化的特点,为相关人员提供启示。

Comments This paper has been accepted for publication in ASE 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 16 篇

2608.26190 2026-08-28 cs.AI 新提交 89%

Predicting Consequences and Reinforcing Navigation Policies with Latent World Models

用潜世界模型预测后果并强化导航策略

Zengmao Wang, Wei Gao, Shuhan Shen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 具身推理 :world model(title,abstract);navigation(title,abstract);分类 cs.AI

AI总结 本研究提出用于机器人导航的兼容性预测潜世界模型(LWM),通过预测动作条件下的潜特征兼容性评估动作后果,可从无标注视频监督策略学习并经强化学习改进,在多机器人导航数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26239 2026-08-28 cs.RO 新提交 85%

WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression

WALL-SS:通过下一尺度自回归扩展来缩放长视界世界模型

Maeve Zhang, Rain Sun, Xiang Wang, Cyril Zhang, Shalfun Li, Meng Cao, Howard Lu, Ethan Chen, Harry Jhou, KZ Zheng, Lights Shi, Regis Cheng, Lorenzin, Robert Wang, Victor Yao, Gody Li, Elise Mon, Yohann Tang, Ryan Yu, PS Zhang, Vincent Chen, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X Square Robot(X Square机器人)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出WALL-SS世界模型,通过尺度自回归扩展实现动作可控的长视界机器人仿真,经实验验证其可提升动作跟随与轨迹精度,减少动作漂移和长视界不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27406 2026-08-28 cs.RO cs.AI cs.CV 新提交 85%

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAP:跨具身视频世界模型是零样本物理模拟器

Kechen Liu, Ola Shorinwa

机构 * Princeton University(普林斯顿大学)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 CLAP是跨具身动作条件视频生成框架,可在人类与机器人的多样化视频上训练,能接近或超越单具身视频模型性能,开源代码与模型,为训练单具身视频世界模型提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27367 2026-08-28 cs.CV cs.AI 新提交 84%

Successive Capacity Growth: Task-Complexity-Driven Width and Depth Expansion for Vision Transformer Encoders in JEPA World Models

连续容量增长:面向JEPA世界模型的视觉Transformer编码器的任务复杂度驱动的宽度与深度扩展

Frederik Berenz

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出SCG方法,使JEPA世界模型的视觉Transformer编码器可按需连续扩展宽度或深度,在多任务上提升性能并实现更高参数效率,且零误扩展。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 83%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22294 2026-08-28 cs.RO 版本更新 83%

Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning

超越实例槽:面向物理交互规划的语义丰富世界模型

Juntao Cheng, Jingkai Wang, Yijun Shen, Xiansheng Chen, Zhiwei Yu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 该研究针对物理交互规划中实例槽无法明确实体任务角色的问题,提出SR-WM模型,通过功能角色绑定实现语义接口,在LIBERO模拟套件等评估中验证了其视觉动力学与规划决策的连接能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-08-28 cs.CV cs.AI 新提交 81%

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27073 2026-08-28 cs.CV cs.RO 新提交 81%

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

专题命中 具身推理 :world model(title);robotics(abstract);分类 cs.RO、cs.CV

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27328 2026-08-28 cs.CV 新提交 79%

R2M-Bench: Evaluating Revisit Memory via Relative Consistency in Interactive Video World Models

R2M-Bench:通过交互式视频世界模型中的相对一致性评估重访记忆

Qiwen Gu, Bingjie Gao, Rui Chen, Geng Li, Jifan Li, Qishuai Wen, Li Niu, Jing Tang, Xiangxiang Chu, Junqiao Zhao

机构 * DreamX Team, Alibaba Group(阿里巴巴集团DreamX团队) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究提出R2M-Bench基准,通过同滚动过程的相对校准评估视频世界模型的重访记忆,其NMR与人类判断相关性良好,可减少慢动作捷径,DreamX-World-Memo表现最优。

Comments Code: this https URL (https://github.com/AMAP-ML/R2MBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 79%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-08-28 cs.CV 版本更新 79%

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: this https URL (https://aka.ms/latent-spatial-memory), Code: this https URL (https://github.com/microsoft/LatentSpatialMemory)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-08-28 cs.CV 版本更新 79%

DALE-CT: Depth-Aware 2D Slice Encoders Learn an Anatomical World Model of Chest CT

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 18 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-28 cs.CV cs.AI 版本更新 73%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 具身推理 :embodied agent(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26200 2026-08-28 cs.AI cs.CV cs.LG 新提交 67%

GameWAM: A World Action Model for Video Games

GameWAM:面向电子游戏的世界动作模型

Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li

机构 * Fudan University(复旦大学) LIGHTSPEED(光速(企业名)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 GameWAM是首个用于原生闭环游戏玩法和GUI控制的世界动作模型,通过并行生成过程实现世界-动作联合学习,实验表明其以更少原生动作达到竞争力任务成功率,还发现了LASI失效模式。

Comments 44 pages, 23 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-08-28 cs.LG cs.AI 版本更新 62%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-08-28 cs.RO 版本更新 57%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 具身推理 :robotics(abstract);分类 cs.RO

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 4 篇

2608.26821 2026-08-28 cs.RO 新提交 79%

TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation

TemporalFlow-VLA:学习基于物理基础的执行历史以实现长 horizon 机器人操作

Jiarui Yang, Yehao Lu, Yuning Su, Yu Zhong, Yufeng Xie, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Junwei Liang, Enyu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Simon Fraser University(西蒙菲莎大学) AgiBot(云圣智能科技(上海)有限公司)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 TemporalFlow-VLA 针对长 horizon 机器人操作中视觉相似状态需不同动作的问题,通过物理监督学习紧凑执行历史,在 LIBERO、RoboTwin 等任务上取得优异性能,且部署无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25757 2026-08-28 cs.RO cs.LG 版本更新 76%

LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation

LM-X:面向通用机器人操控的、具备进度、事件与不确定性预测能力的可解释动作建模方法

Jin Lou, Zhiyuan Jing, Andong Chen, Xupeng Wang, Yuan Xu, Yuexuan Li, Xingdong Zhu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Yufei Liu, Boyang Xing, Lei Jiang, Yan Cui, Ying Chu, Jingxuan Zhu, Jingyi Li, Liangliang Chen, Jinyan Liu, Zhiqi Song, Jidong Zhang, Hongming Li, Yuchen Zhu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) E-surfing Digital Life Technology Co., Ltd., China Telecom(中国电信天翼数字生活科技有限公司)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.LG

AI总结 LM-X是一种面向通用机器人操控的可解释动作建模方法,通过多尺度预测信号提升操控成功率,在RoboTwin2.0等任务上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27384 2026-08-28 cs.RO 新提交 70%

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA:用于快速异步VLA推理的流式动作解码

Zekai Li, Jiaming Tang, Zhijian Liu

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 FlashVLA是一种流式动作解码框架,通过分块因果注意力维护动作缓冲,实现低延迟、平稳异步的VLA推理,在单GPU上达≥30Hz控制频率且任务性能优异。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26578 2026-08-28 cs.RO cs.CV 新提交 62%

TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes

TrapVLA:将视觉-语言-动作模型困在配置好的故障模式中

Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei, Xu-Han Chen, Yinghao Li, Zhuohao Li, Yuan-Ming Li, Qing Zhang, Xiaoyi Fan, Dongmei Jiang, Yan Li, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Pengcheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Jiangxing Intelligence (Guizhou) Technology Inc.(匠星智能(贵州)科技有限公司)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究针对VLA模型提出名为TrapVLA的后门攻击方法,通过配置故障诱捕任务诱导模型进入指定故障模式,构建了相关基准并验证了攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 3 篇

2507.00611 2026-08-28 cs.LG cs.AI cs.RO 版本更新 82%

Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics

残差奖励模型:利用先验知识实现机器人领域高效的基于偏好的强化学习

Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :robotics(title);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出残差奖励模型(RRM),将环境真实奖励拆分为先验奖励与学习奖励之和,可提升机器人领域基于偏好的强化学习的样本效率,在仿真与物理机器人实验中均优于基准方法。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏