arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-25 至 2026-08-25 共收录 64 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2602.14255 2026-08-25 cs.RO 版本更新 57%

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

面向工业机器人视觉-运动策略学习的延迟感知框架

Daniel Ruan (1), Salma Mozaffari (1), Sigrid Adriaenssens (1), Arash Adel (1) ((1) Princeton University)

机构 * Princeton University(普林斯顿大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 17 篇

2509.23155 2026-08-25 cs.RO 版本更新 92%

LaGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Safaeid Hossain Arib, Rabeya Akter

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 机器人操作 :robotic(title,abstract);embodied agent(title,abstract);manipulation(title,abstract);分类 cs.RO

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

Comments ICML 2026 Main Track Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01027 2026-08-25 cs.RO 版本更新 92%

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型

Pengfei Zhou, Shengcong Chen, Di Chen, Jiaxu Wang, Rongjun Jin, Bingwen Zhu, Yike Pan, Songen Gu, Kuanning Wang, Shufeng Nan, Xingyu Qiu, Chenhao Qiu, Pu Yang, Yunuo Cai, Jianxiong Gao, Yifan Li, Yanwei Fu, Xiangyu Yue, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。

Comments Our project homepge: this https URL (https://tau0-wm.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17774 2026-08-25 cs.RO 版本更新 88%

Learning Diffusion Policies for Robotic Manipulation of Timber Joinery under Fabrication Uncertainty

通过扩散策略学习实现建筑中的接触密集机器人装配

Salma Mozaffari (1), Daniel Ruan (1), William van den Bogert (2), Nima Fazeli (2), Sigrid Adriaenssens (1), Arash Adel (1) ((1) Princeton University, (2) University of Michigan)

机构 * Princeton University(普林斯顿大学) University of Michigan(密歇根大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文研究了在建筑施工中使用扩散策略学习提升机器人装配的鲁棒性和精度,通过紧密契合的木构接合作为案例,证明扩散策略能通过接触感知控制补偿对齐误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26757 2026-08-25 cs.RO 版本更新 83%

Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?

超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们

Boyang Cai, Qiwei Liang, Jiawei Li, Shihang Weng, Zhaoxin Zhang, Tao Lin, Xiangyu Chen, Wenjie Zhang, Jiaqi Mao, Weisheng Xu, Bin Yang, Jiaming Liang, Junhao Cai, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing Jiaotong University(北京交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17885 2026-08-25 cs.CV cs.AI cs.RO 版本更新 83%

PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation

PEAfowl:感知增强的多视角视觉-语言-动作用于双臂操作

Qingyu Fan, Zhaoxiang Li, Jinrui Hu, Yi Lu, Wang Chen, Qiu Shen, Xiao-xiao Long, Yinghao Cai, Tao Lu, Shuo Wang, Xun Cao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)

AI总结 PEAfowl通过增强感知的多视角视觉-语言-动作策略,提升双臂操作在复杂环境中的稳定性和成功率。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L), 2026. This version includes an extended appendix with additional implementation details, deployment analysis, robustness evaluation, and real-world evaluation protocol. DOI: https://doi.org/10.1109/LRA.2026.3726379

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17443 2026-08-25 cs.AI cs.CL cs.CY 版本更新 74%

Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems

在位优势:LLM推荐系统中的品牌偏见与认知操纵动态

Xi Chu, Yupeng Hou

机构 * Trine University(特莱恩大学) Texas A&M University(德克萨斯农工大学)

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 研究LLM推荐中的品牌动态,发现知名品牌在同等规格下获100%推荐(IAI=10.0),但微弱评分优势可打破垄断;权威营销语言(如虚假临床证据)以+0.17评分点的偏差剩余价值打破垄断;多品牌GEO竞争存在社会困境,集体优化降低个体收益。

Comments 16 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27533 2026-08-25 cs.RO 版本更新 74%

Inducing Calmness With Pocket-Sized Robotics: Reducing Movement and Heart Rate in Children through Hand-Held Tactile Interactions

用口袋大小的机器人诱导平静:通过手持触觉交互降低儿童的心率和运动

Morten Roed Frederiksen, Kasper Støy, Maja Matarić

机构 * Data Systems and Robotics, IT-University of Copenhagen(数据系统与机器人,丹麦IT大学) Interaction Lab, University of Southern California(交互实验室,南加州大学)

专题命中 机器人操作 :robotics(title);分类 cs.RO

AI总结 本研究通过手持触觉设备上的节奏振动匹配游戏,发现触觉交互能显著降低儿童的生理唤醒(心率下降3.56 bpm)和身体躁动(整体运动减少38%),从而促进平静和专注状态。

Comments 34 pages, 2 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20817 2026-08-25 cs.CR cs.RO 版本更新 70%

GhostTac: Manipulating Tactile Sensors without Physical Contact

GhostTac:无物理接触的触觉传感器操纵技术

Kun Wang, Xuancun Lu, Ruochen Zhou, Kai Wang, Tongjun Ye, Yihao Shao, Chen Yan, Xiaoyu Ji, Wenyuan Xu

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究人员提出首个非接触式触觉传感器操纵攻击GhostTac,利用电磁干扰引发测量偏差,在15个传感器上验证有效性,揭示机器人触觉传感的新型物理攻击向量。

Comments Accepted at ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-25 cs.RO 版本更新 57%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-25 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28391 2026-08-25 cs.RO 版本更新 57%

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

TacWAM:锚点引导的力学感知触觉世界动作模型

Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 57%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16537 2026-08-25 cs.RO 版本更新 57%

Nori A3: A Bimanual Mobile Manipulator at the Appliance Price Point

Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂

Antonio Li

机构 * LeRobot

专题命中 机器人操作 :navigation(abstract);分类 cs.RO

AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。

Comments 5 pages, 4 figures, 2 tables. Supersedes arXiv:2605.16537 (https://arxiv.org/abs/2605.16537), which described an earlier prototype on a different mechanical base

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14492 2026-08-25 cs.RO 版本更新 57%

UNCLE-Grasp: A Task-Adapted Framework for Uncertainty-Aware Grasping of Leaf-Occluded Strawberries

UNCLE-Grasp: 有不确定性意识的叶片遮挡草莓抓取

Malak Mansour, Ali Abouzeid, Zezhou Sun, Qinbo Sun, Dezhen Song, Abdalla Swikir

机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 UNCLE-Grasp通过建模遮挡和形状补全的几何不确定性,提出了一种在部分遮挡下可靠抓取草莓的方法,通过多假设评估和保守置信界标准提升抓取可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-08-25 cs.CV 版本更新 57%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :world model(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04872 2026-08-25 physics.optics cond-mat.soft 版本更新 50%

Band-Selective LDOS Engineering of Yb/Er Upconversion: an Electromagnetic-Kinetic Diagnostic Framework

镱/铒上转换的带选择性局域态密度工程:电磁-动力学诊断框架

Yuxiang Zhang, Mayte Gómez-Castaño, Agustín Mihi, Serge Ravaine, Xiaogang Liu, Renaud A. L. Vallée

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究构建了带选择性的等离子体上转换平台,通过耦合电磁-动力学框架分析Yb/Er上转换过程,明确了泵浦场与发射侧LDOS的解耦机制,为等离子体上转换架构设计提供了诊断方法。

Comments 38 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10645 2026-08-25 eess.SY 版本更新 50%

AIDC Microgrid Vulnerability Assessment Under Computing-Power Coordinated Attacks

算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估

Ze Yu, Hongwei Zhen, Chao Shen, Mingyang Sun

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 10 篇

2608.10817 2026-08-25 cs.RO 版本更新 79%

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation

AECNav:用于高效零样本开放词汇对象导航的主动证据整合

Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 AECNav是一种无需训练的零样本开放词汇对象导航方法,通过证据门控感知、证据整合与主动证据获取三个组件,在多个基准数据集上达到最新性能,且在物理机器人上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26974 2026-08-25 cs.RO 版本更新 79%

Credibility-Aware Learning and Control for Safe USV Navigation under Perception Uncertainty

信任、几何与规则:不确定性下安全USV导航的可信感知强化学习框架

Yuhang Zhang, Shuqi Chai, Yukang Zhang, Liusha Yang, Mingchuan Zhang, Wei Wang, Qingjiang Shi, Quanbo Ge

机构 * School of Information Engineering, Henan University of Science and Technology(河南科技大学信息工程学院) Shenzhen Research Institute of Big Data(深圳大数据研究院) School of Logistics Engineering, Shanghai Maritime University(上海 Maritime University物流工程学院) Shenzhen Technology University(深圳科技大学) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Software Engineering, Tongji University(同济大学软件工程学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出一种集成可信感知学习、几何安全屏蔽和连续规则感知嵌入的强化学习框架,以解决动态海洋环境中USV导航的安全性和COLREGs合规性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18292 2026-08-25 cs.RO cs.CV 版本更新 76%

GuideFetch: A Task Coordination Framework for Concurrent Navigation and Object Retrieval in Assistive Robot Dogs

GuideFetch:用于辅助机器狗并发导航与物体检索的任务协调框架

Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学)

专题命中 具身导航 :navigation(title);分类 cs.RO、cs.CV

AI总结 针对异构辅助机器狗的导航与物体检索并发任务,提出GuideFetch协调框架,通过LLM规划与状态验证提升执行效率,并行执行可缩短41.3%平均总完成时间。

Comments Accepted to the 1st Workshop on Multimodal Digital Agents (MDA) at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-25 cs.CV cs.RO 版本更新 73%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 具身导航 :embodied agent(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13739 2026-08-25 cs.RO eess.SY 版本更新 57%

XIT: Exploration and Exploitation Informed Trees for Active Gas Distribution Mapping in Unknown Environments

XIT:在未知环境中主动气体分布映射的探索与利用树

Mal Fazliu, Matthew Coombes, Sen Wang, Cunjia Liu

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 XIT通过平衡探索与利用,提升未知环境中自主气体分布映射的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03002 2026-08-25 cs.RO 版本更新 57%

RPL: Learning Robust Humanoid Perceptive Locomotion on Challenging Terrains

RPL:在复杂地形上学习鲁棒的人形感知移动

Yuanhang Zhang, Younggyo Seo, Juyue Chen, Yifu Yuan, Koushil Sreenath, Pieter Abbeel, Carmelo Sferrazza, Karen Liu, Rocky Duan, Guanya Shi

专题命中 具身导航 :manipulation(abstract);分类 cs.RO

AI总结 RPL通过两阶段训练框架在复杂地形上实现稳健的多方向人形移动,结合深度蒸馏和增强技术,提升机器人负载下的移动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07609 2026-08-25 eess.SY cs.RO 版本更新 57%

Obstacle Avoidance of UAV in Dynamic Environments Using Direction and Velocity-Adaptive Artificial Potential Field

使用方向和速度自适应人工势场实现无人机在动态环境中的障碍物避障

Nikita Vaibhav Pavle, Rakesh Kumar Sahoo, Manoranjan Sinha

机构 * Department of Aerospace Engineering, Indian Institute of Technology Kharagpur(航空航天工程系,印度理工学院Kharagpur)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种基于方向和速度自适应的人工势场方法,结合模型预测控制实现无人机在动态环境中的高效避障与安全导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23705 2026-08-25 cs.RO 版本更新 57%

MDCPP: Multi-Robot Dynamic Coverage Path Planning for Workload Adaptation

MDCPP:面向工作负载自适应的多机器人动态覆盖路径规划

Jun Chen, Mingjia Chen, Tianlong Yu, Qi Nie, Shinkyu Park

机构 * School of Electrical and Automation Engineering, Nanjing Normal University(南京师范大学电气与自动化工程学院) Computer, Electrical, and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(王国 Abdullah 科学与技术大学计算机、电气和数学科学与工程系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 针对多机器人覆盖路径规划恒速假设不适用于空间变化遍历速度的问题,提出MDCPP方法,经600次基准测试和3台UGV实验,验证其在强异质性下可改善总完成时间并实现空间速度自适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23772 2026-08-25 cs.HC 版本更新 50%

PageGuide: Browser extension to assist users in navigating a webpage and locating information

PageGuide: 一款辅助用户在网页上导航和查找信息的浏览器扩展

Tin Nguyen, Thang T. Truong, Runtao Zhou, Trung Bui, Chirag Agarwal, Anh Totti Nguyen

专题命中 具身导航 :navigation(abstract)

AI总结 PageGuide通过视觉叠加将LLM回答与HTML DOM结合,帮助用户快速定位信息、逐步指导操作并隐藏干扰内容,提升浏览效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12207 2026-08-25 eess.SP 版本更新 50%

Weighted Covariance Intersection for Range-based Distributed Cooperative Localization of Multi-Vehicle Systems

加权协方差交叠用于多车系统的基于范围的分布式协作定位

Chenxin Tu, Xiaowei Cui, Gang Liu, Mingquan Lu

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出加权协方差交叠方法,用于改进多车系统在三维空间中的分布式协作定位性能,提升鲁棒性和可扩展性。

Comments This manuscript has been published in IEEE Transactions on Vehicular Technology. The final version is available at DOI: this https URL (https://doi.org/10.1109/TVT.2026.3715359)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 7 篇

2608.18234 2026-08-25 cs.RO cs.AI cs.LG 版本更新 85%

GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction

GigaBrain-WBC-0.5:一种用于与环境交互的鲁棒全身控制的行为世界模型

Ziyang Cheng, Tianshu Tang, Jinxin Lan, Xinze Chen, Yuhan Gong, Zhichao Liu, Changzhong Wu, Yahao Mao, Zongyan Deng, Mingxuan Ma, Huasen Xi, Yilong Liu, Yutong Wu, Xiaofeng Wang, Yang Wang, Yun Ye, Guan Huang, Xiaojie Jin, Zheng Zhu, Jiwen Lu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该研究提出首个用于人形机器人全身控制的行为世界模型GigaBrain-WBC-0.5,通过训练因果Transformer联合预测动作、状态与指令分布,在多场景下实现鲁棒控制,成功率优于现有基线。

Comments 20 pages, 8 figures, 4 tables. Technical report. Project page: this https URL (https://shepherd1226.github.io/gigabrain-wbc-0.5/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08600 2026-08-25 cs.CV cs.AI cs.LG 版本更新 82%

Population-Scalable Multi-Agent World Modeling

支持种群规模扩展的多智能体世界建模

Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, He Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jiao Liang, Jianyi Zhu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。

Comments Technical report. Project page: this https URL (https://rhos.ai/research/khora). Online demo: this https URL (https://ophilus.ai/khora)

详情

展开后加载摘要…

URL PDF HTML 收藏