A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots
面向工业机器人视觉-运动策略学习的延迟感知框架
机构 * Princeton University(普林斯顿大学)
专题命中 机器人学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
面向工业机器人视觉-运动策略学习的延迟感知框架
机构 * Princeton University(普林斯顿大学)
专题命中 机器人学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。
LAGEA:基于语言引导的机器人操作代理
机构 * Department of Robotics ; Mechatronics Engineering, University of Dhaka, Bangladesh ; Center for Computational \& Data Sciences, Independent University, Bangladesh
专题命中 机器人操作 :robotic(title,abstract);embodied agent(title,abstract);manipulation(title,abstract);分类 cs.RO
AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。
Comments ICML 2026 Main Track Poster
$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; AGIBOT Finch
专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO
AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。
Comments Our project homepge: this https URL (https://tau0-wm.github.io)
通过扩散策略学习实现建筑中的接触密集机器人装配
机构 * Princeton University(普林斯顿大学) ; University of Michigan(密歇根大学)
专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO
AI总结 本文研究了在建筑施工中使用扩散策略学习提升机器人装配的鲁棒性和精度,通过紧密契合的木构接合作为案例,证明扩散策略能通过接触感知控制补偿对齐误差。
超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shenzhen University(深圳大学) ; Beijing Jiaotong University(北京交通大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO
AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。
PEAfowl:感知增强的多视角视觉-语言-动作用于双臂操作
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学)
专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)
AI总结 PEAfowl通过增强感知的多视角视觉-语言-动作策略,提升双臂操作在复杂环境中的稳定性和成功率。
Comments Accepted by IEEE Robotics and Automation Letters (RA-L), 2026. This version includes an extended appendix with additional implementation details, deployment analysis, robustness evaluation, and real-world evaluation protocol. DOI: https://doi.org/10.1109/LRA.2026.3726379
在位优势:LLM推荐系统中的品牌偏见与认知操纵动态
机构 * Trine University(特莱恩大学) ; Texas A&M University(德克萨斯农工大学)
专题命中 机器人操作 :manipulation(title);分类 cs.AI
AI总结 研究LLM推荐中的品牌动态,发现知名品牌在同等规格下获100%推荐(IAI=10.0),但微弱评分优势可打破垄断;权威营销语言(如虚假临床证据)以+0.17评分点的偏差剩余价值打破垄断;多品牌GEO竞争存在社会困境,集体优化降低个体收益。
Comments 16 pages, 4 figures, 11 tables
用口袋大小的机器人诱导平静:通过手持触觉交互降低儿童的心率和运动
机构 * Data Systems and Robotics, IT-University of Copenhagen(数据系统与机器人,丹麦IT大学) ; Interaction Lab, University of Southern California(交互实验室,南加州大学)
专题命中 机器人操作 :robotics(title);分类 cs.RO
AI总结 本研究通过手持触觉设备上的节奏振动匹配游戏,发现触觉交互能显著降低儿童的生理唤醒(心率下降3.56 bpm)和身体躁动(整体运动减少38%),从而促进平静和专注状态。
Comments 34 pages, 2 tables, 7 figures
GhostTac:无物理接触的触觉传感器操纵技术
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 研究人员提出首个非接触式触觉传感器操纵攻击GhostTac,利用电磁干扰引发测量偏差,在15个传感器上验证有效性,揭示机器人触觉传感的新型物理攻击向量。
Comments Accepted at ACM CCS 2026
用于精准单步动作生成的统一条件-动作建模
机构 * NTU(南洋理工大学) ; HKU(香港大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO
AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
专题命中 机器人操作 :manipulation(abstract);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
TacWAM:锚点引导的力学感知触觉世界动作模型
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO
AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。
Comments 8 pages, 4 figures, 2 tables
语言训练深度伪造检测器的正则化能力
机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.CV
AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。
Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂
机构 * LeRobot
专题命中 机器人操作 :navigation(abstract);分类 cs.RO
AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。
Comments 5 pages, 4 figures, 2 tables. Supersedes arXiv:2605.16537 (https://arxiv.org/abs/2605.16537), which described an earlier prototype on a different mechanical base
UNCLE-Grasp: 有不确定性意识的叶片遮挡草莓抓取
机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)
专题命中 机器人操作 :robotic(abstract);分类 cs.RO
AI总结 UNCLE-Grasp通过建模遮挡和形状补全的几何不确定性,提出了一种在部分遮挡下可靠抓取草莓的方法,通过多假设评估和保守置信界标准提升抓取可靠性。
生成现实:基于交互式视频生成的人本世界模拟
机构 * Stanford University(斯坦福大学) ; NYU Shanghai(纽约大学上海分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 机器人操作 :world model(abstract);分类 cs.CV
AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。
Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)
镱/铒上转换的带选择性局域态密度工程:电磁-动力学诊断框架
专题命中 机器人操作 :manipulation(abstract)
AI总结 该研究构建了带选择性的等离子体上转换平台,通过耦合电磁-动力学框架分析Yb/Er上转换过程,明确了泵浦场与发射侧LDOS的解耦机制,为等离子体上转换架构设计提供了诊断方法。
Comments 38 pages, 13 figures
算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。
AECNav:用于高效零样本开放词汇对象导航的主动证据整合
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO
AI总结 AECNav是一种无需训练的零样本开放词汇对象导航方法,通过证据门控感知、证据整合与主动证据获取三个组件,在多个基准数据集上达到最新性能,且在物理机器人上表现优异。
信任、几何与规则:不确定性下安全USV导航的可信感知强化学习框架
机构 * School of Information Engineering, Henan University of Science and Technology(河南科技大学信息工程学院) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; School of Logistics Engineering, Shanghai Maritime University(上海 Maritime University物流工程学院) ; Shenzhen Technology University(深圳科技大学) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Software Engineering, Tongji University(同济大学软件工程学院)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO
AI总结 提出一种集成可信感知学习、几何安全屏蔽和连续规则感知嵌入的强化学习框架,以解决动态海洋环境中USV导航的安全性和COLREGs合规性问题。
GuideFetch:用于辅助机器狗并发导航与物体检索的任务协调框架
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Hunan University(湖南大学)
专题命中 具身导航 :navigation(title);分类 cs.RO、cs.CV
AI总结 针对异构辅助机器狗的导航与物体检索并发任务,提出GuideFetch协调框架,通过LLM规划与状态验证提升执行效率,并行执行可缩短41.3%平均总完成时间。
Comments Accepted to the 1st Workshop on Multimodal Digital Agents (MDA) at ECCV 2026
Traj-VLN:通过自回归轨迹生成学习像素空间交互
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng National Laboratory(鹏城国家实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 具身导航 :embodied agent(abstract);navigation(abstract);分类 cs.RO、cs.CV
AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。
XIT:在未知环境中主动气体分布映射的探索与利用树
专题命中 具身导航 :robotic(abstract);分类 cs.RO
AI总结 XIT通过平衡探索与利用,提升未知环境中自主气体分布映射的效率和质量。
RPL:在复杂地形上学习鲁棒的人形感知移动
专题命中 具身导航 :manipulation(abstract);分类 cs.RO
AI总结 RPL通过两阶段训练框架在复杂地形上实现稳健的多方向人形移动,结合深度蒸馏和增强技术,提升机器人负载下的移动能力。
使用方向和速度自适应人工势场实现无人机在动态环境中的障碍物避障
机构 * Department of Aerospace Engineering, Indian Institute of Technology Kharagpur(航空航天工程系,印度理工学院Kharagpur)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 本文提出一种基于方向和速度自适应的人工势场方法,结合模型预测控制实现无人机在动态环境中的高效避障与安全导航。
MDCPP:面向工作负载自适应的多机器人动态覆盖路径规划
机构 * School of Electrical and Automation Engineering, Nanjing Normal University(南京师范大学电气与自动化工程学院) ; Computer, Electrical, and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(王国 Abdullah 科学与技术大学计算机、电气和数学科学与工程系)
专题命中 具身导航 :robotic(abstract);分类 cs.RO
AI总结 针对多机器人覆盖路径规划恒速假设不适用于空间变化遍历速度的问题,提出MDCPP方法,经600次基准测试和3台UGV实验,验证其在强异质性下可改善总完成时间并实现空间速度自适应。
PageGuide: 一款辅助用户在网页上导航和查找信息的浏览器扩展
专题命中 具身导航 :navigation(abstract)
AI总结 PageGuide通过视觉叠加将LLM回答与HTML DOM结合,帮助用户快速定位信息、逐步指导操作并隐藏干扰内容,提升浏览效率和准确性。
加权协方差交叠用于多车系统的基于范围的分布式协作定位
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出加权协方差交叠方法,用于改进多车系统在三维空间中的分布式协作定位性能,提升鲁棒性和可扩展性。
Comments This manuscript has been published in IEEE Transactions on Vehicular Technology. The final version is available at DOI: this https URL (https://doi.org/10.1109/TVT.2026.3715359)
GigaBrain-WBC-0.5:一种用于与环境交互的鲁棒全身控制的行为世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 该研究提出首个用于人形机器人全身控制的行为世界模型GigaBrain-WBC-0.5,通过训练因果Transformer联合预测动作、状态与指令分布,在多场景下实现鲁棒控制,成功率优于现有基线。
Comments 20 pages, 8 figures, 4 tables. Technical report. Project page: this https URL (https://shepherd1226.github.io/gigabrain-wbc-0.5/)
支持种群规模扩展的多智能体世界建模
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。
Comments Technical report. Project page: this https URL (https://rhos.ai/research/khora). Online demo: this https URL (https://ophilus.ai/khora)