arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 22125 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22125 篇

2606.24403 2026-06-24 cs.RO cs.LG 新提交 81%

RE4: Transformation-aware Imitation of Object Interactions Using Manipulation Modes

RE4: 使用操作模式进行物体交互的变换感知模仿

Arsh Chawla, Rahul Shome

机构 * Australian National University(澳大利亚国立大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 提出RE4框架,通过轻量级自监督姿态估计和操作模式感知的检索、变换、重规划与执行,在保持可解释性的同时提升物体交互模仿学习的性能和鲁棒性。

Comments 8 pages, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22143 2026-06-23 cs.RO cs.GT cs.LG 新提交 81%

Physics-Informed Eikonal Caging for Whole-Arm Manipulation Planning

基于物理信息的Eikonal笼形约束的全臂操作规划

Yan Zhang, Yiming Li, Yifei Dong, Florian T. Pokorny, Sylvain Calinon

机构 * Idiap Research Institute(Idiap 研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 提出将笼形约束重新表述为最小时间逃逸问题,利用物理信息神经网络近似满足Eikonal方程的逃逸时间场,实现全臂操作规划中的鲁棒性提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22113 2026-06-23 cs.RO cs.AI 新提交 81%

KITE: Decoupling Kinematics and Interaction for Zero-Shot Cross-Embodiment Manipulation

KITE:解耦运动学和交互以实现零样本跨实体操作

Qianxu Wang, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出KITE框架,通过解耦任务推理与实体特定运动控制,利用接触模式学习交互意图的潜在表示,实现零样本跨实体操作迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18276 2026-06-23 cs.RO cs.AI 版本更新 81%

GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation

GAPartManip:面向材料无关铰接物体操作的大规模部件中心数据集

Wenbo Cui, Chengyang Zhao, Songlin Wei, Jiazhao Zhang, Haoran Geng, Yaran Chen, Haoran Li, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Galbot

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出大规模部件中心数据集GAPartManip,结合照片级材质随机化和部件级交互姿态标注,通过模块化框架提升深度估计与交互姿态预测,在仿真和真实场景中实现鲁棒的铰接物体操作。

Comments Accepted by ICRA 2025. Project page: https://pku-epic.github.io/GAPartManip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20272 2026-06-19 cs.RO cs.CV 新提交 81%

Efficiently Linking Real Scenes with Synthetic Data Generation for AI-based Cognitive Robotics and Computer Vision Applications

高效连接真实场景与合成数据生成以支持基于AI的认知机器人和计算机视觉应用

Paul Koch, Vivek Chavan, André Sers, Adem Karakurt, Paul Hofmann, Mohamad Zaher Ziadeh, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫生产设备和设计技术研究所) TU Berlin(柏林工业大学)

专题命中 机器人操作 :robotics(title,abstract);分类 cs.RO、cs.CV

AI总结 本文讨论当前AI视觉模型在认知机器人应用中的局限,并提出通过连接仿真与真实世界训练数据生成来弥合领域差距的方法。

Comments Accepted and best paper award at MHI-Kolloquium 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17463 2026-06-17 cs.CV cs.RO 新提交 81%

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation

WeaveLA: 面向重复机器人操作的基于事件驱动的跨子任务潜在记忆编织

Shoujing Zhu, Zhenyang Liu, Fungmiu Wang, Jiafeng Wang, Bo Yue, Guiliang Liu, Simo Wu, Xiangyang Xue, Taiping Zeng

机构 * Fudan University(复旦大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shanghai Innovation Institute(上海创新研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 针对短窗口VLA策略缺乏跨子任务信息传递的问题,提出WeaveLA,通过事件触发将完成子任务压缩为潜在令牌并注入下一子任务的动作生成路径,在保持基础策略短窗口接口的同时实现轻量级跨子任务通道,在困难重复任务上成功率从0%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31286 2026-06-17 cs.RO cs.AI 版本更新 81%

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型

Taiyi Su, Jian Zhu, Tianjian Wang, Youzhang He, Zitai Huang, Jianjun Zhang, Chong Ma, Hanyang Wang, Tianjiao Zhang, Munan Yin, Weihao Ding, Yi Xu

机构 * Tongji University(同济大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交 81%

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14466 2026-06-15 cs.SD cs.AI cs.LG 新提交 81%

The Perceived Fragility of Explanations in Audio Models: Manipulation of Attribution with Unchanged Predictions

音频模型中解释的感知脆弱性:在预测不变的情况下操纵归因

Piotr Kitłowski, Dominik Wiącek, Mateusz Modrzejewski

机构 * University of Warsaw(华沙大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种心理声学框架,通过优化不可听扰动来解耦模型归因与分类,证明在音频深度伪造检测中可系统扭曲解释热图而保持预测标签不变。

Comments Accepted to the ICML 2026 Workshop on Machine Learning for Audio: 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20348 2026-06-11 cs.RO cs.AI cs.MA 版本更新 81%

Bimanual Robot Manipulation via Multi-Agent In-Context Learning

通过多智能体上下文学习的双臂机器人操作

Alessio Palma, Indro Spinelli, Vignesh Prasad, Luca Scofano, Yufeng Jin, Georgia Chalvatzaki, Fabio Galasso

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) TU Darmstadt(达姆施塔特技术大学) Hessian.AI(黑森AI)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出BiCICLe框架,将双臂操作建模为多智能体主从问题,通过解耦动作空间实现标准LLM的少样本学习,在TWIN基准上平均成功率70.5%,超越无训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09459 2026-06-11 cs.CV cs.AI 版本更新 81%

RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization

RelayFormer: 一种用于可扩展图像和视频篡改定位的统一局部-全局注意力框架

Wen Huang, Jiarui Yang, Tao Dai, Jiawei Li, Shaoxiong Zhan, Bin Wang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) College of Artificial Intelligence, Nankai University(南开大学人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 提出RelayFormer统一框架,通过全局局部中继(GLR)令牌和中继注意力机制,适应不同分辨率并统一处理图像与视频,在篡改定位任务中实现高效且性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08903 2026-06-08 cs.RO cs.AI 81%

3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning

面向机器人任务规划的3D grounded视觉-语言框架:自动化提示合成与监督推理

Guoqin Tang, Qingxuan Jia, Zeyuan Huang, Gang Chen, Ning Ji, Zhipeng Yao

机构 * Tsinghua University(清华大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出融合2D提示合成模块和小语言模型的框架,提升机器人3D场景理解与任务执行能力,实验显示任务成功率高达96.0%。

Journal ref Engineering Applications of Artificial Intelligence, vol. 164, p. 113268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06218 2026-06-05 cs.RO cs.AI 81%

TAM: Torque Adaptation Module for Robust Motion Transfer in Manipulation

TAM: 用于鲁棒操作运动传递的扭矩自适应模块

Dongwon Son, Florian Shkurti, Jason Lee, Naman Shah, Beomjoon Kim, Dieter Fox

机构 * KAIST(韩国科学技术院) Allen Institute for AI(人工智能研究院) University of Toronto(多伦多大学) University of Washington(华盛顿大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出扭矩自适应模块(TAM),通过历史编码器和扭矩适配器修正扭矩指令,实现不同机器人或负载间的运动传递,无需领域随机化或重新收集数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.05095 2026-06-04 cs.LG cs.RO cs.SY eess.SY 81%

Learning Dexterous Manipulation Policies from Experience and Imitation

从经验与模仿中学习灵巧操作策略

Vikash Kumar, Abhishek Gupta, Emanuel Todorov, Sergey Levine

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文研究了通过经验与模仿学习反馈控制灵巧五指手非抓取操作的任务,提出基于轨迹优化的局部控制器,并通过深度学习和最近邻方法进行泛化,展示了小数据训练下的有效性和盲操作优势。

Comments Initial draft for a journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.03628 2026-06-04 cs.RO cs.LG cs.SY eess.SY 81%

Co-active Learning to Adapt Humanoid Movement for Manipulation

协同学习以适应人形机器人的运动用于操作

Ren Mao, John S. Baras, Yezhou Yang, Cornelia Fermuller

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出协同学习框架,通过人机交互适应机器人末端执行器的运动以应对不同约束环境,实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03134 2026-06-03 cs.RO cs.LG 81%

How Visible Are Silent Manipulation Failures? An Observability Study of False-Success Detection in Simulated Robot Episodes

无声操作失败的可见性:模拟机器人任务中假成功检测的可观测性研究

Aarav Bedi

机构 * Aarav Bedi

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 本研究通过模拟双机械臂ALOHA任务,探讨机器人自身成功检测器标记为成功的任务中,假成功(实际失败但被误判为成功)的可恢复性,发现基于关节数据的检测器在方块转移任务中几乎完全可恢复假成功,而在插销任务中仅部分可恢复,视觉检测器可弥补差距,且可分离性依赖于远低于实际传感器噪声的速度差异。

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11460 2026-06-02 cs.RO cs.LG 81%

Semantic-Geometric Task Representations for Bimanual Manipulation from Human Demonstrations to Robot Action Planning

面向双臂操作的语义-几何任务表示:从人类示范到机器人动作规划

Franziska Herbert, Vignesh Prasad, Han Liu, Dorothea Koert, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, Computer Science Dept., TU Darmstadt, Germany(图腾大学达姆施塔特分校计算机科学系交互机器人感知与学习实验室) Hessian.AI, Darmstadt, Germany(黑森人工智能公司) Robotics Institute Germany (RIG)(德国机器人研究所) Interactive AI Algorithms & Cognitive Models for Human-AI Interaction (IKIDA), Computer Science Dept., TU Darmstadt, Germany(人机交互的交互人工智能算法与认知模型(IKIDA),图腾大学达姆施塔特分校计算机科学系) Center for Cognitive Science, TU Darmstadt, Germany(图腾大学达姆施塔特分校认知科学中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 提出一种语义-几何图任务表示,通过消息传递神经网络编码器和Transformer解码器联合编码对象身份、语义关系和运动历史,实现从人类示范中学习结构化任务表示,并支持跨实体迁移和双臂操作规划。

Comments 9 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28231 2026-05-28 cs.RO cs.LG 81%

ProgVLA: Progress-Aware Robot Manipulation Skill Learning

ProgVLA:进度感知的机器人操作技能学习

Seungsu Kim, Jinyoung Choi, Seungmin Baek, Jean-Michel Renders

机构 * NAVER LABS(NAVER实验室) NAVER LABS Europe(NAVER实验室欧洲)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 提出ProgVLA,一种紧凑的视觉-语言-动作模型,通过显式表示任务进度和两阶段Perceiver重采样机制,在有限计算和内存下实现长序列多模态处理,并在多任务操作基准上达到或超越大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27724 2026-05-28 cs.RO cs.AI 81%

HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning

HumanoidMimicGen: 通过全身规划生成行走操作数据

Kevin Lin, Ajay Mandlekar, Caelan Reed Garrett, Nikita Chernyadev, Yu Fang, Runyu Ding, Yuqi Xie, Justin Tran, Linxi Fan, Yuke Zhu

机构 * NVIDIA The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出HumanoidMimicGen方法,通过全身规划自动生成人形机器人行走操作演示数据,在模拟基准上使联合训练的策略性能提升20%。

Comments website: https://humanoidmimicgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27129 2026-05-27 cs.CV cs.RO 81%

YOLO26-RipeLoc Lite: A lightweight architecture for tomato ripeness detection and picking point localization in greenhouse robotic harvesting

YOLO26-RipeLoc Lite:用于温室机器人采摘中番茄成熟度检测与采摘点定位的轻量级架构

Rajmeet Singh, Manveen Kaur, Shahpour Alirezaee, Irfan Hussain

机构 * Department of Mechanical Engineering(机械工程系) Khalifa University(卡利法大学) University of Windsor(温莎大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 提出基于YOLO26的轻量级架构YOLO26-RipeLoc Lite,通过轻量特征金字塔网络、成熟度感知注意力模块和紧凑检测头,实现温室番茄的成熟度分类与中心点定位,在仅2.38M参数下达到92.9% mAP@0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08059 2026-05-27 cs.RO cs.AI 81%

Governed Capability Evolution: Lifecycle-Time Compatibility Checking and Rollback for AI-Component-Based Systems, with Embodied Agents as Case Study

受治理的能力演化:基于AI组件的系统的生命周期兼容性检查与回滚——以具身智能体为例

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦德大学马来西亚分校数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所)

专题命中 机器人操作 :embodied agent(title);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对基于AI组件的系统,提出一种受治理的能力演化框架,通过四类兼容性检查和七阶段升级管线实现安全部署,在具身智能体实验中实现零不安全激活。

Comments 42 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20174 2026-05-20 cs.CV cs.LG 81%

Multi-axis Analysis of Image Manipulation Localization

多轴分析图像操纵定位

Keanu Nichols, Divya Appapogu, Giscard Biamby, Dina Bashkirova, Anna Rohrbach, Bryan A. Plummer

机构 * Boston University(波士顿大学) University of California, Berkeley(加州大学伯克利分校) Technical University of Darmstadt(德累斯顿技术大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出AUDITS基准,用于多轴分析图像操纵检测,通过不同领域转移类型评估现有方法的鲁棒性,以推动更可靠和通用的图像操纵检测方法的发展。

Comments 28 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18556 2026-05-19 cs.RO cs.AI 81%

Key-Gram: Extensible World Knowledge for Embodied Manipulation

Key-Gram: 用于具身操作的可扩展世界知识

Jingjing Fan, Siyuan Li, Botao Ren, Zhidong Deng

机构 * Department of Computer Science and Technology(计算机科学与技术系) Department of Automation(自动化系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出Key-Gram框架,通过分离语言知识与视觉状态推理,提升具身控制中对组合语言指令的理解和执行能力,主要贡献是引入可扩展的外部记忆模块以提高迁移和现实世界操作性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17310 2026-05-19 cs.CV cs.AI 81%

Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models

注意力劫持:跨查询的视觉-语言模型响应操控

Zhiqiang Wang, Dongrui Liu, Yan Li, Zonghao Ying, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文研究了视觉-语言模型中跨查询响应操控问题,提出了一种新的对抗攻击方法Attention Hijacking,通过引导内部注意力分布保持图像主导模式,提高攻击在不同查询下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13067 2026-05-14 cs.RO cs.AI 81%

When Absolute State Fails: Evaluating Proprioceptive Encodings for Robust Manipulation

当绝对状态失效:评估本体感觉编码以实现鲁棒操作

Maxime Alvarez, Ryo Watanabe, Paul Crook, Afshin Zeinaddini Meymand, Suvin Kurian, Pablo Ferreiro, Genki Sano

机构 * TELEXISTENCE Inc, Foundation Model Division(TELEXISTENCE公司基础模型部门) The University of Tokyo(东京大学)

专题命中 机器人操作 :manipulation(title);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究探讨了本体感觉状态编码策略,通过系统分析联合表示发现,简单的回合间相对框架在任务性能与鲁棒性之间提供了最佳平衡,优于基线方法。

Comments Accepted to ICRA 2026 Workshop: From Data to Decisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12826 2026-05-14 cs.CV cs.AI 81%

FRAME: Forensic Routing and Adaptive Multi-path Evidence Fusion for Image Manipulation Detection

FRAME:图像篡改检测的取证路由与自适应多路径证据融合

Kaixiang Zhao, Tianrun Yu, Aoxu Zhang, Junhao Su, Porter Jenkins, Amanda Hughes

机构 * Brigham Young University Rutgers University

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 FRAME通过多路径分析空间整合多种取证算法,自适应选择信息量大的路径并融合互补证据,提升图像篡改检测与定位性能。

Comments Accepted to CVPR 2026 SAFE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12167 2026-05-13 cs.RO cs.CV 81%

From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation

从想象的未来到可执行的动作:用于机器人操作的潜在动作混合

Yajie Li, Bozhou Zhang, Chun Gu, Zipei Ma, Jiahui Zhang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出MoLA,一种面向控制的接口,将想象的未来视频转化为可执行的表示,通过混合预训练的逆动力学模型,提升机器人操作的稳定性和通用性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11203 2026-05-13 cs.LG cs.CV 81%

FeatMap: Understanding image manipulation in the feature space and its implications for feature space geometry

FeatMap: 在特征空间中理解图像篡改及其对特征空间几何的影响

Elias B. Krey, Nils Neukirch, Nils Strodthoff

机构 * Division AI4Health(AI4Health部门) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV、cs.LG

AI总结 本文通过在输入空间中应用多种篡改方法,探讨特征空间中的映射学习,发现线性模型在特征空间中能有效重建复杂语义篡改。

Comments 27 pages, 24 figures, 3 tables, Code is available at https://github.com/AI4HealthUOL/FeatMap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11192 2026-05-13 cs.SD cs.AI cs.LG 81%

Exploring Token-Space Manipulation in Latent Audio Tokenizers

探索潜在音频标记器中的标记空间操控

Francesco Paissan, Luca Della Libera, Mirco Ravanelli, Cem Subakan

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LATTE,通过在音频特征序列后添加固定可学习潜在标记,实现标记空间编辑,支持低比特率语音编码中的可控音频操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG 81%

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏