arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 22125 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22125 篇

2602.06504 2026-02-09 cs.RO cs.CV 81%

MultiGraspNet: A Multitask 3D Vision Model for Multi-gripper Robotic Grasping

MultiGraspNet:一种多任务3D视觉模型用于多机械手抓取

Stephany Ortuno-Chanelo, Paolo Rabino, Enrico Civitelli, Tatiana Tommasi, Raffaello Camoriano

机构 * VANDAL Laboratory, Department of Control and Computer Engineering, Politecnico di Torino(沃纳达实验室,控制与计算机工程系,都灵理工大学) Comau S.p.A., Advanced Automation Solutions(Comau S.p.A.,先进自动化解决方案) Istituto Italiano di Tecnologia(意大利技术研究所)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 MultiGraspNet是一种多任务3D视觉模型,通过统一框架同时预测平行和真空机械手的抓取姿态,提升机器人在复杂环境中的抓取能力和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22153 2026-01-30 cs.RO cs.CV 81%

DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation

DynamicVLA: 一种用于动态物体操控的视觉-语言-动作模型

Haozhe Xie, Beichen Wen, Jiarui Zheng, Zhaoxi Chen, Fangzhou Hong, Haiwen Diao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 DynamicVLA通过整合时间推理和闭环适应,提出了一种用于动态物体操控的视觉-语言-动作模型,提升了响应速度和泛化能力。

Comments Project Page: https://www.infinitescript.com/project/dynamic-vla/ GitHub: https://github.com/hzxie/DynamicVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10111 2026-01-22 cs.CV cs.AI cs.CR 81%

Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization

无需训练的上下文取证链用于图像篡改检测与定位

Rui Chen, Bin Liu, Changtao Miao, Xinghao Wang, Yi Li, Tao Gong, Qi Chu, Nenghai Yu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 ICFC提出一种无需训练的多模态大语言模型框架,用于图像篡改检测与定位,通过可解释的推理流程实现高效且准确的图像分析。

Comments This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12925 2026-01-21 cs.RO cs.AI 81%

ForeDiffusion: Foresight-Conditioned Diffusion Policy via Future View Construction for Robot Manipulation

ForeDiffusion: 通过未来视图构建实现机器人操作的前瞻性条件扩散策略

Weize Xie, Yi Ding, Ying He, Leilei Wang, Binwen Bai, Zheyi Zhao, Chenyang Wang, F. Richard Yu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 ForeDiffusion通过引入未来视图表示,改进机器人操作中的扩散策略,实现更稳定的性能和更高的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11742 2026-01-13 cs.CV cs.AI 81%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06222 2026-01-13 cs.CV cs.AI 81%

SAPL: Semantic-Agnostic Prompt Learning in CLIP for Weakly Supervised Image Manipulation Localization

SAPL: CLIP中基于语义无关的提示学习用于弱监督图像篡改定位

Xinghao Wang, Changtao Miao, Dianmo Sheng, Tao Gong, Qi Chu, Nenghai Yu, Quanchen Zou, Deyue Zhang, Xiangzheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 SAPL通过语义无关的提示学习和边缘信息利用,提升CLIP在弱监督图像篡改定位中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02778 2026-01-12 cs.RO cs.AI 81%

Closing the Reality Gap: Zero-Shot Sim-to-Real Deployment for Dexterous Force-Based Grasping and Manipulation

弥合现实差距:用于灵巧力控抓取与操作的零样本仿真到现实部署

Zhe Zhao, Haoyu Dong, Zhengmao He, Yang Li, Xinyu Yi, Zhibin Li

机构 * ByteDance Seed(字节跳动种子)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于仿真到现实强化学习的框架,通过触觉和扭矩传感结合建模,实现灵巧手在真实硬件上的可控抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 81%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 81%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV、cs.LG

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17085 2025-12-24 cs.RO cs.LG 81%

Deformable Cluster Manipulation via Whole-Arm Policy Learning

通过全身政策学习实现可变形簇 manipulation

Jayadeep Jacob, Wenzheng Zhang, Houston Warren, Paulo Borges, Tirthankar Bandyopadhyay, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Data61, CSIRO(CSIRO数据61研究所) Orica(奥里卡公司) NVIDIA Corporation(NVIDIA公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于全身政策学习的方法,通过整合3D点云和本体感觉触觉信息,实现对可变形簇的高效操纵,并在输电线路清除任务中展示了零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19684 2025-12-23 cs.CV cs.RO 81%

Zero-shot Reconstruction of In-Scene Object Manipulation from Video

从视频中进行零样本场景物体操作重建

Dixuan Lin, Tianyou Wang, Zhuoyang Pan, Yufu Wang, Lingjie Liu, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Oxford(牛津大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于数据驱动模型的零样本方法,用于从视频中重建场景中的物体操作,通过两阶段优化实现手-物体运动的准确重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18987 2025-12-23 cs.RO cs.CL cs.CV 81%

Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation

语义可感知的多模态检索:基于具身记忆的层次化移动操作

Ryosuke Korekata, Quanting Xie, Yonatan Bisk, Komei Sugiura

机构 * Keio University(keio大学) Keio AI Research Center(keio人工智能研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本研究提出Affordance RAG框架,通过构建具有可操作性的具身记忆,提升机器人在开放词汇移动操作中的检索性能和任务成功率。

Comments Accepted to IEEE RA-L, with presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16103 2025-12-19 cs.LG cs.AI 81%

AIMM: An AI-Driven Multimodal Framework for Detecting Social-Media-Influenced Stock Market Manipulation

AIMM:一种基于人工智能的多模态框架,用于检测受社交媒体影响的股市操纵

Sandeep Neela

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 AIMM通过融合社交媒体和市场数据,提出了一种人工智能驱动的多模态框架,用于检测社交媒体影响的股市操纵,并展示了其在GME事件中的早期预警能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00866 2025-12-15 cs.RO cs.AI 81%

3DSGrasp: 3D Shape-Completion for Robotic Grasp

3DSGrasp:用于机器人抓取的3D形状补全

Seyed S. Mohammadi, Nuno F. Duarte, Dimitris Dimou, Yiming Wang, Matteo Taiana, Pietro Morerio, Atabak Dehban, Plinio Moreno, Alexandre Bernardino, Alessio Del Bue, Jose Santos-Victor

机构 * Vislab, Institute for Systems and Robotics—Lisboa, Instituto Superior Técnico, Universidade de Lisboa, Portugal(葡萄牙里斯本系统与机器人研究所Vislab,理工学院里斯本高等技术大学,里斯本大学) Department of Marine, Electrical, Electronic and Telecommunications Engineering, University of Genoa, Italy(意大利热那亚大学海洋、电气、电子与电信工程系) Pattern Analysis & Computer Vision (PAVIS), Istituto Italiano di Tecnologia (IIT), Genoa, Italy(意大利热那亚理工学院模式分析与计算机视觉(PAVIS)) Deep Visual Learning (DVL), Fondazione Bruno Kessler, Trento, Italy(意大利特伦托布鲁诺·凯瑟基金会深度视觉学习(DVL))

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 3DSGrasp通过基于Transformer的编码器-解码器网络实现3D点云补全,提升机器人抓取的准确性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19086 2025-12-12 cs.RO cs.AI cs.GR 81%

MaskedManipulator: Versatile Whole-Body Manipulation

MaskedManipulator: 通用全身体姿操控

Chen Tessler, Yifeng Jiang, Erwin Coumans, Zhengyi Luo, Gal Chechik, Xue Bin Peng

机构 * NVIDIA Israel(NVIDIA以色列分公司) NVIDIA USA(NVIDIA美国分公司) NVIDIA Canada(NVIDIA加拿大分公司) Simon Fraser University Canada(西蒙·弗雷泽大学加拿大分校) NVIDIA Simon Fraser University(西蒙·弗雷泽大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 MaskedManipulator通过生成控制策略实现通用全身体姿操控,提供直观用户控制和复杂交互行为。

Comments SIGGRAPH Asia 2025 (Project page: https://research.nvidia.com/labs/par/maskedmanipulator/ )

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08580 2025-12-11 cs.RO cs.AI 81%

Mind to Hand: Purposeful Robotic Control via Embodied Reasoning

Mind to Hand: 通过具身推理实现目的性机器人控制

Peijun Tang, Shangjin Xie, Binyan Sun, Baifu Huang, Kuncheng Luo, Haotian Yang, Weiqi Jin, Jianan Wang

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 Lumo-1通过具身推理实现目的性机器人控制,结合视觉语言动作模型提升机器人推理与动作协调能力。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 81%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO 81%

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

专题命中 机器人操作 :embodied agent(title);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20330 2025-12-01 cs.RO cs.CV 81%

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20359 2025-11-26 cs.CV cs.AI 81%

From Passive Perception to Active Memory: A Weakly Supervised Image Manipulation Localization Framework Driven by Coarse-Grained Annotations

从被动感知到主动记忆:一种由粗粒注释驱动的弱监督图像篡改定位框架

Zhiqing Guo, Dongdong Xi, Songlin Li, Gaobo Yang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 BoxPromptIML通过粗粒注释策略和双指导特征融合,实现低注释成本下的高精度图像篡改定位。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11375 2025-11-05 cs.RO cs.LG 81%

Robot Deformable Object Manipulation via NMPC-generated Demonstrations in Deep Reinforcement Learning

Haoyuan Wang, Zihao Dong, Hongliang Lei, Zejia Zhang, Weizhuang Shi, Wei Luo, Weiwei Wan, Jian Huang

机构 * Hubei Key Laboratory of Brain-inspired Intelligent Systems and the Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(湖北脑启发智能系统重点实验室和图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01476 2025-11-04 cs.RO cs.AI 81%

MO-SeGMan: Rearrangement Planning Framework for Multi Objective Sequential and Guided Manipulation in Constrained Environments

Cankut Bora Tuncer, Marc Toussaint, Ozgur S. Oguz

机构 * LIRA Lab, Bilkent University, Turkey(比尔肯大学LIRA实验室,土耳其) LIS Lab, TU Berlin, Germany(柏林技术大学LIS实验室,德国) Department of Computer Engineering, Bilkent University(比尔肯大学计算机工程系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

Comments 8 pages, 8 figures, website:https://sites.google.com/view/mo-segman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25776 2025-10-28 cs.CV cs.AI 81%

Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation

Mingyu Kang, Yong Suk Choi

机构 * Department of Artificial Intelligence, University of Hanyang, Seoul, Korea(人工智能系,翰阳大学,韩国首尔) Department of Computer Science, University of Hanyang, Seoul, Korea(计算机科学系,翰阳大学,韩国首尔)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02992 2025-10-27 cs.AI cs.CL cs.LG 81%

Mitigating Manipulation and Enhancing Persuasion: A Reflective Multi-Agent Approach for Legal Argument Generation

Li Zhang, Kevin D. Ashley

机构 * Intelligent Systems Program University of Pittsburgh Pittsburgh Pennsylvania USA Intelligent Systems Program University of Pittsburgh

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

Comments 13 pages, 2 figures, 2nd ConventicLe on Artificial Intelligence Regulation and Safety Workshop at ICAIL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09389 2025-10-24 cs.RO cs.AI 81%

S$^2$-Diffusion: Generalizing from Instance-level to Category-level Skills in Robot Manipulation

Quantao Yang, Michael C. Welle, Danica Kragic, Olov Andersson

机构 * Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习部门,皇家理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19983 2025-10-20 cs.RO cs.AI 81%

CLASP: General-Purpose Clothes Manipulation with Semantic Keypoints

Yuhong Deng, Chao Tang, Cunjun Yu, Linfeng Li, David Hsu

机构 * School of Computing, Smart System Institute, National University of Singapore, Singapore(计算学院、智能系统研究所、新加坡国立大学,新加坡) Department of Electronic and Electrical Engineering, Southern University of Science and Technology, China(电子与电气工程系、南方科技大学,中国)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07961 2025-10-15 cs.RO cs.AI 81%

BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models

Peiyan Li, Yixiang Chen, Hongtao Wu, Xiao Ma, Xiangnan Wu, Yan Huang, Liang Wang, Tao Kong, Tieniu Tan

机构 * CASIA(中国科学院自动化研究所) ByteDance Seed(字节跳动种子实验室) UCAS(中国科学院大学) FiveAges NJU(南京大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05070 2025-10-09 cs.RO cs.LG 81%

ResMimic: From General Motion Tracking to Humanoid Whole-body Loco-Manipulation via Residual Learning

Siheng Zhao, Yanjie Ze, Yue Wang, C. Karen Liu, Pieter Abbeel, Guanya Shi, Rocky Duan

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) USC(南加州大学) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13055 2025-10-09 cs.RO cs.AI 81%

Mitigating Cross-Modal Distraction and Ensuring Geometric Feasibility via Affordance-Guided and Self-Consistent MLLMs for Task Planning in Instruction-Following Manipulation

Yu-Hong Shen, Chuan-Yu Wu, Yi-Ru Yang, Yen-Ling Tai, Yi-Ting Chen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学) Department of Computer Science and Information Engineering, National Taiwan University(计算机科学与信息工程系,台湾大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01622 2025-10-03 cs.RO cs.LG 81%

VFP: Variational Flow-Matching Policy for Multi-Modal Robot Manipulation

Xuanran Zhai, Qianyou Zhao, Qiaojun Yu, Ce Hao

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏