arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 503 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 503 篇

2510.14768 2026-08-07 cs.RO 版本更新 57%

CADRE: Dynamic Catching via Implicit Contact Descriptors and Task-Appropriate Recovery Affordances

CADRE:基于隐式接触描述符和任务适配恢复可供性的动态抓取

Fan Yang, Zixuan Huang, Abhinav Kumar, Sergio Aguilera Marinovic, Soshi Iba, Rana Soltani Zarrin, Dmitry Berenson

机构 * Honda Research Institute USA(本田美国研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对灵巧操作中物体掉落的问题,提出CADRE强化学习框架,结合NDF提取接触特征与隐式恢复可供性函数,可高效成功恢复并零样本泛化到不同几何的未见物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15890 2026-08-06 cs.CV 版本更新 57%

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02915 2026-08-06 cs.RO 版本更新 57%

Zero-shot Sim2Real Transfer for Magnet-Based Tactile Sensor on Insertion Tasks

基于磁敏触觉传感器的零样本仿真到真实迁移在插入任务中的应用

Beining Han, Abhishek Joshi, Jia Deng

机构 * Princeton University(普林斯顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对磁敏触觉传感器的仿真到真实差距问题,提出新型GCS技术,实现了盲插入任务中基于原始触觉读数的RL策略零样本仿真到真实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07622 2026-08-05 cs.RO 版本更新 57%

Continuous and large-scale: ELEANOR, the soft architected arm inspired by the elephant trunk

连续且大规模:受象鼻启发的软结构手臂ELEANOR

Giovanna A. Naselli, Anderson B. Nardin, Seonggun Joe, Ryan Drinkwater, Enrico Donato, Diego Bianchi, Egidio Falotico, Michel C. Milinkovitch, Lucia Beccai

机构 * Soft BioRobotics Perception Laboratory, Istituto Italiano di Tecnologia(软生物机器人感知实验室,意大利理工学院) Department of Autonomous Systems Engineering, Korea Aerospace University(自主系统工程系,韩国航空航天大学) Photocentric Ltd.(Photocentric公司) BRAIR lab, The BioRobotics Institute, Scuola Superiore Sant’Anna(BRAIR实验室,生物机器人研究所,圣安娜高等学院) Laboratory of Artificial and Natural Evolution, Department of Genetics and Evolution, University of Geneva(人工与自然进化实验室,基因与进化系,日内瓦大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 以非洲象鼻为模型,提出注重结构连续性和动态特性的设计方法,通过3D打印构建结合腱驱动的连续体手臂,实现对不同物体的全身抓握,突出了仿生设计在机器人技术中的应用及与生物象鼻的比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08469 2026-08-05 cs.RO cs.SY eess.SY 版本更新 57%

Electrostatic Clutch-Based Mechanical Multiplexer with Increased Force Capability

基于静电离合器的机械多路复用器及其增强的力能力

Timothy E. Amish, Jeffrey T. Auletta, Chad C. Kessens, Joshua R. Smith, Jeffrey I. Lipton

机构 * Dept of Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) US Army Research Directorate, DEVCOM Army Research Laboratory(美国陆军研究署, DEVCOM陆军研究实验室) Mechanical and Industrial Engineering Department of Northeastern University(东北大学机械与工业工程系)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于静电 capstan 离合器的机械多路复用器,实现单电机同时和顺序控制,展示在四自由度腱驱动机器人手中,单电机输出力达212N,垂直抓力提升4.09倍,水平承载力达111.2N。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 57%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 57%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03557 2026-08-04 cs.RO 版本更新 57%

CoorGrasp: Coordinated Contact Control for Adaptive Dexterous Grasping Under Uncertainty

CoorGrasp:不确定性下自适应灵巧抓取的协调接触控制

Mingrui Yu, Yongpeng Jiang, Yongyi Jia, Yi Ren, Xiang Li

机构 * BNRist(北京信息科学与技术国家研究中心)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 研究在形状和位置不确定时灵巧抓取执行问题,提出触觉驱动模型预测控制器,强调多接触协调,有协调感知相分离等三个创新点,经仿真和实验验证,提高了抓取成功率并减少物体不必要移动。

Comments Accepted by ICRA 2026. Best Poster Award at ICRA 2026 Workshop on Dexterity with Multifingered Hands: Hardware, Sensing, and Skills. Project Website: https://ada-grasp-ctrl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07386 2026-08-04 cs.RO 版本更新 57%

Spline Policy: A Structured Representation for Robot Policies

样条策略:机器人策略的结构化表示

Mengze Tian, Yiming Li, Sichao Liu, Auke Ijspeert, Sylvain Calinon

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)) Idiap Research Institute(Idiap研究 institute)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出样条策略(SP),用样条参数替代动作块,保留策略主干,支持连续轨迹解码、时域重采样、参数空间编辑及下游控制,并具有局部修正机制。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16056 2026-08-04 cs.SD cs.AI 版本更新 57%

AST: Adaptive, Seamless, and Training-Free Precise Speech Editing

AST:自适应、无缝且无需训练的精确语音编辑

Sihan Lv, Yechen Jin, Zhen Li, Jintao Chen, Jinshan Zhang, Ying Li, Jianwei Yin, Meng Xi

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Innovation and Management Center of the School of Software (Ningbo), Zhejiang University(浙江大学软件学院(宁波)创新与管理中心) Institute of Remote Sensing Satellite, China Academy of Space Technology(中国空间技术研究院遥感卫星研究所) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出AST框架,通过预训练自回归TTS模型实现精确语音编辑,引入潜变量重组和自适应弱事实引导,提升编辑区域的时序一致性和语音质量,同时引入LibriSpeech-Edit数据集和WDTW指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20635 2026-08-04 cs.CV 版本更新 57%

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

iMontage:统一、多功能、高度动态的多对多图像生成

Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。

Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06945 2026-08-04 cs.CV 版本更新 57%

Direct and Adaptable Mesh-Gaussian Scene Reconstruction from Multi-View Images

从多视图图像进行直接且可自适应的网格-高斯场景重建

Ancheng Lin, Tianqing Su, Zuo Yuan, Quanke Su, Samuel S. Mao, Yusheng Xiang

机构 * School of Computer Science, Australian Artificial Intelligence Institute (AAII)(计算机科学学院,澳大利亚人工智能研究所) University of Technology Sydney(悉尼技术大学) School of Automobile(汽车学院) Chang’an University(长安大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 该研究针对现有方法分离几何与外观建模的问题,提出端到端网格-高斯场景表示,实现直接联合学习,提升重建效率与质量,可高效适配局部场景修改,支撑具身智能相关环境维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23332 2026-08-03 cs.LG 版本更新 57%

AllocBench: Measuring Online Tool Allocation Capability in LLM Agents

AlloBench:测量大语言模型智能体中的在线工具分配能力

Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07663 2026-08-03 cs.GT cs.CR cs.LG 版本更新 57%

Quotient Semivalues for False-Name-Resistant Data Attribution

商数半值用于抗虚假身份的数据归因

Florian A. D. Burnat, Brittany I. Davidson

机构 * School of Management, University of Bath, UK(巴斯大学管理学院,英国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本文提出商数半值机制,通过证据支持的归因集群计算Shapley、Banzhaf或Beta值,以对抗虚假身份操纵,证明在固定单调数据价值游戏中,精确Shapley公平归因与无限制抗虚假身份性不可兼得,并在DataMarket-Gym中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25802 2026-07-30 cs.CV 版本更新 57%

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

用于视频对象插入和层分解的显式层建模

Kyujin Han, Seungjoo Shin, Sunghyun Cho

机构 * POSTECH(浦项科技大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究针对视频编辑系统缺乏显式分层表示的问题,提出TriLayer数据集及DBL-Diffusion框架,用于视频对象插入和层分解任务,显著提升了插入保真度和分解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30555 2026-07-30 cs.AI cs.MA 版本更新 57%

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

语言防火墙:多智能体系统路由中的几何防御

Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson

机构 * Dvir Alsheich Adar Peleg Ben Hagag Rom Himelstein Amit Levi Avi Mendelson

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出ANTAP架构,通过主动能力测试替代间接代理,将性能蒸馏为语义空间中的行为算子,实现非文本代数投影路由,有效防御描述注入和嵌入攻击。

Comments 8 pages (9 more for appendix), 3 figures. Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00537 2026-07-30 cs.RO 版本更新 57%

PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking

PACE: 面向动作分块策略的相位感知分块执行方法

Junnan Nie, Jiayi Li, Jiachen Zhang, Junyi Lao, Chenghao Liu, Tianle Zhang, Liang Lin, Songfang Huang

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出PACE方法,通过在线预测动作分块中的低速过渡点作为重规划边界,自适应选择执行步长,无需重新训练即可提升机器人策略成功率。

Comments 21 pages, 7 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25112 2026-07-30 cs.CL cs.AI 版本更新 57%

Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory

大语言模型知道它们知道什么吗?基于信号检测理论测量元认知效率

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究员)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文基于信号检测理论中的元认知敏感性,提出新的评估框架,发现不同模型的元认知效率差异显著,且受领域影响,温度调整影响置信度策略而非元认知能力,证明AUROC_2和M-ratio指标回答不同评估问题。

Comments 12 pages, 4 figures, 3 tables. v3 corrects a differential length bias in the automated correctness scorer, validated against 1,830 human adjudications; all analyses recomputed. The inverse accuracy-efficiency coupling in v1/v2 does not survive relabelling; see the version note on page 1. Pre-registered. Code and annotations: github.com/synthiumjp/metacognition-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14914 2026-07-29 cs.CV 版本更新 57%

Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes

超越提示:无条件3D反演用于分布外形状

Victoria Yue Chen, Emery Pierson, Léopold Maillard, Maks Ovsjanikov

机构 * ETH Zürich(苏黎世联邦理工学院) École Polytechnique(巴黎高等理工学院) Dassault Systèmes(达索系统)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究揭示了文本驱动生成模型在3D形状生成中的局限性,提出通过解耦几何表示与语言敏感性来提升无条件生成的鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11548 2026-07-29 cs.CY cs.AI cs.CL 版本更新 57%

Fairness Is Not Enough: Auditing Competence and Intersectional Bias in AI-powered Resume Screening

公平还不够:人工智能驱动的简历筛选中的能力审核与交叉性偏差

Kevin T Webster

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究对八个用于简历筛选的AI平台进行审核,通过实验发现其存在情境依赖和交叉性的种族及性别偏差,部分看似无偏差的模型无评估能力,仅公平评估不足,进而提出双重验证框架以确保AI负责任部署。

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18975 2026-07-29 cs.LG 版本更新 57%

Invariance Pair Guidance: Robustness to Spurious Correlations via Corrective Gradients

不变性对引导:通过校正梯度实现对抗虚假相关性的鲁棒性

Martin Surner, Abdelmajid Khelil, Ludwig Bothmann

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 提出不变性对引导(IPG)方法,利用稀疏的反事实对和双更新机制动态校正优化轨迹,减少模型对虚假相关性的依赖,在多个数据集上验证了有效性。

Comments This version of the article has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections. The Version of Record is available online at: https://doi.org/10.1007/s10994-026-07092-0

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06989 2026-07-28 cs.RO cs.SY eess.SY 版本更新 57%

Ace! Motion Planning of Professional-Level Table Tennis Serves with a Robot Arm

王牌!用机器人手臂进行专业水平乒乓球发球的运动规划

Guillem Torrente, Guilherme Jorge Maeda, Divij Grover, Megumu Tsukamoto, Hamdi Sahloul, Peter Dürr

机构 * Sony AI, Tokyo, Japan(索尼人工智能,东京,日本) Sony AI, Zürich, Switzerland(索尼人工智能,苏黎世,瑞士) Sony Group Corporation, Tokyo, Japan(索尼集团公司,东京,日本)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 研究乒乓球机器人发球问题,结合运动原语、模型预测控制和贝叶斯优化方法,实现符合官方规则发球,自旋高达550rad/s,速度达6.7m/s,表现与精英球员相当甚至更优。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新 57%

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02063 2026-07-28 cs.CV 版本更新 57%

ORGAN: Object-Centric Representation Learning using Cycle Consistent Generative Adversarial Networks

ORGAN:基于循环一致生成对抗网络的对象中心表示学习

Joël Küchler, Ellen van Maren, Vaiva Vasiliauskaitė, Katarina Vulić, Reza Abbasi-Asl, Stephan J. Ihle

机构 * Laboratory of Biosensors and Bioelectronics, Institute for Biomedical Engineering, University and ETH Zurich(生物传感器与生物电子实验室,生物医学工程研究所,大学和ETH苏黎世分校) Department of Neurology, Insel Gruppe, Bern, Switzerland(神经病学系,因塞格鲁普,瑞士伯恩) University of California, San Francisco, USA(加州大学旧金山分校,美国) Department of Neurobiology, University of Chicago, 951 E 58th St, Chicago, 60637, IL, USA(神经生物学系,芝加哥大学,951 E 58th St, 奇克阿哥,60637, IL, 美国) Department of Physics, University of Chicago, 929 E 57th St, Chicago, 60637, IL, USA(物理学系,芝加哥大学,929 E 57th St, 奇克阿哥,60637, IL, 美国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 ORGAN通过循环一致生成对抗网络实现对象中心表示学习,在合成数据集上表现优异,并能处理现实世界中具有众多对象和低对比度的数据。

Comments GitHub: https://github.com/Hullimulli/ORGAN

Journal ref Artificial Intelligence Applications and Innovations (AIAI 2026), IFIP Advances in Information and Communication Technology, vol. 792, pp. 94-111, Springer (2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02024 2026-07-27 cs.AI 版本更新 57%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 57%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08797 2026-07-27 cs.CV 版本更新 57%

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新 57%

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16577 2026-07-22 cs.CV cs.GR 版本更新 57%

CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation

CNS-Edit++:基于耦合神经形状表示的类别无关3D编辑

Jingyu Hu, Weilong Yan, Zhengzhe Liu, Haipeng Li, Ka-Hei Hui, Hao Zhang, Chi-Wing Fu

机构 * The Chinese University of Hong Kong(香港中文大学) Lingnan University(岭南大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Autodesk AI Lab(欧特克人工智能实验室) Simon Fraser University(西蒙弗雷泽大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究提出基于耦合神经形状表示和神经特征体积优化的潜在空间3D形状编辑框架CNS-Edit++,能在特定类别和类别无关模型上实例化,有多种编辑操作符及区域控制机制,经评估其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02838 2026-07-22 cs.SI cs.LG 版本更新 57%

Beyond Content: Behavioral Policies Reveal Actors in Information Operations

超越内容:行为策略揭示信息操作中的行为者

Philipp J. Schneider, Lanqin Yuan, Marian-Andrei Rizoiu

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 通过分析用户行为策略而非内容,有效识别恶意行为者,提升信息操作检测的鲁棒性和跨平台适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏