arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8686 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8686 篇

2505.17760 2026-04-02 cs.LG cs.AI 62%

But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors

但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案

Leon Eshuijs, Archie Chaudhury, Alan McBeth, Ethan Nguyen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent(独立)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00168 2026-04-02 cs.RO cs.AI 62%

Neural-Assisted in-Motion Self-Heading Alignment

神经辅助动态自航向对齐

Zeev Yampolsky, Felipe O. Silva, Adriano Frutuoso, Itzik Klein

机构 * The Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa(海法大学查尼海洋科学学院哈特海洋技术系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出神经辅助框架提升海洋自主平台初始航向估计精度与速度,实验显示精度提升53%并缩短对齐时间67%。

Comments 12 Pages, 10 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG 62%

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 62%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27533 2026-03-31 cs.CV cs.AI 62%

Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation

Demo-Pose: 深度-单目模态融合用于物体姿态估计

Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim

机构 * Samsung Electronics Suwon, Republic of Korea(三星电子水原,韩国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Demo-Pose,通过新颖的多模态融合策略融合单目语义特征与基于深度的图卷积表示,提升物体姿态估计的几何推理能力,在REAL275数据集上优于现有方法。

Comments Accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27441 2026-03-31 cs.CV cs.AI 62%

Evaluating Large and Lightweight Vision Models for Irregular Component Segmentation in E-Waste Disassembly

评估大型和轻量级视觉模型在电子废弃物拆解中不规则组件分割的应用

Xinyao Zhang, Chang Liu, Xiao Liang, Minghui Zheng, Sara Behdad

机构 * Florida State University(佛罗里达州立大学) Texas A&M University(德克萨斯农工大学) University of Florida(佛罗里达大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文通过比较SAM2和YOLOv8模型,评估了模型架构和规模对分割性能的影响,发现YOLOv8在精度和边界精度上优于SAM2,但SAM2在表示多样物体结构上更灵活。

Comments Accepted at ASME MSEC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 62%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17817 2026-03-31 cs.CV cs.RO 62%

Learning Underwater Active Perception in Simulation

在模拟中学习水下主动感知

Alexandre Cardaillac, Donald G. Dansereau

机构 * Australian Centre For Robotics(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering(航空航天、机械与机电工程学院) University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种高效方法,通过多层感知机预测图像质量,以在不同水况下获取高质量资产图像,提升了视觉覆盖和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14375 2026-03-30 cs.CV cs.AI 62%

The Pulse of Motion: Measuring Physical Frame Rate from Visual Dynamics

运动的脉搏:从视觉动态测量物理帧率

Xiangbo Gao, Mingyang Wu, Siyuan Yang, Jiongze Yu, Pardis Taghavi, Fangzhou Lin, Zhengzhong Tu

机构 * Texas A\&M University

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Visual Chronometer,通过视觉动态直接恢复物理帧率,解决视频生成中因训练数据帧率不一致导致的物理运动速度模糊问题,提升生成视频的自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23973 2026-03-26 cs.CV cs.GR cs.RO 62%

SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents

SLAT-Phys:从结构化3D潜在特征快速预测材料属性场

Rocktim Jyoti Das, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 SLAT-Phys通过单张RGB图像直接预测3D资产的空间变化材料属性场,利用预训练的3D资产生成模型的结构化潜在特征,结合轻量级神经解码器,高效估计杨氏模量、密度和泊松比,实现比传统方法更快的材料属性预测。

Comments 8 page, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22102 2026-03-24 cs.CV cs.GR cs.RO 62%

FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

FreeArtGS: 自由移动场景下的关节高斯溅射重建

Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学CFCS) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) PrimeBot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 FreeArtGS通过自由移动部分分割、关节估计和端到端优化,实现高可扩展性的自由移动关节物体重建,实验表明其在真实资产生成中具有实用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15054 2026-03-24 cs.CL cs.AI cs.LG q-bio.BM 62%

MolLangBench: A Comprehensive Benchmark for Language-Prompted Molecular Structure Recognition, Editing, and Generation

MolLangBench: 一种全面的分子结构识别、编辑和生成语言提示基准

Feiyang Cai, Jiahui Bai, Tao Tang, Guijuan He, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) HitGen University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolLangBench,用于评估分子语言接口任务,发现现有模型在分子识别和编辑任务上表现欠佳,生成任务更差,强调了对化学应用中更可靠AI系统的研发需求。

Comments ICLR-2026 Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07698 2026-03-24 cs.CV cs.RO 62%

sim2art: Accurate Articulated Object Modeling from a Single Video using Synthetic Training Data Only

sim2art:仅使用合成训练数据从单个视频准确建模可变形物体

Arslan Artykov, Tom Ravaud, Corentin Sautier, Vincent Lepetit

机构 * LIGM, École Nationale des Ponts et Chaussées, IP Paris, CNRS, France(LIGM实验室,巴黎国立桥梁与道路学院,IP巴黎,法国国家科学研究中心,法国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出sim2art框架,通过单目视频重建可变形物体的3D部分分割和关节参数,采用基于帧表面点采样的稳健表示,无需依赖长期对应关系,实现仿真与现实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12339 2026-03-24 cs.RO cs.CV 62%

SPOT: Point Cloud Based Stereo Visual Place Recognition for Similar and Opposing Viewpoints

SPOT:基于点云的立体视觉位置识别用于相似和对立视角

Spencer Carmichael, Rahul Agrawal, Ram Vasudevan, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of Robotics and the Department of Mechanical Engineering, University of Michigan(机器人学系和机械工程系,密歇根大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SPOT技术,利用立体视觉里程计估计的结构进行对立视角视觉位置识别,通过双距离矩阵序列匹配方法提升识别精度,实验表明在不同光照条件下,SPOT在对立视角识别中达到91.7%的召回率,且存储和运行效率优于现有方法。

Comments Expanded version with added appendix. Published in ICRA 2024. Project page: https://umautobots.github.io/spot

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19936 2026-03-23 cs.CV cs.RO 62%

LIORNet: Self-Supervised LiDAR Snow Removal Framework for Autonomous Driving under Adverse Weather Conditions

LIORNet:一种用于恶劣天气条件下自动驾驶的自监督激光雷达雪清除框架

Ji-il Park, Inwook Shim

机构 * Ministry of National Defense(国防 ministry) Department of Smart Mobility Engineering(智能移动工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LIORNet,通过自监督学习和多物理统计线索生成伪标签,有效区分噪声点与环境结构,提升恶劣天气下激光雷达感知的准确性和鲁棒性。

Comments 14 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06344 2026-03-23 cs.CV cs.LG 62%

Hyper-STTN: Hypergraph Augmented Spatial-Temporal Transformer Network for Trajectory Prediction

Hyper-STTN:基于超图的时空变换网络用于轨迹预测

Weizheng Wang, Baijian Yang, Sungeun Hong, Wenhai Sun, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系和智能系统工程系) Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Hyper-STTN,通过构建多尺度超图和时空变换器,有效建模人群轨迹预测中的群体和个体交互,实验表明其优于现有方法。

Comments To appear in ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24129 2026-03-23 cs.RO cs.CV 62%

Mash, Spread, Slice! Learning to Manipulate Object States via Visual Spatial Progress

Mash, Spread, Slice! 通过视觉空间进展学习操控物体状态

Priyanka Mandikal, Jiaheng Hu, Shivin Dass, Sagnik Majumder, Roberto Martín-Martín, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 SPARTA框架首次统一处理物体状态变化任务,通过空间进展和物体中心变化生成结构化策略观察和密集奖励,提升机器人操控效率和准确性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19074 2026-03-20 cs.RO cs.AI 62%

CAMO: A Conditional Neural Solver for the Multi-objective Multiple Traveling Salesman Problem

CAMO:一种用于多目标多旅行商问题的条件神经求解器

Fengxiaoxiao Li, Xiao Mao, Mingfeng Fan, Yifeng Zhang, Yi Li, Tanishq Duhan, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) China Unicom Shenzhen Branch(中国unicom深圳分公司) Central South University(中南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 CAMO提出一种条件神经求解器,解决多目标多旅行商问题,通过融合偏好和协作解码器实现多目标权衡,实验显示其在求解帕累托前沿方面表现优异。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 62%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18623 2026-03-20 cs.CV cs.AI 62%

OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data

OpenT2M:无花车运动生成:开源、大规模、高质量数据

Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu

机构 * CASIA(中国科学院自动化研究所) UCAS(乌拉尔联邦大学) BAAI(北京人工智能研究院) RUC(哈尔滨工业大学) PKU(北京大学) BeingBeyond

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 OpenT2M通过大规模高质量开源数据提升文本到运动生成的泛化能力,引入2D-PRQ运动分词器实现高效运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18034 2026-03-20 cs.CR cs.AI cs.LG 62%

Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems

语义变色龙:RAG系统中依赖语料库的污染攻击与防御

Scott Thornton

机构 * Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究RAG系统中依赖语料库的污染攻击与防御,提出双文档污染攻击方法并评估混合检索防御效果,展示混合检索能有效降低攻击成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02861 2026-03-20 cs.CV cs.AI cs.GR 62%

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

LiteReality:从RGB-D扫描生成图形-ready的3D场景重建

Zhening Huang, Xiaoyang Wu, Fangcheng Zhong, Hengshuang Zhao, Matthias Nießner, Joan Lasenby

机构 * University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 LiteReality通过结构化场景图解析扫描数据,生成紧凑且逼真的3D虚拟场景,支持图形管线所需的关键特性,适用于AR/VR、游戏、机器人和数字孪生等应用。

Comments Project Page: https://litereality.github.io; Video: https://www.youtube.com/watch?v=ecK9m3LXg2c&feature=youtu.be Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10488 2026-03-20 cs.CV cs.AI cs.GR 62%

SVGBuilder: Component-Based Colored SVG Generation with Text-Guided Autoregressive Transformers

SVGBuilder:基于组件的带颜色SVG生成与文本引导自回归变换

Zehao Chen, Rong Pan

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 SVGBuilder基于组件的文本引导自回归变换生成高质量彩色SVG,显著降低计算开销,提升效率,引入ColorSVG-100K数据集提升模型多样性与颜色信息。

Comments Accepted by AAAI 2025. Project: https://svgbuilder.github.io

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39(3), 2358-2366

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17993 2026-03-19 cs.CV cs.RO 62%

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

GMT:用于3D场景中6自由度物体轨迹合成的目标条件多模态Transformer

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆桑大学人工智能研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出GMT,一种多模态Transformer框架,通过结合3D边界框几何、点云上下文、语义物体类别和目标末端姿态,生成真实且目标导向的物体轨迹,提升了空间精度和方向控制。

Comments Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12224 2026-03-19 cs.CV cs.AI 62%

Where It Moves, It Matters: Referring Surgical Instrument Segmentation via Motion

在何处移动,它就重要:通过运动进行指称手术器械分割

Meng Wei, Kun Yuan, Shi Li, Yue Zhou, Long Bai, Nassir Navab, Hongliang Ren, Hong Joo Lee, Tom Vercauteren, Nicolas Padoy

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出SurgRef框架,通过器械运动引导自由语言表达,实现手术视频中器械的鲁棒分割,克服遮挡和术语不熟悉问题。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15484 2026-03-18 cs.CV cs.AI 62%

RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance

RSGen: 通过多样边缘引导增强布局驱动的遥感图像生成

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang

机构 * School of Future Science and Engineering, Soochow University, Suzhou, China(未来科学与工程学院,苏州大学) D-Robotics, Beijing, China(北京D-机器人) Fraunhofer Institute for Applied Information Technology, Sankt Augustin, Germany(弗劳恩霍夫应用信息技术研究所) School of Mathematical and Computing Sciences, Heriot-Watt University Malaysia, Putrajaya, Malaysia(数学与计算科学学院,赫瑞-瓦德大学马来西亚分校) Institute of Automation, Chinese Academy of Sciences, Beijing, China(自动化研究所,中国科学院北京分院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 RSGen通过多样边缘引导提升布局驱动的遥感图像生成,增强细粒度控制并严格遵守边界框约束,实验表明其显著提升了现有L2I模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15612 2026-03-17 cs.CV cs.RO 62%

HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions

HSImul3R:物理循环中的人机交互仿真准备重建

Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ACE Robotics(ACE机器人公司) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 HSImul3R通过物理引导的双向优化框架,解决人机交互仿真中的感知与仿真差距问题,实现稳定且可部署的3D重建。

Comments https://yukangcao.github.io/HSImul3R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15546 2026-03-17 cs.CV cs.GR cs.RO 62%

Kimodo: Scaling Controllable Human Motion Generation

Kimodo:可控制的人体运动生成

Davis Rempe, Mathis Petrovich, Ye Yuan, Haotian Zhang, Xue Bin Peng, Yifeng Jiang, Tingwu Wang, Umar Iqbal, David Minor, Michael de Ruyter, Jiefeng Li, Chen Tessler, Edy Lim, Eugene Jeong, Sam Wu, Ehsan Hassani, Michael Huang, Jin-Bey Yu, Chaeyeon Chung, Lina Song, Olivier Dionne, Jan Kautz, Simon Yuen, Sanja Fidler

机构 * NVIDIA

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Kimodo模型,通过大规模动作捕捉数据训练,实现高质量可控的人体运动生成,结合文本输入和多种运动约束条件,提升生成质量和泛化能力。

Comments Project page: https://research.nvidia.com/labs/sil/projects/kimodo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09653 2026-03-17 cs.CV cs.AI 62%

Ultralytics YOLO Evolution: An Overview of YOLO26, YOLO11, YOLOv8 and YOLOv5 Object Detectors for Computer Vision and Pattern Recognition

Ultralytics YOLO进化:YOLO26、YOLO11、YOLOv8和YOLOv5目标检测器在计算机视觉和模式识别中的综述

Ranjan Sapkota, Manoj Karkee

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文综述了Ultralytics YOLO系列目标检测器的架构演变、基准测试、部署及未来挑战,涵盖YOLO26、YOLO11、YOLOv8和YOLOv5的核心创新与性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14738 2026-03-17 cs.CV cs.RO 62%

Efficient Event Camera Volume System

高效事件相机体积系统

Juan Camilo Soto, Ian Noronha, Saru Bharti, Upinder Kaur

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出EECVS框架,通过连续时间Dirac脉冲列车建模事件流,结合自适应变换选择与系数剪枝策略,实现无伪影压缩,并在多个数据集上展示出优异的重建精度和跨数据集泛化能力。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏