arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8699 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8699 篇

2603.27573 2026-03-31 cs.GR 67%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18532 2026-03-31 cs.RO cs.AI cs.LG 67%

Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds

在生成3D世界中扩展机器人视觉语言动作的强化学习

Andrew Choi, Xinjie Wang, Zhizhong Su, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 67%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 67%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17318 2026-03-23 cs.RO cs.AI cs.CE cs.LG physics.app-ph 67%

FORWARD: Dataset of a forwarder operating in rough terrain

FORWARD:在崎岖地形中操作的前送机数据集

Mikael Lundbäck, Erik Wallin, Carola Häggström, Mattias Nyström, Andreas Grönlund, Mats Richardson, Petrus Jönsson, William Arnvik, Lucas Hedström, Arvid Fälldin, Martin Servin

机构 * Umeå University(乌梅亚大学) Swedish University of Agricultural Sciences(瑞典农业科学大学) Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。

Comments 33 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16868 2026-03-18 cs.CV cs.AI cs.RO 67%

MessyKitchens: Contact-rich object-level 3D scene reconstruction

MessyKitchens: 密集接触的物体级3D场景重建

Junaid Ahmed Ansari, Ran Ding, Fabio Pizzati, Ivan Laptev

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出MessyKitchens数据集和Multi-Object Decoder方法,提升复杂场景中物体级3D重建的精度与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15847 2026-03-18 cs.CV cs.LG cs.RO 67%

FEEL (Force-Enhanced Egocentric Learning): A Dataset for Physical Action Understanding

FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集

Eadom Dessalene, Botao He, Michael Maynord, Yonatan Tussa, Pavan Mantripragada, Yianni Karabati, Nirupam Roy, Yiannis Aloimonos

机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11453 2026-03-17 cs.CV cs.AI cs.RO 67%

Beyond Frame-wise Tracking: A Trajectory-based Paradigm for Efficient Point Cloud Tracking

超越帧级跟踪:一种基于轨迹的高效点云跟踪范式

BaiChen Fan, Yuanxi Cui, Jian Li, Qin Wang, Shibo Zhao, Muqing Cao, Sifan Zhou

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出基于轨迹的跟踪范式TrajTrack,通过隐式学习历史轨迹提升跟踪精度,实现高效且鲁棒的3D单目标跟踪。

Comments Acceptted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 67%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13027 2026-03-16 cs.CV cs.AI cs.LG 67%

SortScrews: A Dataset and Baseline for Real-time Screw Classification

SortScrews:一种用于实时螺钉分类的数据集和基线

Tianhao Fu, Bingxuan Yang, Juncheng Guo, Shrena Sribalan, Yucheng Chen

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Project Neura UTMIST Amplimit

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11554 2026-03-13 cs.CV cs.AI cs.RO 67%

MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

MANSION: 多楼层语言到3D场景生成用于长周期任务

Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su

机构 * Tsinghua University(清华大学) AgiBot McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11400 2026-03-13 cs.RO cs.AI cs.LG 67%

Deployment-Time Reliability of Learned Robot Policies

部署时学习机器人策略的可靠性

Christopher Agia

机构 * STANFORD UNIVERSITY(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究了如何通过部署时机制提升学习机器人策略的可靠性,提出运行时监控、数据驱动的可解释性框架及长周期任务执行方法,以应对部署中的分布偏移、误差叠加和复杂依赖性问题。

Comments Stanford University PhD dissertation, 2026. 182 pages, 37 figures. Available from Stanford Digital Repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG 67%

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01549 2026-03-11 cs.CV cs.AI cs.RO 67%

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) LG AI Research(LG人工智能研究) Yonsei University(延世大学) Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06742 2026-03-10 cs.LG cs.AI cs.RO 67%

Improved Constrained Generation by Bridging Pretrained Generative Models

通过桥梁预训练生成模型实现改进的约束生成

Xiaoxuan Liang, Saeid Naderiparizi, Yunpeng Liu, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种通过桥梁预训练生成模型实现改进的约束生成方法,通过在可行区域内生成样本并保持现实感,实现了约束满足与采样质量之间的新平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04949 2026-03-06 cs.AI cs.CL cs.CV cs.LG 67%

TimeWarp: Evaluating Web Agents by Revisiting the Past

TimeWarp: 通过回顾过去评估网络代理

Md Farhan Ishmam, Kenneth Marino

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 TimeWarp通过模拟变化的网络环境评估代理鲁棒性,提出TimeTraj算法提升计划收集效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 67%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03278 2026-03-04 cs.RO cs.AI cs.CV 67%

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校) Dyna Robotics(Dyna机器人技术)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。

Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11663 2026-03-04 cs.RO cs.AI cs.CV 67%

ConEQsA: Concurrent and Asynchronous Embodied Questions Scheduling and Answering

ConEQsA:并发与异步具身问题调度与回答

Haisheng Wang, Dong Liu, Weiming Zhi

机构 * Software Engineering Institute, East China Normal University(东华大学软件工程学院) Department of Computer Science, Yale University(耶鲁大学计算机科学系) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 ConEQsA通过并发与异步机制提升具身问题回答的效率与响应能力

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23524 2026-03-03 cs.RO cs.CV cs.LG 67%

V-MORALS: Visual Morse Graph-Aided Estimation of Regions of Attraction in a Learned Latent Space

V-MORALS: 基于视觉莫尔斯图的学得潜在空间中吸引区域估计

Faiz Aladin, Ashwin Balasubramanian, Lars Lindemann, Daniel Seita

机构 * Viterbi School of Engineering, University of Southern California(美国南加州大学维特比工程学院) Automatic Control Laboratory, ETH Zürich(瑞士苏黎世联邦理工学院自动控制实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 V-MORALS通过学习潜在空间生成莫尔斯图,实现无需全状态信息的吸引区域估计,适用于仅使用传感器数据的机器人系统分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19652 2026-02-24 eess.SP 67%

Hardware-Accelerated Geometrical Simulation of Biological and Engineered In-Air Ultrasonic Systems

硬件加速的生物与工程空气中超声系统几何模拟

Wouter Jansen, Jan Steckel

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract)

AI总结 SonoTraceUE是一种基于Unreal Engine的高保真声学仿真框架,通过硬件加速的射线追踪和蒙特卡洛衍射模型,实现动态多材料环境中的实时声学传感模拟,用于生物声学研究和机器人闭环系统开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16928 2026-02-20 cs.AI cs.LG cs.RO 67%

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用

Bosung Kim, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04641 2026-02-17 cs.CV cs.AI cs.LG 67%

Simulating the Real World: A Unified Survey of Multimodal Generative Models

模拟现实世界:多模态生成模型的统一综述

Yuqi Hu, Longguang Wang, Xian Liu, Ling-Hao Chen, Yuwei Guo, Yukai Shi, Ce Liu, Anyi Rao, Zeyu Wang, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能前沿技术研究所,香港科学与技术大学(广州)) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR(计算机科学与工程系,香港科学与技术大学香港特别行政区) MMLab, The Hong Kong University of Science and Technology(多模态实验室,香港科学与技术大学) School of Electronics and Communication Engineering, Shenzhen Campus of Sun Yat-sen University(电子与通信工程学院,中山大学深圳校区) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国) Tsinghua University, Guangdong, China(清华大学,广东,中国) Bosch (China) Investment Co., Ltd., Shanghai, China(博世(中国)投资有限公司,上海,中国)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文首次系统性地统一研究了2D、视频、3D和4D生成,为多模态生成模型和现实世界模拟提供了统一框架的综述。

Comments Repository for the related papers at https://github.com/ALEEEHU/World-Simulator

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09605 2026-02-16 cs.CV cs.AI cs.RO 67%

Sim2real Image Translation Enables Viewpoint-Robust Policies from Fixed-Camera Datasets

Sim2real图像翻译实现从固定相机数据集的视角鲁棒策略

Jeremiah Coholich, Justin Wit, Robert Azarcon, Zsolt Kira

机构 * Institute of Robotics and Intelligent Machine(机器人与智能机器研究所) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 MANGO通过无配对图像翻译方法,从固定相机数据集生成视角鲁棒的机器人策略,显著提升现实任务中的视角适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04215 2026-02-12 cs.RO cs.AI cs.LG 67%

OAT: Ordered Action Tokenization

OAT:有序动作标记化

Chaoqi Liu, Xiaoshen Han, Jiawei Gao, Yue Zhao, Haonan Chen, Yilun Du

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 OAT通过有序动作标记化方法,实现高压缩性和因果有序的标记空间,提升机器人动作生成的灵活性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06556 2026-02-09 cs.CV cs.AI cs.RO 67%

LIBERO-X: Robustness Litmus for Vision-Language-Action Models

LIBERO-X:用于视觉-语言-动作模型的鲁棒性检测仪

Guodong Wang, Chenkai Zhang, Qingjie Liu, Jinjin Zhang, Jiancheng Cai, Junjie Liu, Xinmin Liu

机构 * Meituan(美团) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LIBERO-X通过分层评估协议和多样化训练数据集,系统性地提升视觉-语言-动作模型的鲁棒性评估能力。

Comments 19 pages, 14 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02167 2026-02-03 eess.SP cs.CV cs.LG cs.RO 67%

Real-Time 2D LiDAR Object Detection Using Three-Frame RGB Scan Encoding

基于三帧RGB扫描编码的实时2D激光雷达目标检测

Soheil Behnam Roudsari, Alexandre S. Brandão, Felipe N. Martins

机构 * Smart Systems Group, Institute of Engineering Hanze University of Applied Sciences, Groningen, The Netherlands

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本研究提出一种基于三帧RGB扫描编码的实时2D激光雷达目标检测方法,实现高效且隐私友好的嵌入式室内机器人感知。

Comments 6 pages, 6 figures, submitted to IEEE SAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12138 2026-02-02 cs.CV cs.LG cs.RO 67%

Monocular pose estimation of articulated open surgery tools -- in the wild

单目手术工具姿态估计——在真实环境中

Robert Spektor, Tom Friedman, Itay Or, Gil Bolotin, Shlomi Laufer

机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology, Haifa, Israel(数据与决策科学学院,技术Ion-以色列理工学院,海法,以色列)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出了一种基于合成数据和真实数据的单目手术工具姿态估计框架,通过域适应和伪标签提升实际应用性能。

Comments Author Accepted Manuscript (AAM)

Journal ref Medical Image Analysis, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21222 2026-01-30 cs.AR 67%

FireFly-P: FPGA-Accelerated Spiking Neural Network Plasticity for Robust Adaptive Control

FireFly-P:FPGA加速的脉冲神经网络可塑性用于鲁棒自适应控制

Tenglong Li, Jindong Li, Guobin Shen, Dongcheng Zhao, Qian Zhang, Yi Zeng

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract)

AI总结 FireFly-P是一种基于FPGA的脉冲神经网络可塑性加速器,通过高效硬件设计实现低功耗、低延迟的自适应控制

Comments 5 pages, 4 figures. Accepted for lecture presentation at the 2026 IEEE International Symposium on Circuits and Systems (ISCAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18451 2026-01-27 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control

3DGesPolicy: 基于动作控制的音素感知整体语义手势生成

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电讯大学) Osaka University(大阪大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏