From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation
从流到一步:通过隐式最大似然估计基于的分布蒸馏实现实时多模轨迹策略
Ju Dong, Liding Zhang, Lei Zhang, Yu Fu, Kaixin Bai, Zoltan-Csaba Marton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang
机构
*
TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术方面))
;
Technical University of Munich(慕尼黑技术大学)
;
Agile Robots SE(敏捷机器人公司)
Adaptive Capacity Allocation for Vision Language Action Fine-tuning
面向视觉语言动作微调的自适应容量分配
Donghoon Kim, Minji Bae, Unghui Nam, Gyeonghun Kim, Suyun Lee, Kyuhong Shim, Byonghyo Shim
机构
*
Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
;
Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,全北国立大学)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
MEM:多尺度具身记忆用于视觉语言动作模型
Marcel Torne, Karl Pertsch, Homer Walke, Kyle Vedder, Suraj Nair, Brian Ichter, Allen Z. Ren, Haohuan Wang, Jiaming Tang, Kyle Stachowicz, Karan Dhabalia, Michael Equi, Quan Vuong, Jost Tobias Springenberg, Sergey Levine, Chelsea Finn, Danny Driess
ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments
ACE-Brain-0:空间智能作为通用具身化体系的共享框架
Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
The University of Hong Kong(香港大学)
;
University of Science(科学技术大学)
;
Fudan University(复旦大学)
;
Xiamen University(厦门大学)
;
East China Normal University(华东师范大学)
;
Wuhan University(武汉大学)
;
Sun Yat-sen University(中山大学)
Clutt3R-Seg: Sparse-view 3D Instance Segmentation for Language-grounded Grasping in Cluttered Scenes
Clutt3R-Seg:用于语言引导抓取的稀疏视角3D实例分割
Jeongho Noh, Tai Hyoung Rhee, Eunho Lee, Jeongyun Kim, Sunwoo Lee, Ayoung Kim
机构
*
Dept. of Mechanical Engineering, SNU(机械工程系,首尔国立大学)
;
Interdisciplinary Program in Artificial Intelligence, SNU(人工智能跨学科项目,首尔国立大学)
;
Robotics Lab, Hyundai Motor Company(Hyundai Motor Company机器人实验室)
Towards Learning a Generalizable 3D Scene Representation from 2D Observations
从2D观测向量学习通用的3D场景表示
Martin Gromniak, Jan-Gerrit Habekost, Sebastian Kamp, Sven Magg, Stefan Wermter
机构
*
University of Hamburg - Department of Informatics(汉堡大学信息学院)
;
ZAL Center of Applied Aeronautical Research(应用航空研究中心)
;
Hamburger Informatik Technologie-Center e.V. (HITeC)(汉堡信息科技中心(HITeC))
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
DTP: 一种简单而有效的干扰令牌修剪框架用于视觉-语言动作模型
Chenyang Li, Jieyuan Liu, Bin Li, Bo Gao, Yilin Yuan, Yangfan He, Yuchen Li, Jingqun Tang
机构
*
Australian National University(澳大利亚国立大学)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Chinese Academy of Sciences(中国科学院)
;
Beijing Institute of Graphic Communication(北京印刷学院)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Baidu Search(百度搜索)
;
Bytedance(字节跳动)
Vidarc: Embodied Video Diffusion Model for Closed-loop Control
Vidarc:用于闭环控制的具身视频扩散模型
Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu
机构
*
Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)