MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
Boyang Zhang, Lianlei Shan
机构
*
Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系)
;
Department of Computer Science, Tsinghua University(清华大学计算机系)
BioProVLA-Agent: An Affordable, Protocol-Driven, Vision-Enhanced VLA-Enabled Embodied Multi-Agent System with Closed-Loop-Capable Reasoning for Biological Laboratory Manipulation
Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, Hongmei Fei, Xiwen Cao, Ting Xiao, Qi Wang, Huanbo Jin, Jiaming Gu, Quan Lu, Zhe Liu
机构
*
Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education, East China University of Science and Technology, Shanghai, CN(能源化工过程智能制造教育部重点实验室,东华大学,上海,中国)
;
Department of Computer Science and Engineering, East China University of Science and Technology, Shanghai, CN(东华大学计算机科学与工程系,上海,中国)
;
Department of Laboratory Medicine, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, CN(复旦大学附属瑞金医院检验医学科,上海,中国)
;
School of Information Science and Technology, Shihezi University, Shihezi, CN(石河子大学信息科学与技术学院,石河子,中国)
FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation
FOCA: 面向未来的条件化用于数据高效的视觉-语言-动作适应
Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien
机构
*
Center for AI Research, VinUniversity, Vietnam
;
University of Utah, USA
;
German Research Center for Artificial Intelligence (DFKI)
;
Technical University of Denmark, Denmark
;
University of Oldenburg, Germany
;
University of Stuttgart, Germany
;
Max Planck Research School for Intelligent Systems (IMPRS-IS), Germany
Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation
离线语义引导用于高效视觉-语言-动作策略蒸馏
Jin Shi, Brady Zhang, Yishun Lu
机构
*
Department of Mechanical Engineering(机械工程系)
;
University College London(伦敦大学学院)
;
Department of Engineering Science(工程科学系)
;
University of Oxford(牛津大学)
One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy
每帧一个令牌:重新考虑世界模型中的视觉带宽
Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jing, De Ma, Gang Pan, Bin Liu
机构
*
Zhejiang University(浙江大学)
;
Central South University(中南大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室)
;
E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
ForgeVLA:无需语言标注的联邦视觉-语言-动作学习
Yuhao Zhou, Yunpeng Zhu, Yang Zhou, Jindi Lyu, Jian Lan, Zhangyuan Wang, Dan Si, Thomas Seidl, Qing Ye, Jiancheng Lyu
机构
*
Sichuan University(四川大学)
;
Zhejiang University(浙江大学)
;
Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学)
;
Lenovo Group Limited(联想集团有限公司)
;
Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心)
ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation
ST-$π$: 结构化时空VLA用于机器人操作
Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan
机构
*
School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
School of Computing, Macquarie University(麦考瑞大学计算机学院)