arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2026-08-26 至 2026-08-26 共收录 3
2608.24603 2026-08-26 cs.RO 新提交

Gripper-aware Vision Language Action Models

感知夹具的视觉语言动作模型

Hanyi Zhang, Zihong Luo, Tianyu Li, Khang Nguyen, Basu Hela, Shreyas Kumar, Ngoc Duy Tran, Feng Dai, Charith Munasinghe, Jorge Peña Queralta, Giovanni Toffetti, Khoa Vo, Ngan Le, Ravi Prakash, Quan Vuong, Tung D. Ta, Long Hu, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Science(印度科学学院) The University of Tokyo(东京大学) Zürcher Hochschule für Angewandte Wissenschaften(苏黎世应用科技大学) University of Arkansas(阿肯色大学) Physical Intelligence(物理智能公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有视觉语言动作模型(VLA)忽略夹具差异的问题,提出多夹具感知数据集MiGA与结合多夹具分词器及适配器策略路由的GVLA,实验显示其性能优于基线且泛化与适应能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23723 2026-08-26 cs.CV 新提交

DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection

DriftAD:用于小样本工业异常检测的视觉引导文本漂移

Wenyang Liu, Tianyi Liu, Dongshuo Zhang, Kejun Wu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有小样本工业异常检测方法无法捕捉缺陷局部性与尺度依赖性的问题,提出含ASA、VGTD、DGSG模块及对应损失的DriftAD框架,在MVTec-AD和VisA数据集的1/2/4次设置下取得最优性能。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏