arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-05 至 2025-12-05 共收录 6 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2510.19430 2025-12-05 cs.RO cs.CV 88%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04446 2025-12-05 cs.RO cs.SY eess.SY 88%

Vision-Language-Action Models for Selective Robotic Disassembly: A Case Study on Critical Component Extraction from Desktops

面向选择性机器人拆解的视觉-语言-动作模型:以从台式机中提取关键部件的案例研究

Chang Liu, Sibo Tian, Sara Behdad, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学) Engineering School of Sustainable Infrastructure & Environment, University of Florida(可持续基础设施与环境工程学院,佛罗里达大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(土木与环境工程系,德克萨斯A&M大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文研究了视觉-语言-动作模型在机器人选择性拆解中的应用,通过定制数据集微调两种VLA方法,发现其在复杂拆解任务中存在局限,但结合规则控制器的混合策略能有效完成拆解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08713 2025-12-05 cs.LG cs.AI cs.IR 81%

Beyond KAN: Introducing KarSein for Adaptive High-Order Feature Interaction Modeling in CTR Prediction

超越KAN:引入KarSein用于CTR预测中的自适应高阶特征交互建模

Yunxiao Shi, Wujiang Xu, Haimin Zhang, Qiang Wu, Min Xu

机构 * University of Technology Sydney(悉尼技术大学) Rutgers University(罗格斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 KarSein通过自适应高阶特征交互建模方法,提升CTR预测的准确性和效率,同时保持参数紧凑与解释性。

Comments Under review by TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04537 2025-12-05 cs.CV 70%

X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale

X-Humanoid:将人类视频机器人化以生成大规模人形视频

Pei Yang, Hai Ci, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 X-Humanoid通过生成式视频编辑方法,将人类视频机器人化,生成大规模人形视频数据集,提升人形机器人研究的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05066 2025-12-05 cs.LG cs.AI cs.CL 62%

Multi-LLM Collaboration for Medication Recommendation

多LLM协作用于药物推荐

Huascar Sanchez, Briland Hitaj, Jules Bergmann, Linda Briesemeister

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室) University of Maryland St. Joseph Medical Center(马里兰大学圣约瑟夫医疗中心)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于LLM化学的多模型协作方法,通过增强互补性、稳定性和校准性,提高药物推荐的可靠性与可信度。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21746 2025-12-05 nucl-ex 50%

Nuclear excitation functions for medical isotope production: targeted radionuclide therapy via natIr(d,x)193mPt

核激发函数用于医疗同位素生产:通过自然铱(d,x)193m铂的靶向放射性核素治疗

H. L. O. Ekeberg, A. S. Voyles, M. S. Basunia, J. C. Batchelder, L. A. Bernstein, D. L. Bleul, K. C. W. Li, E. M. Martinsen, E. F. Matthews, J. T. Morrell, N. I. J. Pettersen, S. Siem

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过实验确定了193mPt的生产路径,揭示了现代核反应建模代码的不足,并强调了改进模型和更新反应评估的重要性。

Comments 48 pages, 10 tables, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏