arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-01-09 至 2026-01-09 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2601.05241 2026-01-09 cs.CV cs.AI cs.RO 67%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04223 2026-01-09 cs.CY cs.AI cs.LG econ.GN q-fin.EC stat.ME 62%

Beyond Interaction Effects: Two Logics for Studying Population Inequalities

超越交互效应:研究人口不平等的两种逻辑

Adel Daoud

机构 * Institute for Analytical Sociology, Linköping University, Sweden(分析社会学研究所,利厄普斯大学,瑞典) Division of Data Science and AI, Chalmers University of Technology, Sweden(数据科学与人工智能部门,查尔姆斯理工大学,瑞典) The AI and Development Lab, www.aidevlab.org(人工智能与发展实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于在演绎逻辑和归纳逻辑之间导航,探讨研究人口不平等时可解释性与灵活性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04657 2026-01-09 cs.RO cs.HC 57%

Model of Spatial Human-Agent Interaction with Consideration for Others

考虑他人的空间人机交互模型

Takafumi Sakamoto, Yugo Takeuchi

机构 * Graduate School of Science and Technology, Shizuoka University(静冈大学理学技术研究生院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出了一种考虑他人的空间人机交互模型,通过实验验证了该模型在调节人机交互行为方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23394 2026-01-09 astro-ph.HE 50%

A Data-driven Heavy-Metal Scenario for Ultra-High-Energy Cosmic Rays

基于数据的重金属情景用于超高能宇宙射线

Jakub Vícha, Alena Bakalová, Ana L. Müller, Olena Tkachenko, Maximilian K. Stadelmaier

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于数据的重金属情景,假设超高能宇宙射线的质量组成为铁核,并通过调整X_max尺度来解释其质量组成及能量演化。

Comments Presented at the 39th International Cosmic Ray Conference (ICRC 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23385 2026-01-09 astro-ph.HE 50%

On the Origin of Ultra-high-energy Cosmic Rays Assuming a Heavy Mass Composition

超高能宇宙射线起源的假设:假设重质量组成

Alena Bakalová, Ana Laura Müller, Jakub Vícha

专题命中 VLA模型 :action model(abstract)

AI总结 本研究假设超高能宇宙射线由铁核组成,通过模拟传播研究其来源,发现活跃星系核与恒星burst星系相比更符合观测数据,但GMF偏转使源识别仍具挑战性。

Comments Presented at the 39th International Cosmic Ray Conference (ICRC 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00692 2026-01-09 quant-ph 50%

Inter-qubit correlation dynamics driven by mutual interactions

由相互作用驱动的量子比特相关动力学

Aleksandra Kwiatkowska, Waldemar Kłobus

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了由相互作用驱动的量子比特相关动力学,分析了不同哈密顿量下的稳态相关性,并探讨了外部场对相关特性的影响。

Comments 14 pages, 6 figures

Journal ref Phys. Rev. A 113, 012417 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2410.24164 2026-01-09 cs.LG cs.RO 81%

$π_0$: A Vision-Language-Action Flow Model for General Robot Control

π₀:一种面向通用机器人控制的视觉-语言-动作流模型

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 动作表示与策略 :vision-language-action(title);robot foundation model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。

Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏