arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-31 至 2026-08-31 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2608.27609 2026-08-31 cs.RO cs.AI 新提交 94%

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

PHR-VLA:面向视觉-语言-动作模型的规划视界推理

Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng

机构 * Texas A&M University(德克萨斯农工大学) Purdue University(普渡大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有视觉-语言-动作模型缺乏未来任务动态推理机制的问题,提出PHR-VLA框架,通过辅助未来头对齐潜在动态,提升了机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27550 2026-08-31 cs.RO cs.CV 新提交 92%

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

超越数据缩放:面向视觉-语言-动作模型的以表示为中心的持续预训练

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对VLA模型数据扩展的瓶颈,提出以表示为中心的持续预训练方法VLAct,在多具身机器人数据上训练后,在多项基准任务中超越现有工业级系统,在未见具身迁移任务中仅用20%数据即优于全数据基线,为VLA进展提供新方向。

Comments All models and training pipelines are publicly available at this https URL (https://starvla.github.io/VLAct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28108 2026-08-31 cs.RO cs.CV 新提交 92%

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA:在单一视觉-语言-动作模型(VLA)中统一基于语言和指示手势的指令模式

Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出DeicticVLA,将三种指令模式统一于单一VLA,经仿真与真实任务验证,其在未见场景和新类别下的表现优于仅用语言指令的模型,为相关设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27913 2026-08-31 astro-ph.GA 新提交 80%

Dense Cores in the Vicinity of an HII Region

电离氢区(HII区)附近的致密核

Ruofei Zhang, Xing Lu, Jingwen Wu, Sihan Jiao, Hauyu Baobab Liu, Guang-Xing Li, Roberto Galván-Madrid, Aiyuan Yang, Siju Zhang, Shanghuo Li, Fengwei Xu, Xindi Tang, Yu Cheng, Weiyuan Zhang, Andrés E. Guzmán, Yuxin Lin, Yuhua Liu, Qizhou Zhang, Patricio Sanhueza, Ke Wang, Siyi Feng, Linjing Feng, Fangyuan Deng, Hao Ruan, Yuanzhen Xiong, Yuxiang Liu

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究结合ALMA、VLA观测与astrodendro分析,探究HII区对分子云IRAS 18530+0215中致密核的影响,发现HII区反馈延伸至0.3 pc,可提升致密核的速度弥散、温度与维里参数,但未促进大质量致密核形成。

Comments Accepted for publication in Astronomy & Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28210 2026-08-31 math.AP 新提交 50%

Detection of a moving point-like scatter by using moving receivers and emitter

利用运动的接收器与发射器检测运动的类点散射体

Minghui Li, Guanghui Hu, Hongyu Liu

专题命中 VLA模型 :action model(abstract)

AI总结 针对发射器、散射体、接收器均运动的标量波动方程逆散射问题,建立时域点相互作用模型,提出结合初始定位与常微分方程组求解的重建算法,数值实验验证其对噪声的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27862 2026-08-31 math-ph 新提交 50%

Holomorphy of the ground state and energy for bosonic quadratic Hamiltonians

玻色二次哈密顿量的基态与能量的全纯性

Kota Imura, Shinnosuke Izumi, Yasumichi Matsuzawa, Itaru Sasaki

专题命中 VLA模型 :action model(abstract)

AI总结 本研究证明玻色二次哈密顿量基态与能量随耦合常数变化的全纯性,为微扰展开提供严格依据,还确定了两类模型的收敛半径,验证Pauli-Fierz模型微扰在物理电荷处收敛。

Comments 57 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28095 2026-08-31 hep-ex 新提交 50%

Characterizing Single-Signal Events from Atmospheric-Neutrino Neutral-Current Interactions in Large Liquid Scintillator Detectors

大型液体闪烁体探测器中大气中微子中性流相互作用产生的单信号事例的表征

Zhenning Qu, Jie Cheng, Wan-lei Guo, Gaosong Li, Yu-Feng Li, Liang-jian Wen

专题命中 VLA模型 :action model(abstract)

AI总结 本研究表征大型液体闪烁体探测器中大气中微子中性流单信号事例的模型依赖性,给出事例率与能谱,凸显江门地下中微子天文台等装置的物理潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.28491 2026-08-31 cs.AI cs.RO 新提交 62%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏