arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-23 至 2025-12-23 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2507.17383 2025-12-23 cs.RO cs.LG 89%

Confidence Calibration in Vision-Language-Action Models

视觉-语言-动作模型中的置信度校准

Thomas P Zollo, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.LG

AI总结 本文提出通过提示集合和动作-wise Platt缩放技术,改进视觉-语言-动作模型的置信度校准,以提升机器人行为的可靠性和性能。

Comments 38 pages, 19 figures; additional experiments with VLA variants

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06951 2025-12-23 cs.RO cs.AI cs.CV cs.LG 86%

Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge

视觉-语言-动作模型的任务适应:2025 BEHAVIOR挑战第一名解决方案

Ilia Larchenko, Gleb Zarin, Akash Karnatak

机构 * Independent Researchers(独立研究者)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种视觉-动作策略,通过相关噪声和混合层注意力等创新,实现了在2025 BEHAVIOR挑战中对50种家庭任务的高效处理。

Comments 2025 NeurIPS Behavior Challenge 1st place solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 84%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18477 2025-12-23 cs.RO cs.CV 73%

STORM: Search-Guided Generative World Models for Robotic Manipulation

STORM:基于搜索的生成世界模型用于机器人操作

Wenjun Lin, Jensen Zhang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 STORM通过结合生成模型与搜索算法,实现了机器人操作中的时空推理,显著提升了任务成功率和环境适应能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02190 2025-12-23 cs.RO cs.LG 73%

cVLA: Towards Efficient Camera-Space VLAs

cVLA:迈向高效的相机空间VLA

Max Argus, Jelena Bratulic, Houman Masnavi, Maxim Velikanov, Nick Heppert, Abhinav Valada, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 cVLA通过利用视觉语言模型在2D图像上的性能,提出了一种高效预测机器人轨迹的VLA方法,具备良好的仿真到现实迁移能力。

Comments 20 pages, 10 figures; CoRL 2025 Workshop on Generalizable Priors for Robot Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11960 2025-12-23 cs.RO 70%

Human Centric General Physical Intelligence for Agile Manufacturing Automation

以人为中心的敏捷制造通用物理智能

Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri, Venkata Akhil Kumar, Santhi Bharath Punati, Praveen Damacharla, Sunny Katyara

机构 * Northeastern University(东北大学) Bmade Robotics(Bmade机器人)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨了通过VLA模型实现通用物理智能在敏捷制造中的应用,系统回顾了最新进展并提出未来研究方向。

Comments Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 62%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09921 2025-12-23 cs.CV 57%

FaceShield: Defending Facial Image against Deepfake Threats

FaceShield:防御面部图像 against 深度伪造威胁

Jaehwan Jeong, Sumin In, Sieun Kim, Hannie Shin, Jongheon Jeong, Sang Ho Yoon, Jaewook Chung, Sangpil Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Samsung Research(三星研究)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 FaceShield通过操控扩散模型的注意力机制和面部特征提取器,提出了一种主动防御深度伪造的方案,有效提升对抗性扰动的鲁棒性和不可察觉性。

Comments Accepted to ICCV 2025. Keywords: Deepfake, Adversarial Attack, Diffusion Models, GANs, Face Swap, Proactive Defense

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16316 2025-12-23 astro-ph.HE astro-ph.GA astro-ph.SR 50%

Hydrodynamic Evolution and Detectability of Nova Remnants in the Galactic Center

银河系中心内新星残骸的水动力学演化与可探测性

Zhao Su, Zhiyuan Li

专题命中 VLA模型 :VLA(abstract)

AI总结 本研究通过水动力学模拟,评估银河系中心新星残骸在X射线、射电和Paschen-α波段的可探测性,发现X射线波段最有可能探测到残骸。

Comments 15 pages, 11 figures, accepted by MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏