arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-03 至 2025-12-03 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2512.02834 2025-12-03 cs.RO cs.AI 88%

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

引导视觉-语言-动作模型作为反探索:一种测试时间缩放方法

Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出TACO框架,通过测试时间缩放方法在视觉-语言-动作模型中引入反探索机制,提升推理稳定性和任务成功率。

Comments The first two authors contributed equally. Yang Zhang leads the whole project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO 70%

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01629 2025-12-03 cs.CV cs.RO 62%

SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge

SPARK: 面向模拟的关节化重建与VLK知识

Yumeng He, Ying Jiang, Jiayin Lu, Yin Yang, Chenfanfu Jiang

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV

AI总结 SPARK通过结合VLK和生成扩散模型,实现从单张图像中生成物理一致的关节化3D物体,提升机器人操作和交互建模的应用效果。

Comments Project page: https://heyumeng.com/SPARK/index.html. 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01234 2025-12-03 cs.HC cs.AI 57%

Proactive Agentic Whiteboards: Enhancing Diagrammatic Learning

主动代理白板:增强图示学习

Suveen Ellawela, Sashenka Gamage, Dinithi Dissanayake

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 DrawDash通过实时语音驱动的视觉辅助,主动完成和优化教育图表,以减少教师认知负担并提升图示教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13064 2025-12-03 math.CO math.AG 50%

Lawrence Lifts, Matroids, and Maximum Likelihood Degrees

拉格朗日提升、交错群与最大似然度次数

Taylor Brysiewicz, Aida Maraj

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过交错群的Mobius不变量,将由拉格朗日提升完全单模矩阵参数化的托里奇品种的最大似然度次数进行了表达,并给出了无三向交互作用模型的闭式公式。

Comments 23 pages, 5 figures. Comments welcome!

Journal ref Alg. Stat. 16 (2025) 217-242

详情

展开后加载摘要…

URL PDF HTML 收藏