arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-08 至 2025-12-08 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 4 篇

2511.04555 2025-12-08 cs.RO cs.CV 88%

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07339 2025-12-08 cs.RO cs.AI cs.LG 75%

Real-Time Execution of Action Chunking Flow Policies

实时执行动作分块流策略

Kevin Black, Manuel Y. Galliker, Sergey Levine

机构 * Physical Intelligence(物理智能) UC Berkeley(伯克利大学)

专题命中 VLA模型 :VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出实时分块(RTC)方法,通过在执行当前动作分块的同时生成下一个分块,实现动作分块策略的实时异步执行,提升任务吞吐量和精确任务成功率。

Comments published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00080 2025-12-08 cs.SI cs.AI 57%

SoREX: Towards Self-Explainable Social Recommendation with Relevant Ego-Path Extraction

SoREX:面向具有相关自我路径提取的自解释社交推荐

Hanze Guo, Yijun Ma, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 SoREX通过引入自解释的GNN框架,利用相关自我路径提取提升社交推荐的预测准确性与解释能力。

Comments ACM Transactions on Information Systems (TOIS), 2025. Online AM: 17 Nov 2025. DOI: 10.1145/3777374. Code: https://github.com/antman9914/SoREX

Journal ref ACM Transactions on Information Systems (TOIS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05685 2025-12-08 math.DS 50%

An output scaling layer boosts deep neural networks for multiscale ODE systems

输出缩放层提升深度神经网络用于多尺度ODE系统

Yuxiao Yi, Weizong Wang, Tianhan Zhang, Zhi-Qin John Xu

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出GBCT方法,通过非线性缩放缓解多尺度ODE系统的挑战,显著提升深度神经网络的预测精度和训练效率。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 1 篇

2506.02738 2025-12-08 cs.CV 57%

Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning

Open-PMC-18M: 一种高保真大规模医学数据集用于多模态表示学习

Negin Baghbanzadeh, Mohammed Saidul Islam, Sajad Ashkezari, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究所) York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.CV

AI总结 Open-PMC-18M通过高保真医学数据集提升多模态表示学习性能,实现子图提取与上下文丰富化,支持多种视觉-语言任务。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏