arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-09-01 至 2026-09-01 共收录 48 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 39 篇

2608.29622 2026-09-01 cs.MA cs.AI 新提交 57%

AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

AgenticRag-R1:用于多步推理、检索与记忆的带栈式记忆的智能体强化学习

Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对现有智能体RAG方法的奖励分配弱、偏向短程推理等问题,提出AgenticRag-R1框架,通过记忆栈等实现长程学习,在多类基准上性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-09-01 cs.AI 版本更新 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 60 pages, added additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31058 2026-09-01 cs.CL 新提交 50%

Improving Information Extraction with Learned Queries

利用学习到的查询改进信息抽取

Omar Sharif, Soroush Vosoughi, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 VLA模型 :action model(abstract)

AI总结 该研究针对信息抽取问题,提出LoQ生成文档特定问题集、FeedQ反馈驱动优化方法,优化问题可训练轻量级模型,4B参数模型性能超未调大模型,发布12820个优化问题数据集。

Comments Accepted in EMNLP-2026, 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29926 2026-09-01 quant-ph 新提交 50%

Emergence of Strategic Equilibria from Transverse Field Ising Hamiltonian Dynamics

横向场伊辛哈密顿量动力学中策略均衡的涌现

Teena Thomas, S. Balakrishnan

专题命中 VLA模型 :action model(abstract)

AI总结 该研究基于横向场伊辛哈密顿量动力学,提出算子形式的量子博弈研究方法,通过可调纠缠算子解决博弈困境,获得优于经典结果的量子优势,为量子博弈设计提供硬件相关视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29701 2026-09-01 cond-mat.str-el 新提交 50%

Magnetic Field-Tunable Repulsive Exciton-Exciton Interaction in the van der Waals Antiferromagnet NiPS$_3$

范德华反铁磁体NiPS₃中磁场可调的排斥性激子-激子相互作用

Kaiyang Huang, Jaena Park, Zhuo Yang, Je-Geun Park, Atsuhiko Miyata, Yoshimitsu Kohama, Yasuhiro H. Matsuda

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过最高178 T的脉冲磁场磁光测量,发现NiPS₃中两个激子峰存在磁场可调的排斥耦合,为强关联激子物理研究提供了新平台。

Comments 8 pages, 7 figures

Journal ref Phys. Rev. Lett. 137, 076903, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28095 2026-09-01 hep-ex hep-ph 交叉投稿 50%

Characterizing Single-Signal Events from Atmospheric-Neutrino Neutral-Current Interactions in Large Liquid Scintillator Detectors

大型液体闪烁体探测器中大气中微子中性流相互作用产生的单信号事例的表征

Zhenning Qu, Jie Cheng, Wan-lei Guo, Gaosong Li, Yu-Feng Li, Liang-jian Wen

专题命中 VLA模型 :action model(abstract)

AI总结 本研究表征大型液体闪烁体探测器中大气中微子中性流单信号事例的模型依赖性,给出事例率与能谱,凸显江门地下中微子天文台等装置的物理潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04577 2026-09-01 astro-ph.GA astro-ph.HE 版本更新 50%

From NVSS to RACS: Identifying truly Compact Galactic and Extragalactic sources with Steep Spectra

从NVSS到RACS:识别真正紧凑且陡谱的射电源

Rajat Shinde, Yogesh Maan, Apurba Bera

专题命中 VLA模型 :VLA(abstract)

AI总结 本文利用RACS数据识别紧凑陡谱射电源,发现部分源在NVSS未被检测到,揭示了高红移射电星系等天体的研究价值。

Comments 16 pages, 6 figures, accepted for publication in PASA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16299 2026-09-01 cs.IR 版本更新 50%

MICE: Minimal Interaction Cross-Encoders for efficient Re-ranking

MICE:用于高效重排的最小交互交叉编码器

Mathias Vast, Victor Morand, Josiane Mothe, Benjamin Piwowarski

专题命中 VLA模型 :action model(abstract)

AI总结 研究针对交叉编码器推理成本高的问题,提出MICE架构,通过去除有害或不必要交互,将加速交叉编码器推理与提升一级检索效果两种方法结合,评估显示其降低推理延迟四倍,效果良好。

Comments 9 pages, 5 figures. Accepted as a Main Conference paper to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06792 2026-09-01 math.NA cs.NA 50%

Fully discrete finite element approximation for the projection method to solve the Chemotaxis-Fluid System

完全离散有限元近似用于求解趋化-流体系统的投影方法

Chenyang Li, Ping Lin, Haibiao Zheng

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种完全离散有限元方法用于求解趋化-流体系统,通过压强校正投影框架实现稳定高效计算,并验证了方法的收敛性和有效性。

Journal ref Communications in Nonlinear Science and Numerical Simulation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 6 篇

2608.30536 2026-09-01 cs.RO 新提交 87%

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

Behavior-Skill:用于评估长 horizon 任务中视觉-语言-动作策略的细粒度基准

Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

机构 * XPeng Inc.(小鹏汽车) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学)

专题命中 动作表示与策略 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 本研究提出细粒度基准 Behavior-Skill,含 235492 个技能实例,引入轨迹与技能级指标,实验发现接触丰富操作技能是长 horizon VLA 策略瓶颈,可用于分析改进该类策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30237 2026-09-01 cs.RO cs.AI cs.CV cs.LG 新提交 70%

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2:一种用于灵巧操作的自进化通用世界模型

Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

机构 * GensPI Tsinghua University(清华大学) BUAA(北京航空航天大学) BIT(北京理工大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Motus2,一种用于灵巧操作的自进化通用世界模型,通过模型缩放与数据缩放构建闭环决策学习循环,结合多模态数据与仿生平台实现通用具身智能体的灵巧操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30378 2026-09-01 cs.RO cs.AI 新提交 62%

PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies

PAVE:面向世界-动作策略的预测对齐与价值引导进化

Botong Zhao, Fang Yu, Tim, Senhua Zhu, Xinyuan Chen, Yue Lu

机构 * East China Normal University(华东师范大学) EBKernel Shanghai Artificial Intelligence Laboratory(上海人工智能实验室EBKernel)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出PAVE策略,通过多时间步转换对齐与分布价值评论者优化,在三个模拟基准中实现最优性能,同时保留在线直接动作生成路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29768 2026-09-01 cs.RO 新提交 57%

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

SmoothRL:异步执行期间的在线强化学习

Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

AI总结 SmoothRL是一种在异步推理循环内微调预训练策略的在线RL框架,通过显式建模异步推理过程优化策略,在高精度及高度动态机器人任务上实现有效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 57%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07837 2026-09-01 cs.RO 版本更新 57%

RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

RLinf-USER: 一个统一且可扩展的系统,用于具身人工智能中的现实世界在线策略学习

Hongzhi Zang, Shu'ang Yu, Hao Lin, Tianxing Zhou, Zefang Huang, Zhen Guo, Xin Xu, Jiakai Zhou, Yuze Sheng, Shizhe Zhang, Feng Gao, Wenhao Tang, Yufeng Yue, Quanlu Zhang, Xinlei Chen, Chao Yu, Yu Wang

专题命中 动作表示与策略 :VLA(abstract_cn);分类 cs.RO

AI总结 RLinf-USER是一个统一且可扩展的系统,用于现实世界中的在线策略学习,通过统一硬件抽象层和异步框架实现多机器人协调与长时训练。

Comments Accepted to RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 2 篇

2608.29005 2026-09-01 cs.RO 新提交 57%

A Degradation-Tolerance Benchmark for Camera-Only End-to-End Driving

仅基于相机的端到端驾驶的抗退化基准测试

Haohua Que, Handong Yao

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 研究人员提出DriveDegrade基准测试,评估仅基于相机的端到端驾驶模型对各类图像退化的容忍度,发现不同退化对规划的影响差异显著,某视觉-语言-动作规划器被遮挡6个相机仅损失11.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28594 2026-09-01 cs.AI 新提交 57%

From Question-First to Analyst-First: Domain-Expert Skills and Verified Knowledge Compilation for Proactive Enterprise Analytics

从问题优先到分析师优先:面向主动企业分析的领域专家技能与验证知识编译

Harmohit Singh, Rahul Sharma

专题命中 数据集与评测 :action model(abstract);分类 cs.AI

AI总结 该研究提出了一种从问题优先转为分析师优先的主动企业分析系统,通过领域专家技能抽象与离线知识编译循环实现,无需查询日志,可生成验证过的报告与建议问题。

Comments 21 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2608.29078 2026-09-01 cs.RO 新提交 86%

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM:基于实境到仿真的部署时演示生成,用于可扩展的策略适配

Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 部署与泛化 :VLA(summary_cn,abstract);vision-language-action(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 本研究提出DREAM框架,可无需人类演示生成VLA微调数据,经实机实验验证其能降低新工作空间的数据收集成本并提升操纵任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏