arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-09-01 至 2026-09-01 共收录 48 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 39 篇

2605.30117 2026-09-01 cs.AI 版本更新 94%

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.AI

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24622 2026-09-01 cs.CV cs.AI 版本更新 93%

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He, Fei Wang, Heng Yang

机构 * Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) United Nova Technology(联合Nova技术) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CF-VLA,通过粗到细两阶段方法优化视觉-语言-动作策略的动作生成,提升效率与性能,在低NFE条件下实现更优的效率-性能平衡。

Comments Accepted to ACM Multimedia (ACM MM) 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29208 2026-09-01 cs.RO cs.LG 新提交 92%

AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models

AdaVLA:用于无需训练的视觉-语言-动作模型加速的自适应步长流匹配

Sunghwan Han, Youngtae Han, Youngmin Yi

机构 * Sogang University(西江大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.LG

AI总结 本研究提出AdaVLA,一种无需训练的自适应框架,通过流匹配轨迹曲率度量动态调整推理步骤与MLP剪枝率,在LIBERO基准等测试中实现VLA模型加速且性能下降可忽略。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29967 2026-09-01 cs.RO cs.AI 新提交 92%

Training-Free Action Correction for VLA Model Failures via Language Feedback

无需训练的、基于语言反馈的VLA模型错误动作校正方法

Owen Kwon, Pablo Ortega-Kral, Arthur Bucker, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 该研究提出CorrectVLA框架,利用任务级自然语言反馈在不重训的情况下校正VLA模型的执行错位错误,在仿真与真实机器人实验中均实现了良好的泛化校正效果,明确了推理阶段动作校正的适用边界。

Comments 8 pages, 6 figures. Project page: https://correctvla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2026-09-01 cs.RO cs.CV 版本更新 92%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

用于机器人操作的基于大型VLM的视觉-语言-动作模型:综述

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本综述首次系统分类梳理用于机器人操作的基于大型VLM的VLA模型,明确其定义与两类架构,考察其与先进领域的集成等内容,整合进展并提供更新项目页面

Comments Under Minor Revision at IEEE TPAMI, Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30122 2026-09-01 cs.CV cs.AI cs.LG 新提交 91%

Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving

面向视觉-语言-动作(VLA)驾驶的多轨迹监督与策略优化对齐

Tian Zhang, Zhuo Huang, Hongrui Ye, Yu Wu, Zengmao Wang, Kaixuan Zhou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Dongfeng Research & Development Institute(东风研发院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对VLA驾驶中多轨迹与GRPO不对齐的问题,本文提出对齐框架,引入两种互补机制,在NAVSIM数据集上取得优于GRPO基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29537 2026-09-01 cs.RO cs.AI 新提交 91%

AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies

AGM:基于成就的闭环智能体记忆,适用于冻结的视觉-语言-动作(VLA)策略

Hongbo Gao, Zeyu Ni, Xin Wen, Siyu Xu, Ruifeng Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Sydney(悉尼大学) StellarEdge AI(星边人工智能)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 针对冻结VLA策略无法跟踪任务进度的问题,提出AGM框架,通过物理证据验证子目标实现闭环,在RoboMME基准和物理机器人上均取得显著性能提升。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28656 2026-09-01 cs.RO cs.CV 新提交 91%

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA:用于驾驶策略中交通规则落地与行为强化的模型

Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likhar, Senthil Yogamani

机构 * Qualcomm Technologies, Inc.(高通技术公司) Qualcomm Auto Ltd Sweden(瑞典高通汽车有限公司) Qualcomm India Private Limited(高通印度私人有限公司) Arriver System Software S.r.l.(Arriver系统软件有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 针对行为克隆VLA驾驶策略在信号交叉口罕见规则操作上的不足,提出RedLight-VLA,通过行为重加权与并行辅助头结合,提升交通规则落地能力,在多位移指标上优于基线及单独机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30144 2026-09-01 cs.RO 新提交 91%

Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving

重新思考语言在自动驾驶高效视觉-语言-动作(VLA)模型中的作用:迈向更智能、可信的驾驶

Tongfei Guo, Lili Su

机构 * Northeastern University(东北大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对自动驾驶VLA模型的高推理开销问题,提出语言残差分类法梳理高效语言使用方法,在多基准上分析适配性,将发布相关代码仓库。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29432 2026-09-01 cs.RO 新提交 91%

SMILE: Smooth Motion for Improved Long-Horizon VLA Execution

SMILE:用于改进长视界视觉-语言-动作(VLA)执行的平滑运动

Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe, Cristina Mata, Xiang Li, Michael S Ryoo

机构 * Stony Brook University(石溪大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 SMILE是一种保留架构的接口,通过预测B样条系数生成平滑动作序列,应用于多款VLA模型后,在多个基准及真实实验中提升了长视界VLA执行的准确率与效率

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29583 2026-09-01 cs.SE 新提交 90%

Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency

驱动思考:VLA推理-轨迹一致性的运行时监测

Tian Yu, Lu Feng, Sebastian Elbaum

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract)

AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29828 2026-09-01 eess.SY cs.SY 新提交 89%

SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation

SymVD:面向机器人操作的对称视觉语言动作蒸馏

Hyewon Choi, Donggyu Kim, Soojean Han

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(title);vision-language-action(abstract,abstract_cn)

AI总结 SymVD是利用操作任务几何对称性的VLA蒸馏框架,采用等变actor-critic架构与自适应加权方案,提升了机器人操作任务的样本效率与泛化能力,优于标准蒸馏及SAC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30643 2026-09-01 cs.RO 新提交 89%

Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models

时序强制:面向视觉-语言-动作模型的四维表示对齐

Xingyu Ding, Yuzhong Zhao, Chunhai Zhao, Yinghuan Shi, Chaoyang Zhao, Yifan Zhang

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型缺乏时序信息的问题,提出 Temporal Forcing 方法,通过历史通路与时序一致的四维几何特征对齐,在 LIBERO 等任务上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20754 2026-09-01 cs.RO 版本更新 89%

Perturbation-Based Epistemic Uncertainty for Failure Detection in Vision-Language-Action Models

基于扰动的视觉-语言-动作模型不确定性用于故障检测

Yousung Lee, Dongsoo Har

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种无标签、模型无关的扰动框架,通过注入高斯扰动到隐藏激活中估计认知不确定性,在分布偏移下提升故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08684 2026-09-01 cs.CV 版本更新 89%

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

BLUE:迈向自动驾驶高效视觉-语言-动作模型中更好的语言使用

George Ling, Lijin Yang, Hao Yang, Zhongzhan Huang

机构 * Bosch Research(博世研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出BLUE方法,通过轻量门控机制在视觉-语言-动作模型中按帧决定是否激活语言生成,实现性能提升和2.54倍推理加速。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29749 2026-09-01 cs.RO 新提交 89%

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLA:基于逐维度时序漂移的原生单步视觉-语言-动作生成模型

Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) LYNSENSE(灵犀科技)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 DriftingVLA是基于逐维度时序漂移的原生单步VLA模型,通过单步生成动作块,在多个机器人任务上优于基线模型,同时实现3.36倍的动作块生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-09-01 cs.LG 版本更新 89%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments Accepted to EMNLP 2026 (Main Conference). Code and benchmark: https://github.com/cau-hai-lab/LIBERO-Para

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30289 2026-09-01 cs.RO 新提交 84%

CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding

CometVLA:基于具身数据金字塔的协同训练以实现物理理解

Hanwen Wan, Dafeng Chi, Linbo Zhai, Tianao Shen, Yuzheng Zhuang, Tianle Zhang, Peidong Liu, Liang Lin, Xiaoqiang Ji

机构 * JD Explore Academy(京东探索研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院) South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出CometVLA,通过构建与机器人动作对齐的具身物理VQA数据及引入GAP token,在具身数据金字塔上协同训练,提升VLA模型的物理理解能力,显著优于基线模型并验证了物理预训练对下游操作的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-09-01 cs.RO cs.CV 版本更新 84%

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-09-01 cs.RO cs.AI cs.CL cs.CV 版本更新 83%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments EMNLP 2026 Main Conference, Code can be found at https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08283 2026-09-01 cs.RO 版本更新 81%

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

TFP:用于视觉运动学习的时间条件记忆融合策略

Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 研究针对视觉运动学习中阶段依赖操作问题,提出时间条件记忆融合策略(TFP),通过维护任务进展信念并注入动作解码器来改进VLA策略,在多个任务上提升成功率,证明紧凑且对事件敏感的记忆动态可优化VLA策略。

Comments Accepted to the SemRob 2026 Workshop at Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28995 2026-09-01 cs.RO cs.CV 新提交 81%

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Hydra:一种具有离散潜在规划与连续流匹配执行能力的导航世界动作模型

Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) Kiel University(基尔大学) Ludwig Maximilian University Munich(慕尼黑大学) Ewha Womans University(梨花女子大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出Hydra模型,通过将规划器移入模型内部消除生成模型与规划器的表示不对齐问题,结合离散潜在规划与条件流匹配,在物理机器人平台上的目标导向规划与闭环执行能力表现优异。

Comments 29 pages, 12 figures. https://robotixx.github.io/hydra

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30955 2026-09-01 cs.AI 新提交 79%

Learning Action Models with Conditional and Quantified Effects via Uncertainty-Guided Exploration

通过不确定性引导的探索学习具有条件和量化效果的动作模型

Jeffrey Jewett, William Solow, Sandhya Saisubramanian

机构 * Oregon State University(俄勒冈州立大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究针对现有动作模型学习方法难以处理条件与量化效果的问题,提出OHCAM方法,通过不确定性引导探索学习动作模型,在基准领域与机器人任务中验证其样本效率与现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26673 2026-09-01 cs.RO 版本更新 77%

PredVLA: Predictive Sensorimotor Modeling for Sub-Million-Parameter Robot Manipulation

PredVLA:用于机器人操作的亚百万级参数预测编码策略

Hiroki Sawada, Shunichi Kasahara

机构 * Sony Computer Science Laboratory(索尼计算机科学实验室)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 PredVLA是仅0.68M参数的无机器人数据预训练预测编码策略,在LIBERO基准上远超参数匹配的Transformer、LSTM策略,实现强语言条件机器人操作性能且具备显式在线修正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-09-01 cs.RO 版本更新 77%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22067 2026-09-01 cs.RO cs.AI cs.CV cs.LG 版本更新 77%

DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

Comments DeepLeap Technology Co., Ltd., Shenzhen, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-09-01 cs.AI 版本更新 77%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-09-01 cs.LG 版本更新 70%

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.LG

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30702 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

An Agentic Retrobiosynthesis Framework with Learned Frontier Selection

一种基于学习的前沿选择的智能体逆生物合成框架

Philippe Meyer, Guillaume Gricourt, Thomas Duigou, Joan Hérisson, Jean-Loup Faulon

机构 * Université Paris-Saclay(巴黎萨克雷大学) INRAE(法国国家农业食品与环境研究院) AgroParisTech(巴黎高科农业学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于学习前沿选择的智能体逆生物合成框架,经微调的Qwen2.5-7B策略在多个基准上优于MCTS等方法,可提升预算内逆合成搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29937 2026-09-01 cs.AI 新提交 57%

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

AcrossWAM1.0:用于紧凑机器人策略的模块化潜在世界-动作栈

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨物理人工智能机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 该研究针对LaWAM的耦合问题推出AcrossWAM1.0模块化潜在世界-动作栈,在LIBERO实验中实现高成功率,参数规模显著缩小,提供可审计的部署边界。

详情

展开后加载摘要…

URL PDF HTML 收藏