arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9855 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9176 篇

1906.11479 2020-07-13 eess.IV cs.CV cs.LG 62%

Change Detection in Multi-temporal VHR Images Based on Deep Siamese Multi-scale Convolutional Networks

Hongruixuan Chen, Chen Wu, Bo Du, Liangpei Zhang

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13608 2020-06-25 cs.CV cs.LG cs.MM 62%

Comprehensive Information Integration Modeling Framework for Video Titling

Shengyu Zhang, Ziqi Tan, Jin Yu, Zhou Zhao, Kun Kuang, Tan Jiang, Jingren Zhou, Hongxia Yang, Fei Wu

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 6 figures, to appear in KDD 2020 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13046 2020-06-24 cs.CV cs.LG eess.IV 62%

Rotation Invariant Deep CBIR

Subhadip Maji, Smarajit Bose

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments arXiv admin note: text overlap with arXiv:2002.07877

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09272 2020-03-03 cs.CV cs.RO 62%

Learning 3D-aware Egocentric Spatial-Temporal Interaction via Graph Convolutional Networks

Chengxi Li, Yue Meng, Stanley H. Chan, Yi-Ting Chen

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV

Comments Accepted to the International Conference on Robotics and Automation (ICRA) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.10188 2020-01-29 eess.IV cs.CV cs.LG stat.ML 62%

Robust Method for Semantic Segmentation of Whole-Slide Blood Cell Microscopic Image

Muhammad Shahzad, Arif Iqbal Umar, Muazzam A. Khan, Syed Hamad Shirazi, Zakir Khan, Waqas Yousaf

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments 13 pages, 13 figures

Journal ref Volume 2020, Article ID 4015323, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06588 2019-06-18 cs.RO cs.LG 62%

Reinforcement Learning with Non-uniform State Representations for Adaptive Search

Sandeep Manjanna, Herke van Hoof, Gregory Dudek

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

Comments Published at IEEE INTERNATIONAL SYMPOSIUM ON SAFETY, SECURITY AND RESCUE ROBOTICS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00848 2019-06-04 cs.RO cs.LG 62%

Predicting Vehicle Behaviors Over An Extended Horizon Using Behavior Interaction Network

Wenchao Ding, Jing Chen, Shaojie Shen

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

Comments 6+n pages. Accepted to International Conference on Robotics and Automation (ICRA) 2019. IEEE copyright

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.11279 2019-03-28 cs.IR cs.CV cs.LG 62%

Graph Convolution for Multimodal Information Extraction from Visually Rich Documents

Xiaojing Liu, Feiyu Gao, Qiong Zhang, Huasha Zhao

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments naacl'19 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.05054 2018-10-05 cs.CL cs.AI cs.DB cs.LG 62%

IncSQL: Training Incremental Text-to-SQL Parsers with Non-Deterministic Oracles

Tianze Shi, Kedar Tatwawadi, Kaushik Chakrabarti, Yi Mao, Oleksandr Polozov, Weizhu Chen

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09496 2018-01-30 cs.IR cs.AI cs.DL cs.LG 62%

Improving Active Learning in Systematic Reviews

Gaurav Singh, James Thomas, John Shawe-Taylor

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, many figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.04115 2017-06-14 cs.CL cs.AI cs.LG 62%

Zero-Shot Relation Extraction via Reading Comprehension

Omer Levy, Minjoon Seo, Eunsol Choi, Luke Zettlemoyer

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments CoNLL 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.00873 2016-11-04 cs.AI cs.LG 62%

Extracting Actionability from Machine Learning Models by Sub-optimal Deterministic Planning

Qiang Lyu, Yixin Chen, Zhaorong Li, Zhicheng Cui, Ling Chen, Xing Zhang, Haihua Shen

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.02877 2016-06-10 cs.RO cs.AI 62%

Understanding User Instructions by Utilizing Open Knowledge for Service Robots

Dongcai Lu, Feng Wu, Xiaoping Chen

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.03269 2016-05-12 cs.RO cs.AI 62%

A Hierarchical Emotion Regulated Sensorimotor Model: Case Studies

Junpei Zhong, Rony Novianto, Mingjun Dai, Xinzheng Zhang, Angelo Cangelosi

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

Comments Accepted at The 5th International Conference on Data-Driven Control and Learning Systems. 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1210.4889 2012-10-19 cs.LG cs.AI stat.ML 62%

Learning STRIPS Operators from Noisy and Incomplete Observations

Kira Mourao, Luke S. Zettlemoyer, Ronald P. A. Petrick, Mark Steedman

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments Appears in Proceedings of the Twenty-Eighth Conference on Uncertainty in Artificial Intelligence (UAI2012)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01027 2026-08-25 cs.RO 版本更新 57%

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型

Pengfei Zhou, Shengcong Chen, Di Chen, Jiaxu Wang, Rongjun Jin, Bingwen Zhu, Yike Pan, Songen Gu, Kuanning Wang, Shufeng Nan, Xingyu Qiu, Chenhao Qiu, Pu Yang, Yunuo Cai, Jianxiong Gao, Yifan Li, Yanwei Fu, Xiangyu Yue, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。

Comments Our project homepge: https://tau0-wm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21355 2026-08-24 cs.RO 新提交 57%

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: https://vitacphys.github.io/ViTacPhys/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 57%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: https://github.com/cseeyangchen/Human-Centric-AI; Project Page: https://cseeyangchen.github.io/Human-Centric-AI/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18026 2026-08-19 cs.LG cs.CE 新提交 57%

TabNSM: Neural Sparse Mixer for Tabular Regression

TabNSM:面向表格回归的神经稀疏混合器

Ali Eslamian, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Institute for Biomedical Informatics(生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 该研究提出TabNSM框架,通过自适应稀疏交互模块、多阶段回归头等组件,在9个真实回归基准上实现高维表格回归的优性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 57%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16797 2026-08-18 cs.IR cs.AI 新提交 57%

UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation

UniDot:用于大规模推荐中序列建模与特征交互的统一网络

Rongcheng Lin, Yan Sun, Jamey Zhang, Guanglei Xiong, Ivan Ji, Xianjie Chen, Shujian Bu

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 UniDot是统一推荐系统中特征交互与序列建模的架构,经特定优化方法训练后,在TAAC KDD Cup 2026工业赛道获亚军。

Journal ref KDD 2026 UniRec Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16476 2026-08-18 cs.RO 新提交 57%

Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos

通过从野外视频进行可扩展学习揭示具身城市导航中的长尾分布

Bingyi Xia, Han Bao, Zhewei Chen, Hanjing Ye, Jingwen Yu, Yuhan Pang, Wenjun Xu, Jiankun Wang

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出可扩展框架,从网络规模野外 egocentric 视频学习点目标城市导航策略,自动注释视频并训练视觉-语言-动作策略,表征并诊断导航长尾分布与失败模式,验证了知识迁移效果并揭示长尾结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15266 2026-08-18 cs.GR cs.LG 新提交 57%

BrainLinear: A Linear Model for Brain Network Analysis in Sparse Tangent Subspaces

BrainLinear:用于稀疏切空间中脑网络分析的线性模型

Sijing Wu, Dongyuan Li, Miaoting Huang, Weiwei Ye, Ying Zhang, Feng Xia, Renhe Jiang

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究针对脑网络分析中现有方法的冗余与高成本问题,提出轻量几何感知框架BrainLinear,在ABIDE和ADNI数据集上以远低于GNN、Transformer的成本达到更优性能,且支持连接层面解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02169 2026-08-17 cs.LG 版本更新 57%

Responsiveness Verification: Will Predictions Change? How Much? How Often?

响应性验证:预测会改变吗?改变多少?改变频率如何?

Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 57%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交 57%

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08632 2026-08-11 cs.AI 新提交 57%

A QUBO-Inspired Computational Framework for Airport Landside Bottleneck Diagnosis and Dynamic Dispatch Optimization

一种受QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架

Wuming Lei, Xiaobin Li, Mingyan Sun, Jianing Long, Yulin Tong, Yanbin Gao

机构 * East China Jiaotong University(华东交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本研究针对机场陆侧高峰耦合拥堵问题,提出受QUBO启发的计算框架,通过5分钟状态模型与多指标诊断瓶颈,采用两种调度方案优化,在两大机场测试中显著缩减旅客队列,且具备鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06435 2026-08-04 cs.AI 版本更新 57%

Trust but Verify:Evidence-Linked Multi-Agent Clinical Information Extraction in Pathology

从细则中发现幽门螺杆菌:基于证据关联的多智能体胃活检报告病例发现

Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor

机构 * Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理科) Duke–NUS Medical School(新加坡国立大学Duke-NUS医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究针对胃活检报告中幽门螺杆菌证据提取难题,采用Nimblemind多智能体系统,经试点评估其总体准确率达98.61%,虽与其他比较器性能相似,但实现了工作流程整合和可追溯性,还能大幅减少审查时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28829 2026-08-03 cs.NI cs.LG 新提交 57%

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

当遗忘失效时:智能体网络后训练下的可靠数据删除

Zihao Ding, Jun Huang, Liang Dong

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.LG

AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27475 2026-08-03 cs.IR cs.LG 版本更新 57%

OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval

OneShot:面向大规模检索的结合神经打分的排序内索引方法

Ziwei Li, Shuyao Li, Xufeng Cai, Xue Zou, Yiming Ma, Huiting Lu, Wujie Yan, Zhichen Zhao, Yang Lu, Zhe Wang, Rui Luo, Zhengyu Su, Dan Zhang, Yimin Tan, Ji Liu

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究针对推荐系统检索阶段排序目标与索引结构不一致的问题,提出OneShot框架,将索引学习与排序目标联合,突破点积瓶颈,部署于Instagram短视频推荐系统,提升了召回率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏