arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1576 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1576 篇

2510.19655 2026-03-05 cs.RO 67%

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01813 2026-03-03 cs.RO 67%

SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph

SSMG-Nav: 通过语义骨架记忆图增强终身物体导航

Haochen Niu, Lantao Zhang, Xingwu Ji, Rendong Ying, Peilin Liu, Fei Wen

机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00926 2026-03-03 cs.RO 67%

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作

Xiongfeng Peng, Jiaqian Yu, Dingzhe Li, Yixiang Jin, Lu Xu, Yamin Mao, Chao Zhang, Weiming Li, Sujin Jang, Dongwook Lee, Daehyun Ji

机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Hanyang University ERICA(翰洋大学ERICA)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-03-03 cs.CV cs.AI cs.LG 67%

Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22663 2026-02-27 cs.RO 67%

Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline

重新审视视觉-语言-动作模型的实用性:一个全面的基准和一个改进的基线

Wenxuan Song, Jiayi Chen, Xiaoquan Sun, Huashuo Lei, Yikai Qin, Wei Zhao, Pengxiang Ding, Han Zhao, Tongxin Wang, Pengxu Hou, Zhide Zhong, Haodong Yan, Donglin Wang, Jun Ma, Haoang Li

机构 * OpenHelix-Team(OpenHelix团队)

专题命中 GUI与屏幕智能体 :VLM(abstract);LLaVA(abstract)

AI总结 本文提出CEbench基准和LLaVA-VLA模型,通过轻量级设计和两阶段训练提升视觉-语言-动作模型的实用性,实现在消费级GPU上的实际应用。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09082 2026-02-25 cs.CV cs.AI cs.CL cs.LG 67%

UI-Venus-1.5 Technical Report

UI-Venus-1.5 技术报告

Venus Team, Changlong Gao, Zhangxuan Gu, Yulin Liu, Xinyu Qiu, Shuheng Shen, Yue Wen, Tianyu Xia, Zhenyu Xu, Zhengwen Zeng, Beitong Zhou, Xingran Zhou, Weizhi Chen, Sunhao Dai, Jingya Dou, Yichen Gong, Yuan Guo, Zhenlin Guo, Feng Li, Qian Li, Jinzhen Lin, Yuqi Zhou, Linchao Zhu, Liang Chen, Zhenyu Guo, Changhua Meng, Weiqiang Wang

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 UI-Venus-1.5通过统一的GUI代理和关键技术改进,在多个基准测试中实现了最先进的性能,展示了在现实世界应用中的强大导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20037 2026-02-17 cs.RO 67%

Visio-Verbal Teleimpedance Interface: Enabling Semi-Autonomous Control of Physical Interaction via Eye Tracking and Speech

视觉-语言远阻抗接口:通过眼动追踪和语音实现物理交互的半自主控制

Henk H. A. Jekel, Alejandro Díaz Rosales, Luka Peternel

机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人系,代尔夫特理工大学) European Organization for Nuclear Research (CERN)(欧洲核子研究中心)

专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract)

AI总结 本文提出一种结合眼动追踪和语音交互的视觉-语言远阻抗接口,用于通过生成刚度矩阵实现远程机械臂的半自主物理交互控制。

Journal ref Frontiers in Robotics and AI, Volume 13, 1749105, February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 67%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 67%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08440 2026-02-16 cs.RO 67%

SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios

SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Microsoft(微软公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 67%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 67%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA 67%

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01644 2026-02-03 cs.LG cs.AI cs.CV cs.MA cs.RO 67%

From Perception to Action: Spatial AI Agents and World Models

从感知到行动:空间AI代理与世界模型

Gloria Felicia, Nolan Bryant, Handi Putra, Ayaan Gazali, Eliel Lobo, Esteban Rojas

机构 * AtlasPro AI

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种统一的三轴分类法,将代理能力与空间任务联系起来,强调空间定位与符号定位的区别,并指出世界模型对跨尺度安全部署的重要性。

Comments 61 pages, 742 citations, 1 figure, 3 tables. Survey paper on spatial AI agents, embodied AI, graph neural networks, and world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12479 2026-01-21 cs.RO 67%

Language-Based Swarm Perception: Decentralized Person Re-Identification via Natural Language Descriptions

基于语言的群体感知:通过自然语言描述实现去中心化的人员重识别

Miquel Kegeleirs, Lorenzo Garattoni, Gianpiero Francesca, Mauro Birattari

机构 * IRIDIA, Université libre de Bruxelles(IRIDIA,布鲁塞尔自由大学) Toyota Motor Europe(丰田欧洲 motors)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种基于自然语言的去中心化人员重识别方法,通过视觉-语言模型生成文本描述,实现群体协作识别与可解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04070 2025-12-19 cs.CL cs.MM 67%

LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward

LaF-GRPO:通过GRPO与LLM-as-Follower生成视障人士的现场导航指令

Yi Zhao, Siqi Wang, Jing Li

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 LaF-GRPO通过GRPO与LLM-as-Follower生成更直观安全的视障人士现场导航指令,提升指令准确性和实用性。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO 67%

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04356 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment

通过自增强对比对齐缓解多模态大语言模型中的对象和动作幻觉

Kai-Po Chang, Wei-Yuan Cheng, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SANTA框架通过自增强对比对齐方法,有效缓解多模态大语言模型中的对象和动作幻觉问题。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Project page: https://kpc0810.github.io/santa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL 67%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14004 2025-11-24 cs.RO 67%

Searching in Space and Time: Unified Memory-Action Loops for Open-World Object Retrieval

在空间和时间中搜索:统一的记忆-动作循环用于开放世界物体检索

Taijing Chen, Sateesh Kumar, Junhong Xu, Georgios Pavlakos, Joydeep Biswas, Roberto Martín-Martín

机构 * Department of Computer Science, The University of Texas at Austin(计算机科学系,德克萨斯大学奥斯汀分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)

AI总结 STAR框架通过统一记忆查询和具身动作,提升开放世界中时空物体检索的效率与准确性。

Comments https://amrl.cs.utexas.edu/STAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06182 2025-11-24 cs.RO 67%

OpenVLN: Open-world Aerial Vision-Language Navigation

OpenVLN: 开放世界空中视觉语言导航

Peican Lin, Gan Sun, Chenxi Liu, Fazeng Li, Weihong Ren, Yang Cong

机构 * School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人重点实验室) State Key Laboratory of Robotics and System, School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院机器人与系统重点实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 OpenVLN通过强化学习和长视距规划器提升无人机在复杂空中环境中的长视距导航能力。

Comments Content: 8 pages 4 figures, conference paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19002 2025-11-18 cs.CV cs.AI cs.CL cs.LG 67%

VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction

Hao Wang, Eiki Murata, Lingfang Zhang, Ayako Sato, So Fukuda, Ziqi Yin, Wentao Hu, Keisuke Nakao, Yusuke Nakamura, Sebastian Zwirner, Yi-Chia Chen, Hiroyuki Otomo, Hiroki Ouchi, Daisuke Kawahara

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(CyberAgent公司) AI Shift, Inc.(AI Shift公司) Nara Institute of Science and Technology(奈良研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25122 2025-10-30 cs.RO 67%

NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies

Jiahong Chen, Jing Wang, Long Chen, Chuwei Cai, Jinghui Lu

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Alberta(阿尔伯塔大学) Xiaomi EV(小米电动车) Northeastern University(东北大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24949 2025-10-30 cs.RO cs.AI cs.CV cs.LG 67%

SCOUT: A Lightweight Framework for Scenario Coverage Assessment in Autonomous Driving

Anil Yildiz, Sarah M. Thornton, Carl Hildebrandt, Sreeja Roy-Singh, Mykel J. Kochenderfer

机构 * Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) Nuro Inc.(Nuro公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11717 2025-10-20 cs.LG cs.AI cs.CL cs.CV 67%

WebInject: Prompt Injection Attack to Web Agents

Xilong Wang, John Bloch, Zedian Shao, Yuepeng Hu, Shuyan Zhou, Neil Zhenqiang Gong

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11886 2025-10-15 cs.RO 67%

Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation

Shuo Wang, Yongcai Wang, Wanting Li, Xudong Cai, Yucheng Wang, Maiyue Chen, Kaihui Wang, Zhizhong Su, Deying Li, Zhaoxin Fan

机构 * Renmin University of China(中国人民大学) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Horizon Robotics(地平线机器人)

专题命中 GUI与屏幕智能体 :visual question answering(abstract);grounding(abstract)

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09038 2025-10-13 cs.AI cs.CL cs.CV cs.CY cs.LG 67%

Auto-scaling Continuous Memory for GUI Agent

Wenyi Wu, Kun Zhou, Ruoxin Yuan, Vivian Yu, Stephen Wang, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Fudan University(复旦大学) Abel AI

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20711 2025-10-13 cs.HC cs.RO 67%

Automating eHMI Action Design with LLMs for Automated Vehicle Communication

Ding Xia, Xinyue Gui, Fan Gao, Dongyuan Li, Mark Colley, Takeo Igarashi

机构 * The University of Tokyo(东京大学) University College London(伦敦大学学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

Comments Accepted as findings for EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07077 2025-10-09 cs.RO cs.AI cs.CV cs.LG 67%

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to IEEE Access, website: https://vla-survey.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23655 2025-09-30 cs.RO cs.AI cs.CV cs.LG 67%

Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models

Rokas Bendikas, Daniel Dijkman, Markus Peschl, Sanjay Haresh, Pietro Mazzaglia

机构 * Centre for Artificial Intelligence, UCL(人工智能中心,伦敦大学学院) Qualcomm AI Research(高通人工智能研究)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Presented at 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏