arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-11 至 2025-12-11 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1 篇

2512.09920 2025-12-11 cs.RO cs.AI cs.CV 81%

LISN: Language-Instructed Social Navigation with VLM-based Controller Modulating

LISN: 基于VLM控制器的指令引导社交导航

Junting Chen, Yunchuan Li, Panfeng Jiang, Jiacheng Du, Zixuan Chen, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * RoboScience Co.(RoboScience公司) ShanghaiTech University(上海科技大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV、cs.AI

AI总结 LISN通过VLM控制器实现指令引导的社交导航,提出首个标准化基准并提升动态避障能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏