arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-25 至 2025-12-25 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2512.20674 2025-12-25 cs.LG cs.AI cs.CV 82%

HyDRA: Hierarchical and Dynamic Rank Adaptation for Mobile Vision Language Model

HyDRA:面向移动视觉语言模型的分层和动态秩适应

Yuanhao Xi, Xiaohuan Bing, Ramin Yahyapour

机构 * Liaoning Technical University(辽宁技术大学) University of Göttingen(哥廷根大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 HyDRA通过分层和动态秩调度优化,提升移动视觉语言模型的微调效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20940 2025-12-25 cs.RO 50%

ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments

连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。

Shuhao Ye, Sitong Mao, Yuxiang Cui, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19083 2025-12-25 cs.RO 50%

CoDrone: Autonomous Drone Navigation Assisted by Edge and Cloud Foundation Models

CoDrone:由边缘和云基础模型辅助的自主无人机导航

Pengyu Chen, Tao Ouyang, Ke Luo, Weijie Hong, Xu Chen

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 CoDrone通过整合云-边-端协作计算框架和基础模型,提升无人机自主导航性能,实现更高效和精确的环境感知与动态适应。

Comments This paper is accepted by the IEEE Internet of Things Journal (IoT-J) for publication in the Special Issue on "Augmented Edge Sensing Intelligence for Low-Altitude IoT Systems"

详情

展开后加载摘要…

URL PDF HTML 收藏