GenieBlue: Integrating both Linguistic and Multimodal Capabilities for Large Language Models on Mobile Devices
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 14 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 14 pages
专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments ICLR 2025 (spotlight)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);vision language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted at WACV 2025
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI
Comments 34 pages, 14 figures, 10 tables
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 9 pages, 5 figures, Under review
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.AI
Comments 51 pages, 21 figures
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments 12 pages, 0 figures
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICLR 2024 Workshop in Large Language Model (LLM) Agents
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 8 pages, 6 figures, to be published in IEEE IRC 2023
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments Tech Report
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Tech Report
面向人类购物行为的忠实模拟
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。
UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Xiaomi(小米) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。
Comments Technical report. 27 pages, 7 figures, 7 tables
MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn)
AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。
Comments Project page: https://mobile-forge.github.io/
视觉-语言-动作(VLA)模型应如何使用本体感受状态?
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 本研究针对视觉-语言-动作(VLA)模型的本体感受状态接入方式开展受控实验,探究状态接入位置、历史长度等问题,得出系统性答案并提炼为可验证的VLA模型设计原则。
FreqNav:面向面向对象空中视觉语言导航的分阶段频率路由
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn)
AI总结 针对现有空中VLN方法的感知干扰问题,提出FreqNav框架,通过动态分配视觉令牌实现分阶段频率路由,提升性能并加快推理速度,验证了其实际应用潜力。
CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Engineering, University of Cambridge(剑桥大学工程系)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力
Comments Project Page: https://dannymcy.github.io/cyclevla/
SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。
Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)
EdgeCoInfer:用于设备端多模态大模型的分层协作推理
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
AI总结 针对边缘环境中多模态大模型面临的挑战,提出EdgeCoInfer框架,通过模型间功能模块共享和模型内细粒度划分实现粒度自适应部署,采用混合进化分层强化学习解决问题,实验表明该框架能提高任务完成率并降低系统成本和内存消耗。
诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败
机构 * SimpleAI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)
AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。
Journal ref RSS SemRob Workshop 2026
让它简单:视觉-语言-动作模型的单步动作生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。
Comments 13 pages, 10 figures
通过用密集CLIP泛化语义映射实现开放词汇目标导航
机构 * Shanghai AI Lab(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。
Comments Accepted by ICRA 2026
CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)
AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。
Comments 16 pages, 6 figures