arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-14 至 2026-01-14 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2601.08470 2026-01-14 cs.CV 70%

Towards Safer Mobile Agents: Scalable Generation and Evaluation of Diverse Scenarios for VLMs

迈向更安全的移动代理:为视觉语言模型(VLMs)可扩展生成和评估多样化场景

Takara Taniguchi, Kuniaki Saito, Atsushi Hashimoto

机构 * OMRON SINIC X

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出HazardForge框架,用于生成多样化场景以评估VLM在复杂环境中的安全决策能力,构建MovSafeBench基准测试并验证VLM在异常场景下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08325 2026-01-14 cs.RO 50%

ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation

ActiveVLA: 向视觉-语言-动作模型注入主动感知以实现精确的3D机器人操控

Zhenyang Liu, Yongchong Gu, Yikai Wang, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 ActiveVLA通过引入主动感知能力,提升机器人在复杂环境中的高精度3D操控性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00634 2026-01-14 cs.SE cs.HC 50%

Does GenAI Make Usability Testing Obsolete?

生成式AI会使可用性测试过时吗?

Ali Ebrahimi Pourasad, Walid Maalej

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出UX-LLM,一种基于大视觉语言模型的可用性问题预测工具,虽无法完全替代传统测试,但可作为补充,尤其适用于资源有限的小型团队。

Comments Accepted for publication at The 47th IEEE/ACM International Conference on Software Engineering ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏