Towards Safer Mobile Agents: Scalable Generation and Evaluation of Diverse Scenarios for VLMs
迈向更安全的移动代理:为视觉语言模型(VLMs)可扩展生成和评估多样化场景
机构 * OMRON SINIC X
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV
AI总结 本研究提出HazardForge框架,用于生成多样化场景以评估VLM在复杂环境中的安全决策能力,构建MovSafeBench基准测试并验证VLM在异常场景下的性能下降。