arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2411.03709 2026-01-28 cs.HC cs.AI 79%

AutoGameUI: Constructing High-Fidelity GameUI via Multimodal Correspondence Matching

AutoGameUI: 通过多模态对应匹配构建高保真的游戏界面

Zhongliang Tang, Qingrong Cheng, Mengchen Tan, Yongxiang Zhang, Fei Xia

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 AutoGameUI通过多模态对应匹配自动构建高保真的游戏界面,提升了游戏界面设计的效率和一致性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10809 2026-01-28 cs.CR cs.LG 71%

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

针对代理的恶意图像补丁:多模态操作系统代理劫持

Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) University of Oxford(牛津大学)

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出恶意图像补丁(MIPs)攻击,通过篡改屏幕区域使多模态OS代理执行有害操作,揭示了OS代理的安全漏洞。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 57%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CL

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏