arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2797 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2797 篇

2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 67%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18746 2026-05-26 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

ESI-Bench: 迈向闭环感知-动作的具身空间智能

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) Northwestern University(西北大学)

专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。

Comments https://esi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO 67%

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 67%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO 67%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18975 2026-04-22 cs.MA 67%

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game

门控协调:Minecraft游戏中的高效多智能体协作

HuaDong Jian, Chenghao Li, Haoyu Wang, Jiajia Shuai, Jinyu Guo, Yang Yang, Chaoning Zhang

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 本文提出门控协调机制,通过分离私有状态与公共协调状态,减少通信噪声,提升多智能体在Minecraft中的协作效率与任务完成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13822 2026-04-16 cs.LG 67%

UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization

UI-Copilot: 通过工具集成策略优化推进长周期GUI自动化

Zhengxi Lu, Fei Tang, Guangyi Liu, Kaitao Song, Xu Tan, Jin Ma, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 本文提出UI-Copilot框架,通过分离持久观察与临时执行上下文实现内存解耦,结合工具集成策略优化提升长周期GUI任务性能,实验显示其在MemGUI-Bench和AndroidWorld上均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22025 2026-04-09 cs.AI cs.CL cs.CV 67%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26107 2026-03-30 cs.HC 67%

One Is Not Enough: How People Use Multiple AI Models in Everyday Life

一个不够:人们如何在日常生活中使用多个AI模型

Seunghwa Pyo, Donggun Lee, Jungwoo Rhee, Soobin Park, Youn-kyung Lim

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 研究探讨了人们如何在日常生活中协调多个多模态大语言模型,揭示用户构建模型层级和切换策略以优化任务效率与输出可信度。

Comments Accepted as a poster at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14448 2026-03-17 cs.LG 67%

Zoom to Essence: Trainless GUI Grounding by Inferring upon Interface Elements

聚焦本质:通过推断界面元素实现无训练GUI接地

Ziwei Liu, Tao Feng, Borui Kang, Yanbing Yang, Jun Luo

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 本文提出ZoomUI,通过推断界面元素实现无训练GUI接地,利用推理缩放引导常见MLLM逐步锚定指令元素到更详细的界面元素,提升GUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20503 2026-03-11 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

基于基础模型的具身AI在移动服务机器人中的应用:系统综述

Matthew Lisondra, Beno Benhabib, Goldie Nejat

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。

Comments v2: Expanded systematic review; resubmitted to Robotics

Journal ref Robotics 2026, 15(3), 55

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19516 2026-02-24 cs.CE 67%

Pixel2Phys: Distilling Governing Laws from Visual Dynamics

Pixel2Phys: 从视觉动态中提炼 governing laws

Ruikun Li, Jun Yao, Yingfan Hua, Shixiang Tang, Biqing Qi, Bin Liu, Wanli Ouyang, Yan Lu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 Pixel2Phys通过协作多智能体框架从视觉动态中自动提炼物理定律,实现从高维数据到简洁可解释方程的转化。

Comments CVPR2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 67%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14979 2026-02-17 cs.RO 67%

RynnBrain: Open Embodied Foundation Models

RynnBrain: 开放式具身基础模型

Ronghao Dang, Jiayan Guo, Bohan Hou, Sicong Leng, Kehan Li, Xin Li, Jiangpin Liu, Yunxuan Mao, Zhikai Wang, Yuqian Yuan, Minghao Zhu, Xiao Lin, Yang Bai, Qian Jiang, Yaxi Zhao, Minghua Zeng, Junlong Gao, Yuming Jiang, Jun Cen, Siteng Huang, Liuyi Wang, Wenqiao Zhang, Chengju Liu, Jianfei Yang, Shijian Lu, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract)

AI总结 RynnBrain提出了一种开放的具身基础模型,通过统一框架强化感知、推理、规划等能力,显著优于现有模型,并能高效适应多种具身任务。

Comments Homepage: https://alibaba-damo-academy.github.io/RynnBrain.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA 67%

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 67%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23343 2025-12-30 cs.CL cs.AI cs.CV 67%

AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents

AI 与大脑:从认知神经科学到自主代理的记忆系统

Jiafeng Liang, Hao Li, Chang Li, Jiaqi Zhou, Shixin Jiang, Zekun Wang, Changkai Ji, Zhihao Zhu, Runxuan Liu, Tao Ren, Jinlan Fu, See-Kiong Ng, Xia Liang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文从认知神经科学到自主代理,系统综合了记忆的跨学科知识,探讨了记忆的定义、功能、分类、存储机制及安全问题,并展望了多模态记忆系统和技能获取的未来研究方向。

Comments 57 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23132 2025-12-30 cs.CR cs.LG cs.MA 67%

Multi-Agent Framework for Threat Mitigation and Resilience in AI-Based Systems

多智能体框架用于AI系统中的威胁缓解与韧性

Armstrong Foundjem, Lionel Nganyewou Tidjon, Leuson Da Silva, Foutse Khomh

机构 * Department of Computer and Software Engineering, Polytechnique Montreal(计算机与软件工程系,蒙特利尔理工学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出多智能体框架,用于识别和缓解AI系统中的威胁,通过构建威胁图分析漏洞和攻击模式,提升系统韧性。

Comments 56 pages, 18 Figures, 22 Tables, TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23046 2025-12-16 cs.CL cs.AI cs.CV cs.RO 67%

SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions

SoMi-ToM:评估具身社会互动中的多视角理论之心假设

Xianzhe Fan, Xuhui Zhou, Chuanyang Jin, Kolby Nottingham, Hao Zhu, Maarten Sap

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SoMi-ToM基准通过多视角评估人类与模型在具身社会互动中的理论之心能力,揭示大型视觉-语言模型在复杂社交场景中的不足。

Comments 24 pages, 6 figures

Journal ref Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV 67%

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 67%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19654 2025-11-26 cs.CV cs.AI cs.CL cs.RO 67%

From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction

从预测到规划:用于协作状态-动作预测的策略世界模型

Zhida Zhao, Talas Fu, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出策略世界模型(PWM),通过整合世界建模与轨迹规划,并利用无动作未来状态预测提升规划性能,实现更可靠的自主驾驶决策。

Comments Accepted by NuerIPS 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09127 2025-11-13 cs.AI cs.CL cs.CV cs.HC 67%

History-Aware Reasoning for GUI Agents

Ziwei Wang, Leyang Yang, Xiaoxuan Tang, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15685 2025-11-04 cs.RO 67%

From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems

Xiuchao Sui, Daiying Tian, Qi Sun, Ruirui Chen, Dongkyu Choi, Kenneth Kwok, Soujanya Poria

机构 * IHPC, Agency for Science, Technology and Research, Singapore(科技研究局智能技术中心,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

Comments EMNLP 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17336 2025-11-03 cs.MM cs.CL cs.CV 67%

Mano Technical Report

Tianyu Fu, Anyang Su, Chenxu Zhao, Hanning Wang, Minghui Wu, Zhe Yu, Fei Hu, Mingjia Shi, Wei Dong, Jiayao Wang, Yuyang Chen, Ruiyang Yu, Siran Peng, Menglin Li, Nan Huang, Haitian Wei, Jiawei Yu, Yi Xin, Xilin Zhao, Kai Gu, Ping Jiang, Sifan Zhou, Shuo Wang

机构 * Mininglamp Technology(Mininglamp技术)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21746 2025-10-28 cs.RO 67%

Avi: Action from Volumetric Inference

Harris Song, Long Le

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of pennsylvania(宾夕法尼亚大学)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract)

Comments NeurIPS 2025 Workshop on Embodied World Models for Decision Making. URL: https://avi-3drobot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01055 2025-10-20 cs.AI cs.CL cs.CV 67%

VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use

Dongfu Jiang, Yi Lu, Zhuofeng Li, Zhiheng Lyu, Ping Nie, Haozhe Wang, Alex Su, Hui Chen, Kai Zou, Chao Du, Tianyu Pang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Sea AI Lab(Sea AI 实验室) University of Toronto(多伦多大学) Shanghai University(上海大学) HKUST(香港科技大学) M-A-P National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 32 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07882 2025-10-16 cs.RO 67%

Towards Proprioception-Aware Embodied Planning for Dual-Arm Humanoid Robots

Boyu Li, Siyuan He, Hang Xu, Haoqi Yuan, Xinrun Xu, Yu Zang, Liwei Hu, Junpeng Yue, Zhenxiong Jiang, Pengbo Hu, Börje F. Karlsson, Yehui Tang, Zongqing Lu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) AgiBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01424 2025-10-14 cs.RO 67%

TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control

Zhenyang Liu, Yongchong Gu, Sixiao Zheng, Yanwei Fu, Xiangyang Xue, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12163 2025-10-09 cs.SE 67%

AgentDroid: A Multi-Agent Framework for Detecting Fraudulent Android Applications

Ruwei Pan, Hongyu Zhang, Zhonghao Jiang, Ran Hou

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏