arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2797 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2797 篇

2507.01376 2025-07-03 cs.AI 70%

AI Agents and Agentic AI-Navigating a Plethora of Concepts for Future Manufacturing

Yinwang Ren, Yangyang Liu, Tang Ji, Xun Xu

机构 * Department of Mechanical and Mechatronics Engineering, Faculty of Engineering and Design, University of Auckland(机械与机电工程系,工程与设计学院,奥克兰大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

Comments Submitted to JMS(March 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17612 2025-06-24 cs.CV 70%

JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent

Yunlong Lin, Zixu Lin, Kunjie Lin, Jinbin Bai, Panwang Pan, Chenxin Li, Haoyu Chen, Zhongdao Wang, Xinghao Ding, Wenbo Li, Shuicheng Yan

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Bytedance(字节跳动) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments 40 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10069 2025-06-18 cs.RO cs.CV 70%

SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation

Xiangyu Shi, Zerui Li, Wenqi Lyu, Jiatong Xia, Feras Dayoub, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning at the University of Adelaide(澳大利亚机器学习研究所(阿德莱德大学))

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by IROS 2025. Project website: https://sxyxs.github.io/smartway/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17399 2025-05-27 cs.CL 70%

FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow

Haoyu Sun, Huichen Will Wang, Jiawei Gu, Linjie Li, Yu Cheng

机构 * Tongji University(同济大学) University of Washington(华盛顿大学) Sun Yat-sen University(中山大学) Microsoft(微软) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21620 2025-05-27 cs.AI 70%

UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning

Zhengxi Lu, Yuxiang Chai, Yaxuan Guo, Xi Yin, Liang Liu, Hao Wang, Han Xiao, Shuai Ren, Guanjing Xiong, Hongsheng Li

机构 * vivo AI Lab(vivo人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.AI

Comments Updated UI-R1-E-3B

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20464 2025-05-14 cs.AI 70%

A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning

Jiahao Li, Kaer Huang

机构 * Lenovo Research(联想研究院)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01268 2024-12-03 cs.CV 70%

Ponder & Press: Advancing Visual GUI Agent towards General Computer Control

Yiqin Wang, Haoji Zhang, Jingqi Tian, Yansong Tang

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10252 2024-11-18 cs.CV 70%

Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning

Jingru Yang, Huan Yu, Yang Jingxin, Chentianye Xu, Yin Biao, Yu Sun, Shengfeng He

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16048 2024-10-29 cs.HC cs.AI 70%

GUIDE: Graphical User Interface Data for Execution

Rajat Chawla, Adarsh Jha, Muskaan Kumar, Mukunda NS, Ishaan Bhola

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

Comments 11 pages, 8 figures, 3 Tables and 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11872 2024-10-18 cs.HC cs.AI cs.LG 70%

ClickAgent: Enhancing UI Location Capabilities of Autonomous Agents

Jakub Hoscilowicz, Bartosz Maj, Bartosz Kozakiewicz, Oleksii Tymoshchuk, Artur Janicki

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

Comments The code for ClickAgent is available at github.com/Samsung/ClickAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14170 2024-09-24 cs.CV 70%

LFP: Efficient and Accurate End-to-End Lane-Level Planning via Camera-LiDAR Fusion

Guoliang You, Xiaomeng Chu, Yifan Duan, Xingchen Li, Sha Zhang, Jianmin Ji, Yanyong Zhang

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17842 2024-07-26 cs.LG cs.AI 70%

On the Opportunities of (Re)-Exploring Atmospheric Science by Foundation Models: A Case Study

Lujia Zhang, Hanzhe Cui, Yurong Song, Chenyue Li, Binhang Yuan, Mengqian Lu

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03710 2024-05-08 cs.SE cs.AI cs.LG 70%

Automating the Enterprise with Foundation Models

Michael Wornow, Avanika Narayan, Krista Opsahl-Ong, Quinn McIntyre, Nigam H. Shah, Christopher Re

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10040 2024-03-19 eess.IV cs.CV 70%

Histo-Genomic Knowledge Distillation For Cancer Prognosis From Histopathology Whole Slide Images

Zhikang Wang, Yumeng Zhang, Yingxue Xu, Seiya Imoto, Hao Chen, Jiangning Song

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09127 2024-01-23 cs.CR cs.AI cs.LG 70%

Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts

Yuanwei Wu, Xiang Li, Yixin Liu, Pan Zhou, Lichao Sun

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13549 2023-11-23 cs.CV cs.RO 70%

ADriver-I: A General World Model for Autonomous Driving

Fan Jia, Weixin Mao, Yingfei Liu, Yucheng Zhao, Yuqing Wen, Chi Zhang, Xiangyu Zhang, Tiancai Wang

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00782 2022-07-05 cs.AI cs.HC 70%

Enabling Harmonious Human-Machine Interaction with Visual-Context Augmented Dialogue System: A Review

Hao Wang, Bin Guo, Yating Zeng, Yasan Ding, Chen Qiu, Ying Zhang, Lina Yao, Zhiwen Yu

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments 33pages, 4pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.00600 2022-03-02 cs.LG cs.AI 70%

Dual Embodied-Symbolic Concept Representations for Deep Learning

Daniel T. Chang

专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01880 2021-09-07 eess.IV cs.CV cs.LG 70%

Deep learning facilitates fully automated brain image registration of optoacoustic tomography and magnetic resonance imaging

Yexing Hu, Berkan Lafci, Artur Luzgin, Hao Wang, Jan Klohs, Xose Luis Dean-Ben, Ruiqing Ni, Daniel Razansky, Wuwei Ren

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.03340 2021-06-07 cs.CV 70%

MANTRA: Memory Augmented Networks for Multiple Trajectory Prediction

Francesco Marchetti, Federico Becattini, Lorenzo Seidenari, Alberto Del Bimbo

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted at CVPR20

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09104 2026-08-11 cond-mat.mtrl-sci cs.LG physics.ins-det 新提交 67%

Multitask Scanning Probe Microscopy

多任务扫描探针显微镜

Aditya Raghavan, Yu Liu, Ian Mercer, JP Maria, Sergei Kalinin

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 该研究提出多任务扫描探针显微镜,基于多任务高斯过程的闭环工作流程,实现测量位置与模态的自主选择,在AlScN晶圆上验证了其可扩展主动学习应用的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08005 2026-08-11 cs.LG 版本更新 67%

Preference Redirection via Attention Concentration: An Attack on Computer Use Agents

通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击

Dominik Seip, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。

Journal ref Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19930 2026-08-10 cs.HC 版本更新 67%

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配

Guangyi Liu, Pengxiang Zhao, Gao Wu, Yiwen Yin, Mading Li, Liang Liu, Congxiao Liu, Zhang Qi, Mengyan Wang, Liang Guo, Jiangning Zhang, Yong Liu

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。

Comments Project page: https://mobile-forge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29600 2026-08-03 cs.RO 新提交 67%

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航

An Liu, Bingxi Liu, Hongyu Ding, Yixuan Jiang, Yaran Chen, Fulin Tang, Cong Leng, Hong Zhang, Jian Cheng

专题命中 多模态Agent :multimodal(abstract,abstract_cn)

AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 67%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 67%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06559 2026-07-08 cs.RO 新提交 67%

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

RynnWorld-4D:用于机器人操作的4D具身世界模型

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室)

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract)

AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29425 2026-06-30 cs.AI cs.CL cs.MA cs.MM 67%

Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning

辩论者混合:在多智能体推理中实现架构级别的辩论学习

Dayong Liang, Kaisong Gong, Yi Cai, Changmeng Zheng, Xiao-Yong Wei

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19926 2026-06-19 cs.HC 新提交 67%

MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management

MemGUI-Agent: 一种具有主动上下文管理的端到端长时移动GUI智能体

Guangyi Liu, Gao Wu, Congxiao Liu, Pengxiang Zhao, Liang Liu, Mading Li, Qi Zhang, Mengyan Wang, Liang Guo, Yong Liu

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 提出MemGUI-Agent,通过主动上下文管理机制(ConAct)将上下文管理作为一等动作,解决长时任务中提示膨胀和关键信息稀释问题,在8B模型上达到最佳性能。

Comments 33 pages, 6 figures. Project page: https://memgui-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11078 2026-06-10 cs.AI cs.CL cs.CV 新提交 67%

A History-Aware Visually Grounded Critic for Computer Use Agents

面向计算机使用代理的历史感知视觉基础批评家

Jaewoo Lee, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Supriyo Chakraborty, Kartik Balasubramaniam, Sambit Sahu, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Capital One University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。

Comments Code: https://github.com/G-JWLee/HiViG

详情

展开后加载摘要…

URL PDF HTML 收藏