arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2790 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2790 篇

2512.02395 2025-12-09 cs.CV 79%

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

Skywork-R1V4:通过图像与深度研究交织思考实现代理多模态智能

Yifan Zhang, Liang Hu, Haofeng Sun, Peiyu Wang, Yichen Wei, Shukang Yin, Jiangbo Pei, Wei Shen, Peng Xia, Yi Peng, Tianyidan Xie, Eric Li, Yang Liu, Xuchen Song, Yahui Zhou

机构 * Skywork AI

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 Skywork-R1V4通过交织推理实现多模态代理智能,仅用监督学习在少数据上训练,超越现有模型在多个基准测试中的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05111 2025-12-05 cs.CV 79%

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12679 2025-12-05 cs.CV 79%

TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents

TongUI: 通过多模态网络教程构建大规模GUI代理

Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 TongUI通过多模态网络教程构建大规模GUI代理,利用GUI-Net数据集提升定位和导航性能,优于基线代理10%。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20085 2025-12-04 cs.AI cs.MA 79%

VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis

VICoT-Agent:一种用于可解释多模态推理和可扩展遥感分析的视觉交织思维链框架

Chujie Wang, Zhiyuan Luo, Ruiqi Liu, Can Ran, Shenghua Fan, Xi Chen, Chu He

机构 * Wuhan University(武汉大学) University of Toronto(多伦多大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 VICoT-Agent通过视觉交织思维链框架实现多模态推理和遥感分析,采用堆栈结构和模块化工具集提升推理效率,并通过推理堆栈蒸馏方法降低模型复杂度,显著提升推理透明度和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17425 2025-11-21 cs.AI 79%

Evaluating Multimodal Large Language Models with Daily Composite Tasks in Home Environments

在家庭环境中评估多模态大语言模型的日常复合任务

Zhenliang Zhang, Yuxi Wang, Hongzhao Xie, Shiyun Zhao, Mingyuan Liu, Yujie Lu, Xinyi He, Zhenku Cheng, Yujia Peng

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence(通用人工智能国家重点实验室、北京通用人工智能研究院) School of Psychological and Cognitive Sciences and Beijing Key Laboratory of Behavior and Mental Health, Key Laboratory of Machine Perception (Ministry of Education), Peking University(心理与认知科学学院及北京行为与心理健康重点实验室、机器感知重点实验室(教育部)) School of Intelligence Science and Technology, Peking University(智能科学与技术学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本研究在家庭环境中评估了多模态大语言模型在日常复合任务中的表现,发现其在物体理解、空间智能和社会活动领域存在显著差距,为具身MLLMs的发展提供了初步评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13476 2025-11-18 cs.AI 79%

Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation

Zhipeng Ma, Ali Rida Bahja, Andreas Burgdorf, André Pomp, Tobias Meisen, Bo Nørregaard Jørgensen, Zheng Grace Ma

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Journal ref Applied Sciences, 2025, 15(21), 11619

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12586 2025-11-18 cs.CL 79%

MMWOZ: Building Multimodal Agent for Task-oriented Dialogue

Pu-Hai Yang, Heyan Huang, Heng-Da Xu, Fanshu Sun, Xian-Ling Mao, Chaoxu Mu

机构 * School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) School of Computer Science(计算机科学学院) School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(计算机科学与技术学院,北京理工大学,北京,中国)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19768 2025-11-18 cs.CL 79%

T^2Agent A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search

Xing Cui, Yueying Zou, Zekun Li, Peipei Li, Xinyuan Xu, Xuannan Liu, Huaibo Huang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

Comments accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11257 2025-11-17 cs.AI cs.CE cs.LG 79%

AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery

Yuqi Yin, Yibo Fu, Siyuan Wang, Peng Sun, Hongyu Wang, Xiaohui Wang, Lei Zheng, Zhiyong Li, Zhirong Liu, Jianji Wang, Zhaoxi Sun

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09804 2025-11-14 cs.AI 79%

SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations

Eric Xie, Danielle Waterfield, Michael Kennedy, Aidong Zhang

专题命中 多模态Agent :multi-modal(title);multimodal(abstract);分类 cs.AI

Comments 32 pages, 14 figures, accepted into EAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26114 2025-10-31 cs.CV 79%

OracleAgent: A Multimodal Reasoning Agent for Oracle Bone Script Research

Caoshuo Li, Zengmao Ding, Xiaobin Hu, Bang Li, Donghao Luo, Xu Peng, Taisong Jin, Yongge Liu, Shengwei Han, Jing Yang, Xiaoping He, Feng Gao, AndyPian Wu, SevenShu, Chaoyang Wang, Chengjie Wang

机构 * Xiamen University(厦门大学) Anyang Normal University(安阳师范学院) Tencent YouTu Lab(腾讯YouTu实验室) Tencent SSV(腾讯SSV)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21142 2025-10-29 cs.AI cs.LG q-bio.NC 79%

Multimodal Dreaming: A Global Workspace Approach to World Model-Based Reinforcement Learning

Léopold Maytié, Roland Bertin Johannet, Rufin VanRullen

机构 * Univ Toulouse, CNRS, CerCo, and ANITI, Artificial and Natural Intelligence Toulouse Institute(图卢兹大学、法国国家科学研究中心、CerCo以及ANITI人工智能与自然智能图卢兹研究所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23691 2025-10-29 cs.AI 79%

Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents

Zihao Wang, Xujing Li, Yining Ye, Junjie Fang, Haoming Wang, Longxiang Liu, Shihao Liang, Junting Lu, Zhiyong Wu, Jiazhan Feng, Wanjun Zhong, Zili Li, Yu Wang, Yu Miao, Bo Zhou, Yuanfan Li, Hao Wang, Zhongkai Zhao, Faming Wu, Zhengxuan Jiang, Weihao Tan, Heyuan Yao, Shi Yan, Xiangyang Li, Yitao Liang, Yujia Qin, Guang Shi

机构 * Bytedance Seed(字节跳动种子)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20077 2025-10-29 cs.RO cs.CV cs.HC 79%

Queryable 3D Scene Representation: A Multi-Modal Framework for Semantic Reasoning and Robotic Task Planning

Xun Li, Rodrigo Santa Cruz, Mingze Xi, Hu Zhang, Madhawa Perera, Ziwei Wang, Ahalya Ravendran, Brandon J. Matthews, Feng Xu, Matt Adcock, Dadong Wang, Jiajun Liu

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 多模态Agent :multi-modal(title);multimodal(abstract);分类 cs.CV

Journal ref MM '25: Proceedings of the 33rd ACM International Conference on Multimedia (2025) Pages 12492 - 12500

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19497 2025-10-23 cs.MA cs.AI 79%

Modeling realistic human behavior using generative agents in a multimodal transport system: Software architecture and Application to Toulouse

Trung-Dung Vu, Benoit Gaudou, Kamaldeep Singh Oberoi

机构 * UMR IRIT University Toulouse Capitole(IRIT大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15261 2025-10-20 cs.AI 79%

AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory

Jitesh Jain, Shubham Maheshwari, Ning Yu, Wen-mei Hwu, Humphrey Shi

机构 * Adobe(Adobe公司) Netflix Eyeline Studios(Netflix Eyeline工作室) UIUC(伊利诺伊大学香槟分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments LAW 2025 Workshop at NeurIPS 2025. Work done from late 2023 to early 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19905 2025-10-17 cs.AI 79%

EMAC+: Embodied Multimodal Agent for Collaborative Planning with VLM+LLM

Shuang Ao, Flora D. Salim, Simon Khan

机构 * University of New South Wales(新南威尔士大学) Air Force Research Laboratory(空军研究实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09762 2025-10-14 cs.LG cs.AI 79%

PatentVision: A multimodal method for drafting patent applications

Ruo Yang, Sai Krishna Reddy Mudhiganti, Manali Sharma

机构 * Samsung Semiconductor, Inc.(三星半导体公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06223 2025-10-10 cs.HC cs.AI 79%

A Multimodal GUI Architecture for Interfacing with LLM-Based Conversational Assistants

Hans G. W. van Dam

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments 24 pages, 19 figures, code available at https://github.com/hansvdam/langbar

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06664 2025-10-09 cs.CL 79%

ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory

Yunzhong Xiao, Yangmin Li, Hewei Wang, Yunlong Tang, Zora Zhiruo Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04560 2025-10-07 cs.AI 79%

ContextNav: Towards Agentic Multimodal In-Context Learning

Honghao Fu, Yuan Ouyang, Kai-Wei Chang, Yiwei Wang, Zi Huang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) Nanjing University(南京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Merced(加州大学默塞德分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02677 2025-10-06 cs.AI cs.LG 79%

ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks

Zhaorun Chen, Xun Liu, Mintong Kang, Jiawei Zhang, Minzhou Pan, Shuang Yang, Bo Li

机构 * University of Chicago(芝加哥大学) University of Illinois(伊利诺伊大学) Virtue AI Meta

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments 60 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00496 2025-10-06 cs.CL 79%

Agent-ScanKit: Unraveling Memory and Reasoning of Multimodal Agents via Sensitivity Perturbations

Pengzhou Cheng, Lingzhong Dong, Zeng Wu, Zongru Wu, Xiangru Tang, Chengwei Qin, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Yale University(耶鲁大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

Comments 23 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01717 2025-10-03 cs.LG cs.AI 79%

Latency-aware Multimodal Federated Learning over UAV Networks

Shaba Shaon, Dinh C. Nguyen

机构 * ECE Department, University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校电子与计算机工程系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments Accepted at IEEE Transactions on Network Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00161 2025-10-02 cs.CL 79%

TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding

Kimihiro Hasegawa, Wiradee Imrattanatrai, Masaki Asada, Ken Fukuda, Teruko Mitamura

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

Comments 21 pages. Code: https://github.com/kimihiroh/tama

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26161 2025-10-01 cs.AI cs.SE 79%

90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development

Runxin Yang, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :MLLM(title);multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24855 2025-09-30 cs.AI 79%

PhysicsMinions: Winning Gold Medals in the Latest Physics Olympiads with a Coevolutionary Multimodal Multi-Agent System

Fangchen Yu, Junchi Yao, Ziyi Wang, Haiyuan Wan, Youling Huang, Bo Zhang, Shuyue Hu, Dongzhan Zhou, Ning Ding, Ganqu Cui, Lei Bai, Wanli Ouyang, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) CUHK-Shenzhen(香港中文大学(深圳)) CUHK(香港中文大学) UESTC(电子科技大学) Tsinghua University(清华大学) DUT(大连理工大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24314 2025-09-30 cs.AI 79%

MedMMV: A Controllable Multimodal Multi-Agent Framework for Reliable and Verifiable Clinical Reasoning

Hongjun Liu, Yinghao Zhu, Yuhui Wang, Yitao Long, Zeyu Lai, Lequan Yu, Chen Zhao

机构 * New York University(纽约大学) NYU Shanghai(纽约大学上海分校) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12839 2025-09-30 cs.AI 79%

From An LLM Swarm To A PDDL-Empowered HIVE: Planning Self-Executed Instructions In A Multi-Modal Jungle

Kaustubh Vyas, Damien Graux, Yijun Yang, Sébastien Montella, Chenxin Diao, Wendi Zhou, Pavlos Vougiouklis, Ruofei Lai, Yang Ren, Keshuang Li, Jeff Z. Pan

机构 * Huawei Technologies Ltd., UK(华为技术有限公司,英国) University of Edinburgh, UK(爱丁堡大学,英国)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08524 2025-09-29 cs.HC cs.AI 79%

StreetReaderAI: Making Street View Accessible Using Context-Aware Multimodal AI

Jon E. Froehlich, Alexander Fiannaca, Nimer Jaber, Victor Tsaran, Shaun Kane

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

Comments Accepted to UIST'25; v2. Fixed a missing word in the PDF; v3. Fixed a typo in an author's name; v4. Changed system name and title

详情

展开后加载摘要…

URL PDF HTML 收藏