arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 24 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 24 篇

2608.30498 2026-09-01 cs.AI 新提交 90%

CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework

CM2:基于集成多智能体框架的多模态文化推理

Qi Li, Zhaojie Kang, Yingjie He, Zheng Lin, Hao Zhang, Guangxin Wu, Yan Gong, Rong Fu, Jianyuan Ni

机构 * Lanzhou University(兰州大学) Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLM)跨学科文化推理不足的问题,提出基于人类文化解释认知路径的CM2多智能体框架,在CM2D数据集上较CoT等范式取得一致提升,各模块贡献及跨模态仲裁能力均得到验证。

Comments Accepted to the 23rd Pacific Rim International Conference on Artificial Intelligence (PRICAI 2026) as a short paper. 11 pages, 4 figures. Code and dataset are available at https://github.com/GitHub-12138/CM2-Multimodal-Cultural-Reasoning-via-an-Integrated-Multi-Agent-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30704 2026-09-01 cs.CV 新提交 90%

TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos

TUE-Detector:一种基于使用工具的专家多模态大语言模型(MLLM)的AI生成视频检测器

Yichen Wu, Haoxuan Qu, Yongxing Dai, Yan Bai, Yihang Lou, Yuqi Lin, Hossein Rahmani, Jun Liu

机构 * University of Nottingham(诺丁汉大学) Lancaster University(兰卡斯特大学) Peking University(北京大学)

专题命中 多模态Agent :MLLM(title,title_cn);分类 cs.CV

AI总结 本研究针对AI生成视频检测中识别细微非自然伪影的挑战,提出TUE-Detector框架,将通用MLLM训练为使用工具的专家检测器,通过调用工具收集证据推理检测,经大量实验验证其有效性。

Comments 32 pages, 7 figures, 28 tables; includes supplementary material. Code: https://github.com/Louis-YW/TUE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30705 2026-09-01 cs.CV 新提交 85%

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

VisLens:面向多模态大语言模型的单次可解释视觉搜索方法

Jingyi He, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Munich(慕尼黑亥姆霍兹中心) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对多模态大语言模型的细粒度视觉搜索问题,提出VisLens方法,通过单次前向传播实现可解释的视觉搜索,性能优于或相当现有方法且推理速度大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新 81%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29114 2026-09-01 cs.RO cs.AI 新提交 79%

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

CGFM-Nav:用于语义引导的终身多模态具身导航的认知图场记忆

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对视觉与语言导航中环境表征的不足,提出CGFM及基于其的CGFM-Nav框架,在GOAT-Bench实验中提升了导航的成功率与SPL,验证了方法的有效性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新 79%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2026-09-01 cs.CY cs.AI 版本更新 79%

Multimodal Large Language Models Predict Urban Safety Perception but Encode Non-Neutral Demographic Priors

多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29678 2026-09-01 cs.DB 新提交 78%

Diachronic Hypergraphs for Orchestrated Multi-Agent Multimodal Memory Curation

用于编排多智能体多模态记忆整理的历时超图

Yichao Feng, Ran Zhang, Haoran Luo, Zhenghong Lin, Carl Yang, Anh Tuan Luu

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究针对多智能体系统记忆结构模糊等问题,提出基于超图的多模态数据库MAGE,其可保存高阶协作事件,实验表明MAGE在多种记忆基准中性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29410 2026-09-01 cs.IR 新提交 78%

Agents as Knowledge Integrator and Utilizer in Multimodal Recommendation

智能体作为多模态推荐中的知识整合器与利用器

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Puzhen Wu, Zewei Liu, Zheng Lin, Jianheng Tang, Jing Yang, Wei Wang, Xiping Hu, Edith Ngai

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究针对多模态推荐中信号与目标不匹配的问题,提出AgentMMRec框架,通过整合与利用两个智能体角色优化图结构与表示,在亚马逊数据集上提升了推荐指标,且适用于稀疏与冷启动场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29108 2026-09-01 cs.RO 新提交 78%

From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots

从多模态路径到可执行轨迹:面向四轮独立转向(4WIS)机器人的轨迹规划框架

Runjiao Bao, Lin Zhang, Yongkang Xu, Shoukun Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology(北京理工大学) Shenzhen Research Institute of Nankai University(南开大学深圳研究院)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 针对4WIS机器人现有规划方法无法充分利用其多模态能力的问题,提出结合模式增强前端搜索与模式一致后端优化的轨迹规划框架,实验验证了其综合性能与实际可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-09-01 cs.CL 版本更新 74%

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态Agent :multimodal(title);分类 cs.CL

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-09-01 cs.AI 版本更新 70%

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-09-01 cs.LG cs.CL cs.RO 版本更新 70%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2026-09-01 cs.RO cs.CV 版本更新 70%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

用于机器人操作的基于大型VLM的视觉-语言-动作模型:综述

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本综述首次系统分类梳理用于机器人操作的基于大型VLM的VLA模型,明确其定义与两类架构,考察其与先进领域的集成等内容,整合进展并提供更新项目页面

Comments Under Minor Revision at IEEE TPAMI, Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30428 2026-09-01 cs.CL cs.AI cs.CV cs.LG 新提交 67%

Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

我们能看见的谎言:具身社交交互中VLM智能体的联合言语与非言语欺骗

Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira, Gunhee Kim

机构 * Seoul National University(首尔大学) Inha University(仁荷大学) KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究构建了3D多模态社交推理游戏测试平台MineAmongUs,提出可配置VLM智能体控制程序ARIA,发现非言语通道是VLM智能体欺骗取胜的更关键因素,为具身VLM智能体对齐研究开辟新方向。

Comments Workshop on Agent Behavior (WAB) at COLM 2026. Project page: https://junseokim0103.github.io/Lies-We-Can-See/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30672 2026-09-01 cs.AI cs.MA cs.MM 新提交 62%

HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving

HiRS-Agent:用于可靠长时程遥感任务解决的分层多智能体系统

Boyang Mu, Zhiwei Wei, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hunan Normal University(湖南师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出HiRS-Agent分层多智能体系统,通过两层协作架构与优化策略,在Earth-Agent Benchmark和ThinkGeo上提升了长时程遥感任务的工具使用能力与正确性。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29483 2026-09-01 cs.CV cs.CL 新提交 62%

GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation

GeoAgent:通过具身导航评估视觉语言模型的地理定位能力

Arka Mukherjee, Soham Roy, Kartikeya Trivedi, Shreya Ghosh

机构 * KIIT Bhubaneswar(布巴内斯瓦尔KIIT大学) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出基于街景导航的GeoAgent基准,发现VLMs在地理定位中难区分区域模式,智能体导航可提升准确率,但模型存在地区偏差且自我改进能力差,明确了具身地理定位的挑战

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-09-01 cs.RO cs.AI cs.CV 版本更新 62%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Shang Wu, Jiayi Wang, Jianshu Zhang, Jihai Zhao, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

Comments v2:Expanded the supplementary materials by adding three sections-Scene YAML, Robot Embodiment List, and Atomic Skill List-corrected typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29814 2026-09-01 cs.AI 新提交 57%

FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production

FRAMEWORKERS:一种用于AI生成视频制作的动态多智能体框架

Zhendong Li, Lei Sun, Letian Shi, Deheng Zhang, Ruibo Ming, Mengshun Hu, Dannong Xu, Jian Wang, Danda Paudel, Luc Van Gool, Jinjin Gu

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 FRAMEWORKERS是一种以任务为中心的动态多智能体视频制作框架,通过Director和Assistant分工优化任务编排,在路由准确性、故障恢复等多方面优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28597 2026-09-01 cs.AI cs.CY 新提交 57%

The Race between Agentic AI Capabilities and Data Quality Control in Online Surveys

在线调查中智能体AI能力与数据质量控制的竞赛

Sourav Panda, Hillmer Chona, Rupak Kumar Das, Shreyash Kale, Shikha Soneji, Jonathan Dodge

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究针对在线调查的注意力检查防线,探究智能体AI完成调查并通过检查的能力,分析其结构漏洞并提出DOM元数据混淆的防御策略,评估相关模型以平衡不同研究者的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-09-01 cs.CV 版本更新 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2026-09-01 cs.AI 版本更新 57%

GUI-PRA: Process Reward Agent for GUI Tasks

GUI-PRA:面向GUI任务的过程奖励智能体

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30938 2026-09-01 cs.MA 新提交 50%

Evidence, Logic, and Compliance: Multi-Agent Structured Graph Reasoning with Expert Arbitration for Medical Referral

证据、逻辑与合规性:面向医疗转诊的专家仲裁多智能体结构化图推理

Qi Peng, Yi Cai, Jialin Cui, Tong Zhu, Yujuan Ding, Qingbao Huang, Tao Wang, Jiayuan Xie, Changmeng Zheng, Qing Li

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究针对LLM用于医疗转诊的信息过载与非结构化协作问题,提出MASGR框架,通过多智能体结构化图推理及专家仲裁机制提升复杂医疗转诊的精准度,表现优于现有模型。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30760 2026-09-01 cs.LG 新提交 50%

PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents

PRACTICE:从经验到自进化具身智能体的专业能力

Ziyi Bai, Siqi Li, Tinglei Huang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院(BAAI)) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 PRACTICE通过训练技能学习者维护技能库,结合两阶段课程训练与在线编辑蒸馏,在EB-ALFRED等任务上实现优于基线的自进化具身智能体性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏