arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2797 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2797 篇

2608.19537 2026-08-21 cs.RO 新提交 78%

Multimodal Trajectory Planning for Surface Vehicles using Turning Circle-based Control Barrier Functions

基于转向圆型控制障碍函数的水面航行器多模态轨迹规划

Changyu Lee

机构 * Kongju National University(公州国立大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文针对动态环境下自主水面航行器,提出结合MPC与TC-CBF的无引导路径多模态轨迹规划框架,可提升避碰成功率、减少安全违规并缓解局部极小问题。

Comments This work has been submitted to an Elsevier journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21113 2026-08-20 cs.RO 版本更新 78%

Multimodal Adaptive Control for Safe Robotic Craniotomy Under Partial Observability

RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) Second Hospital of Dalian Medical University(大连医科大学附属第二医院) The University of Tokyo(东京大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22447 2026-08-18 cs.SE 版本更新 78%

Latent Reuse in Agent Skills: Multi-modal Clone Detection at Ecosystem Scale

SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中

Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新 78%

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00874 2026-08-11 cs.HC 版本更新 78%

MIA: A Visual Analytics System for Multimodal Spectral Imaging Data

MIA:一种用于多模态光谱成像数据的可视分析系统

Hennes Rave, Katharina Kronenberg, Hannes Gödde, Lea Tobergte, Michael Holtkamp, Julia Werner, Peter Bohrer, Fabian Lohöfer, Rickmer Braren, David Clases, Uwe Karst, Lars Linsen

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出一种模态无关的可视分析系统MIA,集成光谱预处理、降维、交互分割和相似性分析等全流程,支持层次化嵌入和多模态数据联合分析,通过三个实际案例验证其有效性。

Journal ref Computers & Graphics, Vol. 139, Art. 104727, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10055 2026-08-10 cs.RO 版本更新 78%

STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations

STRONG-VLA: 多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习

Yuhan Xie, Yuping Yan, Yunqi Zhao, Handing Wang, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xidian University(西安电子科技大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出STRONG-VLA框架,通过解耦鲁棒性学习与任务对齐优化,提升多模态扰动下的视觉-语言-动作模型鲁棒性与任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05966 2026-08-07 cs.HC 新提交 78%

A Modular Workflow for Multimodal Reading Experiments

多模态阅读实验的模块化工作流程

Thomas Krämer, Thomas Kosch, Dagmar Kern, Daniel Hienert

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究提出一种基于网络的模块化工作流程,整合眼动、EEG等多模态数据,可适配不同实验设置,用于在线阅读的多模态研究,支持生态情境下的实证验证。

Comments In Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22014 2026-08-06 cs.MA cs.RO 版本更新 78%

DM$^3$-Nav: Decentralized Multi-Agent Multimodal Multi-Object Semantic Navigation

DM$^3$-Nav:去中心化多智能体多模态多目标语义导航

Amin Kashiri, Atharva Jamsandekar, Yasin Yazıcıoğlu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Northeastern University(东北大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 DM$^3$-Nav是一种去中心化的多智能体语义导航系统,支持多模态开放词汇目标指定和多目标任务,通过局部通信实现自主协调,验证了在真实办公环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04398 2026-07-30 cs.HC cs.CY 版本更新 78%

The Agency Gap in AI-Supported Writing: How Reactive and Proactive Agent Designs Shape Multimodal Reasoning

AI辅助写作中的主体差距:反应式与主动式智能体设计如何塑造多模态推理

Yueqiao Jin, Kaixun Yang, Roberto Martinez-Maldonado, Dragan Gašević, Lixiang Yan

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究针对AI辅助写作中的主体差距,对比反应式与主动式智能体设计的效果,发现主动式设计可强化多模态推理关联,还能缩小AI素养相关的表现差异,为教育AI智能体设计提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19568 2026-07-23 eess.SY cs.SY 新提交 78%

From P&ID Drawings to Process Graphs: A Multimodal Language Model Approach

从管道和仪表图到过程图:一种多模态语言模型方法

Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 78%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04974 2026-07-07 cs.SE 新提交 78%

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

多模态智能体中实现错误的综合研究

Suwan Li, Lei Bu, Shangqing Liu, Yile Wang, Guangdong Bai, Fuman Xie, Kai Chen, Chang Yue

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29788 2026-06-30 cs.LG 78%

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

MemLeak: 诊断多模态智能体记忆中的信息泄露

Kuan Wang, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。

Comments 23 pages, 3 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26567 2026-06-26 eess.SP 新提交 78%

Multi-Modal Environment-Aware Beam Management for Massive MIMO: A Geometry-Driven Virtual Base Station Framework

大规模MIMO的多模态环境感知波束管理:一种几何驱动的虚拟基站框架

Yijie Bian, Wei Guo, Jie Yang, Shenghui Song, Jun Zhang, Shi Jin, Khaled B. Letaief

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 提出几何驱动框架,利用3D LiDAR点云和位置信息构建虚拟基站数据库,通过镜像对称建模主导反射路径,实现粗信道重建和低开销波束训练,并采用双智能体深度强化学习协调波束选择,提升波束管理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 78%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态Agent :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11975 2026-06-23 cs.RO 版本更新 78%

M2HRI: An LLM-Driven Multimodal Multi-Agent Framework for Personalized Human-Robot Interaction

M2HRI:一种LLM驱动的多模态多智能体框架,用于个性化人机交互

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出M2HRI框架,通过个性、长期记忆和情境化协调机制赋予每个机器人独特身份,实验表明该方法能提升交互自然性和协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14780 2026-06-16 cs.MA cs.CY cs.RO cs.SY eess.SY 版本更新 78%

ROSA: Roundabout Optimized Speed Advisory with Multi-Agent Trajectory Prediction in Multimodal Traffic

ROSA: 多模式交通中基于多智能体轨迹预测的环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * IEEE

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出ROSA系统,结合Transformer多智能体轨迹预测与协调速度引导,提升环岛多模式混合交通的效率与安全,预测精度优于前人工作。

Comments 8 pages, 1 figure, 4 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2025 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14154 2026-06-15 cs.CR 新提交 78%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 多模态Agent :cross-modal(title,abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11652 2026-06-11 cs.LG 新提交 78%

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

IAPO:面向小型多模态代理工具使用的输入归因感知策略优化

Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出输入归因感知策略优化(IAPO),通过强化学习对齐模型与教师模型的输入归因,提升多模态小语言模型的工具调用能力,在六个测试集上平均准确率提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06998 2026-06-11 cond-mat.other 版本更新 78%

Identifying Topological Invariants of Non-Hermitian Systems via Domain-Adaptive Multimodal Model for Mathematics

通过数学多模态模型识别非厄密系统拓扑不变量

Jiuchun Meng, Lichao Sun, Xiumei Wang, Dandan Zhu, Xingping Zhou

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.08830 2026-06-04 eess.SY cs.CR cs.LG cs.SY 78%

Catching Anomalous Distributed Photovoltaics: An Edge-based Multi-modal Anomaly Detection

捕捉异常分布式光伏:基于边缘的多模态异常检测

Devu Manikantan Shilay, Kin Gwn Lorey, Tianshu Weiz, Teems Lovetty, Yu Cheng

机构 * University of California, Riverside, California, 92507(加州大学河滨分校) Illinois Institute of Technology, Chicago, Illinois 60616(伊利诺伊理工学院)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出基于边缘的多模态异常检测方法,用于识别分布式光伏等设备的异常行为,通过融合多源时间序列数据,提升对电网安全的检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02977 2026-06-03 cs.HC cs.SE 78%

A Benchmarking Framework for Multimodal User Interface Toolkits: Comparing Modality Coverage, Developer Workflow, and Experimental Support

多模态用户界面工具包的基准测试框架:比较模态覆盖、开发者工作流和实验支持

Ariton Verush

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一个基于文档分析、技术比较和未来开发者评估的结构化基准框架,从模态覆盖、开发者体验和实验支持三个维度比较多模态用户界面工具包。

Comments 13 pages, 3 tables, 1 figure. Benchmarking framework paper revised and expanded from an HCI seminar draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02382 2026-06-02 cs.CC cs.HC stat.CO 78%

Attention Dynamics and Adaptive Decision Support in C5ISR: A Recurrence Quantification Analysis of Visual and Multimodal Attention Guidance Effects on Mission Performance

C5ISR中的注意力动态与自适应决策支持:视觉与多模态注意力引导对任务绩效影响的递归量化分析

Hyun-Gee Jei, Caleb J. Armstrong, Farzan Sasangohar

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本研究通过递归量化分析眼动数据,探讨了视觉与多模态自适应决策支持工具在C5ISR环境中的效果,发现多模态工具显著提升绩效,且递归度量与绩效存在线性和非线性关系。

Comments 11 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02208 2026-06-02 cs.HC 78%

Context-Aware Workflow Decomposition for Automated Mobile UI Annotation Using Multimodal Large Language Models

基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注

Athar Parvez, Muhammad Jawad Mufti, Muqaddas Gull, Omar Hammad

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01801 2026-06-02 cs.MA 78%

MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand

MetaForge:一种自我进化的多模态智能体,可按需检索、适应和锻造工具

Shouang Wei, Houcheng Min, Xinpeng Dong, Xin Lin, Sen Cui, Bo Jiang, Zhongxiang Dai, Kun Kuang, Guandong Xu, Fei Wu, Min Zhang

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出MetaForge框架,通过决策-检索-适应-锻造-回收的闭环机制,使多模态智能体能够按需自我进化工具集,在12个基准测试中超越16个基线方法,提升了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26164 2026-05-27 cs.SE 78%

Gamified Requirement Elicitation for a Multi-Modal Decision Support System. The Case of SYNCHROMODE

多模态决策支持系统的游戏化需求获取:以SYNCHROMODE为例

Dimitris Tzanis, Alexandros Dolianitis, Viktoria Petkani, Areti Kotsi, Evangelos Mitsakis

专题命中 多模态Agent :multi-modal(title);multimodal(abstract)

AI总结 本文以SYNCHROMODE项目为案例,通过传统用例方法和游戏化方式获取多模态决策支持系统的需求,并对比分析两种方法产生的需求。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22600 2026-05-22 cs.RO 78%

Branch-Stochastic Model Predictive Control for Motion Planning under Multi-Modal Uncertainty with Scenario Clustering

基于分支随机优化的运动规划在多模态不确定性下的场景聚类

Zekun Xing, Ramkrishna Chaudhari, Marion Leibold, Dirk Wollherr, Martin Buss

机构 * Chair of Automatic Control Engineering(自动控制工程教授会)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出一种结合随机模型预测控制与分支结构的方法,用于在多模态不确定性下进行运动规划,通过场景聚类提高实时计算性能并减少保守性。

Comments This work has been accepted for presentation at IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21923 2026-05-22 quant-ph 78%

Multi-Modal Spectroscopy Theory for Ultrafast Control of Rabi Oscillations

多模光谱理论用于超快控制Rabi振荡

J. W. Yu, H. B Wang, X. Q. Zhou, M. Tang, Z. B. Ni, X. T. Cheng, Y. Zhao, S. N Ding, J. Y. Yan, H. H. Zhu, C. H. Li, F. Liu, C. Y. Jin

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出了一种三腔方案,用于在腔量子电动力学(cQED)中实现发射器-腔耦合强度的完全控制。通过耦合振荡器引入了包含多个谱分量的瞬态动力学,显著增加了在时域中解析荧光光谱的数值成本。因此开发了一种通用传感器方法,以简化非稳态量子动力学的表征计算。多模光谱实时揭示了超模的出现、分裂和消失。基于零能超模的耗尽,证明了在时域多模光谱中实现超快的Rabi振荡切换。这些结果展示了从多个振子的谱控制到超快动力学的量子观测的一致图景,确立了传感器方法作为cQED系统超快光谱学的强大理论工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16149 2026-05-18 cs.DS 78%

Fast and Memory Efficient Multimodal Journey Planning with Delays

快速且内存高效的考虑延迟的多模式行程规划

Denys Katkalo, Andrii Rohovyi, Toby Walsh

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种更高效、快速且准确的多模式行程规划方法,适用于单目标和双目标场景,通过优化算法提升速度和精度。

Comments v4: revised manuscript incorporating reviewer feedback (Related Work restructure, temporal-planning baselines, Bez 2020 thesis acknowledgment, equation relocation); style switched to the AAAI 2026 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25563 2026-04-29 cs.RO 78%

Improving Sensing Coverage and Compliance of 3D-Printed Artificial Skins Through Multi-Modal Sensing and Soft Materials

通过多模感知和柔性材料提升3D打印人工皮肤的感知覆盖与合规性

Carson Kohlbrenner, Caleb Escobedo, Sayak Ray, Alexander Dickhans, Anna Soukhovei, Nickolaus Jackoski, Lyle Antieau, Alessandro Roncone

机构 * University of Colorado Boulder(科罗拉多大学波尔得分校)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出结合时间飞行和自电容传感的柔性皮肤,实现多模感知、压力传感与电接口优化,提升3D打印人工皮肤的实用性和覆盖能力。

Comments This work was accepted at the "Towards Large-Area Tactile Sensing Skins: From Scalable Materials to Embodied Robotic Perception" workshop at the International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏