arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 271 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 271 篇

2606.07533 2026-06-09 cs.CL cs.AI cs.SD 新提交 81%

Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

桥接传统可解释性方法与多模态多语言模型:基于XAI的分析

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。

Comments Bachelor's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27926 2026-06-29 cs.AI cs.CL cs.CV 新提交 80%

Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing

可验证几何问题求解:求解器驱动的自动形式化与定理提出

Can Li, Ting Zhang, Junbo Zhao, Hua Huang

机构 * Beijing Normal University(北京师范大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出SD-GPS框架,通过求解器驱动的自动形式化和可验证定理提出,解决几何问题求解中神经符号方法的瓶颈,在Geometry3K和PGPS9K上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16491 2026-06-16 cs.RO 新提交 80%

HATS: A Human-Agent Teleoperation System for Multi-Arm Data Collection

HATS:用于多臂数据收集的人-智能体遥操作系统

Zesen Lin, Jian-Jian Jiang, Haoming Cen, Xiao-Ming Wu, Dandan Zhang, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Imperial College London(帝国理工学院)

专题命中 多模态Agent :MLLM(summary_cn,abstract)

AI总结 提出HATS系统,由单操作员借助MLLM智能体控制两主臂和两辅助臂,实现高效多臂数据收集,性能媲美双人专家团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20237 2026-08-21 cs.AI 新提交 79%

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

面向多模态大语言模型的符合规则的视觉空间规划

Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交 79%

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18673 2026-08-20 cs.CV 新提交 79%

DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization

DynCur-Geo:面向多模态主动地理定位的动态好奇心奖励塑造

Yiming Sun, Yang Zhang, Pengfei Zhu

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DynCur-Geo动态好奇心框架,通过距离感知门与势能奖励塑造优化多模态主动地理定位,在多场景实验中较基线方法取得一致性能提升。

Comments 24 pages, 18 figures, 15 tables. The main paper is 7 pages, with supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13807 2026-08-17 physics.optics cs.CV physics.med-ph 新提交 79%

Label-Free Deep-Tissue Peripheral Nerve Detection with a Handheld Multimodal OCT Probe and NerveDetNet

使用手持式多模态OCT探头和NerveDetNet进行无标记深层组织周围神经检测

Yihan Wang, Ruilin You, Shaobai Li, Jiabin Chen, Bofan Song, Anh D. Le, Rongguang Liang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 该研究开发了结合手持式多模态OCT探头与NerveDetNet的无标记框架,可在不切开组织的情况下检测皮下周围神经并解析深度,其性能优于多种基线方法,具备术中应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 79%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08523 2026-08-11 cs.AI 新提交 79%

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

用质量多样性优化发现多模态具身智能体的多样化规划策略

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。

Comments To appear in ACM MM (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08184 2026-08-11 cs.AI 新提交 79%

Large Multimodal Agents for Intelligent Transportation Systems: Architectures, Evidence, and Deployment Challenges

面向智能交通系统的大型多模态智能体:架构、证据与部署挑战

Muhammad Ayub Sabir, Shaohong Zheng, Zhiyu Qu, Fatima Ashraf, Junbiao Pang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本综述梳理2023-2026年42个LMAs研究家族,评估其在ITS中的多模态性、性能与部署情况,支持有限编排而非替代,提供评估协议与部署路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02283 2026-08-04 cs.HC cs.MM 新提交 79%

Embodied Empathy: A Multimodal AR and LLM-Powered System for Self-Attachment Psychotherapy with Self-Initiated Humour

具身共情:一种用于自我依恋心理治疗的多模态AR与大语言模型驱动系统,结合自发起幽默协议

Xinyan Ye, Gwyneth Phang, Anandha Gopalan, Abbas Edalat

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.MM

AI总结 该研究针对心理健康从业者供给不足的问题,开发结合SIHP与SAT的多模态AR及LLM系统,经8天16人研究验证其可行性,可改善情绪并转变用户对AI对话工具的期望。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29637 2026-08-03 cs.CV cs.SE 新提交 79%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27967 2026-07-31 cs.AI 新提交 79%

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation

MARS-RA:基于具身多智能体协作中多模态比较的信用分配排序聚合

Dawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison

机构 * Newcastle University(纽卡斯尔大学) University of Auckland(奥克兰大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对具身多智能体协作的信用分配难题,提出MARS-RA框架,将其转化为多模态模型生成的成对比较排序聚合问题,经理论与实验验证可引导智能体有效协作。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26042 2026-07-29 cs.CV cs.LG 新提交 79%

VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening

VetClaw:一种用于兽医疾病筛查的边缘云多模态智能系统

Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid

机构 * Southern Illinois University(南伊利诺伊大学) Utah Valley University(犹他谷大学) Jazan University(吉赞大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 VetClaw是用于兽医疾病筛查的边缘云多模态智能系统,用相机模块采集图像等并发送至视觉语言模型分类。它分离智能体交互与工作流编排,超越静态图像分类,症状引导和多模态输入提升性能,将静态模型转变为多功能安全感知系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23588 2026-07-28 cs.CV 新提交 79%

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

JarvisHub:用于原生画布多模态创意智能体的开放框架

Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li, Haonan Wang, Haitao Wu, Hengyu Liu, Jianghai Chen, Kaituo Feng, Kaixin Li, Shawn Chen, Shijue Huang, Sixiang Chen, Tsung-Yi Ho, Wenxuan Huang, Xiangyan Liu, Xiaomeng Hu, Xuanhua He, Yan Sun, Yunqing Zhao, Zhiqin Yang, Zehan Wang, Zhengyang Tang, Tianyu Pang, Xiangyu Yue

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对创意人工智能从单步到多模态创作转变中现有系统不足的问题,引入JarvisHub框架,以可编辑画布为核心,通过三层架构让智能体实现持续、人工可控的创意自动化创作。

Comments 15 pages, 9 figures. Project page: https://www.jarvishub.site/ Code github: https://github.com/LYL1015/JarvisHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19532 2026-07-23 cs.LG cs.AI 新提交 79%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18536 2026-07-22 cs.AI cs.RO 新提交 79%

MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning

MAGE:通过智能多模态推理实现类人宏布局

Andrew B. Kahng, Sayak Kundu, Bodhisatta Pramanik

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对工业物理设计流程中宏布局需大量人工优化的问题,提出MAGE框架。该框架通过多模态多智能体实现宏布局优化,结合多种规则与检查,引入量化类人性指标。实验表明其相比商业工具及基线有显著提升,且能转移到新布局设置。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16038 2026-07-20 cs.AI 新提交 79%

SciForge: An AI-Native, Multimodal Workbench for Scientific Discovery

SciForge:用于科学发现的人工智能原生多模态工作台

SciForge Team, Zhangyang Gao, Minghao Fang, Yifei Liu, Hanhui Yang, Xinyu Gu, Shixiang Tang, Siqi Sun, Lei Bai, Cheng Tan, Mengdi Liu, Hao Wu, Shuizhou Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 SciForge针对科学工作中异构工件难保存为连贯可审计状态的问题,构建多模态工作台,围绕五个支柱运行,结合多种组件,通过多种应用场景展示实际影响,当前为桌面应用,未来深化团队协作且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14658 2026-07-17 cs.AI 新提交 79%

TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning

TopoAgent:用于多模态科学推理的自进化拓扑智能体

Mingze Xu, Yinghui Li, Jiayi Kuang, Zhanhui Kang, Di Yin, Ying Shen, Xing Sun, Yuxing Han

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型科学推理难题,提出TopoAgent自进化拓扑框架,用图进化取代线性轨迹,通过前端分解器、DAG组织原子及自适应原子裂变实现,实验证明其显著优于线性智能体框架,为科学推理提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交 79%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09521 2026-07-13 cs.AI 新提交 79%

SAGEAgent: A Self-Evolving Agent for Cost-Aware Modality Acquisition in Multimodal Survival Prediction

SAGEAgent:用于多模态生存预测中成本感知模态获取的自进化智能体

Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai Huo

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态生存预测中如何平衡预测准确性与临床侵入性,提出基于自进化大语言模型的SAGEAgent,通过多种记忆和工具为患者决定诊断方式,实验证明其能在胶质瘤队列中降低获取负担并保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08647 2026-07-10 cs.LG cs.AI 新提交 79%

Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning

用于稳健奖励学习的多模态、多环境机器教学

Ali Larian, Qian Lin, Chang Zong Wu, Daniel S. Brown

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 研究自主智能体在多环境下奖励学习问题,提出分层机器教学算法,先选信息丰富环境,再查询低成本反馈,实验表明该方法比统一教学基线有更低遗憾值和更强泛化能力,凸显多环境多模态教学对稳健奖励学习的重要性。

Comments Accepted to RLC 2026. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06964 2026-07-09 cs.RO cs.AI 新提交 79%

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划

Amin Tabrizian, Arsyi Aziz, Aarifah Ullah, Mahyar Ghazanfari, Pouria Razzaghi, Peng Wei

机构 * George Washington University(乔治华盛顿大学) Metis Solutions Technology Inc

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31613 2026-07-01 cs.CV cs.RO 新提交 79%

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

基于多模态智能体AI和主动波浪补偿的自主无人机稳健海上平台着陆

Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho, Andry M. Pinto

机构 * Fundação Para a Ciência e a Tecnologia(葡萄牙科学技术基金会)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种解耦的多飞行器着陆框架,利用双深度强化学习智能体(SAC和模态RL)实现无人机在海上平台的稳健着陆,在15次试验中达到100%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31504 2026-07-01 cs.CV 新提交 79%

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

SimpleSearch-VL:多模态智能深度搜索的简单配方

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24231 2026-06-24 cs.AI 新提交 79%

FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning

FlowR2A: 学习奖励到动作分布用于多模态驾驶规划

Xirui Li, Zhe Liu, Xiaoqing Ye, Wenhua Han, Yifeng Pan, Junyu Han, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Changan Automobile(长安汽车)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出FlowR2A,通过流匹配解码器学习奖励条件动作分布,统一了基于评分和基于锚点的方法,实现密集监督与动态生成,在NAVSIM基准上取得最优结果。

Comments Project page: https://lixirui142.github.io/flowr2a-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21963 2026-06-23 cs.AI cs.SE 新提交 79%

Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale

Holmes: 工业级混合语言移动崩溃的多模态智能诊断

Jia Li, Wenyuan Ma, Ting Peng, Haibin Zheng, Yuetang Deng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出多智能体系统Holmes,通过多模态运行时信号合成重构崩溃上下文,采用层次化检索-探索-推理架构,在70M行代码中实现87.6%函数级定位准确率,将平均排查时间降低98%至约77秒。

Comments Accepted at FSE'26 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23257 2026-06-23 cs.LG cs.AI math.OC 新提交 79%

Dynamic multi-agent deep reinforcement learning-based pricing and incentivization approach in multimodal transportation networks

基于动态多智能体深度强化学习的多模式交通网络定价与激励方法

Khadidja Kadem, Mostafa Ameli, Carlos Lima Azevedo, Mahdi Zargayouna, Latifa Oukhellou

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Denmark(丹麦技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出多智能体深度强化学习框架,通过动态定价和激励策略协调公共交通与共享出行服务,平衡效率、公平与收益,实验表明可降低通勤成本20%、排放10%并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-06-23 cs.AI 新提交 79%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhonfliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18448 2026-06-18 cs.CL 新提交 79%

VISUALSKILL: Multimodal Skills for Computer-Use Agents

VISUALSKILL:面向计算机使用智能体的多模态技能

Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 提出VISUALSKILL分层多模态技能库,通过结合文档与UI探索构建,使智能体在CUA基准上平均得分提升15.3点,且多模态优于纯文本技能。

详情

展开后加载摘要…

URL PDF HTML 收藏