arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2790 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2790 篇

2606.31613 2026-07-01 cs.CV cs.RO 新提交 79%

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

基于多模态智能体AI和主动波浪补偿的自主无人机稳健海上平台着陆

Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho, Andry M. Pinto

机构 * Fundação Para a Ciência e a Tecnologia(葡萄牙科学技术基金会)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种解耦的多飞行器着陆框架,利用双深度强化学习智能体(SAC和模态RL)实现无人机在海上平台的稳健着陆,在15次试验中达到100%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31504 2026-07-01 cs.CV 新提交 79%

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

SimpleSearch-VL:多模态智能深度搜索的简单配方

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30189 2026-06-30 cs.CL 79%

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

DAIN: 基于动态智能体交互网络的高效协同多模态推理

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 提出动态智能体交互网络(DAIN),通过上下文感知元控制器动态调度专业交互智能体并压缩通信,实现高效协同多模态推理,在五个基准上取得最优性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28357 2026-06-30 cs.IR cs.AI 79%

ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

ReasonRec: 一种用于统一推荐的推理增强多模态智能体

Yihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Frank Shyu, Luke Simon, Sijia Liu, Tianlong Chen, Xi Liu

机构 * Meta AI Michigan State University(密歇根州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。

Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24231 2026-06-24 cs.AI 新提交 79%

FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning

FlowR2A: 学习奖励到动作分布用于多模态驾驶规划

Xirui Li, Zhe Liu, Xiaoqing Ye, Wenhua Han, Yifeng Pan, Junyu Han, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Changan Automobile(长安汽车)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出FlowR2A,通过流匹配解码器学习奖励条件动作分布,统一了基于评分和基于锚点的方法,实现密集监督与动态生成,在NAVSIM基准上取得最优结果。

Comments Project page: https://lixirui142.github.io/flowr2a-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00588 2026-06-24 cs.CV 版本更新 79%

Response-Aware Multimodal Learning for Post-Treatment Visual Acuity Forecasting

响应感知的多模态学习用于治疗后视力预测

Phuoc-Nguyen Bui, Van-Vi Vo, Duc-Tai Le, Junghyun Bum, Van-Nguyen Pham, Ki-Young Kim, Seung-Young Yu, Hyunseung Choo

机构 * Research Convergence Institute(研究融合研究所) Sungkyunkwan University(全北大学) Dept. of AI Systems Engineering(人工智能系统工程系) Dept. of Ophthalmology(眼科系) Kyung Hee University Medical Center(庆熙大学医学院) Dept. of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出ReVA框架,利用基线与第1个月OCT影像及表格数据,通过多模态融合预测糖尿病性黄斑水肿患者抗VEGF治疗后3-24个月的视力轨迹。

Comments To appear in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21963 2026-06-23 cs.AI cs.SE 新提交 79%

Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale

Holmes: 工业级混合语言移动崩溃的多模态智能诊断

Jia Li, Wenyuan Ma, Ting Peng, Haibin Zheng, Yuetang Deng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出多智能体系统Holmes,通过多模态运行时信号合成重构崩溃上下文,采用层次化检索-探索-推理架构,在70M行代码中实现87.6%函数级定位准确率,将平均排查时间降低98%至约77秒。

Comments Accepted at FSE'26 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23257 2026-06-23 cs.LG cs.AI math.OC 新提交 79%

Dynamic multi-agent deep reinforcement learning-based pricing and incentivization approach in multimodal transportation networks

基于动态多智能体深度强化学习的多模式交通网络定价与激励方法

Khadidja Kadem, Mostafa Ameli, Carlos Lima Azevedo, Mahdi Zargayouna, Latifa Oukhellou

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Denmark(丹麦技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出多智能体深度强化学习框架,通过动态定价和激励策略协调公共交通与共享出行服务,平衡效率、公平与收益,实验表明可降低通勤成本20%、排放10%并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-06-23 cs.AI 新提交 79%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhonfliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12970 2026-06-23 eess.IV cs.CV 79%

Probabilistic Feature Imputation and Uncertainty-Aware Multimodal Federated Aggregation

概率特征填补与不确定性感知的多模态联邦聚合

Nafis Fuad Shahid, Maroof Ahmed, Md Akib Haider, Saidur Rahman Sagor, Aashnan Rahman, Md Azam Hossain

机构 * Department of Computer Science and Engineering, Islamic University and Technology (IUT), Gazipur, Bangladesh(伊斯兰大学与技术(IUT)信息工程系,加兹ipur,孟加拉国)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出概率特征填补网络(P-FIN),通过在本地和全局层面利用不确定性估计改进多模态联邦学习中的特征填补,实验表明在胸部X光分类任务中优于确定性基线方法。

Comments Accepted for publication at the Medical Imaging with Deep Learning (MIDL) 2026 conference

Journal ref Proceedings of The 9th International Conference on Medical Imaging with Deep Learning, PMLR 315 (2026) 3593-3607

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18448 2026-06-18 cs.CL 新提交 79%

VISUALSKILL: Multimodal Skills for Computer-Use Agents

VISUALSKILL:面向计算机使用智能体的多模态技能

Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 提出VISUALSKILL分层多模态技能库,通过结合文档与UI探索构建,使智能体在CUA基准上平均得分提升15.3点,且多模态优于纯文本技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18198 2026-06-17 cs.CR cs.CV 新提交 79%

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners

看见不等于筛查:针对智能体技能扫描仪的多模态隐藏指令攻击

Xiaojun Jia, Jie Liao, Simeng Qin, Ke Ma, Wenbo Guo, Yebo Feng, Aishan Liu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) University of Chinese Academy of Sciences, China(中国科学院大学) Beihang University, China(北航大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有技能扫描仪忽视图像中恶意指令的盲点,提出SkillCamo多模态攻击将指令隐藏于图像,并设计ExecScan执行级扫描模块,通过意图提取、行为重建等检测隐藏指令,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-06-17 cs.CL 新提交 79%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Work completed in January 2026. Updating now

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23014 2026-06-16 cs.CV 版本更新 79%

Planning with Unified Multimodal Models

统一多模态模型规划

Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Nanjing University(南京大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出Uni-Plan框架,利用统一多模态模型同时作为策略、动态模型和价值函数,通过自判别过滤避免动态预测幻觉,在具身决策任务中优于VLM方法,无需专家演示且数据可扩展。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 79%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新 79%

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05784 2026-06-05 cs.AI 79%

TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents

TAPO: 通过信用转移实现工具感知策略优化用于多模态搜索代理

Chengqi Dong, Chuhuai Yue, Hang He, yandong liu, Fenghe Tang, S Kevin Zhou, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 针对GRPO在多模态搜索代理中信用误分配问题,提出TAPO方法,利用工具参数确定性构建反事实证人进行保守优势校正,无需额外标注或采样,在多个基准上持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22768 2026-06-05 cs.CL 79%

Seeing is Believing? Evaluating Vision-Language Model Susceptibility in Agent-to-Agent Multimodal Persuasion

见多识广?评估面向Agent-to-Agent多模态说服的视觉语言模型易受性

Haoyi Qiu, Yilun Zhou, Pranav Narayanan Venkit, Kung-Hsiang Huang, Jiaxin Zhang, Nanyun Peng, Chien-Sheng Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文研究了在多智能体多模态说服场景中,视觉语言模型对多模态内容的易受性,提出了MMPersuade框架和数据集,通过实验揭示了多模态输入在说服中的优势,以及说服对象的领域和格式依赖性,以及心理策略在不同上下文和模型架构下的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13527 2026-06-02 cs.AI 79%

MMSkills: Towards Multimodal Skills for General Visual Agents

MMSkills: 面向通用视觉智能体的多模态技能

Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出MMSkills框架,通过将多模态程序知识编码为紧凑的状态条件包(包含文本程序、运行时状态卡和多视角关键帧),并利用轨迹到技能生成器和分支加载多模态技能智能体,显著提升GUI和游戏场景下视觉智能体的决策能力。

Comments 25 pages, 8 figures, 8 tables. Project page: https://zkangning.github.io/MMSkills_for_Visual_Agents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06995 2026-06-02 cs.AI 79%

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

屏幕到动作中缺失了什么?面向多模态GUI推理的UI-in-the-Loop范式

Songze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出UI-in-the-Loop (UILoop) 范式,通过循环的屏幕-UI元素-动作过程,让多模态大模型显式学习UI元素的定位、语义和用法,实现可解释推理,并在UI理解任务上达到最优。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28774 2026-05-28 cs.CL 79%

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

Agent探索性策略优化用于多模态Agent推理

Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov, Yu-Chiang Frank Wang, Byung-Kwan Lee

机构 * NVIDIA KAIST(韩国科学技术院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 针对多模态Agent推理中思考与工具使用的不对称性(Thinking-Acting Gap),提出AXPO算法,通过固定思考前缀并重采样工具调用及其延续,结合基于不确定性的前缀选择,显著提升工具使用率和模型性能。

Comments Project page: https://byungkwanlee.github.io/AXPO-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27960 2026-05-28 cs.CV 79%

Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

Mags-RL: 通过智能体强化学习为多模态大语言模型戴上放大镜以进行复杂场景推理

Xuanzhao Dong, Wenhui Zhu, Peijie Qiu, Xiwen Chen, Xiaobing Yu, Xin Li, Zhipeng Wang, Shao Tang, Gen Li, Yujian Xiong, Hao Wang, Yanxi Chen, Prayag Tiwari, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) Halmstad University(哈姆斯塔德大学) Florida State University(佛罗里达州立大学) Rice University(里士满大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出Mags-RL框架,通过智能体强化学习让多模态大语言模型调用超分辨率代理进行高分辨率细粒度检查,实现两轮推理以提升复杂场景下的视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05483 2026-05-26 cs.AI 79%

MMUEChange: A Generalized LLM Agent Framework for Intelligent Multi-Modal Urban Environment Change Analysis

MMUEChange:面向智能多模态城市环境变化分析的通用LLM智能体框架

Zixuan Xiao, Jun Ma, Siwei Zhang

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 提出MMUEChange多模态智能体框架,通过模块化工具包和模态控制器实现异构城市数据灵活集成与跨模态对齐,在三个城市案例中任务成功率提升46.7%并有效缓解幻觉。

Journal ref Applied Soft Computing 190 (2026) 114576

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19192 2026-05-22 cs.AI cs.CR 79%

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

幻觉作为利用:证据承载多模态智能体

Guijia Zhang, Hao Zheng, Harry Yang

机构 * Shenzhen University(深圳大学) HKUST(香港科技大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态智能体中幻觉导致授权失败的问题,提出证据承载多模态智能体(ECA)方法,通过分解工具调用、获取类型证书并使用确定性门控来授权,从而将模型的模糊信念转换为可审计的残余,提高了系统的安全性。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05765 2026-05-22 cs.CV 79%

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

X-OmniClaw 技术报告:一种统一的移动代理用于多模态理解和交互

Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出X-OmniClaw,一种统一的移动代理,用于Android生态系统中的多模态理解和交互,通过统一的感知、记忆和行动架构,提升复杂移动任务的上下文感知能力,展示了其在多模态交互中的高效性和可靠性。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20200 2026-05-21 cs.HC cs.AI 79%

Evaluating multimodal emotion recognition in proactive conversational agents: A user study

评估主动对话代理中的多模态情绪识别:一项用户研究

Adnana Dragut, Raquel Lacuesta, F. Xavier Gaya-Morey, Jose M. Buades-Rubio

机构 * I3A (Institute of Engineering Research of Aragon)(阿拉贡工程研究院) Universidad de Zaragoza(萨拉戈塔大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态情绪识别在主动对话代理中的应用,通过用户研究验证了视觉和语言分析模块的有效性,发现语言分析比视觉线索更可靠,并探讨了SIAs在情绪引导中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20176 2026-05-20 cs.CL 79%

ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning

ClinSeekAgent: 自动化多模态证据检索以实现代理临床推理

Juncheng Wu, Letian Zhang, Yuhan Wang, Haoqin Tu, Hardy Chen, Zijun Wang, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出ClinSeekAgent,一种自动化代理框架,用于动态多模态证据检索,旨在从异构来源主动检索、迭代规划和综合多模态证据,从而提升临床决策支持。

Comments 24 pages, 9 figures; Project Page: https://ucsc-vlaa.github.io/ClinSeekAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16857 2026-05-19 cs.AI 79%

Learning to Learn from Multimodal Experience

从多模态经验中学习学习

Xingyu Sui, Weixiang Zhao, Yongxin Tang, Yanyan Zhao, Yang Wu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种新的学习范式,即从多模态经验中学习,通过动态构建和利用记忆来提升智能体的性能和泛化能力,解决了传统固定记忆设计在多模态环境中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15710 2026-05-18 cs.CL 79%

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14771 2026-05-15 cs.AI 79%

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

MediaClaw:多模态智能体平台技术报告

Shaoan Zhao, Huanlin Gao, Qiang Hui, Ting Lu, Xueqiang Guo, Yantao Li, Xinpei Su, Fuyuan Shi, Chao Tan, Fang Zhao, Kai Wang, Shiguo Lian

机构 * China Unicom AI (Yuanjing) Team(中国unicom AI (元京)团队)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 MediaClaw基于OpenClaw生态系统构建多模态智能体平台,通过统一抽象、插件扩展和工作流编排三层架构解决AIGC应用中的碎片化能力、异构接口、生产流程断层和高质量流程复用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏